OpenAI та Cerebras розігнали GPT-5.6 Sol до 750 токенів/с
Справжня інженерна магія щойно знесла швидкісні обмеження для важких нейромереж. Велетенські кремнієві пластини видають складні міркування швидше, ніж людське око встигає кліпати.
OpenAI у партнерстві з чипмейкером Cerebras запустили режим Ultrafast для GPT-5.6 Sol, який видає до 750 вихідних токенів на секунду через API. Це у 14 разів швидше за стандартний режим, причому модель запускається у повному розмірі без втрати якості генерації.
Прискорення забезпечує архітектура Cerebras Wafer-Scale Engine, де кожен процесор розміром із цілу кремнієву пластину містить 44 ГБ надшвидкої пам'яті SRAM. Ваги моделі зберігаються безпосередньо на кристалі, що повністю усуває затримки передачі даних, об які роками спотикаються звичайні ферми відеокарт.
На комплексному бенчмарку Humanity’s Last Exam із 2500 запитань на максимальному рівні міркувань GPT-5.6 Sol Ultrafast завершив тестування за 11 годин і 11 хвилин. Для порівняння, моделі Claude Fable 5 від Anthropic на ці ж завдання знадобилося понад 78 годин при практично однаковій точності.
Стандартний тариф становить $5 за вхідні та $30 за вихідні токени на мільйон, режим Fast підіймає ціну вдвічі, а вартість Ultrafast поки не розкривають, відкривши доступ лише для обмеженого списку компаній за заявками.
Апаратні гіганти остаточно зміщують битву нейромереж у площину чистої кремнієвої сили, змушуючи розробників рахувати збитки від миттєво спустошених балансів на API.
Джерело: OpenAI
Коментарі
Допоможи покращити наступну версію: Додавай контекст або пропонуй виправлення. Після AI-перевірки коментарі можуть отримати бали для переписування. Перевірка й оновлення потребують часу; повна шкала не гарантує нової версії.