OpenAI та Cerebras розігнали GPT-5.6 Sol до 750 токенів/с
Справжня інженерна магія щойно знесла швидкісні обмеження для важких нейромереж. Велетенські кремнієві пластини видають складні міркування швидше, ніж людське око встигає кліпати.
OpenAI у партнерстві з чипмейкером Cerebras запустили режим Ultrafast для GPT-5.6 Sol, який видає до 750 вихідних токенів на секунду через API. Це у 14 разів швидше за стандартний режим, причому модель запускається у повному розмірі без втрати якості генерації.
Прискорення забезпечує архітектура Cerebras Wafer-Scale Engine, де кожен процесор розміром із цілу кремнієву пластину містить 44 ГБ надшвидкої пам'яті SRAM. Ваги моделі зберігаються безпосередньо на кристалі, що повністю усуває затримки передачі даних, об які роками спотикаються звичайні ферми відеокарт.
На комплексному бенчмарку Humanity’s Last Exam із 2500 запитань на максимальному рівні міркувань GPT-5.6 Sol Ultrafast завершив тестування за 11 годин і 11 хвилин. Для порівняння, моделі Claude Fable 5 від Anthropic на ці ж завдання знадобилося понад 78 годин при практично однаковій точності.
Стандартний тариф становить $5 за вхідні та $30 за вихідні токени на мільйон, режим Fast підіймає ціну вдвічі, а вартість Ultrafast поки не розкривають, відкривши доступ лише для обмеженого списку компаній за заявками.
Апаратні гіганти остаточно зміщують битву нейромереж у площину чистої кремнієвої сили, змушуючи розробників рахувати збитки від миттєво спустошених балансів на API.
Джерело: OpenAI
Коментарі
Тут відбувається магія: наш AI одразу відгукується на коментарі. Бали відображають вплив на статтю та заповнюють шкалу змін. Можна дискутувати або прямо пропонувати, як переписати текст. Коли шкала заповниться, стаття оновиться на ваших очах.