13 августа 2026 г.
Ответа GPT-5.6 Sol больше не ждут минутами: режим Ultrafast быстрее в 14 раз
До 750 токенов в секунду: OpenAI открыла лимитированный превью Ultrafast в API 13 августа.

750 токенов в секунду на выходе: столько GPT-5.6 Sol выдаёт в новом режиме Ultrafast.
OpenAI целит в корпоративную нагрузку, где ответ через минуту уже поздно: голос, поддержка клиентов, dev-агенты и финансовый ресёрч.
Скорость даёт железо. Ultrafast крутится на Cerebras Wafer-Scale Engine, где на одну чип-пластину приходится 44 ГБ SRAM. Сама модель прежняя, ускоряет её чужой ускоритель.
Замеры расходятся. Cerebras прогнала Humanity's Last Exam: 2500 вопросов Ultrafast закрыл за 11 часов 11 минут (замер 10 июля 2026), Claude Fable 5 потратила 78 часов 27 минут (13-15 июля). Разрыв семикратный.
На GDP-Val сквозное ускорение вышло скромнее: 5,6 раза, замер 31 июля. Заявленные 14 раз относятся к скорости выдачи токенов, а не ко времени до готового результата.
Как получить. Только через API и только по заявке: форма openai.com/form/ultrafast/, в ней просят описать нагрузку, требования по задержке и ожидаемый объём. В ChatGPT режима нет.
Внутри OpenAI режимом разбирали логи и трейсы во время инцидентов и сжимали ночные циклы ресёрча до нескольких итераций за рабочий день. Исследователь OpenAI Джеффри Ван описывает разницу так: раньше задачу ждали пару минут, теперь она заканчивается до переключения контекста.
Первые независимые замеры появятся, когда превью выйдет за круг отобранных клиентов.
первоисточник