./новости · 30 июля 2026 г.
новость
Код-агент теперь оптимизирует прод OpenAI: раздача моделей подешевела на 20%
источник: @simonw · X·
машинная выжимка · сверена с источником

Simon Willison
@simonw
GPT-5.6 нашла оптимизации, которые «снизили сквозную стоимость раздачи на 20%» - речь про раздачу самой этой модели у OpenAI. Похоже, это уже миллиарды долларов экономии в месяц?
Codex разобрал продовый трафик, улучшил балансировку нагрузки, переписал GPU-ядра в проде и прогнал сотни экспериментов над собственной моделью спекулятивного декодирования. Правки ядер снизили сквозную стоимость раздачи на 20%, а спекулятивное декодирование подняло эффективность генерации токенов больше чем на 15%.

· 23,5 тыс. просмотров
Codex переписал GPU-ядра в проде OpenAI и срезал сквозную стоимость раздачи на 20%. Об этом рассказали 30 июля 2026. Тот же агент разобрал продовый трафик, поправил балансировку нагрузки и прогнал сотни экспериментов над собственной моделью спекулятивного декодирования: эффективность генерации токенов выросла больше чем на 15%.
Почему это важно: До сих пор код-агентам отдавали работу с проверяемым ответом: тесты, рефакторинг, миграции, типовые эндпоинты. GPU-ядра, балансировка и спекулятивное декодирование - другой класс: ошибка тут стоит денег и простоя, а проверить её можно только замером на живом трафике. Теперь OpenAI отдаёт агенту собственную инфраструктуру раздачи. Считать экономию в деньгах пока не на чем: 20% снимаются с расходов на инференс, а расходы OpenAI не публикует - известна только выручка около $2B в месяц на 3 июля 2026, так что «миллиарды в месяц» у Саймона Уиллисона это прикидка, а не цифра компании. Сколько инженеров-людей смотрело эти ядра перед выкаткой, тоже не сказали.
Что дальше: Замер на своём: взять профиль горячего цикла, дать агенту переписать одно ядро или один запрос и сравнить p95 и счёт за неделю до и после.
первоисточник