13 августа 2026 г.
Мелкая модель тянет работу флагмана: gpt-5.6-luna дешевле GPT-5.5 в 18 раз
Hypha гоняет извлечение данных на gpt-5.6-luna и держит 98% прежней точности за одну восемнадцатую цены.

Browser Use прогнала сложные браузерные задачи на самой дешёвой модели семьи: 78% решённых, счёт около $14.
Прежняя SOTA-модель брала за тот же набор около $235. Оба числа компания отдала в гайд OpenAI от 13 августа.
Не хотите разбираться сами? Внедряем ИИ в ваш бизнес: задачи без лимита, одна цена в месяц, отмена в любой момент.
OpenAI собрала этот гайд для тех, кто строит агентов на GPT-5.6. Главный совет: не звать флагман на каждый шаг, а раскидывать шаги по трём моделям линейки.
В семье три модели. gpt-5.6-sol стоит наверху, terra держит баланс цены и интеллекта, luna рассчитана на большие объёмы. Алиас gpt-5.6 ведёт на sol.
Контекст у sol и terra доходит до 1,05 млн токенов, у luna - до 400 тысяч. Вывод у всех троих упирается в 128 тысяч. Запрос длиннее 272 тысяч входных токенов у sol и terra тарифицируется по длинноконтекстной ставке.
Цена за миллион токенов (короткий контекст, прайс OpenAI на 13.08):
- gpt-5.6-sol: $5 вход, $30 выход - gpt-5.6-terra: $2 и $12 - gpt-5.6-luna: $0,20 и $1,20
Длинный контекст удваивает вход и поднимает выход, у sol это $10 и $45. Запись в кэш стоит 1,25 от некэшированной ставки входа.
Модель зовёт инструменты кодом. Раньше каждый результат инструмента ехал обратно в контекст целиком. Теперь модель пишет код, который дёргает инструменты сам, а в контекст возвращается только итог. Rogo получила ту же оценку по своей рубрике при 21% меньше входных токенов.
Включается режим объектом {"type": "programmatic_tool_calling"} в массиве tools у Responses API. Функцию, которую надо звать только из кода, помечают "allowed_callers": ["programmatic"]. Так вызываются MCP-серверы, shell и code_interpreter, обычные функции тоже.
Код крутится в свежем изолированном V8-рантайме: JavaScript с top-level await, без Node.js, пакетов, сети, файловой системы и памяти между запусками. Наружу код выходит только через включённые инструменты. Постоянный контейнер режиму не нужен, поэтому он совместим с Zero Data Retention.
Рассуждение переносится между ходами. Параметр reasoning.context в режиме all_turns подмешивает reasoning прошлых ходов в следующий сэмпл, current_turn оставляет только текущий. У GPT-5.6 дефолт all_turns, у прежних моделей был current_turn. На ARC-AGI-3 перенесённое рассуждение подняло результат с 13,3% до 38,3% и срезало выходные токены примерно вшестеро.
При переезде OpenAI требует выставлять reasoning.effort явно. Уровней теперь шесть: none, low, medium, high, xhigh, max. GPT-5.5 по умолчанию уходил в medium, модели постарше в none, и молчаливый апгрейд тянет за собой лишнее время ответа и лишние деньги. Рядом появились reasoning.mode "pro" для Responses и явный кэш prompt_cache_options с ttl 30 минут.
Остальные замеры гайда идут тем же курсом. PlayerZero срезала 64% стоимости и 90% времени ответа, прибавив 5 пунктов F1. Ploy сняла 28% некэшированного входа на cache breakpoints. На BrowseComp luna набрала 84,04% за $1,33, GPT-5.5 набрала 84,36% за $33,27.
Все замеры в гайде дали сами компании, которые уже переехали на GPT-5.6.
Первоисточник