27 августа 2026 г.
Объёмную работу забирают дешёвые модели: та же задача вместо $1 стоит $0.10
Персонализация новостей на gpt-5.6-luna обходится в $0.10 за запрос: на прошлом поколении та же задача стоила $1.
Питер, сооснователь Segment, поделил свою работу надвое: задачи уровня «IQ 180» и объёмная рутина.
На рутину приходится около 95%. Самый умный уровень там не нужен, нужны скорость и цена.
Раньше эту работу всё равно гоняли на дорогих моделях и платили по полной цене. Теперь её забирают модели на порядок дешевле, и разница видна прямо в счёте за API.
Арифметика простая. Кэлвин Френч-Оуэн замерил это на персонализации новостей: на прошлом поколении класса Sonnet один запрос стоил около $1, у gpt-5.6-luna та же задача выходит в среднем $0.10 при вполне приличном результате. Поиск по тысячам писем обходится ему в десятки центов, а накрутить крупный счёт на длинных исследовательских цепочках не вышло. Скорость он видит около 100 токенов в секунду.
Прайс gpt-5.6-luna: $0.20 за миллион входных токенов и $1.20 за миллион выходных. Окно контекста — 1,05 млн токенов, ответ до 128 тысяч.
Веса лежат открыто. GLM-5.3-Flash выложили на Hugging Face под лицензией MIT. Модель поднимается у себя двумя командами: `pip install vllm`, дальше `vllm serve "zai-org/GLM-5.3-Flash"`. Рядом работают SGLang, transformers и Unsloth. Внутри MoE: на запрос просыпается 18 млрд параметров из 320 млрд, поэтому гигант отвечает по цене середняка. По индексу Artificial Analysis задача на ней стоит $0.045, а подписчикам GLM Coding Plan её открыли с тройной квотой к GLM-5.3.
На кодинге сам Кэлвин почти всегда берёт верх линейки — Fable 5 и 5.6 Sol. Дешёвые быстрые модели он ставит на объёмную работу, а не на код.
При подписке в $30 в месяц потребительское приложение на дорогих моделях не окупалось. Цена инференса и была ответом на вопрос, почему потребительских ИИ-компаний почти нет.
Первоисточник