18 августа 2026 г.
Четыре новые модели не сдвинули топ: Claude Opus 5 решил 92% прогонов Agents on Rails
17.08 бенч Agents on Rails принял четыре новые модели, но верх таблицы удержал Claude Opus 5 с 92% решённых прогонов.

DHH
@dhh
С ума сойти: Grok уже догнал GPT-Sol, а Muse от Meta вплотную подошла к Luna. Kimi тоже показал себя отлично!
Agents on Rails: мы добавили в бенчмарк четыре новые модели: @SpaceXAI Grok 4.6 (ваш запрос номер один) @ZhipuAI GLM 5.3 (вышла 3 дня назад) @GoogleDeepMind Gemini 3.7 Flash (вышла 4 дня назад) и @AnthropicAI Claude Opus 4.8 …но ни одна не забралась на вершину таблицы. По состоянию на 17 августа 2026: - Самая точная: по-прежнему Claude Opus 5. Решила 92% прогонов (58 из 63). (Kimi идёт вторым вплотную и стоит намного дешевле.) - Самая дешёвая: GPT-5.6 Luna, насколько мы можем судить, всё ещё самая дешёвая. (GLM 5.3 потребовала подписки, так что расходы по ней пока неизвестны.) - Быстрее всех: снова Luna.

Четыре свежие модели зашли в бенч агентов на Rails и не подвинули лидера ни на строчку.
В таблицу добавили Grok 4.6, GLM 5.3, Gemini 3.7 Flash и Claude Opus 4.8. По точности первым остался Claude Opus 5: он решил 58 прогонов из 63, то есть 92% (Agents on Rails, 17.08).
Второе место дешевле. Следом за Opus 5 идёт Kimi, и прогоны на нём стоят меньше (Agents on Rails, 17.08). Миллион входных токенов Kimi K3 обходится в $3, выходных в $15 у самой Moonshot AI, а через OpenRouter те же токены идут по $2,60 и $13 (17.07).
Дешевле и быстрее всех. Обе строки держит GPT-5.6 Luna: миллион входных токенов стоит $1, выходных $6 (прайс OpenAI, 09.07). GLM 5.3 в ценовой зачёт не попал, потому что идёт по подписке.
Grok догнал Sol. Тот же паритет виден в независимом индексе Artificial Analysis: у Grok 4.6 и GPT-5.6 Sol по 61 баллу (12.08). Grok при этом дешевле, $2 и $6 за миллион токенов против $5 и $30 у Sol.
Opus 5 держит верх с 17.08, и следующий прогон бенча покажет, сохранит ли он отрыв от Kimi.
первоисточник