13 июля 2026 г.
Grok 4.5 возглавил Long-Horizon-Terminal-Bench - 29 из 46 задач без решения
Вышел бенчмарк Long-Horizon-Terminal-Bench из 46 терминальных задач на часы работы и сотни шагов, Grok 4.5 занял первое место. Лучшая модель набирает лишь около половины среднего reward. 29 из 46 задач не решила ни одна модель.

Min Choi
@minchoi
Только что вышел новый Long-Horizon-Terminal-Bench. 46 реальных терминальных задач. Часы работы. Сотни шагов. И Grok 4.5 - #1 на лидерборде. Всё равно: никто не близок к решению. Лучшая модель набирает лишь ~половину среднего reward. 29 из 46 задач остаются нерешёнными кем-либо. Агенты умеют начинать сложную работу. Они всё ещё не умеют её заканчивать.

· 24,2 тыс. просмотров
Почему это важно: Бенчмарк меряет не старт, а удержание задачи на сотни шагов. Grok 4.5 лидирует и всё равно берёт только половину среднего reward. Агенты берутся за длинную работу, но не доводят её до конца - потолок в финише, а не в начале.
Не хотите разбираться сами? Внедряем ИИ в ваш бизнес: задачи без лимита, одна цена в месяц, отмена в любой момент.
Что дальше: Сверяйся с лидербордом при выборе агента под многошаговую задачу. Перед автономным прогоном на сотни шагов прогони задачу вручную и проверь, доходит ли модель до конца.
Первоисточник