./новости · 6 августа 2026 г.
новость
Модели проверили на задачах из нераскрытой игры: лучший результат 59% у Opus 5
источник: @epochairesearch · X·
машинная выжимка · сверена с источником

Epoch AI
@epochairesearch
Мы запустили новый бенчмарк «game puzzles»: он устроен так же, как наш Chess Puzzles, но задачи взяты из другой игры, название которой мы не раскрываем. Так мы проверяем ИИ на задачах с упором на рассуждение, под которые модели, скорее всего, не дообучали. Сейчас рекорд держит Opus 5 с результатом 59%.

· 641 просмотров
Epoch AI запустила бенчмарк на головоломках из игры, название которой не раскрывает. Лучший результат - 59%, его держит Opus 5. Устройство то же, что у их Chess Puzzles, только игра другая и закрытая.
Зачем прятать игру. Шахматные задачи лежат в открытом доступе миллионами, и модели видели их при обучении. Высокий балл на них не отделяет рассуждение от памяти.
Раньше Epoch AI мерила логику на шахматных задачах. Теперь лаборатория взяла игру, которую не называет, и дообучиться на ней заранее уже не выйдет.
Лидер решает чуть больше половины. 59% у Opus 5 - это верх таблицы, остальные модели ниже. До двух задач из трёх не дотягивает пока никто.
Пока название игры закрыто, каждая следующая модель приходит на этот замер такой же неподготовленной.
первоисточник