./новости · 28 июля 2026 г.
новость
Модели упёрлись в 3D-лабиринт из сотен комнат: лучший результат - 12%
источник: @testingcatalog · X·
машинная выжимка · сверена с источником

🚨 AI News | TestingCatalog
@testingcatalog
Patience Cave представили MazeBench - новый бенчмарк на головоломках, в 3D. Лучший результат сейчас - 12% 👀 - GPT 5.6 Sol - Fable 5 - Opus 5 - Kimi K3 Сколько времени уйдёт у ИИ, чтобы перевалить за 80? P.S. Похоже на хитрый план ещё сильнее оттянуть релизы моделей!
Представляем MazeBench - 3D-мир с открытой картой, который проверяет долгосрочное планирование и пространственное мышление по картинке. В нём сотни комнат и головоломок. Лучшие агенты сегодня не проходят дальше первых уровней.


· 2,7 тыс. просмотров
12% - потолок на MazeBench, новом бенчмарке от Patience Cave, о котором рассказали 28 июля 2026. Это 3D-мир из сотен комнат и головоломок: меряют долгое планирование и пространственное мышление по картинке. В прогоне четыре модели - GPT 5.6 Sol, Fable 5, Opus 5 и Kimi K3, и ни одна не уходит дальше стартовых уровней.
Почему это важно: Раньше бенчмарк давал модели одну задачу: ответить, починить код, пройти тест. MazeBench ставит другое условие: сотни комнат подряд, и план надо держать от первой до последней. На этой длине четыре сильнейшие модели набирают 12%. Patience Cave не назвали ни методику подсчёта, ни дату следующего прогона, ни как получить доступ к среде.
Что дальше: Даты следующего замера в анонсе нет. Пока её нет, возьмите свой самый длинный агентский сценарий и запишите, на каком шаге модель теряет план: это ваш личный аналог MazeBench.
первоисточник