28 июля 2026 г.
Топ-модели упёрлись в 3D-лабиринт: лучший результат на MazeBench - 12%
Лучший результат на MazeBench - 12%. Бенчмарк вышел 28 июля от лаборатории Patience Cave: 3D-мир с открытой картой, сотни комнат и головоломок, проверяют долгое планирование и пространственное мышление. В прогонах четыре модели: GPT 5.6 Sol, Fable 5, Opus 5 и Kimi K3.

🚨 AI News | TestingCatalog
@testingcatalog
Patience Cave представили MazeBench - новый бенчмарк на головоломках, в 3D. Лучший результат сейчас - 12% 👀 - GPT 5.6 Sol - Fable 5 - Opus 5 - Kimi K3 Сколько времени уйдёт у ИИ, чтобы перевалить за 80? P.S. Похоже на хитрый план ещё сильнее оттянуть релизы моделей!
Представляем MazeBench - 3D-мир с открытой картой, который проверяет долгосрочное планирование и пространственное мышление по картинке. В нём сотни комнат и головоломок. Лучшие агенты сегодня не проходят дальше первых уровней.


· 14,5 тыс. просмотров
Почему это важно: Обычная история с новым бенчмарком: он выходит, и топ-модели сразу делят верх таблицы. Здесь наоборот. Четыре разные модели застряли на первых уровнях, выше 12% не поднялся никто. Проверяют не знание фактов и не код: агенту нужно держать карту сотен комнат и не терять цель на длинной дистанции. Именно там ломаются агенты, которые в чате выглядят умными. Как считают процент и кто может прогнать свой прогон, в анонсе не сказано.
Не хотите разбираться сами? Внедряем ИИ в ваш бизнес: задачи без лимита, одна цена в месяц, отмена в любой момент.
Что дальше: Ждать публичную таблицу с методикой: пока есть только четыре имени и цифра 12%. Свой замер простой - дать агенту задачу на 200+ шагов с возвратами к пройденному и посмотреть, на каком шаге он теряет состояние.
Первоисточник