3 сентября 2026 г.
Ни одна модель не лидирует всюду: Martian открыла дашборд на 44 LLM
Martian выложила AI Frontier - открытый дашборд, где 44 модели сравниваются по качеству, реальной цене работы и стабильности ответов. Внутри пять видов: профили моделей, дуэли пар, прайс против замеренной цены, надёжность на повторах и методология.

🚨 AI News | TestingCatalog
@testingcatalog
Martian выпустила AI Frontier - интерактивный дашборд, который показывает, как 44 LLM соотносятся по качеству, по цене на реальных задачах и по тому, насколько стабильно каждая решает одну и ту же задачу от прогона к прогону. Дашборд разбит на пять видов: профили отдельных моделей, сравнение пар, заявленный прайс против замеренной цены, стабильность на повторных попытках и методология под всем этим. Model Reliability считает, как часто модель решает однотипную задачу одним и тем же способом на повторных попытках; оценки идут примерно от 0,74 до 0,96. Ни одна модель и ни одно семейство не лидирует безоговорочно 👀
Мы получили на 46% меньше ошибок, чем у лучшей одиночной LLM, по 16 самым используемым бенчмаркам (TerminalBench, LiveCodeBench и другие). Вот как это возможно и что каждая модель способна выдать при оптимальном использовании (любой бенчмарк упускает большую часть возможностей моделей) 👇 Интерактивный сайт: https://aifrontier.withmartian.com/ Научная статья: https://arxiv.org/abs/2606.26836
· 3,1 тыс. просмотров
Одна таблица, один лидер, его и берут в работу. Дашборд Martian меряет другое: как часто модель решает одну и ту же задачу одинаково на десяти независимых прогонах. По этой шкале в статье диапазон - от 76,3% у GLM-4.6 до 90,2% у GPT-5-mini, Claude Sonnet 4.5 держит 87,8%, Gemini 2.5 Pro - 87,6%.
Дорогая не значит стабильная. Значимой связи между надёжностью модели, её качеством и ценой авторы не нашли. Для практика это меняет порядок выбора: одна модель на все задачи проигрывает связке, где под каждый тип задачи берётся своя.
Цифры разрыва в деньгах авторы измерили на агентских задачах. На Terminal-Bench 2.0 результат уровня лучшей модели стоит $2,6084, а идеальный выбор под задачу - $0,2539. На LiveBench-Coding - $0,0106 против $0,0026. В среднем по замерам точность уровня SOTA выходит на 85,2% дешевле.
Открывается дашборд по ссылке без регистрации. Роутер за замерами подключается отдельно как Martian Gateway: эндпоинт совместим с SDK OpenAI и Anthropic, ключ берётся в личном кабинете, за ним 200+ моделей.
В очередь на следующий прогон поставлены 12 моделей, включая Claude Opus 5, Gemini 3.7 Flash, Grok 4.6 и Qwen3.8 Max.
Первоисточник
