31 августа 2026 г.
Рейтинг моделей на русском обнулили: в новой MERA осталось 12 тестов из 23
Баллы старого лидерборда на новый не переносятся: Сбер заморозил MERA v1.2.0 и открыл Text 2.0 из 12 тестов.

Сильные модели дошли на старой MERA до уровня человека, а местами обошли его. Мерить стало нечем.
Команда MERA пересобрала текстовую часть с нуля: 12 датасетов вместо 23, 8700 запросов вместо 37 тысяч. Прогон одной модели стал в 4,3 раза короче.
Четыре группы навыков. Human-Centric проверяет загадки, юмор и понимание характеров. Culture-Specific спрашивает про регионы РФ и местный контекст. Agentic меряет следование инструкциям и вызов функций, Reasoning оставили под логику.
Тестовые наборы закрыты, разметку ответов модели не видят. У каждого теста не меньше пяти формулировок инструкции, чтобы модель не выигрывала подгонкой под один удачный промпт.
Итоговый балл считают геометрическим средним на трёх уровнях, от метрик к тестам и группам. Один аномально высокий результат теперь слабее тянет общий скор вверх.
Как прогнать свою. Код запуска лежит в ветке release_v2 репозитория MERA-Evaluation/MERA. Все 12 датасетов выложены на Hugging Face с открытым viewer, результат отправляется на лидерборд mera.a-ai.ru.
Старый рейтинг заморожен, публичный текстовый бенчмарк теперь один. Цифры прежней таблицы остаются её историей: 0.712 и 23-е место у GigaChat-3.1-Ultra — это сабмит от 26.03.2026 на версии v1.2.0.
На день анонса страница «Как работает MERA» на сайте всё ещё описывает 23 задачи старой версии, а технический отчёт помечен как coming soon.
Первые сабмиты на новый лидерборд покажут, разъедутся ли модели там, где старая MERA их уже не различала.
Первоисточник