
Разбор · Обновили 22.08.2026
Какая нейросеть лучше: разбираем экзамены, по которым меряют ИИ
Каждую неделю очередная нейросеть «обходит все бенчмарки» — а через неделю её саму обходит следующая. Кому верить, разбираем на пальцах: что это за экзамены, кто их устраивает и почему цифра без паспорта не значит ничего.
Текст собран ИИ-агентами редакции под надзором автора · факты проверены по первоисточникам 22.08.2026
Масштаб разброса такой. Школьную математику топ-модели решают на 97 из 100 (тест GSM8K, сводка 2024 года). А задачи FrontierMath, которые математики собрали специально против машин, те же модели на старте брали меньше двух из ста — замер ноября 2024-го. Обе цифры честные, и обе пришли из бенчмарков.
Сразу короткий ответ на главный вопрос: единой «лучшей нейросети» не существует. Есть лучшие под конкретную задачу, и в конце статьи лежит способ найти свою за десять минут.
1. Что такое бенчмарк, простыми словами
Бенчмарк — это экзамен для нейросети. Составители собирают набор задач с проверяемыми ответами, прогоняют через него модели и публикуют таблицу баллов. Никакой магии. Те же ЕГЭ, только сдают их не школьники, а ChatGPT, Claude и DeepSeek.
Слово перегружено. В поиске «бенчмарк» чаще всего значит тест железа вроде AnTuTu для смартфона. Здесь речь про экзамены для ИИ, у них другое устройство и свои болезни.
Бенчмарк не то же самое, что рейтинг. Бенчмарк ставит балл за один экзамен, а рейтинг сводит много экзаменов в таблицу «кто лучше». Под любым «рейтингом нейросетей 2026» лежат конкретные бенчмарки, и качество рейтинга упирается в их качество.
Аналогия с ЕГЭ не буквальная. У человеческого экзамена есть проктор и паспорт сдающего, у машинного — только честность организаторов. Дальше видно, куда это приводит.
2. Как устроен прогон: задачи, обвязка, балл
Любой бенчмарк собирается из трёх частей.
Метрик немного, и все переводятся на человеческий.
Теперь представь два экзамена по одному предмету. Одному сдающему дали калькулятор, черновик и три попытки, другому устный ответ без всего. Предмет один, оценки несравнимы. Ровно это делает обвязка.
Пример из живых таблиц. Claude Opus 4.5 на SWE-bench Pro показывает 45,9% в стандартизованной обвязке Scale AI и 52–54% в агентных обвязках со свободой действий (замеры SEAL и независимые, 2026). Модель одна, разница до восьми пунктов. Цифру без указания обвязки сравнивать не с чем.
3. Какие бенчмарки главные сейчас
Эрудиция. MMLU с 2020 года гонял модели по 57 предметам, но топы упёрлись в потолок: около 88% при уровне экспертов 89,8% по сводке бенчмарка за 2024 год. Тогда индустрия собрала Humanity’s Last Exam, «последний экзамен человечества» на 2 500 вопросов от тысячи учёных. Лучшие модели без инструментов пока не берут на нём и половины (lastexam.ai, 2026).
Код. SWE-bench заставляет агента чинить реальные задачи из GitHub, а патч гоняется против скрытых тестов.
Агенты. METR меряет не баллы, а длину задач, которые ИИ вытягивает с надёжностью 50%. Этот горизонт удваивается каждые четыре месяца и к маю 2026 дошёл до 16–20 часов человеческой работы (METR, Time Horizon 1.1).
Арена. LMArena устраивает слепые дуэли: два анонимных ответа, живой человек голосует за лучший. Это конкурс симпатий, а не экзамен. Побеждает ответ, который понравился, и это не всегда ответ, который верен.

4. Почему старые экзамены умирают
Свежие бенчмарки насыщаются за месяцы — поэтому индустрия строит всё более злые датасеты и композитные индексы.
У бенчмарков короткая жизнь. GLUE, главный экзамен по пониманию языка 2018 года, модели превзошли примерно за год. MMLU продержался четыре года: GPT-3 в 2020-м набирал 43,9%, а к 2024-му топы вышли на 88% и перестали различаться.
Stanford AI Index фиксирует, что свежие бенчмарки теперь насыщаются за месяцы. Насыщенный экзамен бесполезен: контрольная для пятиклассников не отличит двух профессоров, оба напишут её на пятёрку.
Первый ответ индустрии — всё более злые датасеты вроде FrontierMath. Задачи для него собирали больше шестидесяти математиков, включая Терренса Тао.
Второй ответ — композитные индексы. Epoch Capabilities Index сшивает больше пятидесяти бенчмарков в одну шкалу, и она не ломается, когда очередной экзамен «решён».

5. Какая нейросеть лучше: почему нет одного ответа
Лучшей вообще не бывает, бывает лучшая для задачи. Чемпион по коду не обязан быть чемпионом по видео или картинкам. Таблицы это подтверждают: лидеры разных классов бенчмарков не совпадают.
Алгоритм на десять минут.
1. Определи свою задачу: код, тексты, картинки или математика.
2. Открой профильный бенчмарк из карты выше и возьми топ-3, а не топ-1. Разница внутри тройки обычно меньше погрешности замера.
3. Прогони все три модели на паре своих реальных задач. Свой мини-экзамен скажет больше, чем чужая таблица.
Кто не хочет собирать таблицы руками, смотрит композитные индексы: там за обвязками и датами следит измеритель.

Для кода мы делаем это сами. РуБенч гоняет код-агентов на задачах на русском, а Индекс вайбкодинг.ру замеряет их заметность на российском рынке.
6. Почему цифрам нельзя верить в лоб
Пять задокументированных способов, которыми цифры врут.
Бенчмарки давно стали маркетингом: высокая строчка продаёт подписки.
Подмена модели на арене. В апреле 2025 Meta подала на LMArena специальную версию Llama 4 Maverick, натренированную нравиться людям в дуэлях. Кастомная версия заняла второе место, а публичная стояла примерно тридцать второй. После скандала арена ужесточила правила.
Игра в лучшую попытку. Исследование «The Leaderboard Illusion» (апрель 2025) показало, что крупные лаборатории приватно гоняли на арене десятки вариантов моделей и публиковали только лучший. Meta прогнала до 27 вариантов перед релизом Llama 4.
Утечка задач в обучение. Модели учатся на текстах из интернета, куда попадают и сами задачи экзаменов. Проверка на «чистом зеркале» роняла точность на GSM8K до 23 пунктов (NAACL 2024). Модель не решала задачи, она их помнила: билеты утекли в интернет задолго до экзамена.

Брак самих экзаменов. В MMLU 6,5% вопросов содержат ошибки (исследование «Are We Done with MMLU?», 2024). SWE-bench чинили ручным отбором пятисот «проверенных» задач, а потом перепроверка нашла серьёзные дефекты в 59% провальных прогонов. После этого OpenAI в 2026-м публично списала этот бенчмарк как метрику фронтира.
Красивые графики релизов. На презентации GPT-5 в августе 2025 столбики диаграмм противоречили собственным числам, и Сэм Альтман признал «mega chart screwup». Слайд анонса не источник. Источник — независимый прогон.
7. Переносится ли балл в реальную работу
В 2025 году лаборатория METR проверила это на живых людях. 16 опытных разработчиков решали 246 реальных задач в своих проектах, часть — с ИИ-помощниками. С ИИ они оказались на 19% медленнее, хотя сами оценивали своё ускорение в плюс 20%.
Вывод бьёт не по нейросетям, а по слепой вере в баллы. Экзамен меряет задачу в вакууме. В живой работе решают контекст проекта, навык постановки задач и цена проверки чужого кода.
Эксперимент METR, июль 2025: 16 опытных open-source разработчиков, 246 задач в их собственных проектах.
8. Кто всё это меряет и на что они живут
У каждой таблицы есть автор, а у автора есть интересы.
Epoch AI, некоммерческая лаборатория на грантах, держит FrontierMath. В январе 2025 она признала, что создание бенчмарка тайно оплатила OpenAI, имевшая доступ к задачам.
LMArena выросла из академического проекта Berkeley в компанию с оценкой 1,7 млрд долларов. Рост совпал с главной критикой: исследование о перекосе арены в пользу больших лабораторий вышло ещё в апреле 2025-го.
Scale AI, державшая лидерборды SEAL, в 2025 году продала 49% компании Meta. Конкуренты свернули с ней работу.
Толпа тоже измеритель. Миллионы голосов арены честно меряют симпатии, вопрос лишь в том, что ты хочешь купить: симпатичный ответ или решённую задачу.

Сами лаборатории публикуют баллы своих моделей в собственных обвязках, и независимой проверки эти цифры по умолчанию не проходят.
Правило чтения простое. У каждой цифры смотри тройку: кто мерял, в какой обвязке, какого числа. Нет хотя бы одного ответа, значит перед тобой не факт, а реклама.
9. А что с русским языком
Английские экзамены почти не проверяют русский, для него есть свои. MERA — открытый бенчмарк консорциума Сбера, Яндекса, Skoltech и РАН из 21 задачи с закрытыми тестами. llmarena.ru устраивает слепые дуэли на русском. Модели GigaChat, YandexGPT и T-pro меряются именно там.
Наш вклад на этой полке — РуБенч, независимый бенчмарк код-агентов на задачах на русском с открытой методологией.


10. Частые вопросы
Какая нейросеть самая умная прямо сейчас?+
Смотри живые композитные индексы, Artificial Analysis или Epoch Capabilities Index. Любой напечатанный здесь ответ протух бы за месяц. И помни про тройку «кто мерял, обвязка, дата».
Какая лучшая бесплатная?+
Бесплатные тарифы меняются чаще, чем рейтинги. Возьми топ-3 своего класса задач и проверь, у кого из них живой бесплатный тариф.
LMArena — это что?+
Сайт слепых дуэлей нейросетей. Задаёшь вопрос, получаешь два анонимных ответа, голосуешь. Из миллионов голосов собирается Elo-рейтинг: вкус толпы, не экзамен.
SWE-bench — это что?+
Экзамен для код-агентов на реальных задачах из GitHub. Версию Verified в 2026 списала сама OpenAI: экзамен насытился и накопил брак.
Чем бенчмарк отличается от индекса?+
Бенчмарк — один экзамен. Индекс сводит много экзаменов в один балл. В финансах у слова вообще другой смысл, эталон для сравнения доходности.
Источники
- Epoch AI — FrontierMath: the benchmark (2024) — официальный сайт
- lastexam.ai — Humanity’s Last Exam (2025) — официальный сайт
- OpenAI — Introducing SWE-bench Verified (2024) — официальный релиз
- OpenAI — Why we no longer evaluate SWE-bench Verified (2026) — официальный релиз
- METR — Measuring the impact of AI on experienced developers (2025) — официальный сайт
- METR — Time Horizon 1.1 (2026) — официальный сайт
- Scale AI — SEAL leaderboard: SWE-bench Pro (2026) — официальный сайт
- Stanford HAI — AI Index Report (2026) — официальный сайт
- MERA — бенчмарк русского языка — официальный сайт
- arXiv — The Leaderboard Illusion (2025) — научная статья
- arXiv — Are We Done with MMLU? (2024) — научная статья
- Wikipedia — MMLU — справочник
- TechCrunch — Meta’s vanilla Maverick ranks below rivals (2025) — пресса
- TechCrunch — Epoch AI criticized for OpenAI funding disclosure (2025) — пресса
- Futurism — GPT-5 demo chart errors (2025) — пресса
Запомнить
1. Бенчмарк — экзамен для нейросети. Рейтинг, не называющий бенчмарки под собой, пуст.
2. Цифра существует только с тройкой «кто мерял, какая обвязка, какая дата». Без тройки это реклама.
3. Один общий балл не решает ничего. Выбирай по своему классу задач и бери топ-3, а не топ-1.
4. Арена показывает вкус толпы, экзамен меряет знания, композит сводит всё в один балл. Это три разных инструмента.
5. Лучший экзамен — собственный. Десять минут на трёх моделях со своей задачей скажут больше любой таблицы.