
Разбор · Обновили 23.08.2026
Какая нейросеть лучше для кода: разбираем бенчмарки для ИИ-программистов
Рейтинги «лучших нейросетей для кода» стоят на бенчмарках, и главный из них топ-модели сдают на семьдесят с лишним из ста. А на свежих закрытых задачах те же модели решают одну из шести. Разбираем, как читать кодовые бенчмарки: задачи, харнес и кто на самом деле отвечал.
Текст собран ИИ-агентами редакции под надзором автора · факты проверены по первоисточникам 23.08.2026
Знакомая история. Открываешь рейтинг «лучших нейросетей для кода», сверху модель с рекордным баллом. Берёшь её в свой проект — и она ходит кругами вокруг простого бага. Таблица не врала. Просто балл в ней собран не так, как ты его прочитал.
Короткий ответ сразу: единой «лучшей нейросети для кода» нет, а у баллов кодовых бенчмарков есть три подвоха. Задачи утекают в обучение моделей, балл рисует харнес, а иногда за модель отвечает вообще другая модель. Разберём все три подвоха и соберём инженерный способ выбора.
2. HumanEval: бенчмарк, который умер от успеха
Первый массовый бенчмарк кода OpenAI выпустила в июле 2021 года. HumanEval, 164 задачки на Python: вот описание функции, напиши тело, пройди тесты. Тогдашний Codex решал 28,8% (статья OpenAI, 2021).
Казалось, вот линейка прогресса на годы. Оказалось, на четыре. К 2025-му топ-модели вышли на 96%+, а разница между «97» и «98» на 164 задачах — меньше двух задач, случайный шум. Бенчмарк перестал различать сильных.
Задачи 2021 года к тому же давно лежат в интернете, то есть в обучающих данных моделей. Отличить «решил» от «вспомнил» на HumanEval уже нельзя. Если в обзоре нейросеть хвалят циферкой HumanEval, обзор устарел года на три.
Мораль первой истории: маленький набор задачек-функций не равен профессии. Программист не пишет функции по описанию в вакууме, он копается в чужом репозитории. Индустрия это поняла и построила бенчмарк из настоящей работы.
3. SWE-bench: бенчмарк из настоящей работы
В октябре 2023 команда из Принстона собрала SWE-bench из 2 294 реальных задач с GitHub: живые баг-репорты и запросы фич из 12 популярных Python-проектов. Модели дают весь репозиторий и текст задачи. Она должна написать патч, а патч гоняют против скрытых тестов.
Это было честнее всего, что существовало. Не задачка из учебника, а настоящий проект на сотни тысяч строк, где сначала нужно найти, где именно чинить.
В августе 2024 OpenAI навела в бенчмарке порядок: профессиональные инженеры перепроверили 1 699 задач, по три эксперта на каждую, и отобрали 500 корректных. Так появился SWE-bench Verified, на два года главная цифра всех презентаций. «Наша модель решает X% SWE-bench» звучало из каждого релиза.
Сегодня у лидера официального лидерборда 76,8% в самом скромном харнесе, где у модели только терминал и одна попытка (swebench.com, замер февраля 2026). В релизах лабораторий с их агентными харнесами звучат цифры заметно выше. Модели те же, разница в условиях сдачи.

Но у этого бенчмарка нашлась болезнь интереснее насыщения.
4. Подвох первый: задачи выучены
Три вскрытия 2024–2026 годов: подсказки в самих задачах, память вместо чутья и узкий корпус.
В 2024–2026 исследователи вскрыли SWE-bench с трёх сторон, и каждый разрез убавлял веры в таблицу.
Ответы лежали в самих задачах. Задачи SWE-bench — старые issue из публичных репозиториев, и во многих обсуждениях прямо написано, как чинить. Когда исследователи отфильтровали такие задачи и слабые тесты, результат агентов на Verified упал с 51,7% до 25,9% (SWE-Bench+, 2024). Половина успеха держалась на подсказках и дырявых проверках.
Модель помнит задачи наизусть. Работа «The SWE-Bench Illusion» (июнь 2025) показала: топ-модели называют файл, где сидит баг, в 76% случаев по одному тексту задачи, вообще не заглядывая в репозиторий. На проектах вне бенчмарка та же способность падает до 53%. Это память, а не инженерное чутьё. Задачи просто были в обучающих данных.
Корпус узкий. Около 40% задач — из одного проекта Django, пять проектов покрывают больше 80% задач. И всё это только Python. Отличник такого бенчмарка знает чужие старые баги Django, а не профессию программиста.
Дальше произошло редкое: индустрия согласилась. В начале 2026 OpenAI публично перестала отчитываться по Verified и перешла на бенчмарки нового поколения. О них следующая история.
5. Бенчмарки нового поколения: закрытые задачи и реальные деньги
Ответ на выученные задачи один: задачи, которых модель не могла видеть. Три подхода.
Закрытые задачи. SWE-bench Pro (Scale AI, сентябрь 2025) собрал 1 865 задач из 41 репозитория на четырёх языках, и часть корпуса держит закрытой: эти репозитории не могли попасть в обучение. Задачи взрослые, в среднем правка на 107 строк в четырёх файлах. Результат отрезвил.
Модели, решающие старый бенчмарк на 70 из 100, на закрытых свежих задачах берут меньше 20
Свежие задачи по дате. LiveCodeBench засчитывает модели только задачи, опубликованные после конца её обучения. Списать физически не с чего. Родственный LiveCodeBench Pro взял 584 задачи олимпиадного уровня: лучшие модели без инструментов решают 53% средних и 0% сложных (июнь 2025). По олимпиадной шкале это уровень «мастер», далеко не гроссмейстер.

Реальные деньги вместо баллов. SWE-Lancer (OpenAI, февраль 2025) взял 1 400 с лишним настоящих фриланс-заказов с Upwork на миллион долларов суммарных выплат, от багфикса за $50 до фичи за $32 000. Лучшая модель исследования «заработала» $403 тысячи из миллиона. Хороший подмастерье, которому пока не доверить большинство заказов.
Есть и бенчмарк на самостоятельность целиком. Terminal-Bench проверяет, как модель сама ведёт задачу в терминале от начала до конца, с установкой окружения и отладкой. На его сложном ярусе лучшие берут около 66% (Artificial Analysis, май 2026).
6. Карта кодовых бенчмарков
Главный водораздел карты — колонка «свежие задачи»: она отделяет бенчмарки, которым можно верить, от выученных.
Соберём всё в одну таблицу. Имена — двери на сами площадки, а звёзды GitHub показывают, насколько бенчмарк на слуху у разработчиков.
Задачи свежее обучения — этим таблицам можно верить
Задачи из открытой сети — выучены моделями
Отдельная полка: замеры, арены, агрегаторы
Карта составлена по официальным площадкам, срез 23.08.2026. Эмблемы — значки площадок; звёзды GitHub замерены 23.08.2026 по репозиторию бенчмарка, прочерк — открытого репозитория нет.
Одна ловушка карты заслуживает сноски. Именем DeepSWE называются две разные вещи: RL-агент 2025 года от Together AI и бенчмарк 2026 года от Datacurve со 113 задачами, собранными с нуля. В таблице выше — бенчмарк. Встретишь цифру «DeepSWE» — сначала выясни, о ком речь.
7. Подвох второй: балл рисует харнес
Один и тот же ИИ в разных харнесах даёт разные баллы — сравнивать можно только пары «модель + харнес».
Карта выглядит как ответ. Теперь второй подвох: балл в таблице принадлежит не модели, а паре «модель + харнес».
Лучшее доказательство — официальный лидерборд Terminal-Bench, где одна и та же модель заявлена в нескольких харнесах сразу.
Один GPT-5.5 на одном бенчмарке: три харнеса — три балла
То же с другой стороны. У линейки Claude Opus на одном SWE-bench Verified живут три числа: 76,8% на официальном лидерборде в скромном bash-харнесе, 80,9% в релиз-заявке Anthropic со своим харнесом (Opus 4.5, ноябрь 2025) и 88,6% у независимого замерщика Vals AI (Opus 4.8, август 2026). Никто не врёт. Просто это три разных условия сдачи и две версии модели.
Ручкой служит даже усердие. Один gpt-5 на Aider Polyglot: 88,0% на высоком уровне размышления и 81,3% на низком — семь пунктов на одном переключателе.
Отсюда правило чтения. Строка таблицы без названия харнеса не говорит ничего, а смена харнеса легально двигает балл и меняет победителя: когда агрегатор Artificial Analysis заменил один компонент своего индекса, лидер сменился без единого нового релиза моделей.
8. Подвох третий: а ту ли модель мерили
Летом 2026 выяснилось: часть ответов «модели» в таблицах давала другая модель.
Третья история случилась летом 2026-го и добавила вопрос, который раньше не приходил в голову никому: а кто вообще отвечал на задачи.
У Anthropic вышла Claude Fable 5 с необычным устройством: перед моделью стоит фильтр-классификатор, и запросы из чувствительных областей он передаёт другой модели, Opus 4.8. В API такой отказ виден явно, отдельным полем ответа. А в приложениях и в Claude Code подмена происходит тихо: спросил одну модель, ответила другая.
Для замерщиков это стало ловушкой. Artificial Analysis обнаружила, что примерно в 8% задач её индекса вместо Fable 5 отвечала Opus 4.8, и опубликовала смешанный балл, честно пометив конфигурацию «Opus 4.8 Fallback». Vals AI на научном бенчмарке GPQA Diamond показала размах трактовок: 93,18%, если засчитывать ответы подменной модели, и 55,56%, если считать каждый отказ провалом. Одна модель, одна таблица, тридцать восемь пунктов разницы от одной учётной политики.
Через два дня после релиза Anthropic сделала самый тихий из фильтров видимым, а замерщики развели баллы на «pure» и «practical»: чистая способность модели и поведение с подменами. Оба числа честные, но это разные числа.
Так у паспорта цифры появился четвёртый вопрос: чьи ответы внутри балла. Хороший замерщик отвечает на него прямо в названии конфигурации.
9. Переносится ли балл в настоящую работу
Самый неудобный замер сделала лаборатория METR летом 2025-го, и он про людей. 16 опытных разработчиков решали 246 задач в собственных проектах, случайная часть задач шла с ИИ-помощниками. До старта они ждали ускорения на 24%. После финиша оценивали своё ускорение в 20%. Секундомер показал обратное: с ИИ они работали на 19% медленнее.
Это ранний 2025-й, конкретные инструменты и очень опытные люди в очень знакомом им коде, и METR уже перепроектирует эксперимент (февраль 2026). Но вывод для чтения таблиц вечный. Балл бенчмарка и польза в твоём проекте — разные величины, и вторая не следует из первой автоматически.
Чего кодовые бенчмарки не меряют почти совсем: ревью чужого кода, отладку по кривому баг-репорту, работу в легаси на миллион строк, читаемость и безопасность написанного. То есть большой кусок настоящей работы программиста.
Эксперимент METR, июль 2025: 16 опытных open-source разработчиков, 246 задач в их собственных проектах.
10. Какая нейросеть лучше для кода: алгоритм выбора
Теперь собираем всё в короткий способ выбора.
1. Определи свой класс задачи, у каждого свой бенчмарк.
2. Возьми топ-3 свежего лидерборда, не топ-1. На свежем срезе SWE-rebench пятёрка топов уместилась в два пункта (окно май–июль 2026): внутри тройки разница меньше погрешности, а цены и лимиты различаются в разы.
3. Прогони тройку на паре своих реальных задач. Твой репозиторий, твой стек, твои формулировки. Такой домашний бенчмарк скажет больше любой таблицы, потому что твоих задач гарантированно не было в обучении.
У каждой цифры по дороге проверяй паспорт, теперь из четырёх вопросов: кто мерял, каким харнесом, когда собраны задачи и чьи ответы внутри балла.
Для задач на русском мы держим собственный бенчмарк. РуБенч гоняет код-агентов на задачах с русским ТЗ по открытой методологии: свежие задачи, закрытые тесты, у каждого балла назван харнес.

11. Куда это едет
Разоблачения бенчмарков — не приговор моделям. Честные замеры роста впечатляют сильнее маркетинговых.
METR меряет не баллы, а длину задач: какую работу, если считать в часах человека-профи, модель вытягивает с надёжностью 50%. К январю 2026 горизонт лучшей модели дошёл до пяти с лишним часов, и он удваивается каждые 4–7 месяцев (METR, Time Horizon 1.1). Год назад счёт шёл на десятки минут.
А на ICPC 2025, мировом финале командного программирования, модели OpenAI решили 12 задач из 12. Ни одна команда людей столько не взяла. Gemini решила 10 из 12, включая задачу, которую не осилила ни одна человеческая команда (сентябрь 2025).
Противоречия с «0% сложных задач» здесь нет. На олимпиаде моделям дали время, попытки и вычислительный бюджет, в бенчмарке — одну попытку без инструментов. Это и есть главный навык чтения кодовых цифр: балл существует только вместе с условиями замера.
12. Частые вопросы
Какая нейросеть лучше всего пишет код прямо сейчас?+
Открой свежий лидерборд под свой класс задач из карты выше и возьми топ-3. Любой конкретный ответ, напечатанный здесь, протух бы за месяц.
Что такое харнес простыми словами?+
Обвязка прогона: код вокруг модели, который решает, какие инструменты, контекст и сколько попыток она получает. Один и тот же ИИ в разных харнесах даёт разные баллы, поэтому сравнивать можно только пары «модель + харнес».
SWE-bench — это что, простыми словами?+
Бенчмарк, где модели дают настоящий проект с GitHub и баг-репорт, а она должна написать исправление, проходящее тесты. Старую версию Verified модели почти выучили, смотреть стоит на SWE-bench Pro и Live.
Есть ли бесплатная нейросеть для кода?+
Бесплатные тарифы есть почти у всех, но лимиты меняются чаще рейтингов. Выбери топ-3 по своей задаче и проверь их текущие бесплатные лимиты.
А для 1С нейросеть есть?+
Отдельного публичного бенчмарка по 1С нет, поэтому рейтингам «для 1С» верить не с чего. Работает тот же алгоритм: возьми топ-3 общих кодовых моделей и прогони на своих обработках.
Локальная нейросеть для кода — вариант?+
Да, когда код нельзя отдавать наружу. По баллам локальные модели отстают от облачных. Сравнивай на тех же лидербордах: открытые модели там помечены.
Чем это отличается от вайбкодинга?+
Вайбкодинг отвечает на вопрос «как работать»: ты ставишь задачу, агент пишет код. Бенчмарки отвечают на вопрос «какого агента взять».
Источники
- SWE-bench — официальный лидерборд — официальный сайт
- OpenAI — Introducing SWE-bench Verified (2024) — официальный релиз
- Scale AI — SWE-bench Pro (2025) — официальный релиз
- LiveCodeBench — лидерборд — официальный сайт
- Terminal-Bench — лидерборд 2.0 (Laude Institute) — официальный сайт
- Aider — Polyglot leaderboard — официальный сайт
- SWE-rebench (Nebius) — официальный сайт
- Artificial Analysis — Coding Agents: методология — официальный сайт
- Anthropic — Claude Opus 4.5 (2025) — официальный релиз
- Vals AI — SWE-bench: независимые прогоны — официальный сайт
- DeepLearning.AI — The Batch #358: Claude’s Benchmark Problems (2026) — пресса
- METR — Measuring the impact of AI on experienced developers (2025) — официальный сайт
- METR — Time Horizon 1.1 (2026) — официальный сайт
- Google DeepMind — Gemini gold at ICPC World Finals (2025) — официальный релиз
- arXiv — HumanEval: Evaluating LLMs Trained on Code (2021) — научная статья
- arXiv — SWE-bench: Can LMs Resolve Real-World GitHub Issues? (2023) — научная статья
- arXiv — SWE-bench Pro (2025) — научная статья
- arXiv — The SWE-Bench Illusion (2025) — научная статья
- arXiv — SWE-Bench+ : Enhanced Coding Benchmark (2024) — научная статья
- arXiv — LiveCodeBench Pro (2025) — научная статья
- arXiv — SWE-Lancer: Can Frontier LLMs Earn $1 Million? (2025) — научная статья
- Together AI — DeepSWE (RL-агент, 2025) — официальный релиз
Запомнить
1. Кодовый бенчмарк — экзамен с проверкой тестами. Это честнее эссе, но у него три подвоха: выученные задачи, харнес и подмена сдающего.
2. Цифре нужен паспорт из четырёх вопросов: кто мерял, каким харнесом, когда собраны задачи и чьи ответы внутри балла.
3. Высокий балл на SWE-bench Verified не делает модель программистом: на закрытых свежих задачах те же модели решают одну из шести.
4. Выбирай по своему классу задач из карты, бери топ-3 и прогоняй на паре собственных задач: их точно не было в обучении.
5. Прогресс настоящий, горизонт задач удваивается каждые 4–7 месяцев. Врут не модели, врут цифры без условий замера.