Раунд 2 · обновлён 27.07.2026
Бенчмарк AI-агентов на русском
проект vibecoding.ru · статья arXiv↗
- 25
- задач
- ×3
- прогона на задачу
- 5
- репозиториев
- 4
- языка
- 13
- конфигураций · 1 вне зачёта
- 18.07.2026
- финализирован
РуБенч меряет ИИ для РУ-рынка. Первый бенчмарк - AI-агенты: настоящие задачи с ТЗ на русском, зачёт ставит скрытый тест автора починки. Дальше добавятся новые бенчмарки для новых срезов. Кто справляется лучше сегодня - таблица ниже.
Раунд 2 закрыт 18.07.2026 и обновлён 27.07: в таблице 12 конфигураций в зачёте и одна вне.
Лидерборд · раунд 2
Кто решает больше всех
Все агенты получают одни и те же 25 настоящих задач, по три независимых захода на каждую. Внутри захода дорешивать нельзя: сдал починку - скрытый тест автора либо принял её, либо нет. В таблице - средний процент успешных заходов; до 75 прогонов на строку.
Codex
GPT-5.6 Sol · xhigh
82.6 ±4.3
23
7.6
Claude Code
Opus 4.8 · xhigh
78.7 ±6.1
25
9.3
Claude Code
Opus 5 · xhigh
78.3 ±2.9
20
9.6
Codex
GPT-5.6 Luna · xhigh
75.4 ±2.5
23
6.1
Claude Code
Sonnet 5 · xhigh
74.7 ±2.3
25
8.7
SourceCraft CLI
ds
68.1
23
9.4
Codex
GPT-5.5 · xhigh
66.7 ±4.6
25
7.6
Claude Code
Haiku 4.5 · xhigh
53.3 ±4.6
25
5.1
Koda CLI
koda-pro
51.5
11
11.5
Antigravity
Gemini 3.1 Pro · high
49.3
25
2.7
Antigravity
Gemini 3.5 Flash · high
46.7
25
1.6
SourceCraft CLI
legacy
42.0
23
3.6
Claude Code
Fable 5 · xhigh
вне зачёта
85.0
20
8.7
pass@1 - средний процент успешных заходов (задача, решённая 2 раза из 3, даёт 67%) · N - сколько задач идёт в зачёт этой строки (каждая - трижды) · мин - медиана минут на задачу · ± - разброс между тремя прогонами · звёздочка - честный скор после вычета подсмотренных ячеек
Как считается скор. У агента один заход на задачу: сдал починку - тест либо принял её, либо нет, дорешивать нельзя. Таких независимых заходов по каждой задаче три. Задача, решённая 2 раза из 3, даёт строке 67%; скор строки - среднее по всем её задачам. То есть pass@1 - это «решил без дорешивания», а не «решил с первого из трёх раз».
Почему Fable 5 вне зачёта. Методологию и конвейер этого бенча собирала сама Fable 5 - участник не судит свой экзамен. Вторая причина вскрылась в траекториях: на 5 задачах из 25 продукт молча подменял модель на Opus 4.8. Разбор - сейфгард подменяет модель.
Почему N у строк разный. У каждой модели своя дата среза обучения. Задачи, чьи настоящие починки успели попасть в интернет до этой даты, из зачёта строки убираем: модель могла видеть ответ. Чем свежее модель, тем меньше задач проходит фильтр - отсюда N от 20 до 25.
Почему у части строк нет ±. Разброс показан там, где свод по трём прогонам опубликован в данных раунда. У новичков раунда 2 публиковалась по-ячеечная сетка без свода; пересчитывать задним числом не стали - честный пропуск лучше цифры из воздуха.
Что значит звёздочка у скора и почему разница меньше десяти пунктов - шум: границы раунда разобраны в разборе раунда 2.
Экономика · раунды 1-2
Сколько стоит решённая задача
Каждая точка - конфигурация. По вертикали - процент решённых задач, по горизонтали - средняя цена решённой задачи; переключатель показывает те же точки по минутам. Чем выше и левее точка, тем выгоднее агент.
раунды 1-2 · цена: 11 из 13 конфигураций
Цены - API-эквивалент по родному прайсу модели, средняя на задачу: Claude - из CLI-аккаунтинга ячеек; Codex - из session-роллаутов по прайсам OpenAI; koda-pro - из телеметрии траекторий по прайсу GLM-5.2 (identity базы - заявление вендора); Gemini - реконструкция токенов из транскриптов (оценка, без кэш-скидок). SourceCraft без цены до подтверждения модели вендором - виден на метрике «Минуты». fable-5 - вне зачёта (safeguard-fallback). koda-base вне графика.
Разумный дефолт - Claude Code + Sonnet 5: решает 74.7% задач по $2.42 за задачу. Opus 4.8 решает на 4 пункта больше, но стоит на треть дороже - а разброс между прогонами (±6.1) шире самой разницы. Проще говоря: эти четыре пункта могут быть случайностью.
Дешевле всех зачёт у GPT-5.6 Luna: 75.4% решённых по $0.72 за задачу - втрое дешевле Sonnet при том же уровне.
Быстрее всех - Gemini: Antigravity с 3.5 Flash и 3.1 Pro закрывают задачу за 1.6-2.7 минуты. Плата за скорость - точность: обе строки ниже Claude Code + Haiku 4.5 по доле решённого.
Методология
Почему этим цифрам можно верить
- 01
ТЗ на русском, написанные заново. Формулировки родились в бенче из живых багов и до публикации в интернете не существовали.
- 02
Судья - спрятанный тест мейнтейнера. Зачёт ставит не жюри, а тест, которым мейнтейнер реально закрыл этот баг; агент этого теста не видит.
- 03
Приватный оракул + SHA-слепок до статьи. Оракул не публикуется, но его SHA-256-слепок выложен до выхода статьи - подменить проверки задним числом нельзя.
- 04
Полные траектории + канарейка. Подмену модели сейфгардом увидели только в полных траекториях. Канарейка в каждом опубликованном файле - по ней ловится утечка в тренировочные корпуса.
Задачи · сет v1.0
Шесть примеров из 25
Починить падение сцен на постах канала
aiogram/aiogram
HEAD должен наследовать кэш-заголовки GET
laravel/framework
Мидлварь Fastify не должна пропускать trailing slash
nestjs/nest
Сохранить данные при переходе между сценами
aiogram/aiogram
Развести /start и deep-link аргументы
aiogram/aiogram
Не терять настройки превью при send_copy
aiogram/aiogram
три паспорта раскрыты целиком · ещё три открывают короткую карточку задачи
Блог
Разборы раундов
Подписка
Уведомить о новых раундах
Новый раунд - на каждый крупный релиз модели. В планах сета: задачи, где русский - ещё и язык кода (1С).
письмо на каждый новый раунд · рассылка vibecoding.ru