Раунд 1 · 07.07.2026 · отчёт
Кто довозит задачу по русскому ТЗ
Евгений Шилов↗ · 07.07.2026
Мы берём настоящие баги из живых открытых проектов и даём их ИИ-агентам как задачи. ТЗ на русском, как написал бы заказчик. Агент чинит код сам, без подсказок. Зачёт ставит не человек, а скрытый тест автора настоящей починки. Лучший агент довозит 78.7%.
Первый замер закрыт 07.07.2026: четыре конфигурации, 25 задач, 3 независимых прогона - 300 экзаменов.
Лидерборд 1.0
Кто довозит: 78.7% у лидера
| Место | Конфигурация | pass@1 | Цена | Токены | Минут |
|---|---|---|---|---|---|
| 01 | Claude Code + Opus 4.8 (xhigh) | 78.7 ±6.1 | $3.12 | 33k | 13 |
| 02 | Claude Code + Sonnet 5 (xhigh) | 74.7 ±2.3 | $2.42 | 29k | 13 |
| 03 | Codex + GPT-5.5 (xhigh) | 66.7 ±4.6 | $2.34 | 16k | 12 |
| 04 | Claude Code + Haiku 4.5 (xhigh) | 53.3 ±4.6 | $0.57 | 18k | 10 |
25 задач · 3 прогона · снапшот 07.07.2026
Экономика зачёта
Sonnet 5: лучшая цена за результат
Sonnet 5 решает 74.7% задач по $2.42 за задачу. Opus 4.8 решает на 4 пункта больше, но стоит на треть дороже - а разброс между прогонами (±6.1) шире самой разницы. Эти четыре пункта могут быть случайностью.
GPT-5.5 - лучший расход токенов: 16k на задачу, вдвое меньше Opus (33k), при 66.7% решённых. Он же самый быстрый в зачёте: 11.6 минуты на задачу против 13 у обеих старших конфигураций Claude. Haiku 4.5 закрывает половину задач (53.3%) по $0.57 - в 5.5 раза дешевле Opus.
Методология
Как устроен один билет
Мы не сочиняем задачи - сочинённое топ-модели решают на 100%: автор не заложит сложность выше собственного понимания. Реальную сложность создал реальный мир.
Конвейер билета: мейнтейнер закрыл живой баг и написал регресс-тест → мы откатываем починку (баг снова живой, тест уходит в карман судьи) → пишем ТЗ на русском как жалобу заказчика, без диагноза → агент сдаёт экзамен в изоляции. В сет идут только свежие починки - позже даты, до которой модели «читали интернет». Каждый билет проверен в обе стороны: больная версия проверку проваливает, авторская починка проходит.
Анатомия билета: ТЗ на русском на ~1 100 знаков → живой репозиторий на 324-3 276 файлов без git-истории → один заход агента без подсказок (16-33k токенов, 10-19 минут) → приватный оракул из 1-5 тест-файлов мейнтейнера, которых агент не видит. Судья бинарный: довёз / не довёз.
Правила честности
Почему экзамен нельзя было выучить
- Свежесть. Все 25 починок датированы 10.02-30.06.2026: позже среза обучения (training cutoff) всех моделей зачёта; датировка каждой задачи опубликована.
- Нативные ТЗ. Формулировки на русском написаны для бенча заново и до публикации в интернете не существовали.
- Приватный судья. Оракул не публикуется, но его SHA-256-слепок выложен до выхода статьи - подменить проверки задним числом нельзя.
- Канарейка в каждом опубликованном файле - по ней ловится утечка в тренировочные корпуса.
- Рантайм-аудит. В 3 зачётных ячейках из 300 агент скачал из живого апстрима файл с влитым фиксом - ячейки помечены; исключение меняет счёт максимум на 2.7 пункта и не меняет мест.
Первичные данные