round-01 · 07.07.2026 · отчёт
Кто довозит задачу по русскому ТЗ
Реальные баги из живых репозиториев. ТЗ - жалоба заказчика по-русски, без диагноза. Судья - спрятанный тест мейнтейнера, который этот баг реально закрыл. Лучший агент довозит 79%.
Первый замер закрыт 07.07.2026: четыре конфигурации, 25 задач, 3 независимых прогона - 300 экзаменов.
лидерборд 1.0
Кто довозит: 79% у лидера
| место | конфигурация | pass@1 | цена | токены | минут |
|---|---|---|---|---|---|
| 01 | Claude Code + Opus 4.8 (xhigh) | 78.7 ±6.1 | $3.12 | 33k | 13 |
| 02 | Claude Code + Sonnet 5 (xhigh) | 74.7 ±2.3 | $2.42 | 29k | 13 |
| 03 | Codex + GPT-5.5 (xhigh) | 66.7 ±4.6 | $2.34 | 16k | 12 |
| 04 | Claude Code + Haiku 4.5 (xhigh) | 53.3 ±4.6 | $0.57 | 18k | 10 |
25 задач · 3 прогона · снапшот 07.07.2026
экономика зачёта
Sonnet 5 - лучшая цена скора
74.7% по $2.42 за задачу. Opus 4.8 добавляет 4 пункта (78.7%) за +29% цены ($3.12); при разбросе трёх прогонов ±6.1 эти 4 пункта не различают соседей.
GPT-5.5 - лучший расход токенов: 16k на задачу, вдвое меньше Opus (33k), при 66.7% скора. Он же самый быстрый в зачёте: 11.6 минуты на задачу против 13 у обеих старших конфигураций Claude. Haiku 4.5 закрывает половину задач (53.3%) по $0.57 - в 5.5 раза дешевле Opus.
методология
Как устроен один билет
Мы не сочиняем задачи - сочинённое фронтир решает на 100%: автор не заложит сложность выше собственного понимания. Реальную сложность создал реальный мир.
Конвейер билета: мейнтейнер закрыл живой баг и написал регресс-тест → мы откатываем починку (баг снова живой, тест уходит в карман судьи) → пишем русское ТЗ как жалобу заказчика, без диагноза → агент сдаёт экзамен в изоляции. В сет идут только свежие починки - позже даты, до которой модели «читали интернет». Каждый билет проверен в обе стороны: больная версия проверку проваливает, авторская починка проходит.
Анатомия билета: русское ТЗ на ~1 100 знаков → живой репозиторий на 324-3 276 файлов без git-истории → один заход агента без подсказок (16-33k токенов, 10-19 минут) → приватный оракул из 1-5 тест-файлов мейнтейнера, которых агент не видит. Судья бинарный: довёз / не довёз.
правила честности
Почему экзамен нельзя было выучить
- Свежесть. Все 25 починок датированы 10.02-30.06.2026 - позже training cutoff всех моделей зачёта; датировка каждой задачи опубликована.
- Нативные ТЗ. Русские формулировки написаны для бенча заново и до публикации в интернете не существовали.
- Приватный судья. Оракул не публикуется, но его SHA-256-слепок выложен до выхода статьи - подменить проверки задним числом нельзя.
- Канарейка в каждом опубликованном файле - по ней ловится утечка в тренировочные корпуса.
- Рантайм-аудит. В 3 зачётных ячейках из 300 агент скачал из живого апстрима файл с влитым фиксом - ячейки помечены; исключение меняет счёт максимум на 2.7 пункта и не меняет мест.
первичные данные