round-02 · 18.07.2026 · отчёт
Раунд 2: русские CLI и Gemini входят в таблицу
Тот же замороженный сет, но поле шире: SourceCraft CLI, Koda CLI и Antigravity проходят нативные русские ТЗ рядом с конфигурациями первого раунда.
Волны шли 14–18.07.2026. У каждой строки свой N после freshness-гейта; лоб в лоб все пары сравнивает только общий срез Fresh-11.
сюжеты раунда
Три сдвига в поле
- 01
Русский CLI входит выше GPT-5.5. SourceCraft CLI + ds набирает 68.1% и обходит Codex + GPT-5.5, Antigravity + Gemini 3.1 Pro и Antigravity + Gemini 3.5 Flash на нативных русских ТЗ.
- 02
Gemini — самые быстрые ячейки. Antigravity + Gemini 3.5 Flash и Antigravity + Gemini 3.1 Pro дают медиану 1.6–2.7 минуты, но обе строки остаются ниже Claude Code + Haiku 4.5 по скору.
- 03
Внутри SourceCraft виден разрыв поколений. SourceCraft CLI + ds набирает 68.1%, SourceCraft CLI + legacy — 42.0%. Разница зафиксирована внутри одного продукта на одном сете.
дельты раунда
Новички относительно поля
честный аудит
Raw и honest для GPT-5.6
Honest* считает контаминированные PASS-ячейки как FAIL. Сами ячейки остаются в опубликованном раунде: контаминации опубликованы, не спрятаны.
| конфигурация | pass@1 raw | pass@1 honest* | Wilson95 | время |
|---|---|---|---|---|
| Codex + GPT-5.6 Solмини-колонка 10.07.2026, пересчитана при N=23 | 82.6% ± 4.3 (20/19/18) | 71.0% ± 2.5 (17/16/16) | [59.4, 80.4] | 7.6 мин, медиана |
| Codex + GPT-5.6 Lunaпрогон 12–13.07.2026 | 75.4% ± 2.5 (17/18/17) | 65.2% ± 4.3 (15/14/16) | [53.4, 75.4] | 6.5 мин, медиана |
* метод sensitivity-row из paper §7 · в основной таблице RESULTS для Codex + GPT-5.6 Luna указано 6.1 мин, в детальной секции — 6.5 мин; здесь сохранено значение детальной секции
Повторный аудит 18.07 охватил 437 ячеек — 100% раунда. Каждую траекторию структурно разобрали два независимых сканера, каждый флаг проверил adversarial judge; поверх сетевого слоя прошёл отдельный sweep запрещённых путей на диске. Это кросс-вендорный конвейер.
Русские CLI и Gemini чисты: SourceCraft CLI + ds 0/69 · SourceCraft CLI + legacy 0/69 · Koda CLI + koda-pro 0/32 · Antigravity + Gemini 3.1 Pro 0/49 · Antigravity + Gemini 3.5 Flash 0/74. Итого 0/293 сетевых и дисковых контаминаций.
Контраст — семейство GPT-5.6: Codex + GPT-5.6 Luna имеет 8/69 HARD, из них 7 PASS вычтены из honest; Codex + GPT-5.6 Sol — 13/75 HARD, из них 8 вычтены внутри N=23, ещё 3 лежат вне freshness-гейта.
Fresh-11
Честное сравнение на общих задачах
11 задач с апстрим-починками после 17.06.2026 — самого молодого knowledge cutoff в таблице. Здесь у всех строк одинаковый набор задач, без поправок на N.
| конфигурация | pass@1 % | медиана мин | заметка |
|---|---|---|---|
| Claude Code + Opus 4.8 / Claude Code + Sonnet 5 / Codex + GPT-5.6 Luna | 75.8 | 6.1–7.7 | |
| Codex + GPT-5.5 | 72.7 | 7.2 | |
| Claude Code + Haiku 4.5 | 63.6 | 5.1 | |
| SourceCraft CLI + ds | 63.6 | 9.4 | |
| Koda CLI + koda-pro | 51.5 | 11.5 | 1 дыра |
| Antigravity + Gemini 3.1 Pro | 48.5 | 2.5 | |
| Antigravity + Gemini 3.5 Flash | 33.3 | 1.2 | |
| SourceCraft CLI + legacy | 30.3 | 3.8 |
малый срез → широкие интервалы · Codex + GPT-5.6 Sol без по-задачных данных; Claude Code + Fable 5 покрыт частично
воспроизводимость
Проверить раунд 2
git clone https://github.com/eugeneshilow/rubench cd rubench/1.0 cat rounds/round-02/RESULTS.md cat rounds/round-02/CONTAMINATIONS.md ls rounds/round-02/rep1/ rounds/round-02/rep2/ rounds/round-02/rep3/