Раунд 2 · обновление 06.09.2026 · колонка
Fable 5.1 больше не подменяет модель: все 75 ячеек отработала сама
Евгений Шилов↗ · 06.09.2026
Колонка 05–06.09.2026. Claude Code + Fable 5.1 на усилии high прошёл 25 задач сета 1.0 по три раза и решил 60 из 75. Сырой pass@1 80.0%, честный 76.0%. Строка встаёт вне зачёта: сет старше даты знаний модели, а сама Fable ведёт бенч.
У Fable 5 в июле сейфгард уводил в Opus 4.8 пять задач из 25. У Fable 5.1 во всех 75 траекториях исполняла только заявленная модель.
Сюжеты колонки
Что изменилось с июля
- 01
Подмены нет. Рельса сверяет фактическую модель каждого сообщения с заявленной. Во всех 75 траекториях стоит claude-fable-5-1. Пять задач, на которых у Fable 5 срабатывал сейфгард, Fable 5.1 исполняла сама. AIOH1 и LARA1 решены 3 раза из 3, AIOH8 один раз из 3, AIOH4 и AIOH6 провалены 0 из 3 без единого отказа.
- 02
Сеть съедает четыре пункта честного ряда. В 5 ячейках из 75 агент ходил на GitHub за апстримом. Три зачёта построены на исправленном коде и тестах мейнтейнера, в честном ряду они провалы. Так 80.0 превращается в 76.0.
- 03
Быстрее Opus 5, дороже на четверть. Медиана 6.0 минуты на ячейку против 9.6 у Opus 5 на том же харнесе. За задачу $2.81 API-эквивалента против $2.22. Усилие high, а не xhigh, как у остальных строк Claude, поэтому лоб в лоб минуты и доллары не сравниваются.
Сырой и честный ряд
Две цифры одной колонки
| Конфигурация | pass@1 сырой | pass@1 честный* | N | медиана | цена задачи |
|---|---|---|---|---|---|
| Claude Code + Fable 5.1 (high) | 80.0% ± 6.5 (22/18/20) | 76.0% ± 3.3 (20/18/19) | 25 | 6.0 мин | $2.81 |
* честный: контаминированные зачёты засчитаны провалами · в скобках зачёты по трём повторам · N=25: гейт свежести не применялся, дата среза знаний Fable 5.1 (июнь 2026) новее всех починок сета, последняя сделана 30.06.2026 · цена: API-эквивалент по прайсу модели, средняя на задачу · колонка целиком $211
Две причины строки вне зачёта. Первая та же, что у Fable 5: методологию и рельсу бенча собирает сама Fable, участник не судит свой экзамен. Вторая новая.
Дата среза знаний Fable 5.1 приходится на июнь 2026, а последняя починка сета 1.0 попала в интернет 30.06.2026. Модель могла видеть ответы при обучении, поэтому строка не входит и в срез Fresh-11. Честная цифра для неё появится на сете 1.1 из задач июля и позже.
Три контаминации
Куда ходил агент
Доступ в сеть рельса не запрещает. Агент видит только ТЗ, оракул лежит отдельно, и подсмотреть можно одним способом: найти починку в апстриме самому. Кто ищет, тот виден в траектории. Поиск вызовов инструментов по 75 траекториям нашёл WebFetch в пяти ячейках и ни одного WebSearch.
- rep1 · AIOH5-pool-timeoutmaster streams.py и client_proto.py с просьбой процитировать методы дословно. Апстрим уже содержит починку.зачёт, в честном ряду провал
- rep1 · NEST1-sse-teardownrouter-response-controller.ts и его spec.ts на master и в теге v11.1.27, issues #17352 и #17128, лента коммитов файла. Spec и есть тест, которым судит оракул.зачёт, в честном ряду провал
- rep3 · AIOH8-connection-tokenmaster client.py, tests/test_client_ws.py, CHANGES/12746.bugfix.rst самой починки и поиск PR по тексту ошибки.зачёт, в честном ряду провал
Ещё два похода в сеть, NEST1 в rep2 и rep3, закончились провалом и на ряд не влияют. Все три вычета ведут в апстрим GitHub тех же репозиториев, откуда взяты задачи. Чужих машин и чужих прогонов в траекториях нет.
Поправка
Задача AIOH3: подменённый старт с 15.07
Проверка перед прогоном нашла на машине прогонов стартовый код задачи AIOH3-default-timeout с готовой починкой мейнтейнера, он лежал там с 15.07.2026. Оракул принимал такой старт без единой правки агента. Мы вернули стартовый код из git до первой ячейки Fable 5.1, её ячейки AIOH3 честные.
Шестнадцать ячеек после 15.07 получали решённую задачу. Мы бракуем их как непройденный гейт: задача исключена из N этих пар без добора, скоры пересчитаны по сырым ячейкам. Строки раунда 1, GPT-5.6 Luna и koda-pro не задеты.
| Пара | было | стало | N |
|---|---|---|---|
| Claude Code + Opus 5 (xhigh) | 78.3 · честный 76.7 | 77.2 · честный 75.4 | 20, стало 19 |
| SourceCraft CLI + ds | 68.1 | 66.7 | 23, стало 22 |
| Antigravity + Gemini 3.1 Pro (high) | 49.3 | 47.2 | 25, стало 24 |
| Antigravity + Gemini 3.5 Flash (high) | 46.7 | 44.4 | 25, стало 24 |
| SourceCraft CLI + legacy | 42.0 | 40.3 | 23, стало 22 |
pass@1 сырой · Opus 5 также честный ряд · N: задач в зачёте пары до и после поправки · ds после поправки вровень с Codex + GPT-5.5 (66.7)
Как починка попала в стартовую папку, установить не удалось. В папку ячейки копируется весь старт, поэтому дефект уехал во все ячейки после 15.07. В гейт перед раундом добавлена проверка: старт сета обязан совпадать с git до первой ячейки.
Воспроизводимость
Проверить траектории и реестр контаминаций
Полные траектории всех 75 ячеек, патчи и три пометки контаминации опубликованы в витрине. Пересчитанные строки таблицы лежат в RESULTS.md раунда 2.
git clone https://github.com/eugeneshilow/rubench cd rubench/1.0 ls rounds/round-02/rep1/claude-code_claude-fable-5-1_high/ cat rounds/round-02/CONTAMINATIONS.md