./новости · 27 июля 2026 г.
новость
Бенчмарки перестали ловить ум модели: Opus 5 обходит Fable в тестах, а умнее зовут Fable
источник: @petergostev · X·
машинная выжимка · сверена с источником

Peter Gostev
@petergostev
Opus 5 почему-то стоит выше Fable во многих бенчмарках, но мне кажется, что все, кто пользовался обеими, считают Fable более умной моделью. Думаю, эту странность объясняет проблема больших моделей: на них гораздо сложнее и дороже гонять RL. То есть Opus может быстро и дёшево выиграть от новых данных, новых сред и большего RL-компьюта, а Fable на это, видимо, нужно больше времени и компьюта, поэтому циклы рекурсии длиннее и хуже накапливаются. Так что вполне разумно ожидать, что Fable 5.1 на выходе окажется не сильно лучше Opus 5, а потом Opus 5.1/5.2 будет заметно лучше Fable 5.1, по крайней мере в большинстве бенчмарков. Есть всё же какой-то уровень «ума», которого из RL не достанешь: сложно ткнуть в него пальцем, но это шарм, понимание, письмо или просто способность врубаться. И при этом на любом бенчмарке, какой ни возьми, Fable может отставать. Дойти может и до того, что Fable повторит судьбу GPT-4.5: модель любили, но ни один бенчмарк не оправдывал её цену инференса, и её убили.
· 1 тыс. просмотров
Peter Gostev 27 июля: Opus 5 стоит выше Fable в большинстве бенчмарков, но почти все, кто работал с обеими, считают умнее Fable. Причину он видит в дообучении: RL на большой модели дороже и медленнее, поэтому Opus быстрее забирает выгоду от новых данных и сред. Fable выигрывает там, где тестов нет: понимание, письмо, способность врубаться в задачу.
Почему это важно: Раньше строчка в бенчмарк-таблице заменяла ответ на вопрос «какая модель умнее»: посмотрел на цифру и выбрал. Теперь цифра и рабочий опыт расходятся. Gostev объясняет разрыв экономикой дообучения: маленькую модель дешевле и быстрее прогонять через новые среды, поэтому её счёт растёт циклами, а большая модель эти циклы проходит реже. В таблице тогда видно скорость дообучения, а не потолок понимания. Прецедент уже был: GPT-4.5 любили, но цена инференса не билась ни с одним бенчмарком, и модель закрыли. Цифр в твите нет: это рассуждение, а не замер.
Что дальше: Проверить на своём коде: прогнать один и тот же модуль обеими моделями и сравнить не счёт бенчмарка, а число правок после. Следующая точка отсчёта - выход Fable 5.1: Gostev ждёт, что она не оторвётся от Opus 5, а Opus 5.1 и 5.2 обгонят её в тестах.
первоисточник