27 июля 2026 г.
Бенчмарки разошлись с ощущением ума: Пётр Гостев ждёт, что Opus 5.2 обойдёт Fable 5.1
27 июля Пётр Гостев написал: Opus 5 идёт выше Fable во многих бенчмарках, хотя почти все, кто работал с обеими, считают Fable умнее. Причину он видит в цене RL: на большой модели цикл дообучения длиннее и дороже, поэтому Fable 5.1 может выйти не сильно лучше Opus 5, а Opus 5.1 и 5.2 - заметно обойти его в цифрах.

Peter Gostev
@petergostev
Opus 5 почему-то стоит выше Fable во многих бенчмарках, но мне кажется, что все, кто пользовался обеими, считают Fable более умной моделью. Думаю, эту странность объясняет проблема больших моделей: на них гораздо сложнее и дороже гонять RL. То есть Opus может быстро и дёшево выиграть от новых данных, новых сред и большего RL-компьюта, а Fable на это, видимо, нужно больше времени и компьюта, поэтому циклы рекурсии длиннее и хуже накапливаются. Так что вполне разумно ожидать, что Fable 5.1 на выходе окажется не сильно лучше Opus 5, а потом Opus 5.1/5.2 будет заметно лучше Fable 5.1, по крайней мере в большинстве бенчмарков. Есть всё же какой-то уровень «ума», которого из RL не достанешь: сложно ткнуть в него пальцем, но это шарм, понимание, письмо или просто способность врубаться. И при этом на любом бенчмарке, какой ни возьми, Fable может отставать. Дойти может и до того, что Fable повторит судьбу GPT-4.5: модель любили, но ни один бенчмарк не оправдывал её цену инференса, и её убили.
· 51,9 тыс. просмотров
27 июля Пётр Гостев написал: Opus 5 идёт выше Fable во многих бенчмарках, хотя почти все, кто работал с обеими, считают Fable умнее. Причину он видит в цене RL: на большой модели цикл дообучения длиннее и дороже, поэтому Fable 5.1 может выйти не сильно лучше Opus 5, а Opus 5.1 и 5.2 - заметно обойти его в цифрах.
Что дальше: Прогнать свой рабочий модуль на Opus 5 и на Fable подряд и посчитать, где меньше правок руками: этот разрыв бенчмарки не показывают.
Первоисточник