26 сентября 2026 г.
Выбор модели опирается на свою работу: личный бенчмарк из 10 задач
26 сентября опубликовали результаты запуска Opus 5.5 от 19 сентября: первый драфт прошёл 2 из 8 проверок личного бенчмарка и занял 5 446 токенов. После запроса «see my feedback» тот же тест прошёл 4 из 5 проверок и израсходовал 242 491 токен.

Dan Shipper
@danshipper
Я попросил Opus 5.5 объяснить, почему личные бенчмарки так важны. Это одна попытка.
· 1,5 тыс. просмотров
21 сентября Mike Taylor предложил взять 10 задач за последний месяц, где ИИ ошибался, требовал долгой переписки или был брошен, и сохранить JSON-логи сессий вместе с файлами в отдельной папке. Затем Claude Code запускает эти задачи параллельно на нескольких моделях и собирает HTML-viewer, чтобы сравнить ответы рядом.
Одинаковые условия. Для сравнимого теста сохраняют исходный prompt и файлы, каждую задачу запускают в новом треде и фиксируют первый ответ, модель и reasoning setting. Инструкции и материалы между прогонами не меняют.
Правка становится тестом. 10 сентября Every посоветовала разбивать правки на вопросы да или нет, по одному требованию на check. Для слайдов отдельно проверяют главную идею, минимальный кегль и заданный шрифт. ИИ-судью сначала сверяют с ручной оценкой, затем в новом чате передают ему результат, checklist и референсы: расхождение значит, что ошибся судья или расплывчатый check.
В наборе Mike Taylor из 10 задач с дашбордами, статьями и презентациями недорогая OpenAI Luna отстала от Fable лишь на несколько баллов и, по его ручной проверке, справилась с задачами.
26 сентября Every назвала следующим шагом автоматическое превращение каждой коррекции ИИ в новый case и check.
Первоисточник

