7 октября 2026 г.
Opus 5.5 планирует ИИ-эксперименты экономнее экспертов: преимущество в TasteVal в 2,3 раза
В замере P-Zero Research от 6 октября Opus 5.5 обошла экспертов по эффективности расходования вычислений в 2,3 раза.

Opus 5.5 достигала сопоставимого результата с меньшим расходом вычислений. Средняя стоимость её попытки составила примерно 1/30 стоимости попытки экспертов.
Проверяли выбор экспериментов. TasteVal содержит 8 задач по разработке ИИ. Исследователь планирует эксперименты и разбирает результаты, а фиксированный ИИ-агент Opus 4.8 в Claude Code пишет и запускает код. Авторы отделили умение выбирать следующий эксперимент от умения программировать.
Не хотите разбираться сами? Внедряем ИИ в ваш бизнес: задачи без лимита, одна цена в месяц, отмена в любой момент.
Авторы проверили 20 моделей 2023–2026 годов, по 6 запусков с разными случайными начальными условиями на задачу. Каждую попытку ограничили 40 GPU-часами на одной H100 или 120 часами общего времени. Для сравнения взяли лучшую попытку на каждой задаче среди 24 экспертов, минимум по 2 на задачу, с тем же исполнителем и бюджетами.
Преимущество Opus 5.5 оценили в 2,30 раза, с 95-процентным доверительным интервалом от 1,15 до 4,37 раза. Opus 5.5 и Fable 5.1 прошли 7 из 8 задач из-за отказа выполнять одну задачу. При сравнении всех участников только на этих 7 задачах преимущество Opus 5.5 составило 2,25 раза.
Ускорилась экономия вычислений. До декабря 2025 года передовые модели удваивали этот показатель каждые 14 месяцев. После декабря удвоение занимало 3,0 месяца, с 95-процентным интервалом от 1,7 до 5,0 месяца. По итоговому нормализованному результату ускорения не обнаружили: модели удваивали его каждые 14,6 месяца.
Авторы сохраняют задания закрытыми, чтобы они не попали в обучение моделей.
Первоисточник: [исследование TasteVal на arXiv](https://arxiv.org/abs/2610.06824).
Для оценки своей модели на TasteVal авторы предлагают написать на hello@pzeroresearch.com.
Первоисточник