28 августа 2026 г.
Агенты пока не тянут науку: Opus 5 решил 30% задач Terminal-Bench-Science
Terminal-Bench-Science даёт агенту терминал и настоящую научную задачу. Из 70 таких Claude Opus 5 решил 30,0%.

Куски своей настоящей работы в бенчмарк приносили 376 человек из 22 стран.
Получилось 70 задач, и на них пустили ИИ-агентов: лучший решил 21. Так меряют, годится ли агент исследователю в помощники. Внутри 19 задач из наук о жизни, по 17 из физики и математики, 9 из инженерии и 8 из наук о Земле.
Кто сколько взял. Лидерборд Snorkel AI, все прогоны на максимальном режиме рассуждений:
- Claude Opus 5 с Claude Code: 30,0% ±3,2, полный прогон $6 990 - GPT-5.6 Sol с Codex: 22,4% ±2,9, $4 220 - Claude Fable 5 с Claude Code: 21,4% ±2,8, $14 180
Скачок за поколение. Claude Opus 4.8 брал 10,5% задач, Claude Opus 5 берёт 30,0%. Почти втрое за одно поколение модели.
Свою модель гоняют той же командой. Бенчмарк ставится поверх фреймворка Harbor командой `uv tool install "harbor[modal,daytona]"`, задачи крутятся в песочнице Modal или Daytona. Дальше один вызов: `harbor run -d terminal-bench-science/terminal-bench-science@latest --agent claude-code --model anthropic/claude-opus-5 --env modal`.
Проект ведут команды Terminal-Bench и Harbor вместе со Stanford и Laude Institute.
Версия 0.2 уже в работе: pull request с новыми задачами принимают до 5 октября 2026.