11 сентября 2026 г.
Плагины Claude Code теперь можно мерить одинаково: eval даёт JSON и HTML-отчёт
В версии 2.1.269 от 11.09.2026 Claude Code получил `claude plugin eval`: плагин запускается с тестами и выдаёт воспроизводимые оценки в JSON и HTML. В релизе также появились `/output-style [name]`, до 256 параллельных агентов в Workflow и карта субагентов в VSCode.

Раньше в самом Claude Code не было встроенного прогона eval-наборов. Теперь первый набор создаётся командой `claude plugin eval init`, а все кейсы запускаются через `claude plugin eval .`.
Сравнение готово. Каждый кейс по умолчанию проходит 3 раза с плагином и 3 раза без него. Порог прохождения равен 1.0, а `Δ` показывает вклад плагина относительно baseline. Результаты сохраняются в `aggregate-result.json` и автономный `report.html`, для CI можно вывести JSON командой `claude plugin eval . --json results.json --no-publish`.
Порог входа. Для macOS, Linux и WSL Anthropic рекомендует установить Claude Code командой `curl -fsSL https://claude.ai/install.sh | bash`, затем запустить `claude`. Нужна версия 2.1.269 или новее, обновление запускается через `claude update`. Каждый eval и каждый judge-grader вызывают модель и расходуют лимит плана или оплачиваемый бюджет API.
Раньше output style нельзя было переключать через Remote Control и cloud-сессии. Теперь это делает `/output-style [name]`. Для Workflow лимит параллельных агентов задаётся переменной `CLAUDE_CODE_WORKFLOW_MAX_CONCURRENT_AGENTS` со значением от 1 до 256.
Релиз также чинит восстановление cloud и headless-сессий, повторное использование prompt cache после оборванного ответа и работу терминалов. В VSCode появились карта субагентов, управление hooks и permission rules.
Следующий шаг для этой функции связан с CI: eval-отчёты уже можно сохранять как JSON без публикации.
Первоисточник
