11 сентября 2026 г.
Claude Code научил измерять ценность плагинов: сравнение идёт через 6 прогонов
11 сентября 2026 Anthropic выпустила Claude Code 2.1.269 с новой командой `plugin eval`. По умолчанию каждый кейс теперь гоняется шесть раз: с плагином и без него. Отчёт показывает `WITH`, `W/OUT` и разницу.

ClaudeDevs
@claudedevs
Новое в Claude Code: claude plugin eval. Смотрите, добавляет ли ваш плагин ценность или ему нужно доработать. Вы можете создать тест-кейсы, прогнать ваш плагин или skill по ним, посчитать эти прогоны, а затем запустить каждый кейс снова без плагина и посмотреть разницу.

· 49,4 тыс. просмотров
Раньше Claude Code обычно проверяли плагин вручную и без жёсткого контроля с базовой версией. Теперь `claude plugin eval init` создаёт тест-кейсы и критерии, а `claude plugin eval .` прогоняет их и сохраняет сравнительный отчёт. **Как устроено.** В каждый сценарий входят шесть запусков в двух режимах: с установленным плагином и без него. В отчёте есть блоки `WITH`, `W/OUT` и `Δ`, `--threshold` по умолчанию равен 1.0, и при провале порога сборка в CI получает exit code 1. `--ablation none` отключает сравнение, если оно не нужно. **Что важно.** Токены лимитов считаются в рамках подписки и API-бюджета, для shell-инструментов (`bash`, `write`, `edit`) нужен флаг `--allow-tools`. Free-подписка по-прежнему не даёт этот режим, а рабочий ценник стартует с Pro от 17$/мес.
При провале порога в CI `plugin eval` уже даёт exit code 1, так что оценка плагина становится формальной частью конвейера.
Первоисточник
