25 августа 2026 г.
Тесты для агента можно не писать руками: скилл LangChain собирает их за 4 фазы
Скилл читает репозиторий агента, спрашивает, что мерить, и отдаёт папку с готовыми тестами и проверкой.

Harrison Chase
@hwchase17
Думаю, как сделать создание evals максимально простым. Мы выпустили скилл, который помогает в этой итеративной работе.
https://x.com/i/article/2092117284407926786
· 27 тыс. просмотров
Агент сам находит, что у него можно сломать, и пишет на это тесты.
Скилл eval-engineering от LangChain читает репозиторий агента целиком: промпты, модели, тулзы, хуки, API. Трейсы он тянет через langsmith-cli, если они есть. Раньше набор проверок собирали руками: придумать задачи, поднять среду, написать проверку ответа. Теперь сборку делает агент, а человек выбирает, что мерить.
Четыре фазы. Сначала скилл читает репозиторий. Потом предлагает, какие способности агента стоит померить. На третьем шаге ты выбираешь одну и говоришь, какие тулзы дёргать вживую, а какие подменить заглушкой. На четвёртом он пишет исполняемые задания.
Выход — не отчёт. Скилл кладёт папку evals/<task-id>/ с заданием, Dockerfile со средой и данными и верификатором, который считает баллы. Формат Harbor, официальный харнесс Terminal-Bench 2.0, ставится командой `uv tool install harbor` и гоняет каждый прогон в отдельном контейнере.
Ставится одной командой. `npx skills add langchain-ai/langchain-skills --skill '*' --yes`, флаг `--global` кладёт скилл на всю систему. В Claude Code это плагин: `/plugin marketplace add langchain-ai/langchain-skills`, затем `/plugin install langchain-skills@langchain-skills`. В репозитории 21 скилл, eval-engineering лежит в разделе Evaluation. Спецификацию Agent Skills понимают Claude Code, Cursor, Windsurf и Deep Agents CLI.
Автор даёт готовую стартовую фразу: «Use the eval-engineering skill to create an eval with me. Inspect the agent first, propose a few abilities worth testing, recommend one, and wait for me to choose». Дальше открываешь репозиторий своего агента и указываешь набор трейсов, если он есть.
Авторы пишут, что иногда агент вытягивает eval с одного захода, но лучшие проверки выходили там, где пользователь сам говорил, какие способности мерить. Прогон и агента, и верификатора по трейсам держит агента от подгонки под метрику. Обкатывали скилл на собственном агенте LangChain chat-langchain, который отвечает на вопросы по документации.
Первоисточник