2 сентября 2026 г.
Скилл дрейфует от правок в том же чате: Anthropic проверяет описание 20 запросами
Готовый ответ есть у самой Anthropic: скилл skill-creator подбирает описание по 20 запросам и сверяет его на отложенной части.

Peter Yang
@petergyang
Пока разгребаю свои ИИ-скиллы, есть вопрос к экспертам. Иногда я попадаю вот в такую петлю: 1. Запускаю скилл, и с первого раза он делает не идеально 2. Дожимаю результат руками вместе с ИИ 3. Потом спрашиваю у ИИ что-то вроде: «Как бы ты обновил скилл, чтобы в следующий раз вышло с первого раза?», смотрю правки и принимаю их. Проблема в том, что ИИ часто переобучается на этот один тред, и со временем скилл дрейфует. Есть хорошие решения?
· 5,6 тыс. просмотров
Скилл, поправленный по следам одного разговора, дальше работает только для этого разговора.
Каждая правка «чтобы теперь вышло с первого раза» подгоняет инструкцию под последний случай, и через десяток таких заходов скилл уезжает от исходной задачи. У Anthropic на это есть письменный рецепт и отдельный скилл.
Как править скилл, чтобы он не съезжал
Двое вместо одного. Доки по авторству скиллов запрещают править инструкцию в том же треде, где скилл только что работал. Роли разводят по разным окнам. Один Claude правит текст скилла, второй, свежий инстанс с этим скиллом, выполняет реальные задачи, и наблюдение за ним возвращается первому формулировкой вида «когда Claude использовал этот скилл, он забыл отфильтровать по дате за Q4».
Описание подбирает робот. Скилл skill-creator ставится командой `npx skills add https://github.com/anthropics/skills --skill skill-creator` и несёт внутри оптимизатор описания. Он гоняет 20 реалистичных запросов, делит их 60% на подгонку и 40% на отложенную проверку, повторяет каждый запрос по три раза и крутит до пяти итераций. Победившее описание выбирается по отложенной части, а не по той, на которой подгонялось.
Запускается это одной командой: `python -m scripts.run_loop --eval-set <файл> --skill-path <скилл> --model <модель> --max-iterations 5 --verbose`. На выходе HTML-отчёт по итерациям и JSON с полем best_description, которое вставляется во frontmatter SKILL.md.
Как собрать проверку
Набор запросов собирают руками: 8–10 должны скилл запускать, 8–10 не должны. Во вторую половину идут near-misses, запросы с теми же словами, но требующие другого решения. Формулировки берут те, что пользователи реально печатают, с путями к файлам, именами колонок и ссылками, а не «Format this data».
Первоисточник