24 августа 2026 г.
Скилл может пройти проверку и не помочь агенту: корреляция с пользой 0,14
NVIDIA прогнала 947 парных задач со скиллом и без него: агенту он помог в 72,8% случаев, а угадать это по виду скилла нельзя.

Скилл выглядит образцово: структура на месте, описание чёткое. Агенту от него ноль.
NVIDIA взяла 58 боевых скиллов и собрала 947 парных задач: одну и ту же работу агент делал сначала со скиллом, потом без. Разницу назвали Skill Lift.
Статическая проверка скилла эту разницу не предсказывает. Совпадение оценки «по виду» с реальной пользой — 0,14 по Спирмену, почти случайность.
Что намерили. Средняя прибавка по всем прогонам составила 0,2134, доверительный интервал 0,1967–0,2301. Положительный lift NVIDIA увидела в 72,8% случаев. Значит, почти каждый четвёртый скилл агенту не помогает.
Как замерить свой. NVIDIA выложила SkillEvaluator в открытый доступ. Три тира проверки — безопасность и структура, различимость по эмбеддингам, живые прогоны в песочнице. Запускается двумя командами: `skillevaluator create-eval-dataset ./my-skill --full`, затем `skillevaluator tier3 evaluate ./my-skill --agents codex --env-mode docker`.
Раньше про скилл говорили «выглядит толково» и правили руками. Теперь у прибавки есть число. В замерах NVIDIA средний Skill Lift составил +31 балл: у Claude Code +34, у Codex +29.
Препринт вышел 20.08.2026, и следующий сигнал дадут сторонние прогоны на чужих скиллах: держится ли 0,14 за пределами выборки NVIDIA.
Первоисточник