22 сентября 2026 г.
Проверять ИИ-агентов стало проще: набор из 8 skills для evals
22 сентября 2026 года `evals-skills` собрал 8 skills для проверки конкретного ИИ-продукта, а не общего бенчмарка модели. В Codex плагин v0.3.1 ставится двумя командами: `codex plugin marketplace add ai-evals-course/evals-skills` и `codex plugin add evals@ai-evals-course`.

Lenny Rachitsky
@lennysan
Небольшой совет: установите этот новый skill для evals от @HamelHusain и @sh_reya. Он сэкономит вам много часов и убережёт от множества ошибок. https://github.com/ai-evals-course/evals-skills
В разговорах с гостями подкаста и знакомыми продакт-менеджерами evals всплывают всё чаще. Почти в половине 25 вакансий для продакт-менеджеров, которыми я поделился на прошлой неделе, нужен опыт создания evals. Ведущие компании продолжают рассказывать, что им дали вложения в evals: — @tryramp подняла точность автоматического сбора чеков с 35% до 83%. — @Shopify выкатил конструктор ИИ-процессов, который в 2,2 раза быстрее и на 68% дешевле связки на самых умных моделях, которую он заменил. — @harvey__ai пересобрала ИИ-проверку контрактов и почти удвоила свой внутренний балл качества. — @cursor_ai настроила маршрутизацию Auto Balance,


· 2,3 тыс. просмотров
Раньше смотрели на бенчмарки базовых моделей. Теперь набор ведёт от `evals-start` к аудиту, поиску ошибок, синтетическим данным, judge prompt, проверке оценщика, RAG и интерфейсу ревью.
Разбор сбоев. `error-discovery` берёт JSONL, CSV, JSON с ответами модели или trace, собирает приложение для ревью и группирует типы ошибок. В наборе больше 50 записей он начинает с 15–25 примеров: 60–70% берёт из кластеров и 30–40% случайно. При запуске через `codex exec` skill собирает и проверяет приложение, останавливает сервер и оставляет команду для следующего запуска.
Полный набор ставится через `npx skills add https://github.com/ai-evals-course/evals-skills`; проверить и обновить его можно командами `npx skills check` и `npx skills update`. Авторы предлагают начать с `evals-start`, а `eval-audit` поручать параллельно по диагностическим областям и сводить в один отчёт.
Авторы выпустили набор 2 марта 2026 года, а 22 сентября обновили инструкции по установке и разбору ошибок.
Первоисточник
