3 октября 2026 г.
ИИ-судью тоже нужно оценивать: Чип Хьюен предлагает сверять его баллы с людьми
Автоматическая оценка ответов требует своей проверки: рост баллов ИИ-судьи может расходиться с оценками экспертов.

По наблюдениям Чип Хьюен от 16 января 2025 года, команды ведущих ИИ-продуктов ежедневно проверяют вручную 30–1000 ответов в дополнение к автоматическим evals.
Evals проверяют качество ИИ-приложения перед выпуском пользователям. Для этого используют метрики языковых моделей, точную проверку результата и ИИ-судью, который оценивает ответы другой модели. Сравнительная оценка нужна, чтобы расставить модели по качеству на выбранных задачах.
Проверка судьи. Хьюен рекомендует сопоставлять человеческие и автоматические оценки. Если эксперты ставят всё ниже, а ИИ-судья всё выше, проверять нужно самого судью. Его качество зависит от модели, промпта и задачи.
Проверка агента. В разборе от 7 января 2025 года Хьюен предлагает собрать задачи с перечнем доступных инструментов и сгенерировать несколько планов для каждой задачи. Затем посчитать 6 метрик, включая долю корректных планов и ошибки вызова инструментов. Отдельно она предлагает учитывать число шагов, стоимость выполнения и длительность действий, сравнивая агента с другим агентом или человеком.
Первые улучшения не задают темп всей работы. По изложению Хьюен от 16 января 2025 года, LinkedIn достиг 80% желаемого качества ИИ-продукта за месяц. Чтобы преодолеть 95%, понадобились ещё 4 месяца, а ранний успех привёл команду к недооценке сложности дальнейших улучшений.
В примере LinkedIn доведение продукта до желаемого качества заняло больше времени, чем первые улучшения.
Первоисточник