25 августа 2026 г.
Замеры влияния ИИ на благополучие оплатит Anthropic: $5 млн грантов независимым исследователям
Деньги дают под условие: результат выходит открытым проектом, а работа идёт независимо от Anthropic.
Anthropic выложила список типовых провалов в евалах. Первым идёт circular AI-as-judge: модель судит саму себя или родственницу.
Под этот список компания положила $5 млн. Гранты уходят независимым исследователям, которые меряют влияние ИИ на благополучие пользователей: кроме денег обещают доступ к своим моделям и техподдержку.
Что Anthropic считает плохим евалом
Выборка задана числом. Рядом с анонсом вышел PDF-гайд «What we look for in a wellbeing evaluation». Минимум 100 отдельных айтемов для сложных multi-turn-замеров, минимум 1000 для простых single-turn.
Оба провала сразу. Первый: harmful compliance, вредный ответ. Второй: overrefusal, отказ или увиливание там, где модель должна была ответить. Замер только одной стороны Anthropic относит к дефектам.
Поверхность совпадает с риском. Способ доступа к модели берут тот же, на котором риск и живёт: «не тестируй на API, если меряешь риск в потребительском чат-боте, и не на чат-боте, если риск проявляется в технических workflow вроде Claude Code».
Грейдеров калибруют по разметке живых экспертов, а согласие с ними публикуют. Для скоринга Anthropic советует брать другую LLM, не ту, что тестируешь, и вручную просматривать выборку транскриптов. Остальные болезни списка: отсутствие человеческой валидации, trivially gameable-оценки, которые сдвигаются от косметических правок промпта, и saturation, когда фронтир-модели дают почти одинаковый скор.
Как подать заявку
Заявка идёт через Google-форму, дедлайн — 21 сентября 2026. Anthropic зовёт не только ML-исследователей: в тексте прямо названы клиницисты, психологи и методологи.
Первоисточник