23 сентября 2026 г.
ИИ-ответы о психическом здоровье теперь меряют по диалогу: 1 215 сценариев
23 сентября OpenAI опубликовала MentalHealthBench с 1 215 синтетическими диалогами для проверки следующего ответа ИИ в контексте разговора. Набор можно скачать ZIP-архивом: в нём 5 262 критерия с весами от −10 до +10.

Раньше проверки психического здоровья ИИ в основном смотрели на экстренные случаи по широким критериям. MentalHealthBench оценивает следующий ответ с учётом конкретного диалога: от повседневных тем до экстренных случаев.
Прогон придётся собрать. В ZIP нет готового раннера, ответов моделей и логов оценки. Протокол OpenAI просит для каждого задания сгенерировать 4 независимых ответа и сохранить исходное system-сообщение с контекстом пользователя.
В официальной таблице GPT-6 Astra набрал 57,3% против 32,1% у GPT-4o March 2025 по среднему баллу заданий, не по клиническому результату.
* Meta Platforms Inc. признана в РФ экстремистской организацией, её деятельность запрещена; Facebook и Instagram заблокированы. Meta AI и другие продукты компании — продукты этой организации.
Первоисточник
