9 сентября 2026 г.
Модели выучили новые стереотипы: в эксперименте равные группы получили разные профессии
Модели закрепляли случайные успехи за целыми группами, а бонус за найм редко выбранных групп снижал предвзятость.

В эксперименте модели распределяли по профессиям людей из вымышленных групп. У всех групп была одинаковая вероятность успеха на любой работе: 90%.
Исследователи задали 4 группы и 20 профессий. Модели нанимали работников на протяжении 40 раундов и получали обратную связь об успехах и неудачах. На каждую модель и вариант промпта приходилось 30 прогонов.
Стереотипы возникали заново. Модели закрепляли разные профессии за разными группами, причём сочетания менялись между прогонами. Контрольные эксперименты связали этот перекос с обратной связью, которую модели получали по ходу задачи.
Авторы измеряли разделение групп по профессиям индексом SI: чем он выше, тем сильнее перекос. В версии исследования от 6 июля 2026 года получили такие средние значения:
| Участники | Индекс SI | | --- | ---: | | Люди | 0,84 | | Передовые языковые модели, среднее | 1,39 | | OpenAI o3 | 1,83 |
При ответах без рассуждений Claude 4 Sonnet разделял группы по профессиям более чем в 8 раз сильнее Claude 3 Haiku. Повышение temperature до 1,5 не дало статистически значимого снижения перекоса у GPT-4o, Gemini 2.5 Flash и Llama 4 Maverick.
Помогла другая награда. В исходном условии модель получала за результат найма 0 или 1. Исследователи добавили бонус `1/(1+n)`, где `n` обозначает число прежних наймов этой группы в соответствующий сектор: реже выбирали группу, больше бонус за следующий найм.
С такой наградой индекс SI опустился ниже человеческого и случайного ориентиров почти у всех проверенных моделей и вариантов промпта. Gemini сохранял предвзятость. Формулу вмешательства авторы описали в Appendix A.4.1.
Код воспроизведения авторы выложили на GitHub. Установка описана в README, ключи задаются в `experimental_files/.env`. Ключ `OpenAI_API_KEY` нужен и при проверке других моделей, поскольку через него разбираются их ответы.
Из каталога `experimental_files` все условия запускаются командой `sh run_stratification_exp.sh`. Для одного эксперимента с GPT-4o команда такая:
```sh python stratification_exp.py --model gpt-4o --num_runs 30 --num_hiring_rounds 40 --probability_success 0.9 ```
Флаг `--direct` переключает модель с CoT на ответ без рассуждений.
Первоисточник: [исследование Large language models develop novel social biases through adaptive exploration](https://openreview.net/challenge?redirect=%2Fforum%3Fid%3Dpc7fqaOcAH). Числа и команды приведены по версии статьи и README от 6 июля 2026 года.
В репозитории также лежат готовые результаты, данные эксперимента с людьми и notebook анализа из 14 разделов.
Первоисточник
