1 октября 2026 г.
Ataraxos обыграл самого титулованного игрока в Stratego: 15 побед против Пима Нимейера
Отдельная нейросеть оценивает скрытые фигуры соперника, а Ataraxos проверяет варианты перед ходом.

Ataraxos выиграл у Пима Нимейера 15 партий, проиграл одну и свёл четыре вничью. Результат опубликован 30 сентября 2026 года.
В Stratego игрок не видит типы фигур противника до столкновения. Ataraxos сначала учится играть против себя, затем обучает belief network оценивать скрытые фигуры по доступной информации. Перед ходом система перебирает вероятные расстановки и проверяет продолжения.
Меньше вычислений. По сравнению с DeepNash авторы использовали примерно в 500 раз меньше вычислений и в 30 раз меньше завершённых тренировочных игр. Ataraxos обучился на 163 млн партий, а расчётная стоимость обучения составила менее $8 000 по ценам 2025 года.
Основное обучение заняло неделю на 16 NVIDIA H100. Сеть оценки скрытых фигур обучали ещё четыре дня на четырёх H100. При оценке Ataraxos тратил в среднем 1,26 секунды на ход на одной H100.
Код для запуска. Авторы открыли реализацию и демо обучения. Нужны Linux и GPU с поддержкой CUDA 11.8. Из каталога репозитория установка выполняется так:
```bash micromamba env create -f environment.yml micromamba activate ataraxos make pip install -e . ```
Демо запускается командой ниже. На RTX A6000 одна итерация обычно занимает 10–20 секунд.
```bash python scripts/train/rl_main.py --num_envs 128 --rl.dtype float32 --rl.torch_compile false ```
Первоисточники: [исследование Ataraxos в Nature, 30.09.2026](https://www.nature.com/articles/s41586-026-11036-y), [код и инструкция запуска](https://github.com/AtaraxosAI/stratego).
Тот же подход установил новый лучший результат в Hanabi для 2–5 игроков и победил ботов PerfectDou и DouZero в dou dizhu.
Первоисточник