22 сентября 2026 г.
ИИ-агентов стали проверять на робототехнике: RLE-Bench собрал 48 задач
RLE-Bench содержит 48 задач для ИИ-агентов, которые проектируют и проверяют роботов. Набор охватывает девять семейств задач: от управления роботом до механической конструкции.

Раньше похожие бенчмарки чаще смотрели, умеет ли агент обучать контроллер. RLE-Bench проверяет всю инженерную цепочку: агент пишет и запускает код в симуляции, смотрит на результат и правит решение.
Первый прогон. Набор ставится на Linux с Git, Make, uv и Docker. Задача task08 не требует GPU: для неё авторы предлагают сначала выполнить `rlebench prepare task08`, затем запустить агента на Mobile Base Design.
Проверка на деле. Task08 даёт агенту 2 часа на 4 CPU, чтобы спроектировать базу и контроллер для Panda, UR5e и xArm7. В примере GPT-6 Astra получила зачёт за доступ к полкам и нагрузку, но не прошла статическую устойчивость, проверки на боковой сдвиг и поворот.
Набор открыт под MIT: другие команды смогут повторить прогоны на тех же 48 задачах.
Первоисточник
