14 августа 2026 г.
Роботу хватает одного видео с человеком, чтобы освоить навык: 62% успеха
HOST превращает одно человеческое видео в подсказку для замороженной модели и осваивает новый навык за 29 секунд.

Человек перекладывает предмет из одной ёмкости в другую. Через 29 секунд то же самое повторяет робот, который этой задачи раньше не видел.
Обычно новый навык обходится роботу в полсотни демонстраций и цикл дообучения. Метод HOST не трогает веса модели вовсе.
Демонстрация вместо дообучения. Система смотрит видео с человеком, определяет, на какой стадии задачи он находится, и предсказывает, как та же стадия выглядит глазами самого робота. Дальше она выводит цепочку действий до того же результата. Одна демонстрация, один проход, веса заморожены.
Цифры замера. Без подсказки та же модель решала задачи в 17% попыток, с HOST — в 62%. Бейзлайн Wall-OSS, дообученный на 50 роботных демонстрациях под каждую задачу, дал 56%. По времени HOST обходит такое дообучение в 507 раз (препринт arXiv, 22.07).
Старые навыки на месте. Файнтюн под новую задачу роняет бейзлайн до 40% на ранее освоенных задачах. HOST их сохраняет: проектная страница заявляет 99% удержания.
Тесты шли на установке самих авторов: два шестиосевых манипулятора ARX R5, три RGB-камеры, 50 новых задач по 20 попыток. На чужих роботах и в незнакомых помещениях метод не проверяли, а 62% означают промах почти в четырёх попытках из десяти.
Повторить можно, но дорого. Код лежит на GitHub (CGuangyan-BIT/HOST): четыре модуля и две conda-среды, Python 3.10, CUDA 12.4. Готовых чекпоинтов в репозитории нет — обучение стартует от Wan2.2-TI2V-5B и ActionDiT, в статье на него ушло 64 GPU, 10 тысяч шагов выравнивания и 600 тысяч шагов на политику. Нужен и свой датасет эпизодов с кадрами, действиями робота и инструкциями.
первоисточник