10 сентября 2026 г.
Асинхронное обучение на HF Jobs ускорилось в 3,9 раза: адаптер LoRA передаётся через Storage Bucket
В публикации от 10 сентября 2026 года финальный прогон Async GRPO на 500 шагов занял 53 минуты. Первый прогон серии занял 3 часа 27 минут, итоговый оказался в 3,9 раза быстрее. Тренер, прокси и две vLLM-реплики работали в отдельных HF Jobs, а обновления LoRA проходили через Storage Bucket вместо NCCL.

Async GRPO разделял обучение и генерацию, но для синхронизации процессов требовал общую файловую систему или NCCL. HF Jobs запускают задачи на отдельных машинах, поэтому общий локальный диск и localhost здесь не работают.
Теперь. Rank-1 адаптер для Qwen/Qwen2.5-Math-1.5B занимает несколько мегабайт: процесс обучения сохраняет его в Storage Bucket, а две vLLM-реплики читают тот же путь. Прокси учитывает KV-префикс при распределении запросов и отправляет каждое обновление адаптера всем репликам. В пяти прогонах средняя награда за последние 20 шагов составила 0,438 в первом и 0,416 в последнем.
Поддержка синхронизации только адаптера уже вошла в TRL v1.14, а рецепт из трёх HF Jobs опубликован вместе с кодом прокси.
Первоисточник
