15 сентября 2026 г.
RL лучше добирается до трудных задач: NGU превзошёл GRPO на GSM8K Platinum
NGU с K=4 и p=0.9 превзошёл стандартный GRPO на самой трудной подвыборке GSM8K Platinum (блог Michael Noukhovitch, 15.09.2026). Метод возвращает полностью неверные задачи в очередь, сохраняя старые completions для следующего GRPO-обновления. При фиксированном размере batch K=4 оказался лучше K=32.

RL сильнее улучшает лёгкие задачи, чем трудные. Авторы называют этот перекос Matthew Effect in RL for LLMs: быстрые решения получают больше обучения, а сложные задачи застревают. **Ход NGU.** Never Give Up возвращает задачу в очередь с вероятностью p, если все ответы неверны. Для метода нужна асинхронная RL-инфраструктура, где лёгкие задачи быстрее освобождают вычисления для трудных. **Проверка.** В AIME 2025 исходный pass@1 для трёх уровней сложности составил 0%, 3,8% и 22,7%. В эксперименте с DeepScaler и Qwen 3 4B обучение заняло около 120 H100-часов. На Manufactoria обычный GRPO застревал на частично решённых задачах, а NGU начал полностью решать отдельные задачи. При p=1,0 результат резко ухудшился, а p=0,75 вместе с synchronous RL уступил baseline GRPO.
Код проекта уже доступен на GitHub авторов.
Первоисточник
