./новости · 21 июля 2026 г.
новость
99% open-weight релизов не публикуют датасеты - бенчмарки RLM можно накрутить незаметно
источник: @swyx на X ↗·
машинная выжимка · сверена с источником

swyx
@swyx
Очень заметный разбор со сравнением траекторий - он закопан в статье про RLM от @a1zhang и @lateinteraction. Секрет Полишинеля в тренировке «фронтир»-моделей: даже не обучаясь на самом тесте, можно по сути жульничать, обучаясь на двойниках теста - и так подгонять почти любое число на бенчмарке, какое захочешь. Но когда их выкладывают в open weights, в 99% случаев по норме тебе не дают датасеты и RL-среды, по которым легко было бы увидеть, не учился ли кто-то на Temu Tbench - вот и получается правдоподобное отрицание. Алекс и Омар разбирают, как применять стандартные NLP-метрики расстояния к скрытым траекториям. Окончательного решения тут нет, но у них есть предварительные наработки. Кстати, это подтверждает вывод, что RLM умеют обобщаться на невиданные задачи с той же скрытой структурой, что была в обучении.


· 3,5 тыс. просмотров
В 99% случаев открытые (open-weight) релизы моделей не публикуют датасеты и RL-среды - проверить, обучалась ли модель на двойниках теста, обычно нечем. Статья про RLM от @a1zhang и @lateinteraction показывает: даже без прямого обучения на бенчмарке итоговое число можно подогнать почти под любое значение.
Почему это важно: Раньше казалось: не тренируешься на самом тесте - значит, число бенчмарка честное. Теперь ясно, что это не так - достаточно натренироваться на задачах-двойниках теста, и результат всё равно подгоняется. При этом в 99% open-weight релизов датасеты и RL-среды, которые могли бы это вскрыть, не публикуют - остаётся только правдоподобное отрицание. Авторы пробуют ловить манипуляцию NLP-метриками расстояния между скрытыми траекториями, но сами признают: готового решения нет, только первые наработки.
Что дальше: Публичного детектора накрутки пока нет. Практику - не доверять месту модели в лидерборде и гонять её на своих задачах перед выбором.