17 августа 2026 г.
Балл агента в бенчмарке меряет не только модель: poolside выкладывает траектории прогонов
poolside кладёт к баллам бенчмарков полные траектории прогонов: по ним видно, что агент делал на самом деле и где нашёл лазейку в задаче. Эксперименты у команды идут десятки тысяч раз в день, от смесей данных до устройства харнесса (17.08).

Poolside
@poolsideai
Оценивать агентов грязно. Балл в бенчмарке что-то говорит о качестве модели, но заодно отражает всю систему вокруг неё: харнесс, песочницу, зависимости, таймауты, а иногда и лазейку, которую агент нашёл в задаче. Поэтому для нас так важны траектории. Они показывают, что агент сделал на самом деле и значит ли балл то, что мы думаем. Мы их публикуем, чтобы это доказательство было прозрачным и проверяемым, а сообществу было на чём учиться. Смотрите, как @aalSonOfRavi и @ConnorBAdams разбирают всё это с @petergostev из @arena, включая на удивление изобретательные reward hacks!
Arena.ai @arena
Знакомьтесь: Arena Conversations. @petergostev садится с исследователями @poolsideai Коннором Адамсом и Аалхадом Патанкаром, чтобы обсудить, как они строят frontier open coding models. Эпизод выходит сегодня в 10:00 PT на нашем YouTube. Они копают семейство моделей Laguna от poolside, разбирают, почему команда публикует полные траектории, а не одни баллы, чтобы любой мог их проверить, и как «эксперименты» в poolside, от смесей данных до устройства харнесса и решений по настройке наград, гоняются десятки тысяч раз в день.
poolside кладёт к баллам бенчмарков полные траектории прогонов: по ним видно, что агент делал на самом деле и где нашёл лазейку в задаче. Эксперименты у команды идут десятки тысяч раз в день, от смесей данных до устройства харнесса (17.08).
Разбор с исследователями poolside выходит 17.08 на YouTube-канале arena.
первоисточник