./новости · 25 июля 2026 г.
новость
Sol из шутки собрала бенчмарк бенчмарков BBBBB в пять уровней вместо отписки
источник: @emollick на X ↗·
машинная выжимка · сверена с источником

Ethan Mollick
@emollick
Ха! Оно это сделало: «Представляем BenchBenchBenchBenchBench (BBBBB), исполняемый бенчмарк для AI-написанных наборов проверок соответствия под метрики оценки бенчмарков». Я правда думал, что оно воспримет «теперь сделай benchbenchbenchbenchbench» как шутку, но Sol и вправду провела толковые эксперименты.




· 6,7 тыс. просмотров
25 июля Итан Моллик в шутку попросил модель Sol "теперь сделай benchbenchbenchbenchbench" - и вместо отказа получил рабочий артефакт. Sol собрала BenchBenchBenchBenchBench (BBBBB): исполняемый бенчмарк для AI-написанных наборов проверок под метрики оценки бенчмарков, то есть пять уровней вложенности. По словам автора, модель ещё и провела толковые эксперименты.
Почему это важно: Раньше на заведомо абсурдную эскалацию модель либо отказывалась, либо отшучивалась. Здесь Sol приняла шуточную команду буквально и довела её до исполнимого кода с экспериментами. Для практика это сигнал: агент трактует даже нелепый запрос как задачу и доводит до результата, а не фильтрует его как несерьёзный. Ни цифр по стоимости прогона, ни ссылки на код автор не приводит.
Что дальше: Дать своему агенту заведомо абсурдную задачу и проверить, отшутится он или соберёт исполнимый артефакт.