25 июля 2026 г.
Sol из шутки собрала бенчмарк бенчмарков BBBBB в пять уровней вместо отписки
25 июля Итан Моллик в шутку попросил модель Sol "теперь сделай benchbenchbenchbenchbench" - и вместо отказа получил рабочий артефакт. Sol собрала BenchBenchBenchBenchBench (BBBBB): исполняемый бенчмарк для AI-написанных наборов проверок под метрики оценки бенчмарков, то есть пять уровней вложенности. По словам автора, модель ещё и провела толковые эксперименты.

Ethan Mollick
@emollick
Ха! Оно это сделало: «Представляем BenchBenchBenchBenchBench (BBBBB), исполняемый бенчмарк для AI-написанных наборов проверок соответствия под метрики оценки бенчмарков». Я правда думал, что оно воспримет «теперь сделай benchbenchbenchbenchbench» как шутку, но Sol и вправду провела толковые эксперименты.
As a joke I prompted Codex "Build and run BenchBench, a benchmark of now good ai is at creating benchmarks. then figure out what benchbenchbench is and run that. and then write benchbenchbench up as a good arXiv paper." I got a PDF. But the paper is actually kind of interesting?





· 34,3 тыс. просмотров
Почему это важно: Раньше на заведомо абсурдную эскалацию модель либо отказывалась, либо отшучивалась. Здесь Sol приняла шуточную команду буквально и довела её до исполнимого кода с экспериментами. Для практика это сигнал: агент трактует даже нелепый запрос как задачу и доводит до результата, а не фильтрует его как несерьёзный. Ни цифр по стоимости прогона, ни ссылки на код автор не приводит.
Не хотите разбираться сами? Внедряем ИИ в ваш бизнес: задачи без лимита, одна цена в месяц, отмена в любой момент.
Что дальше: Дать своему агенту заведомо абсурдную задачу и проверить, отшутится он или соберёт исполнимый артефакт.
Первоисточник