11 сентября 2026 г.
GPT-6 Astra чаще отвергает бессмыслицу: 69% чётких возражений в BullshitBench
Astra обошла прежние модели OpenAI в тесте на ошибочные предпосылки, но до результатов Claude ещё не дошла.

Peter Gostev
@petergostev
BullshitBench: GPT-6-Astra выступила заметно лучше всех предыдущих моделей OpenAI, но до моделей Anthropic пока немного не дотянула. Кстати, у меня дилемма: модели, которые сейчас выступают судьями, уже довольно старые — Sonnet 4.6, GPT-5.2 и Gemini 3.1 Pro. В идеале я бы заново оценил все ответы моделями уровня Fable и Astra, но это обойдётся мне примерно в $3 тысячи. Можно сменить судей только для будущих прогонов, но тогда пострадает сопоставимость результатов. При этом нынешние судьи меня тоже не очень устраивают. Посмотрите, например, сколько у Astra жёлтых оценок: с более сильными судьями некоторые из них наверняка стали бы зелёными или красными.
Bullshit Benchmark: давно пора было обновить внешний вид BullshitBench. Нынешние модели настолько лучше справляются с дизайном интерфейсов, что уже было немного стыдно оставлять старую панель просмотра данных, собранную вайбкодингом.

· 1,4 тыс. просмотров
В BullshitBench V2 от 10 сентября 2026 года GPT-6 Astra с максимальным рассуждением отвергла ошибочную предпосылку в 69 вопросах из 100.
BullshitBench проверяет, станет ли модель выполнять запрос с бессмыслицей в условии. Среди заданий есть вопросы по разработке софта. Здесь оценивают способность возразить постановке задачи, а не качество написанного кода.
Прогресс внутри OpenAI. Astra чаще замечает подвох, чем GPT-5.6 Sol и Terra. В опубликованной таблице V2 от 10 сентября результаты такие:
| Модель | Режим рассуждения | Чёткое возражение, доля всех попыток | | --- | --- | --- | | GPT-5.6 Sol | max | 47% | | GPT-5.6 Terra | max | 54% | | GPT-6 Astra | max | 69% | | Claude Sonnet 4.6 | high | 91% | | Claude Opus 4.8 | none | 95% |
Ещё в 27 ответах Astra заметила проблему, но продолжила работать с ошибочной предпосылкой. В 4 ответах приняла бессмыслицу. Отказов и ошибок в этом прогоне не было.
Ответы оценивают Claude Sonnet 4.6, GPT-5.2 и Gemini 3.1 Pro Preview, а категорию определяет средняя оценка. Пётр Гостев хочет перейти на судей уровня Fable и Astra, но смена судей только для новых прогонов нарушит сопоставимость со старыми. По его оценке, часть промежуточных результатов Astra при повторной проверке получила бы однозначную оценку.
Ответы доступны для сравнения. В публичной панели BullshitBench можно выбрать предметную область и режим рассуждения, затем сопоставить ответы моделей. Результаты выгружаются в CSV или PNG.
Повторную оценку всех ответов новыми судьями Гостев оценивает примерно в $3 тысячи.
* Meta Platforms Inc. признана в РФ экстремистской организацией, её деятельность запрещена; Facebook и Instagram заблокированы. Meta AI и другие продукты компании — продукты этой организации.
Первоисточник
