21 августа 2026 г.
Первое место на CursorBench теперь стоит $2,81 за задачу: Grok 4.6 обошёл Fable 5 Max
Grok 4.6 в режиме extra high набрал 70,8% на CursorBench 3.2 и обошёлся вшестеро дешевле Fable 5 Max.

Elon Musk
@elonmusk
Grok 4.6 в режиме extra high thinking выходит на первое место в CursorBench!
Grok 4.6 только что забрал первое место в CursorBench 3.2.....и эффективность просто безумная Вот сравнение по деньгам: • Grok 4.6 Extra High — 70,8% | $2,81 за задачу • Fable 5 Max — 70,5% | $17,32 за задачу • Opus 5 Max — 70,0% | $8,23 за задачу • GPT-5.6 Sol Max — 67,2% | $5,69 за задачу Grok набрал больше всех и при этом обошёлся примерно в 6 раз дешевле Fable 5 Max и почти втрое дешевле Opus 5 Max на задачу Вот почему Grok так хорош для агентов Топовый интеллект — это отлично.....но топовый интеллект, который тянет длинные задачи по коду и не сжигает при этом дикие объёмы вычислений, ещё лучше

Первое место на бенчмарке Cursor стоит $2,81 за задачу.
Столько тратит Grok 4.6 в режиме extra high на средней задаче CursorBench 3.2. Fable 5 Max решает те же задачи за $17,32 и набирает на 0,3 п.п. меньше. Кто гоняет агента весь день, считает именно этот счёт, а не третий знак в проценте.
Срез на 21.08.2026:
- Grok 4.6 extra high: 70,8% при $2,81 за задачу - Claude Fable 5 Max: 70,5% при $17,32 - Claude Opus 5 Max: 70,0% при $8,23 - GPT-5.6 Sol Max: 67,2% при $5,69
Как включить. У Grok 4.6 в Cursor четыре уровня усилия мышления: xhigh, high по умолчанию, medium и low. Extra high из твита включается выбором xhigh. Он виден в списке моделей, а шорткат Cmd+Shift+/ циклически меняет усилие для текущей модели. В API xAI то же самое делает параметр reasoning effort = "xhigh" на grok-4.6 и новее. На grok-4.5 такой запрос молча считается за high.
Раньше и теперь. Grok 4.5 выжимал из CursorBench 3.2 максимум 66,7%. Grok 4.6 на xhigh поднял планку до 70,8%, прибавка 4,1 п.п. На high модель даёт 69,9%. Тариф в Cursor остался прежним: $2 за миллион входных токенов и $6 за миллион выходных, при этом на xhigh модель пишет в среднем 41 136 выходных токенов на задачу.
Лидерство не сплошное. На APEX-SWE Grok 4.6 на high даёт 56,4% против 63,7% у Opus 5.
Следующий ориентир дадут независимые замеры: CursorBench считает сам Cursor, и в сводную формулу BenchLM он не входит.
Первоисточник