28 июля 2026 г.
Дешёвая модель на максимуме размышлений обгоняет дорогую: Luna xHigh дала +3,3% в Agent Arena
27 июля Питер Гостев назвал полной победой @polynoamial то, что бенчмарки теперь публикуют с разбивкой по уровню размышления. В Agent Arena xHigh-варианты GPT-5.6 Terra и Luna заняли 15-е и 17-е места: Luna на xHigh даёт +3,3% к базовой линии и обходит Terra на Medium с её +3,1%.

Peter Gostev
@petergostev
Абсолютная победа @polynoamial: результаты бенчмарков теперь публикуют вместе с уровнем test time scale. Luna, кстати, неожиданно хороша.
GPT-5.6 Terra и Luna (варианты xHigh) присоединились к Sol в Agent Arena! Их сделала @OpenAI, в рейтинге они занимают 15-е и 17-е места по реальным агентным сессиям от нашего сообщества по всему миру. Если сравнить все варианты в Agent Arena, сильнее всего каждый прибавляет на переходе от Low к Medium. На Low Terra не растёт вовсе, а Luna падает на 5,1% ниже базовой линии. Задержку выносим за скобки, и тогда граница эффективности видна ясно: → Luna xHigh (+3,3%) обходит Terra на Medium и на Low (+3,1% и +1,2%) Больше усилий на рассуждение у модели подешевле бьёт модель подороже, которая работает налегке. Ещё не

· 4,6 тыс. просмотров
27 июля Питер Гостев назвал полной победой @polynoamial то, что бенчмарки теперь публикуют с разбивкой по уровню размышления. В Agent Arena xHigh-варианты GPT-5.6 Terra и Luna заняли 15-е и 17-е места: Luna на xHigh даёт +3,3% к базовой линии и обходит Terra на Medium с её +3,1%.
Что дальше: Прогнать свой рабочий модуль дважды: дешёвая модель на максимальном reasoning против дорогой на минимальном - и сравнить счёт с результатом.
Первоисточник