20 сентября 2026 г.
Агенты в долгих задачах ходят по кругу: сотни миллиардов токенов и ни одного решения
Сотни миллиардов токенов на математических задачах не дали ни одного решения: агент раз за разом уходил в мелкие вычисления.

Питер Гостев отдавал агенту математическую задачу, возвращался через сутки и находил гору расчётов вместо прогресса.
Дело не в математике, а в длинных прогонах. Агент увлекается мелкими подзадачами и валидациями вместо того, чтобы придумать, как решать задачу целиком.

Peter Gostev
@petergostev
Не могу выкинуть этот график из головы, и он заводит меня насчёт того, что модели смогут дальше. Я сжёг сотни миллиардов токенов на разных математических задачах и не решил ни одной. Каждый раз история повторялась: - Модель стартует хорошо, потом я возвращаюсь к ней через сутки, а она скатилась в мелкие локальные «головоломки» и бесконечные вычисления ни о чём - Тогда я трачу время на структуру, которая это предотвратит: внешний цикл, ещё один агент-наблюдатель, шаги синтеза и абстракции, всё, что приходит в голову. Какое-то время работает. - Возвращаюсь через сутки, и снова то же самое: «мы много считали, но ходили по кругу и никуда не продвинулись». Прекрасно. Мне это говорит вот о чём: модели были плохи не в математике как таковой, им просто не хватало умения думать так, как думают люди. Хороший человек подумает над задачей, попробует пару подходов, почитает что-нибудь вокруг, вернётся к задаче, зайдёт с другой стороны и так далее. Люди ленивы: вместо того чтобы считать руками каждый частный случай, они хотят придумать, как думать о задаче системнее, и решить её так. А нынешнее поколение агентов, наоборот, души не чает в мелких головоломках, прогонах валидаций и математике уровня карго-культа. Им в радость считать дальше при полном нуле продвижения по самой задаче. Вот почему этот график меня так заводит. Даже на самом низком уровне test-time compute (ось X, к сожалению, не подписана) «внутренняя» модель далеко впереди всего, чего Astra могла достичь с неограниченными токенами. Для меня это сигнал: модель не просто лучше работает, когда ей дают много токенов на размышление, она, похоже, подходит к задачам качественно иначе. Если так, последствия куда шире математики. У будущих моделей должно быть гораздо более глубокое суждение, абстрактное мышление и способность не залипать на неважных деталях. Меня это очень радует. Это будет громко.
· 2 тыс. просмотров
Структура не спасла. Гостев строил обвязку: внешний цикл, второго агента-наблюдателя, отдельные шаги синтеза и абстракции. Помогало ненадолго, через сутки агент снова ходил по кругу.
При минимальном бюджете на размышление внутренняя модель на его графике идёт выше всего, чего Astra достигает с неограниченными токенами. Ось X не подписана. Свой вывод Гостев подаёт как догадку: модель не просто думает дольше, а заходит в задачу иначе.
Раньше нерешённые задачи Эрдёша двигали только математики: за 2024-2025 из открытых в решённые перешли 111 штук. Теперь счёт открыли и модели.
На наборе FrontierMath Erdős из 68 таких задач, который Epoch AI запустила 1 сентября 2026, ненулевой результат только у GPT-6 Astra: две задачи, 3%.
Цена одного захода. Epoch давала на задачу $300 и 72 часа. Два решения Astra стоили $222 и $172 и заняли примерно по 10 часов каждое.
Что помогает против хождения по кругу, видно у Лиама Прайса и Кевина Баррето, решающих задачи Эрдёша с декабря 2025. Они просят решение у чат-бота, отдают его свежему инстансу на проверку и повторяют, пока не выйдет рабочий вариант. Дальше формальная верификация в Aristotle и ревью живыми математиками.
Рабочий цикл над агентом устроен так же. Триггер запускает заход, внешняя проверка решает «готово или ещё раз», стоп-условие закрывает цикл.
Публичный след у этой внутренней модели появится, только когда её прогонят на открытом наборе вроде FrontierMath Erdős.
Первоисточник
