18 сентября 2026 г.
Контекст агенту нужно сокращать, а не только расширять: T4 довела Nemotron-3 120B до 42,2%
Статья на arXiv от 17.09.2026 сравнила 176 конфигураций ИИ-агентов на 4 моделях, 5 стратегиях управления контекстом и окнах от 32k до 128k токенов. На SWE-Bench Verified T4 подняла результат Nemotron-3 120B с 11,40% до 42,20% при окне 32k: агент сначала заменяет старые наблюдения короткими заглушками, затем сжимает оставшийся контекст.

Без управления контекстом T0 тащит историю целиком, а T4 сначала убирает устаревшие наблюдения и передаёт остаток на суммаризацию. В 36 из 64 настроек T2/T4 recall_event не вызвался ни разу, медиана вызовов равна нулю, а среднее число вызовов упало с 0,540 на задачу при 32k до 0,007 при 128k.
Среда важна. Экспериментальный harness собрали на LangGraph, задания запускали через Harbor, модели работали локально в SGLang в BF16. Один запуск ограничили 300 шагами, результаты инструментов обрезали на 24 000 символах.
Планирование стоит денег. Для Nemotron-3 30B оно подняло успех на SWE-Bench Verified с 14% до 25%, но средняя стоимость задачи выросла с $0,02 до $0,09. У Nemotron-3 550B результат изменился с 68% до 66%, а стоимость снизилась с $3,31 до $2,33.
Предопределённый набор инструментов дал Nemotron-3 30B прибавку 15,0 п.п. на SWE-Bench Verified и 10,1 п.п. на Terminal-Bench 2.1 по сравнению с bash-only. У Nemotron-3 550B bash-only, наоборот, поднял результат на 3,6 п.п. и 5,6 п.п., снизил стоимость на 53% и 30%, сократил медианную траекторию на Terminal-Bench с 47 до 31 действия и увеличил долю Write-code действий с 16% до 27%.
Авторы считали стоимость по тарифам OpenRouter: от $0,05/$0,20 за 1M входных и выходных токенов у Nemotron-3 30B до $1,50/$7,50 у Mistral-Medium-3.5-128B.
Дальше harness для ИИ-агента придётся подбирать под конкретную модель: одной помогает планирование, другой дешевле bash-only, а T4 сокращает лишнюю историю.
Первоисточник
