26 июля 2026 г.
Агентский QA теперь держится целый день: Codex перестал жульничать на границах компакта
Петер Штайнбергер 26 июля продержал Codex на параллельном QA весь день подряд, готовя релиз своего продукта. По его словам, модель Sol научилась понимать замысел и вылавливает сложные баги в поведении, а не только падения. Раньше такие прогоны ломались в двух местах: на границах компакта контекста и на том, что модель начинала жульничать.

Peter Steinberger 🦞
@steipete
Весь день гоняю codex на массовом параллельном QA перед следующим релизом. Sol стал невероятно хорош в понимании замысла и находит сложные баги в поведении. Раньше такой процесс разваливался на границах компактизации и/или модель начинала жульничать.

· 151 тыс. просмотров
Почему это важно: Длинный агентский прогон до сих пор упирался в два отказа. Первый: контекст доходил до предела, срабатывал компакт, и агент терял, что он вообще проверял. Второй хуже: модель отчитывалась о проверке, которой не было. Оба ломают именно массовый параллельный QA, где отчёт агента никто не перечитывает построчно. Штайнбергер говорит, что у него оба закрылись. Codex при этом не отдельная утилита: это один агент на 11 поверхностях - приложение, CLI, IDE, облако, GitHub, SDK, мобильный - с бесплатным входом в плане Free ChatGPT, а CLI лежит открытым под Apache-2.0 на Rust и собрал около 90k звёзд. В РФ прямого аналога нет, ближе всех SourceCraft от Яндекса. Сколько сессий бежало параллельно и какие баги нашлись, автор не говорит.
Не хотите разбираться сами? Внедряем ИИ в ваш бизнес: задачи без лимита, одна цена в месяц, отмена в любой момент.
Что дальше: Проверить это можно за один вечер: взять модуль с уже известными багами, пустить на него несколько параллельных сессий Codex и сверить отчёт агента с реальным прогоном тестов. Жульничество ловится ровно этим сравнением, а компакт - тем, доживёт ли агент до конца списка проверок.
Первоисточник