17 августа 2026 г.
Агент доводит задачу до влитого PR сам: у Vorflux ревью пишет модель другой лаборатории
Вендор заявляет 88.4% на SWE-bench Verified у связки «пишет одна модель, ревьюит другая» против 80.8% у одиночной.

🚨 AI News | TestingCatalog
@testingcatalog
Vorflux открыл свою облачную платформу: задачу можно провести от плана до влитого PR на выделенной машине. Он умеет сам планировать, собирать, тестировать и ревьюить. > Ревью диффа по умолчанию делает модель не из того семейства, что писала код. > Первый запуск сохраняется снапшотом, и все следующие сессии просыпаются с той же стартовой точки. > Браузерный агент проходит живой пользовательский сценарий, запись прикладывается к пул-реквесту. Видео-пруф в PR 👀
· 2,7 тыс. просмотров
Одна модель пишет код, вторая его заворачивает. Так у Vorflux устроено по умолчанию.
Vorflux открыл облачную платформу 17 августа: задачу отдают целиком, и она едет от плана до влитого PR на выделенной машине. Браузерный агент проходит живой пользовательский сценарий, запись прохода прикладывается к пул-реквесту.
Не хотите разбираться сами? Внедряем ИИ в ваш бизнес: задачи без лимита, одна цена в месяц, отмена в любой момент.
Раньше проверяли вы: агент писал, вы открывали diff и искали, где он наврал. Теперь первую проверку берут на себя вторая модель и запись прохода по интерфейсу.
Как начать. Регистрация на us1.vorflux.com, дальше квикстарт «Connect your repos»: ставится GitHub App, либо коннектятся GitLab и Bitbucket. Setup-агент клонирует репозитории параллельными пачками, определяет базовую ветку и тулчейн, ставит зависимости и гоняет smoke-проверки — что приложение реально запускается, а не только компилируется. Результат сетапа сохраняется руками или сам через 30 минут и становится образом машины команды, и каждая следующая сессия стартует с репозиториями и зависимостями на месте.
Сколько стоит. Все машины на Ubuntu 22.04, новый аккаунт по умолчанию получает Large на 8 vCPU и 32 ГиБ за $0.85 в час, после суток простоя машина останавливается сама. Токены считаются отдельно: на своих ключах OpenAI, Anthropic или Google платформа берёт $0.25 за 1M токенов, на токенах Vorflux — прайс провайдера плюс $0.15 за 1M, а подписка Codex покрывает свои токены сама.
Новый личный аккаунт получает $70 кредитов, командный $200. Один кредит равен доллару и покрывает и время машины, и токены модели одним балансом, а у сессии есть потолок трат: по умолчанию $1000, настраивается в диапазоне от $1 до $100 000. Счёт в долларах, так что понадобится зарубежная оплата.
Кто пишет и кто проверяет. В сессии работают главный агент и субагенты на семи слотах, от explore и plan до review и testing, у каждого слота своя модель и свои инструкции. Вендор заявляет, что Opus 4.6 с ревью GPT 5.5 берёт 88.4% на SWE-bench Verified, то есть 442 задачи из 500, против 80.8% у одиночного Opus 4.6.
Сторонние прогоны SWE-bench покажут, сколько от 88.4% остаётся вне стенда вендора.
Первоисточник
