27 августа 2026 г.
Агент чинит баг, почти не читая исходники: у Benzi это 9,5 цента за фикс
Benzi решил 391 из 500 задач SWE-bench Verified, а в медианном прогоне прочитал 379 строк кода.

На 24 багах Benzi с Sonnet прочитал 9 125 строк исходника. Claude Code на той же модели — 20 704.
Автор Benzi зашёл с другой стороны: он не даёт модели читать код вообще. Вместо файлов она задаёт вопросы компилятору и получает точный ответ.
Раньше было так. Агент тащил куски кода из разных файлов или строил по проекту эмбеддинги. Токены росли, а после сжатия контекста карта программы забывалась и агент собирал её заново. Многофайловая правка сдвигала номера строк, и поиск начинался с нуля.
Теперь иначе. Benzi разбирает проект через tree-sitter и держит одной картой 10 языков, от Python и TypeScript до Rust и Ruby. Ядро microsoft/vscode на 923 тыс. строк он проиндексировал за две минуты.
Модели харнесс отдаёт больше 35 детерминированных инструментов вместо файлов: кто вызывает эту функцию, куда дотянется правка, откуда пришло неверное значение. Спорные места Benzi помечает отдельным ярусом, а не выдаёт за проверенный факт.
Все 500 прогонов SWE-bench Verified стоили $37,33, то есть 9,5 цента за решённый баг. В медианном прогоне модель сделала 27 ходов, а 97% входных токенов пришли из кеша.
Харнесс DeepSeek на тех же 24 багах прочитал 43 598 строк, в 4,8 раза больше Benzi. OpenCode снялся с замера: он падал раз за разом.
Поставить можно двумя путями. На benzi.fly.dev вставляешь ссылку на публичный репозиторий GitHub без регистрации, но браузерный режим только читает. Правки даёт расширение для VS Code varianttech.benzi версии 0.2.2 от 18 августа 2026: бесплатно, ключ не нужен, требуется Python 3.9+. CLI у проекта нет.
Первоисточник