26 августа 2026 г.
Агенты и правда пишут код чище: ошибок на файл у Sonnet стало 1,29 вместо 3,01
Kiro разобрала 406K проверок кода за полгода: у Sonnet ошибок на файл стало 1,29 вместо 3,01, у Opus прогресс скачет.

Kiro
@kirodotdev
Правда ли AI-агенты становятся лучше? Полгода данных диагностики говорят: да, но с оговорками. Агенты Kiro используют диагностику на базе LSP, чтобы ловить ошибки типов, неразрешённые импорты и неопределённые символы. Новые модели не просто делают меньше ошибок: они проверяют более широкий круг файлов и лучше исправляют себя сами. Полный разбор 👉 http://spr.ly/6018B1x1dG

· 683 просмотров
Kiro посчитала, сколько ошибок агенты оставляют в коде: 1,5 млн рабочих диалогов за январь–июнь 2026.
Из них извлекли 406K обращений к диагностике. Ощущение «новая модель пишет чище» получило числа с живой работы, а не с бенчмарка.
Ошибок стало меньше. Sonnet 4 оставлял 3,01 ошибки на проверенный файл, Sonnet 4.6 оставляет 1,29. Это минус 57%. У Opus ровной линии нет: 1,74 у 4.5, 1,21 у 4.6, 1,82 у 4.7 и снова 1,21 у 4.8.
Заодно модели стали смотреть шире. Sonnet 4 проверял 1,57 файла за один вызов, Sonnet 4.6 берёт 1,86, Opus 4.8 доходит до 1,91.
Сами модели зовут анализатор редко. Доля диалогов с проверкой держится от 2,74% у Sonnet 4.5 до 22,26% у Opus 4.6, а у Opus 4.7 и 4.8 она около 10%. Остальной код уходит к человеку непроверенным.
Помогает жёсткий гейт. Если не давать агенту закрыть задачу, пока диагностика не чиста, доля принятого сломанного кода падает примерно с 90% до 8% (замер Иана Барбера, 11.08.2026).
Как включить. Сама по себе диагностика не заводится: нужен установленный language server для языка, для Python это `pip install pyright`. Дальше в корне проекта выполняется `/code init`, и Kiro определит языки и запишет конфиг в `.kiro/settings/lsp.json`. Режим работает в IDE и CLI, в вебе и на мобильном его нет.
Тариф Free стоит $0 и даёт 50 кредитов с доступом к open-weight моделям и Claude Sonnet 4.5. Pro стоит $20 в месяц за пользователя и даёт 1000 кредитов, добавочные идут по $0,04.
Разгребать придётся неравномерно. На Opus 4.6 ошибки нашлись в 26,7% файлов на Java против 4,0% на Python, а тесты агенты пишут грязнее продуктового кода: у Sonnet 4.5 это 9,13 ошибки на файл в тестах против 2,26 в исходниках. Чистая диагностика при этом ещё не значит рабочий код, потому что анализатор видит только импорты, типы и неопределённые символы, а падения в рантайме и логические баги в такие данные не попадают.
Первоисточник