18 августа 2026 г.
Качество кода агента решает обвязка, а не модель: Османи собрал её в 24 скилла
Читать за агентом весь код больше не выходит: качество теперь задают проверки вокруг агента, а человек владеет тем, что уезжает в прод.

Addy Osmani
@addyosmani
Если вы строите софтверную фабрику, коду, который годится в прод, всё равно нужны человеческий вкус и человек-владелец. Скорее всего, люди понадобятся в петле с самого начала: решить, зачем продукт, как устроена система (если вам это важно) и какая у вас планка качества. Код ревьюить надо (фабрика с включённым светом), но осознанно выбирайте, где это нужнее всего. По моему опыту, смотреть стоит туда, где ломается автоматическая back-pressure. Или где приходится идти на компромисс по поддерживаемости. Стремитесь к тому, чтобы проверки качества шли как можно раньше и непрерывно. Не обязательно все, но сюда входят системы типов, автотесты, мутационное тестирование, сканеры безопасности и линтинг архитектурных правил. Число проверок != качество. Скорее всего, придётся поэкспериментировать, какие проверки дают лучшее соотношение сигнала и шума. Будьте готовы осознанно закручивать или отпускать ограничения. Стройте фабрику так, чтобы часть человеческого вкуса была зашита в окружение, агент приносил доказательства, что сделал правильно, а человек по-прежнему «владел» тем, что уезжает в прод.
Инженеры, работавшие с ИИ, свой же код понимают хуже: 50% против 67% в тесте на понимание.
Это рандомизированное исследование Anthropic, разрыв в 17 процентных пунктов. Эдди Османи выводит из таких данных норматив фабрики: автономии агенту дают ровно столько, сколько получается дёшево и надёжно проверить.
Узкое место фабрики теперь не генерация кода, а проверка.
Османи делит фабрики на две. В light человек остаётся в петле и меняет скорость на суждение. В dark агенты собирают и отправляют код сами, деталей никто не читает.
Что переезжает в автоматику
Раньше качество держал ревьюер. Человек читал диффы и ловил дичь глазами. Опрос Sonar 2026 насчитал 42% закоммиченного кода, написанного ИИ или человеком с существенной помощью ИИ, и на таком объёме чтение глазами не масштабируется.
Проверки поэтому уезжают в окружение агента: типы, автотесты, мутационное тестирование, сканеры безопасности, линтер архитектурных правил. Мутационное тестирование ломает строку нарочно и смотрит, заметит ли тест подмену. Покрытие говорит только, что строка исполнилась.
Больше гейтов не значит лучше. Османи советует мерить не число проверок, а соотношение сигнала и шума, и закручивать или отпускать ограничения осознанно. Ревью человеком автоматику не заменяет: в исследовании Wharton почти три четверти людей принимали ответ ИИ даже тогда, когда он ошибался.
первоисточник
