18 августа 2026 г.
Качество кода агента решает обвязка, а не модель: Османи собрал её в 24 скилла
Читать за агентом весь код больше не выходит: качество теперь задают проверки вокруг агента, а человек владеет тем, что уезжает в прод.

Addy Osmani
@addyosmani
Если вы строите софтверную фабрику, коду, который годится в прод, всё равно нужны человеческий вкус и человек-владелец. Скорее всего, люди понадобятся в петле с самого начала: решить, зачем продукт, как устроена система (если вам это важно) и какая у вас планка качества. Код ревьюить надо (фабрика с включённым светом), но осознанно выбирайте, где это нужнее всего. По моему опыту, смотреть стоит туда, где ломается автоматическая back-pressure. Или где приходится идти на компромисс по поддерживаемости. Стремитесь к тому, чтобы проверки качества шли как можно раньше и непрерывно. Не обязательно все, но сюда входят системы типов, автотесты, мутационное тестирование, сканеры безопасности и линтинг архитектурных правил. Число проверок != качество. Скорее всего, придётся поэкспериментировать, какие проверки дают лучшее соотношение сигнала и шума. Будьте готовы осознанно закручивать или отпускать ограничения. Стройте фабрику так, чтобы часть человеческого вкуса была зашита в окружение, агент приносил доказательства, что сделал правильно, а человек по-прежнему «владел» тем, что уезжает в прод.

· 294,1 тыс. просмотров
Инженеры, работавшие с ИИ, свой же код понимают хуже: 50% против 67% в тесте на понимание.
Это рандомизированное исследование Anthropic, разрыв в 17 процентных пунктов. Эдди Османи выводит из таких данных норматив фабрики: автономии агенту дают ровно столько, сколько получается дёшево и надёжно проверить.
Не хотите разбираться сами? Внедряем ИИ в ваш бизнес: задачи без лимита, одна цена в месяц, отмена в любой момент.
Узкое место фабрики теперь не генерация кода, а проверка.
Османи делит фабрики на две. В light человек остаётся в петле и меняет скорость на суждение. В dark агенты собирают и отправляют код сами, деталей никто не читает.
Что переезжает в автоматику
Раньше качество держал ревьюер. Человек читал диффы и ловил дичь глазами. Опрос Sonar 2026 насчитал 42% закоммиченного кода, написанного ИИ или человеком с существенной помощью ИИ, и на таком объёме чтение глазами не масштабируется.
Проверки поэтому уезжают в окружение агента: типы, автотесты, мутационное тестирование, сканеры безопасности, линтер архитектурных правил. Мутационное тестирование ломает строку нарочно и смотрит, заметит ли тест подмену. Покрытие говорит только, что строка исполнилась.
Больше гейтов не значит лучше. Османи советует мерить не число проверок, а соотношение сигнала и шума, и закручивать или отпускать ограничения осознанно. Ревью человеком автоматику не заменяет: в исследовании Wharton почти три четверти людей принимали ответ ИИ даже тогда, когда он ошибался.
Что уже можно поставить
Готовый набор лежит на GitHub. Османи выложил 24 скилла для агентов: 23 по фазам разработки и один мета-скилл. Ставятся одной командой `npx skills add addyosmani/agent-skills`, заявлена поддержка 70+ агентов.
В Claude Code набор подключается через маркетплейс плагинов, в Cursor папка `skills/` синкается в `.cursor/skills/`, в Gemini CLI работает `gemini skills install`.
Скилл code-review-and-quality задаёт пять осей ревью: корректность, читаемость, архитектура, безопасность, производительность. Пороги размера диффа заданы там же. Около 100 строк идут за один присест, до 300 допустимо при одном логическом изменении, 1000 строк изменений или 1000 строк в файле означают, что задачу пора разбивать.
Обвязка окупается и без смены модели. Команда Viv подняла своего кодового агента с Top 30 до Top 5 на Terminal Bench 2.0 одними изменениями harness. В HumanLayer держат AGENTS.md не длиннее 60 строк и гоняют typecheck, линт и тесты после каждой правки: успех молчит, падение отдаёт текст ошибки обратно в петлю.
Дальше проверку берёт на себя обвязка, а человеку остаётся то, что в неё не зашивается: замысел продукта и подпись под тем, что уехало в прод.
Первоисточник