8 сентября 2026 г.
Советы агенту про тесты чаще не окупаются: без них корректность оказалась выше средней
Инженер Дэн Лу прогнал каждое из 26 промптовых условий по 160 раз на одной задаче: агент без указаний про тесты обошёл большинство советов.

Дэн Лу просил агента писать компрессор Zstd на Rust тысячи раз подряд. Менял одно: что сказать про тесты.
Вывод для тех, кто копит инструкции в промптах и скиллах: почти ни один совет про тестирование не окупился. Условие Default, где про тесты не сказано ничего, дало корректность выше средней по всем 26 условиям. Агенты, которых просили взять конкретную библиотеку или технику, обычно делали что-то бесполезное.
Как мерили. Codex с моделью GPT-5.6 Sol на усилиях medium и xhigh, 26 промптовых условий и 4 внешних скилла, в среднем 160 прогонов на условие. Корректность считали как долю прогонов, прошедших все скрытые тесты. Отдельно ту же батарею гоняли на реализации почтового протокола IMAP, по 40 прогонов на условие.
Просьба работать по TDD (сначала тест, потом код) заставила агентов писать вдвое больше тестов. В 67 прогонах из 160 хотя бы один тест падал до того, как появилась настоящая реализация, а у Default таких прогонов ноль. Корректность при этом не выросла, и проверочный тест TDD-агенты заваливали чаще.
Хуже всех выступили формальные методы: Verus, Alloy и Lean 4 оказались в конце списка. Модель на TLA+ построили 159 агентов из 160, а нетривиальный баг инструмент Kani поймал ровно один раз за 160 прогонов.
Что сработало. Просьба сначала провести аудит кода дала лучшую корректность на xhigh: аудит действительно провели 152 агента из 160, и 151 из них нашёл проблему и внёс правку. На medium то же условие ушло ниже средней. Из техник вытянули две: Proptest и общая просьба про property-based testing (проверять не отдельные примеры, а правила, которым код обязан подчиняться). С библиотекой QuickCheck 63 прогона из 160 проверили ровно одно свойство.
Случайные входы агенты сами почти не строят. Структурированный набор таких входов появился в 10 прогонах из 160, зато там реальные баги находились в половине случаев.
Лучшую корректность из 26 условий дал самодельный скилл автора. Он просит агента заранее назвать места с тонкими багами, придумать проверки на границах, а после реализации перевывести результат с нуля и сравнить. Сам Лу пишет, что задумка не сработала: перепроверять в свежем контексте агенты почти никогда не брались.
Чужой скилл ещё и стоит денег. Hegel добавил в среднем 900 тысяч токенов на medium и 1,8 млн на xhigh, счёт вырос на 16% и 18%, а корректность осталась ниже средней.
Рецепт автора на замену: каркас тестов и разбора падений ставит человек, а агент его потом дополняет.
Первоисточник
