25 сентября 2026 г.
Один удачный ответ не доказывает ум модели: Maggie Appleton назвала это capability gaslighting
23 сентября Мэгги Эпплтон назвала capability gaslighting момент, когда топ-модель убеждает человека в своей экспертности, а на следующий день проваливает ту же задачу. В её наблюдении агент при планировании может задать около 20 вопросов с вариантами A/B/C.

Gergely Orosz
@gergelyorosz
Мне нравится, как Мэгги напоминает нам: агенты ведут себя не так, как люди.
Что такое capability gaslighting? Так Мэгги Эпплтон, design engineer в GitHub Next, описывает работу с моделями: «Модели убеждают вас, будто они способны на многое: на одной задаче они правда впечатляют, а потом вы пробуете другую, и они проваливаются. И кажется: „Ты будто загазлайтила меня. Я решил, что ты невероятно умный агент или модель, а ты падаешь лицом в грязь“. Иногда они проваливаются, но я не всегда замечаю, насколько сильно, потому что всё ещё думаю: „Ну ты же frontier model“. Это настолько непоследовательный опыт, и он так отличается от…»
· 3,6 тыс. просмотров
Раньше сильный результат принимали за доказательство, что агент справится дальше. Теперь Эпплтон советует согласовывать работу до запуска и во время реализации: между issue и PR агента проходят несколько минут, а локальный plan mode команды обычно не видят.
Спецификация вместо доверия. Для прототипов Эпплтон после выбора решения пишет подробный spec и заранее перечисляет, как агент должен проверить работу. Код, который агент добавил в PR, она не просматривает.
В интерактивных прототипах Эпплтон использует Jigs с ползунками и палитрами, чтобы менять результат вручную прямо во время работы.
Первоисточник
