
Разбор · Опубликовали 07.10.2026
A/B-тестирование сайта с агентами ускоряет подготовку вариантов, но требует достаточного трафика
До заказа разработки посчитайте посетителей, которым нужен новый экран. Затем согласуйте закрепление варианта, события и правило остановки.
Текст написан инженером, который ведёт машину агентов на vibecoding.ru, вместе с машиной агентов · факты проверены 7 октября 2026
Агенты помогают быстрее подготовить два варианта сайта, но ответ о конверсии зависит от трафика.
Покажем, как рассчитать выборку и принять работу; своего завершённого клиентского A/B-теста у нас нет.
Не хотите разбираться сами? Внедряем ИИ в ваш бизнес: задачи без лимита, одна цена в месяц, отмена в любой момент.
1. A/B сравнивает посетителей одновременно, а замер до и после решает другую задачу.
Новая кнопка может собрать больше заявок просто потому, что в день её выпуска пришла другая аудитория. Сравнение двух последовательных недель не отделяет правку от этого изменения.
В A/B-тесте подходящих посетителей случайно распределяют между вариантами в один период. Для примера ниже делим поровну, а цель считаем одинаково в обеих группах.
На нашем сайте тоже меняли первый экран и измеряли загрузку. Но посетителей не распределяли по вариантам: это техническая проверка до и после, а не доказательство роста заявок.
Поэтому ускорение разработки и эффект нового экрана принимают отдельно. Готовый код отвечает на вопрос «можно запускать?», эксперимент отвечает на вопрос «что изменилось у посетителей?».
Разные проверки отвечают на разные вопросы.
Источник: разграничение редакции; свой замер первого экрана сверён по записям сентября 2026. Проверено 07.10.2026.
2. Малый искомый рост конверсии требует большой выборки.
«Хватит ли нашего трафика?» решают до заказа вариантов. Нужны исходная конверсия и минимальный рост, ради которого бизнес согласен менять экран.
Условный пример: из посетителей страницы заявку оставляют 2%. Хотим обнаружить рост до 2,4%: это 0,4 процентного пункта, или 20% относительно исходного уровня.
Для расчёта выберем фиксированный двусторонний тест: уровень значимости 5%, мощность 80%, группы поровну. Посетители независимы, цель бинарная: заявка есть или её нет.
По формуле калькулятора Эвана Миллера получаем около 19 800 посетителей на вариант. Это оценка при названных условиях, а не правило «любому сайту нужны двадцать тысяч».
Чем меньше искомая разница, тем больше посетителей нужно.
Источник: собственный расчёт по открытому коду калькулятора Эвана Миллера, 07.10.2026. Уровень значимости 5%, мощность 80%; объёмы округлены вверх до сотен. Пример не описывает наш или клиентский эксперимент.
Считать нужно посетителей, которые попадут в эксперимент, а не все визиты сайта. Возвращающийся участник не становится новым независимым наблюдением при каждом открытии страницы.
При 1 000 таких посетителей в сутки выборка 39 600 наберётся примерно за 40 дней. Срок разработки двух вариантов не сокращает это ожидание.
Четыре дня набора при большом трафике тоже не обещают готовый ответ. В плане учитывают недельные колебания и время от посещения до подтверждённой заявки.
Срок набора зависит от подходящего трафика, а не от скорости агентов.
Источник: 39 600 разделены на неизменный суточный поток, округление дней вверх; расчёт 07.10.2026. Это оценка набора, не рекомендуемая длительность. При малом трафике можно заранее выбрать более крупное изменение или другой способ проверки гипотезы.
3. Агентам поручают подготовку эксперимента с проверяемой приёмкой.
Инженер ведёт машину агентов: задаёт границы правки, принимает код и управляет запуском. Агенты могут готовить экран, события и проверки параллельно, если задачи не мешают друг другу.
В задаче для агента пишут, какую гипотезу проверяем. Например, меняем объяснение цены, сохраняя форму и условия покупки.
Просьба «сделать страницу, которая лучше продаёт» не задаёт приёмку. Исполнитель может одновременно сменить текст, цену и форму; результат будет относиться ко всему набору правок.
Разделите готовность на три части: варианты видны, распределение работает, события доходят. Ни одна из них не требует заранее объявлять новый экран победителем.
Принимать нужно работающий эксперимент, а не два макета.
Источник: предлагаемый состав приёмки редакции, 07.10.2026; механизмы закрепления и регистрации участия сверены с официальной документацией GrowthBook. Срок ускорения именно такой подготовки у нас не измерен.
4. Потерянные участники могут изменить знак результата.
Вернувшийся посетитель должен видеть закреплённый вариант. Что происходит после входа в аккаунт или смены устройства, заранее записывают в правила для агентов.
Для анонимного сайта закрепление в браузере не равно закреплению человека на всех устройствах. Выберите единицу распределения и применяйте её одинаково в назначении, цели и анализе.
Знаменатель задают до влияния варианта: кто имел право участвовать и кому он назначен. Если оставить только нажавших кнопку, сравнение потеряет посетителей, которых эта кнопка не убедила.
Такой сбой был у MSN: бот-фильтр исключал активных посетителей нового варианта карусели. Microsoft Research в сентябре 2020 описала, как диагностика изменила отрицательный вывод на положительный.
Качество данных проверяют до объявления победителя.
Источник: Microsoft Research, 14.09.2020, и документация GrowthBook; прочитано 07.10.2026. Небольшая разница численности групп бывает случайной: перекос проверяют статистически, а не требуют точного равенства счётчиков.
5. Инженерные проверки разрешают запуск, но не доказывают рост конверсии.
На живом /open указаны 2 685 тестов на каждом пуше плюс ревью, срез 7 октября 2026. Они проверяют работу машины и сайта; это не наблюдения участников A/B-теста.
Даже экран с рабочей формой может показать текст поздно или сдвинуть его после загрузки. В наших правках первого экрана это ловили отдельными проверками.
У маркетинга остаётся гипотеза о заявках, у инженера есть условия безопасного запуска. Ответственность за ошибки не снимается тем, что вариант подготовил агент.
Перед экспериментом проверяют обе версии и запись данных, затем наблюдают живой поток. Кнопка работает на стенде, а события теряются на проде: такую проблему нельзя лечить ожиданием большей выборки.
Поломка первого экрана привела к правилам показа, а не к заявлению о конверсии.
02.09
Текст уже был в HTML, но общий эффект появления скрывал его до запуска скрипта. Первый экран исключили из скрывающего правила; видимость проверили ещё во время загрузки документа.
07.09
Первый экран прыгал после скриптового пересчёта отступа. Геометрию перенесли в CSS и удалили скрипт перерасчёта: исходный кадр больше не ждёт эту правку.
Источник: оригинальные записи журнала /open за 02.09 и 07.09, сверка 07.10.2026. Это технические изменения одного сайта, без случайного разделения посетителей и без измеренного прироста конверсии.
6. Правило завершения согласуют до запуска, а не после удачного дня.
Для обычного фиксированного теста заранее задают объём, календарное окно и задержку учёта цели. Остановиться при первом красивом проценте означает изменить условия проверки.
Эван Миллер разбирал эту ошибку в апреле 2010. Последовательный анализ допускает другие способы остановки, но для него тоже нужен план до старта.
После набора данных показывают оценку разницы и интервал неопределённости. «Статистически значимой разницы нет» не означает, что варианты одинаковы или что новый проиграл.
Если диапазон ещё допускает и полезный рост, и существенную потерю, ответ неопределённый. Дальнейшие действия выбирают по согласованному плану, а не продлевают тест до нужного вывода.
У эксперимента есть решение и при отсутствии победителя.
Источник: схема решения редакции, 07.10.2026; ограничение ранней остановки сверено по статье Эвана Миллера. Критерии полезности, допустимый вред и защитные метрики задаёт бизнес до запуска.
Покупатель получает работающие варианты и данные, по которым можно принять решение. Гарантированный рост заявок не становится критерием приёмки кода.
Подписка «Один проект» стоит 250 000 ₽ в месяц на 7 октября 2026. До заказа согласуйте распределение посетителей, закрепление вариантов и события приёмки; это цена общего потока разработки, не одного A/B-теста.
Что и как мы проверяли
| Факт | Что известно | Проверено |
|---|---|---|
| Свой опыт | /open и /services прочитаны 07.10.2026; 2 685 тестов на пуш плюс ревью, «Один проект» за 250 000 ₽ в месяц. Окно обоих чисел: текущая публичная витрина, не исторический A/B-замер. | 2026-10-07 |
| История экрана | записи 02.09 и 07.09 сверены по оригиналу. Нет рандомизации и результата о заявках. | 2026-10-07 |
| Выборка | условный расчёт бинарной конверсии по формуле Эвана Миллера; 2%, 2,4%, уровень значимости 5%, мощность 80%, группы поровну. Трафик сайта не подставлялся. | 2026-10-07 |
| Предел | собственного клиентского кейса, завершённого A/B-теста и подтверждённого прироста конверсии нет. Коэффициент ускорения подготовки не измерен. | 2026-10-07 |
7. Частые вопросы
Что такое A/B-тестирование сайта простыми словами?+
Посетителей случайно распределяют между двумя вариантами в один период и одинаково считают выбранную цель. До запуска задают, кого включают, какую разницу хотят обнаружить и как закончат проверку.
АБ-тестирование, A/B-тест и сплит-тест здесь означают одно и то же?+
В этой статье да: сравнение двух вариантов сайта на разных случайных группах. Название само по себе не гарантирует, что распределение и учёт данных устроены правильно.
Что делать, если трафика мало?+
До разработки пересчитать срок и искомый эффект. Можно проверить более крупную гипотезу, исследовать понятность предложения или исправить явную техническую поломку. Эти действия не доказывают статистический рост конверсии.
Можно ли проверить сайт через эксперименты Яндекс Директа?+
Да, если проверка относится к трафику соответствующих рекламных кампаний: справка допускает сравнение посадочных страниц. Распределение всего органического, прямого и другого трафика сайта нужно решить отдельно.
Можно ли смотреть результаты каждый день?+
Можно контролировать работоспособность и качество данных. Для фиксированного теста нельзя выбирать остановку по первому привлекательному результату; для последовательного метода действуют его заранее заданные правила.
Кто должен объявить победителя: агент или руководитель?+
Аналитик проверяет метод и данные, инженер подтверждает работоспособность. Решение о выпуске принимает назначенный владелец эксперимента по согласованным критериям. Агент может подготовить расчёт и отчёт.
Источники
- Эван Миллер · Sample Size Calculator (прочитано 07.10.2026) — авторский калькулятор
- Эван Миллер · исходный код расчёта выборки (прочитано 07.10.2026) — метод расчёта
- Эван Миллер · How Not To Run an A/B Test (18.04.2010) — статья автора
- Microsoft Research · Diagnosing Sample Ratio Mismatch in A/B Testing (14.09.2020) — инженеры вендора
- GrowthBook · JavaScript SDK (прочитано 07.10.2026) — официальная документация
- Яндекс Директ · эксперименты (прочитано 07.10.2026) — официальная справка
- vibecoding.ru · машина, проверки и история первого экрана (срез 07.10.2026) — наша машина
- vibecoding.ru · «Один проект» (срез 07.10.2026) — наш сервис
Запомнить
- Быстрая подготовка не создаёт трафик. До заказа оцените выборку и срок её набора.
- A/B сравнивает случайные группы одновременно. Не называйте замер до и после доказательством роста заявок.
- Принимайте распределение, закрепление и события вместе с вариантами. Два макета ещё не дают работающий эксперимент.
- До вывода о конверсии проверьте состав групп и полноту данных. Большая выборка не исправляет ошибку учёта.
- Задайте способ завершения до запуска. Неопределённый ответ сохраните как неопределённый, затем выберите следующую гипотезу.