Главная
Тарифы О нас Подход Кейсы Контакты растИИшкаблог 404ai Интеграции Глоссарий Разобрать задачу +7 (993) 729-59-59
Аналитика · 404ai

Как измерить эффект от внедрения AI в продажах

Почти любое внедрение AI в продажах заканчивается слайдом с цифрой роста, и почти любую такую цифру нельзя проверить: собственник платит за результат, который мог случиться и без внедрения. Измерить эффект от внедрения AI — значит отделить изменение, вызванное инструментом, от сезонности, рекламы, найма и обычного разброса. Сравнение «до и после» этого не делает, контрольная группа и заранее записанные правила замера — делают. Ниже — как поставить замер в отделе продаж и как читать чужие цифры, включая те, что публикуем мы.

Разница между двумя периодами содержит всё, что изменилось, кроме ответа

Сравнение периода до внедрения с периодом после — самый распространённый способ отчитаться об эффекте и самый ненадёжный. Между двумя периодами меняется не только инструмент: меняются сезон, рекламный бюджет, состав менеджеров, поведение конкурентов.

Отдельная и недооценённая проблема — эффект наблюдения. Отдел, который знает, что его разговоры теперь разбирают, работает лучше в первые недели независимо от того, что внедрили. Этот всплеск легко принять за результат и потом долго не понимать, почему он угас.

Суть

Разница между двумя периодами — это не эффект внедрения. Это эффект внедрения плюс всё остальное, что изменилось за это время, и разделить их постфактум невозможно.

Вердикт: «в августе конверсия выросла» — это наблюдение об августе, а не об инструменте.

Контрольная группа убирает сезон из уравнения

Надёжный способ один: часть отдела работает по-новому, часть продолжает по-старому, и обе живут в одном и том же периоде. Сезонность, реклама и настроение рынка действуют на группы одинаково, а разница между ними относится к внедрению.

Делить надо случайно, но с оговоркой. Если в отделе есть явно сильные и явно слабые менеджеры, чистая случайность может собрать всех сильных в одной группе. Практичнее разбить людей на пары по прошлым результатам и в каждой паре бросить монетку.

Чего делать нельзя — давать людям выбирать группу самим. Те, кто соглашается на новое добровольно, отличаются от остальных мотивацией, и эта разница попадёт в результат вместо эффекта инструмента. Добровольцы «докажут» эффективность чего угодно.

Если внедряется не инструмент для менеджеров, а AI-агент, который берёт часть разговоров на себя, делить нужно не людей, а поток обращений; как это устроено, разобрано в статье про A/B-тест AI-агента против человека.

Вердикт: контрольная группа стоит части эффекта на время замера и окупается тем, что эффекту можно верить.

Правила замера записываются до первых данных

Список короткий, но записать его надо письменно и до того, как появятся первые цифры. Иначе на выходе всегда найдётся метрика, которая выросла, и именно её объявят целевой.

  • Одна главная метрика. Не набор из восьми, а одна, по которой принимается решение. Остальные — наблюдаемые.
  • Как она считается. Дословно: что входит в числитель и знаменатель, какие сделки исключаются.
  • Срок замера. Заранее заданный, чтобы нельзя было остановиться на удачной неделе.
  • Разброс до внедрения. Насколько метрика прыгала от месяца к месяцу раньше — без этого не понять, что считать значимым изменением.
  • Что ещё меняется. Запланированные акции, найм, изменения в рекламе — всё, что попадёт в период замера.

Последний пункт чаще всего и обесценивает замер: одновременно с AI запускают новый скрипт и меняют мотивацию, а потом месяц обсуждают, что из этого сработало.

Наши пилоты начинаются с того же: до запуска договариваемся о цели, метрике и о том, насколько она должна измениться, — и на каждом шаге можно остановиться. Так устроен метод «Цель → метрика», описанный на странице «Как мы работаем». Если метрику до старта назвать не получается, это сигнал, что задача ещё не сформулирована, и внедрять рано.

Вердикт: замер, правила которого придуманы после данных, подтверждает только чей-то оптимизм.

Длину замера задаёт цикл сделки, а не терпение

Мерить конверсию в оплату за две недели при цикле в полтора месяца бессмысленно: большинство сделок ещё не закрылись, и в выборку попадут только самые быстрые — то есть нетипичные.

Разумный ориентир — не меньше двух полных циклов сделки для метрик, связанных с деньгами, а первые две недели стоит смотреть отдельно, как период эффекта наблюдения. Метрики, не зависящие от цикла, видны раньше.

Что меримКогда виден честный результат
Время первого ответаПочти сразу: метрика не зависит от цикла сделки
Доля дозвонов и охват базыПервые недели
Конверсия в следующий этапОдин цикл сделки
Конверсия в оплату и выручкаНе меньше двух циклов сделки

Вердикт: если в отчёте о пилоте конверсия в оплату посчитана за срок короче цикла сделки, отчёт описывает самые быстрые сделки, а не ваш бизнес.

Четыре вопроса к любой цифре роста, включая нашу

Навык полезен при выборе любого поставщика, и 404ai здесь не исключение. К заявленному проценту роста стоит задать четыре вопроса: с чем сравнивали, на какой выборке, за какой период и что ещё менялось в это время. Если на первый вопрос ответ «с прошлым периодом», цифра описывает не инструмент.

Отдельно стоит спросить, сколько внедрений вошло в статистику и сколько было всего. Средний результат по успешным внедрениям — это не средний результат. Формулировка «до плюс N процентов» говорит о лучшем случае, а не о том, чего ждать вам.

Честный ответ выглядит так

«У этого клиента метрика выросла на столько-то за такой-то период, контрольной группы не было, одновременно менялось вот это». Такой ответ проверяем. «В среднем клиенты получают плюс N процентов» — не проверяем ничем.

Поэтому мы публикуем разборы внедрений с описанием задачи, того, что изменили, и ограничений, а не только итоговую цифру. Читать их стоит с теми же четырьмя вопросами.

Вердикт: поставщик, который обижается на вопрос «с чем сравнивали», сравнивал с прошлым периодом.

Пик первых недель — не результат, результат — уровень после отката

Первые недели после запуска почти всегда показывают улучшение, и часть его не имеет отношения к инструменту. Люди знают, что за процессом наблюдают, и работают внимательнее.

Обычно это видно по форме кривой: резкий подъём в первые две-три недели и постепенный откат к промежуточному уровню. Итоговый эффект — тот, что остаётся после отката, а не пик.

Практический вывод: не подводите итоги на первом месяце и не публикуйте цифры первых недель как результат. Разумный горизонт — от двух до трёх месяцев, и сравнивать надо устоявшийся уровень, а не максимум. Контрольная группа, кстати, отчасти защищает и от этого: эффект наблюдения испытывает и она, если знает, что участвует в замере.

Вердикт: слайд с графиком, обрезанным на третьей неделе, показывает новизну, а не инструмент.

Побочный эффект бывает крупнее основного, но только если замерен до старта

Метрика, названная до старта, обязательна — иначе итог подгоняется под то, что выросло. Но смотреть только на неё тоже ошибка: побочные изменения бывают крупнее основного.

Пример: внедряли разбор звонков ради конверсии, конверсия сдвинулась в пределах разброса, зато руководитель перестал тратить вечера на выборочное прослушивание, а доля обращений, оставшихся без ответа, заметно упала. Второе может стоить дороже первого, но не попадёт в отчёт, если его не замерили до.

Отсюда практика: помимо главной метрики зафиксируйте до старта два-три сопутствующих показателя — время на рутину, долю необработанных обращений, число повторных обращений. Замер стоит недорого, а без исходных значений об изменении потом нечего будет сказать.

Вердикт: сопутствующие метрики не заменяют главную, но спасают честный разговор о проекте, в котором главная не сдвинулась.

Отчёт о замере должен говорить, чего он не доказывает

Результат, изложенный одной цифрой роста, вызывает недоверие независимо от того, насколько аккуратно он получен. Форма изложения работает не хуже методики.

Полезная структура из пяти пунктов: что измеряли и почему именно это; как разделяли группы или почему не разделяли; за какой период; что получилось, с указанием разброса; чего этот замер не доказывает. Последний пункт добавляет доверия больше остальных четырёх.

Отдельно стоит приложить исходные данные в том виде, в каком их можно перепроверить. Замер, который нельзя воспроизвести, через полгода превращается в число из презентации, и второй раз на него уже не сошлёшься.

Вердикт: абзац «ограничения» — самая недооценённая часть отчёта для собственника.

В отделе из четырёх человек честнее наблюдение с датами

В маленьком отделе делить некого: две группы по два человека не дадут сравнимых чисел, один отпуск перевернёт результат. Честный порядок тогда такой — внедрять по одному изменению за раз, фиксировать дату каждого и смотреть на метрику по неделям, а не на две точки.

Это слабее контрольной группы и так и должно называться. Наблюдение с одной группой показывает, что изменение совпало по времени с внедрением, но не доказывает причину.

Вердикт: «совпало по времени» — честная формулировка; «доказали эффект» в отделе из четырёх человек — нет.

Когда строгий замер не нужен

Строгий замер с контрольной группой стоит времени и части эффекта, и бывают случаи, когда он не окупится.

Внедрение закрывает то, что раньше не делал никто. Если звонки раньше не слушали вовсе, а заявки ночью не обрабатывались, сравнивать не с чем: достаточно посчитать новый объём и то, что из него получилось.

Решение дешевле замера. Если инструмент стоит меньше, чем неделя работы человека, который будет вести контрольную группу, проще попробовать, посмотреть на операционные метрики и отказаться, если не пошло.

Эффект измеряется в часах, а не в конверсии. Автоматическое заполнение CRM, резюме звонков, сводки для руководителя проверяются хронометражем до и после, и сезонность на них почти не влияет.

Строгий замер нужен там, где на кону крупный бюджет и решение о масштабировании на весь отдел. Там ошибка «мы думали, что работает» стоит дороже месяца аккуратной работы.

Цифра роста становится аргументом, когда у неё есть контрольная группа

Что это меняет в решении: вопрос собственника «окупилось ли внедрение» перестаёт быть спором впечатлений, если до старта записаны метрика, способ расчёта, срок, разброс до внедрения и список одновременных изменений. Без этого листа ответ всегда будет «кажется, да» или «кажется, нет» — в зависимости от того, кто докладывает.

Проверить готовность к замеру можно сегодня. Выгрузите главную метрику за последние полгода по месяцам и посмотрите, насколько она прыгала без всякого AI. Если разброс от месяца к месяцу больше того роста, который обещает поставщик, без контрольной группы вы не отличите эффект от обычного колебания — и это нужно знать до договора, а не после.

Сколько разговоров нужно, чтобы вывод не был случайным, разобрано в статье про объём выборки.

Частые вопросы

Если не нашли ответа — напишите нам в Telegram, ответим за 15 минут.

Между периодом до и периодом после меняется не только внедрённый инструмент: меняется сезон, рекламный бюджет, состав менеджеров, поведение конкурентов. Разница между двумя периодами — это эффект внедрения плюс всё остальное, что изменилось за это время, и разделить их постфактум невозможно.
Отдел, который знает, что его разговоры теперь разбирают, работает лучше в первые недели независимо от того, что именно внедрили. Этот всплеск легко принять за результат внедрения и потом долго не понимать, почему он угас. Поэтому первые две недели правильнее смотреть отдельно — как период эффекта наблюдения, а не как результат.
Делить надо случайно, но с оговоркой: если в отделе есть явно сильные и явно слабые менеджеры, чистая случайность может собрать всех сильных в одной группе. Практичнее разбить людей на пары по прошлым результатам и в каждой паре бросить монетку. Давать людям выбирать группу самим нельзя — добровольцы отличаются мотивацией, и эта разница попадёт в результат вместо эффекта инструмента.
Длина замера определяется длиной цикла сделки, а не терпением. Время первого ответа видно почти сразу, доля дозвонов — за первые недели, конверсия в следующий этап — за один цикл сделки, а конверсия в оплату и выручка — не меньше чем за два полных цикла. Мерить конверсию в оплату за две недели при цикле в полтора месяца бессмысленно: в выборку попадут только самые быстрые сделки, то есть нетипичные.
Четыре: с чем сравнивали, на какой выборке, за какой период и что ещё менялось в это время. Если на первый вопрос ответ «с прошлым периодом», цифра описывает не инструмент. Отдельно стоит спросить, сколько внедрений вошло в статистику и сколько было всего: средний результат по успешным внедрениям — это не средний результат.
Две группы по два человека не дадут сравнимых чисел, поэтому честный порядок такой: внедрять по одному изменению за раз, фиксировать дату каждого и смотреть на метрику по неделям, а не на две точки. Это слабее контрольной группы и должно так и называться — наблюдение с одной группой показывает, что изменение совпало по времени с внедрением, но не доказывает причину.

Разборы внедрений

Как это выглядело у других компаний

Все разборы внедрений

Поставим замер с контрольной группой

Зафиксируем метрику и способ её расчёта до запуска, разобьём отдел на пары по прошлым результатам и покажем разницу, которую можно отнести к внедрению.

Разбор задачи — бесплатноОтвет за 15 минут
Разобрать задачу