Главная
Тарифы О нас Подход Кейсы Контакты растИИшкаблог 404ai Интеграции Глоссарий Разобрать задачу +7 (993) 729-59-59
AI-агенты · Дирижёр · 404ai

Тестирование AI-агента перед запуском

Одна неверная цена, названная AI-агентом клиенту, стоит сделки, а одна выдуманная гарантия — претензии, и обе обычно проскакивают, потому что агента перед запуском «проверили» разговором на десять минут. Тестирование AI-агента — это сверка его ответов с документами на заранее собранном наборе сценариев до того, как с ним заговорит первый настоящий клиент. Пропустить этот шаг проще простого: агент отвечает связно с первой минуты, и кажется, что проверять нечего. Разберу, какие сценарии собирать, как размечать ответы и при каком результате агента можно выпускать.

Связный ответ ничего не говорит о верном

Языковая модель выдаёт связный текст всегда, независимо от того, верен он или нет. Поэтому первое впечатление от агента обманчиво: он звучит уверенно и на правильных ответах, и на выдуманных, и отличить одно от другого на слух невозможно. Почему так устроено, подробно разобрано в статье о том, почему нейросеть уверенно выдумывает.

Отсюда правило: проверка — это не разговор с агентом, а сверка его ответов с документом. Считается не «понравилось», а доля ответов, совпавших с источником по смыслу и по цифрам.

Суть

Агент, который в десяти диалогах подряд отвечал складно, не проверен никак. Проверен тот, чьи ответы сверили с прайсом, регламентом и условиями договора построчно.

Четыре группы вопросов, и каждая ловит свою ошибку

Полный тест собирается из четырёх групп. Пропуск любой оставляет дыру, которая обнаружится уже на клиентах.

  • Типовые вопросы. Два–три десятка самых частых обращений, взятых из реальных переписок и звонков за последние месяцы, а не придуманных. Проверяют базовую правильность.
  • Вопросы без ответа в базе. То, чего в документах заведомо нет. Правильное поведение — признать незнание и передать человеку. Эта группа ловит склонность выдумывать.
  • Пограничные и неудобные. Просьба о скидке, спор о сумме, претензия, вопрос о конкуренте, настойчивое переспрашивание. Проверяют, не обещает ли агент того, чего компания не даёт.
  • Кривой ввод. Опечатки, обрывки фраз, два вопроса в одном сообщении, переход на другую тему посреди диалога. Проверяют устойчивость, а не вежливость.

Последняя группа обычно даёт больше всего находок и тяжелее всего собирается: придумать кривой ввод сложнее, чем взять его из реальных диалогов, поэтому берите оттуда. Я бы не жалел времени именно на неё — типовые вопросы агент почти всегда проходит, а клиенты пишут совсем не типово.

Откуда брать сценарии для теста

Придуманные вопросы проверяют то, что вы предполагаете, а не то, что происходит. Набор должен строиться на реальном материале, и он у компании обычно уже есть.

Три источника закрывают почти всё. Первый — история обращений за последние месяцы: берётся сплошной срез, а не отбор интересных. Второй — вопросы, которые сотрудники задают друг другу в рабочих чатах: они отражают то, что непонятно, и клиенты спрашивают о том же. Третий — жалобы и спорные случаи: там сосредоточены пограничные ситуации.

Чего в наборе быть не должно — вопросов, сформулированных теми же словами, что и документы. Именно на них агент отвечает правильно всегда, и именно они создают ложное впечатление готовности.

Тестирует не тот, кто настраивал

Человек, собиравший базу знаний, задаёт вопросы теми же словами, какими написаны документы, — и агент отвечает правильно ровно потому, что формулировка совпала. Это не недобросовестность, а слепое пятно: автор документа не может спросить так, как спросит человек, который его не читал.

Рабочий состав проверяющих — сотрудник, который сам ведёт эти разговоры с клиентами, и человек со стороны, не знающий продукта. Первый приносит реальные формулировки и знает, где правильный ответ на самом деле спорный. Второй задаёт вопросы так, как их задаёт неподготовленный клиент.

Пять отметок для каждого ответа

ОтметкаЧто означаетЧто делать
ВерноСовпадает с документом по смыслу и по цифрамНичего
НеполноПравда, но упущено условие или оговоркаДополнить документ в базе
НеверноРасходится с документомБлокирует запуск
ВыдуманоОтвета в документах нет вообщеБлокирует запуск
Правильно передалПризнал незнание и позвал человекаНичего, это норма

Две последние строки часто путают. Передача человеку — не провал теста, а верный ответ на вопрос вне компетенции; провал — это когда агент вместо передачи что-то сочинил. Когда и как агент обязан звать человека, разобрано в статье об эскалации на оператора.

Шкала работает, только если два проверяющих понимают её одинаково. Оценка «нормально» у разных людей означает разное, и на выходе получается число, которое ничего не измеряет. Поэтому по каждой отметке записывается, что в неё попадает, с примером из вашего материала. Перед основной работой стоит потратить полчаса на сверку: два человека размечают одни и те же двадцать ответов и сравнивают. Если расхождений больше пары, уточнять нужно определения отметок, а не выяснять, кто из проверяющих неправ.

Что делать с ответами, которые попали в спорные

Спорные случаи — не помеха разметке, а самая ценная её часть: именно там проходит граница, которую компания ещё не определила.

Разбирать их стоит группами, а не по одному. Обычно они собираются в две-три темы: вопросы, где компания сама не решила, как правильно; вопросы на стыке зон ответственности; ситуации, где верный ответ зависит от того, чего агент не знает. Каждая группа требует своего решения, и ни одно из них не лежит в настройках агента.

Практическое правило на время теста: спорные считаются неверными. Это делает оценку консервативной и подталкивает определить границу. Оставленный неразрешённым спорный случай после запуска превращается в жалобу клиента, и разбирать его придётся всё равно, только дороже.

Порог запуска: два нуля вместо процента

Числа, годного для всех, здесь нет: цена ошибки в записи на стрижку и в согласовании поставки различается на порядки. Если подрядчик называет универсальный процент точности, после которого «можно запускать», это повод насторожиться. Но два условия работают всегда.

Ноль выдуманных ответов. Это не процент, а ноль: одна выдумка означает, что агенту не задано право на незнание, и она повторится на любой незнакомой теме.

Ноль неверных на деньгах. Цены, сроки, условия возврата и гарантии проверяются отдельно и должны совпадать полностью. Ошибка в вежливой формулировке стоит извинения, ошибка в цене — сделки.

Всё остальное — доля «неполно», тон, длина ответов — решается по цене ошибки конкретного процесса и может дорабатываться уже на пилоте.

Пилот на живом потоке

После набора сценариев идёт не полный запуск, а узкий пилот: агент работает на одном канале или в одни часы, а его ответы читает человек — не выборочно, а подряд.

Сплошное чтение здесь важнее, чем кажется. На живом потоке появляются формулировки, которых не было в сценариях, и первые дни пилота часто приносят больше находок, чем весь подготовительный тест. Каждую находку стоит сразу добавлять в набор сценариев, чтобы она проверялась и дальше.

Признак готовности

Расширять пилот стоит тогда, когда за день сплошного чтения не нашлось ни одного ответа с пометкой «выдумано» или «неверно», — а не когда закончилось время, отведённое на пилот.

Так мы в 404ai и строим запуск агентов: сначала договариваемся о метрике и условии остановки, потом пилот на данных клиента, и только потом расширение. Как устроены проверки уже после выхода на весь поток, разобрано в статье о мониторинге AI-агента после запуска.

Что перепроверять после каждого изменения

Набор сценариев — не разовая работа, а актив. Любое изменение базы знаний или настроек способно сломать ответ, который раньше был верным, и заметить это без повторного прогона нельзя.

Поэтому сценарии сохраняются и прогоняются заново после каждого заметного изменения: обновили прайс, добавили раздел в базу, поправили инструкцию, сменили модель. Это единственный способ отличить «стало лучше» от «починили одно, сломали другое». Та же дисциплина действует и для самих инструкций агента — подробнее в статье о промпте для бизнес-задачи.

Когда полная программа тестирования избыточна

Честно о границах. Если агент не разговаривает с клиентами, а помогает сотрудникам — ищет ответ во внутренней инструкции, готовит черновик письма, который человек всё равно прочитает, — четыре группы сценариев и сплошной пилот не нужны. Ошибку поймает сотрудник, и она ничего не стоит, кроме минуты. Достаточно короткого набора типовых вопросов и понятного способа сообщить о неверном ответе.

Обратный случай: тест не спасёт агента, у которого нет материала. Если условия, цены и правила живут в головах менеджеров, а не в документах, сверять ответы не с чем, и любая разметка превратится в спор мнений. Здесь честный вывод — сначала записать правила, а до этого не запускать агента к клиентам. И если обращений так мало, что их спокойно обрабатывает один человек, агент вообще может не окупиться — это стоит посчитать до теста, а не после.

Тест за неделю на своих обращениях

Главное, что меняет этот подход, — решение о запуске агента принимается не по ощущению от демонстрации, а по двум нулям на наборе ваших реальных вопросов. Собрать такой тест можно за неделю: выгрузите месяц обращений, отберите три десятка типовых, два десятка без ответа в базе, десяток неудобных и десяток с кривым вводом, отдайте их сотруднику первой линии и человеку со стороны и разметьте ответы пятью отметками. Если в группе «нет в базе» появилась хоть одна выдумка или в ценах — хоть одна ошибка, агент не готов, сколько бы складных диалогов он ни провёл. Откуда агент берёт фактические ответы и как их чинить, — в статье про базу знаний AI-агента, а как это устроено у нас в мессенджерах — на странице Дирижёра.

Частые вопросы

Если не нашли ответа — напишите нам в Telegram, ответим за 15 минут.

Проверка — это не разговор с агентом, а сверка его ответов с документом. Собирается четыре группы сценариев: типовые вопросы из реальных обращений, вопросы без ответа в базе, пограничные и неудобные (скидка, спор о сумме, претензия) и кривой ввод с опечатками и обрывками фраз. По каждому ответу фиксируется отметка: верно, неполно, неверно, выдумано или правильно передал человеку.
Языковая модель выдаёт связный текст всегда, независимо от того, верен он или нет. Агент звучит уверенно и на правильных ответах, и на выдуманных, и отличить одно от другого на слух невозможно. Агент, который в десяти диалогах подряд отвечал складно, не проверен никак — проверен тот, чьи ответы сверили с прайсом и регламентом построчно.
Не тот, кто его настраивал: человек, собиравший базу знаний, задаёт вопросы теми же словами, какими написаны документы, и агент отвечает правильно ровно потому, что формулировка совпала. Рабочий состав — сотрудник, который сам ведёт такие разговоры с клиентами, и человек со стороны, не знающий продукта: первый приносит реальные формулировки, второй задаёт вопросы как неподготовленный клиент.
Нет. Передача человеку — верный ответ на вопрос вне компетенции агента, и в тесте она отмечается как норма. Провалом считается обратное: когда агент вместо передачи что-то сочинил. Именно поэтому в набор сценариев обязательно входит группа вопросов, ответа на которые в базе заведомо нет.
Универсального процента нет — цена ошибки в записи на стрижку и в согласовании поставки различается на порядки. Но два условия работают всегда: ноль выдуманных ответов (одна выдумка означает, что агенту не задано право на незнание, и она повторится на любой незнакомой теме) и ноль неверных ответов там, где речь о деньгах: цены, сроки, условия возврата и гарантии должны совпадать полностью.
Да, набор сценариев — не разовая работа, а актив. Любое изменение базы знаний или настроек способно сломать ответ, который раньше был верным, и заметить это без повторного прогона нельзя. Сценарии сохраняются и прогоняются заново после каждого заметного изменения — это единственный способ отличить «стало лучше» от «починили одно, сломали другое».

Разборы внедрений

Как это выглядело у других компаний

Все разборы внедрений

Проверим агента на ваших сценариях

Соберём набор из ваших реальных обращений, включая неудобные, прогоним и покажем долю ответов, совпавших с вашими документами дословно.

Разбор задачи — бесплатноОтвет за 15 минут
Разобрать задачу