Одна неверная цена, названная AI-агентом клиенту, стоит сделки, а одна выдуманная гарантия — претензии, и обе обычно проскакивают, потому что агента перед запуском «проверили» разговором на десять минут. Тестирование AI-агента — это сверка его ответов с документами на заранее собранном наборе сценариев до того, как с ним заговорит первый настоящий клиент. Пропустить этот шаг проще простого: агент отвечает связно с первой минуты, и кажется, что проверять нечего. Разберу, какие сценарии собирать, как размечать ответы и при каком результате агента можно выпускать.
Связный ответ ничего не говорит о верном
Языковая модель выдаёт связный текст всегда, независимо от того, верен он или нет. Поэтому первое впечатление от агента обманчиво: он звучит уверенно и на правильных ответах, и на выдуманных, и отличить одно от другого на слух невозможно. Почему так устроено, подробно разобрано в статье о том, почему нейросеть уверенно выдумывает.
Отсюда правило: проверка — это не разговор с агентом, а сверка его ответов с документом. Считается не «понравилось», а доля ответов, совпавших с источником по смыслу и по цифрам.
Агент, который в десяти диалогах подряд отвечал складно, не проверен никак. Проверен тот, чьи ответы сверили с прайсом, регламентом и условиями договора построчно.
Четыре группы вопросов, и каждая ловит свою ошибку
Полный тест собирается из четырёх групп. Пропуск любой оставляет дыру, которая обнаружится уже на клиентах.
- Типовые вопросы. Два–три десятка самых частых обращений, взятых из реальных переписок и звонков за последние месяцы, а не придуманных. Проверяют базовую правильность.
- Вопросы без ответа в базе. То, чего в документах заведомо нет. Правильное поведение — признать незнание и передать человеку. Эта группа ловит склонность выдумывать.
- Пограничные и неудобные. Просьба о скидке, спор о сумме, претензия, вопрос о конкуренте, настойчивое переспрашивание. Проверяют, не обещает ли агент того, чего компания не даёт.
- Кривой ввод. Опечатки, обрывки фраз, два вопроса в одном сообщении, переход на другую тему посреди диалога. Проверяют устойчивость, а не вежливость.
Последняя группа обычно даёт больше всего находок и тяжелее всего собирается: придумать кривой ввод сложнее, чем взять его из реальных диалогов, поэтому берите оттуда. Я бы не жалел времени именно на неё — типовые вопросы агент почти всегда проходит, а клиенты пишут совсем не типово.
Откуда брать сценарии для теста
Придуманные вопросы проверяют то, что вы предполагаете, а не то, что происходит. Набор должен строиться на реальном материале, и он у компании обычно уже есть.
Три источника закрывают почти всё. Первый — история обращений за последние месяцы: берётся сплошной срез, а не отбор интересных. Второй — вопросы, которые сотрудники задают друг другу в рабочих чатах: они отражают то, что непонятно, и клиенты спрашивают о том же. Третий — жалобы и спорные случаи: там сосредоточены пограничные ситуации.
Чего в наборе быть не должно — вопросов, сформулированных теми же словами, что и документы. Именно на них агент отвечает правильно всегда, и именно они создают ложное впечатление готовности.
Тестирует не тот, кто настраивал
Человек, собиравший базу знаний, задаёт вопросы теми же словами, какими написаны документы, — и агент отвечает правильно ровно потому, что формулировка совпала. Это не недобросовестность, а слепое пятно: автор документа не может спросить так, как спросит человек, который его не читал.
Рабочий состав проверяющих — сотрудник, который сам ведёт эти разговоры с клиентами, и человек со стороны, не знающий продукта. Первый приносит реальные формулировки и знает, где правильный ответ на самом деле спорный. Второй задаёт вопросы так, как их задаёт неподготовленный клиент.
Пять отметок для каждого ответа
| Отметка | Что означает | Что делать |
|---|---|---|
| Верно | Совпадает с документом по смыслу и по цифрам | Ничего |
| Неполно | Правда, но упущено условие или оговорка | Дополнить документ в базе |
| Неверно | Расходится с документом | Блокирует запуск |
| Выдумано | Ответа в документах нет вообще | Блокирует запуск |
| Правильно передал | Признал незнание и позвал человека | Ничего, это норма |
Две последние строки часто путают. Передача человеку — не провал теста, а верный ответ на вопрос вне компетенции; провал — это когда агент вместо передачи что-то сочинил. Когда и как агент обязан звать человека, разобрано в статье об эскалации на оператора.
Шкала работает, только если два проверяющих понимают её одинаково. Оценка «нормально» у разных людей означает разное, и на выходе получается число, которое ничего не измеряет. Поэтому по каждой отметке записывается, что в неё попадает, с примером из вашего материала. Перед основной работой стоит потратить полчаса на сверку: два человека размечают одни и те же двадцать ответов и сравнивают. Если расхождений больше пары, уточнять нужно определения отметок, а не выяснять, кто из проверяющих неправ.
Что делать с ответами, которые попали в спорные
Спорные случаи — не помеха разметке, а самая ценная её часть: именно там проходит граница, которую компания ещё не определила.
Разбирать их стоит группами, а не по одному. Обычно они собираются в две-три темы: вопросы, где компания сама не решила, как правильно; вопросы на стыке зон ответственности; ситуации, где верный ответ зависит от того, чего агент не знает. Каждая группа требует своего решения, и ни одно из них не лежит в настройках агента.
Практическое правило на время теста: спорные считаются неверными. Это делает оценку консервативной и подталкивает определить границу. Оставленный неразрешённым спорный случай после запуска превращается в жалобу клиента, и разбирать его придётся всё равно, только дороже.
Порог запуска: два нуля вместо процента
Числа, годного для всех, здесь нет: цена ошибки в записи на стрижку и в согласовании поставки различается на порядки. Если подрядчик называет универсальный процент точности, после которого «можно запускать», это повод насторожиться. Но два условия работают всегда.
Ноль выдуманных ответов. Это не процент, а ноль: одна выдумка означает, что агенту не задано право на незнание, и она повторится на любой незнакомой теме.
Ноль неверных на деньгах. Цены, сроки, условия возврата и гарантии проверяются отдельно и должны совпадать полностью. Ошибка в вежливой формулировке стоит извинения, ошибка в цене — сделки.
Всё остальное — доля «неполно», тон, длина ответов — решается по цене ошибки конкретного процесса и может дорабатываться уже на пилоте.
Пилот на живом потоке
После набора сценариев идёт не полный запуск, а узкий пилот: агент работает на одном канале или в одни часы, а его ответы читает человек — не выборочно, а подряд.
Сплошное чтение здесь важнее, чем кажется. На живом потоке появляются формулировки, которых не было в сценариях, и первые дни пилота часто приносят больше находок, чем весь подготовительный тест. Каждую находку стоит сразу добавлять в набор сценариев, чтобы она проверялась и дальше.
Расширять пилот стоит тогда, когда за день сплошного чтения не нашлось ни одного ответа с пометкой «выдумано» или «неверно», — а не когда закончилось время, отведённое на пилот.
Так мы в 404ai и строим запуск агентов: сначала договариваемся о метрике и условии остановки, потом пилот на данных клиента, и только потом расширение. Как устроены проверки уже после выхода на весь поток, разобрано в статье о мониторинге AI-агента после запуска.
Что перепроверять после каждого изменения
Набор сценариев — не разовая работа, а актив. Любое изменение базы знаний или настроек способно сломать ответ, который раньше был верным, и заметить это без повторного прогона нельзя.
Поэтому сценарии сохраняются и прогоняются заново после каждого заметного изменения: обновили прайс, добавили раздел в базу, поправили инструкцию, сменили модель. Это единственный способ отличить «стало лучше» от «починили одно, сломали другое». Та же дисциплина действует и для самих инструкций агента — подробнее в статье о промпте для бизнес-задачи.
Когда полная программа тестирования избыточна
Честно о границах. Если агент не разговаривает с клиентами, а помогает сотрудникам — ищет ответ во внутренней инструкции, готовит черновик письма, который человек всё равно прочитает, — четыре группы сценариев и сплошной пилот не нужны. Ошибку поймает сотрудник, и она ничего не стоит, кроме минуты. Достаточно короткого набора типовых вопросов и понятного способа сообщить о неверном ответе.
Обратный случай: тест не спасёт агента, у которого нет материала. Если условия, цены и правила живут в головах менеджеров, а не в документах, сверять ответы не с чем, и любая разметка превратится в спор мнений. Здесь честный вывод — сначала записать правила, а до этого не запускать агента к клиентам. И если обращений так мало, что их спокойно обрабатывает один человек, агент вообще может не окупиться — это стоит посчитать до теста, а не после.
Тест за неделю на своих обращениях
Главное, что меняет этот подход, — решение о запуске агента принимается не по ощущению от демонстрации, а по двум нулям на наборе ваших реальных вопросов. Собрать такой тест можно за неделю: выгрузите месяц обращений, отберите три десятка типовых, два десятка без ответа в базе, десяток неудобных и десяток с кривым вводом, отдайте их сотруднику первой линии и человеку со стороны и разметьте ответы пятью отметками. Если в группе «нет в базе» появилась хоть одна выдумка или в ценах — хоть одна ошибка, агент не готов, сколько бы складных диалогов он ни провёл. Откуда агент берёт фактические ответы и как их чинить, — в статье про базу знаний AI-агента, а как это устроено у нас в мессенджерах — на странице Дирижёра.