Балл «7 из 10» за звонок чего-то стоит, только если по нему хвалят, переучивают или лишают премии, — а если он получен на ошибке распознавания, замечание достаётся менеджеру, который всё сделал правильно. AI оценивает звонок цепочкой из четырёх шагов: распознаёт речь, разделяет говорящих, находит в тексте смысловые события и сверяет их с чек-листом, который написала сама компания. Разберу, где на этом пути рождаются неверные оценки, как проверить, что балл не взят с потолка, и когда автоматическая оценка звонков не окупится вовсе.
Четыре шага между записью и баллом
Оценка звонка — не одно действие, а цепочка из четырёх, и ошибка на любом шаге портит результат всех последующих. Разбирать качество оценки полезно именно по шагам: иначе непонятно, что чинить — запись, словарь, модель или сам чек-лист.
- Распознавание речи. Аудио превращается в текст. Здесь возникают ошибки в терминах, именах и числах.
- Разделение говорящих. Реплики размечаются: где менеджер, где клиент. Без этого шага чек-лист бессмыслен — непонятно, кто что сказал.
- Разметка смысла. В тексте находятся смысловые события: прозвучало возражение о цене, названо конкретное время, задан вопрос о сроках.
- Проверка по чек-листу. Найденные события сопоставляются с пунктами чек-листа, и каждый получает зачёт или незачёт с обоснованием.
Балл — это не мнение модели о разговоре, а арифметика по чек-листу, который написали вы. Если чек-лист плохой, точная модель даст точную оценку бесполезного набора пунктов.
Распознавание ошибается именно в важных словах
Точность распознавания измеряется долей верно распознанных слов и на русскоязычных телефонных звонках достигает высоких значений, но не ста процентов и никогда не будет ровной по всей базе. На неё влияют качество линии, фоновый шум, темп речи, акцент, перебивания.
Важная деталь: ошибки распределены неравномерно. Обычные слова распознаются почти всегда, а страдают именно те, что важны для оценки, — названия продуктов, фамилии, суммы. Поэтому в системах контроля качества отраслевые термины обычно добавляют в словарь отдельно.
Реплика клиента, записанная на менеджера
Задача — понять, какая реплика чья. Если запись стереофоническая и каналы разделены телефонией, шаг тривиален. Если запись моно, говорящих приходится разделять по голосу, и здесь появляются ошибки на перебиваниях и при похожих голосах.
Это второй по значимости источник неверных оценок: реплика клиента, приписанная менеджеру, ломает проверку сразу нескольких пунктов. Практический вывод для внедрения: стереозапись со стороны телефонии стоит настроить до запуска аналитики, а не после.
Модель ищет в разговоре события, а не слова
Здесь система ищет не слова, а события. Разница принципиальная: «дорого», «не укладываемся в бюджет» и «у конкурентов дешевле» — три разные формулировки одного возражения о цене, и поиск по ключевым словам поймает только первую.
Именно на этом шаге языковые модели дают выигрыш перед прежними системами на регулярных выражениях: они опознают событие по смыслу, а не по совпадению строки. Обратная сторона — модель может увидеть событие там, где его не было, и это лечится только сверкой на реальных разговорах.
Зачёт без цитаты нельзя оспорить
Последний шаг — сверка с чек-листом — самый прозрачный. Каждый пункт получает зачёт или ноль, и к нему прикладывается обоснование: цитата из разговора или указание, чего именно не прозвучало. Обоснование — не украшение отчёта, а единственный способ проверить систему: без него оценку нельзя оспорить, а значит, ей нельзя и доверять.
| Шаг | Типовая ошибка | Чем лечится |
|---|---|---|
| Распознавание | Термины, имена, суммы | Словарь отрасли |
| Разделение | Реплика приписана не тому | Стереозапись из телефонии |
| Смысл | Событие найдено там, где его нет | Калибровка на реальных звонках |
| Чек-лист | Пункт неоднозначен | Переписать формулировку |
Как ошибка распознавания превращается в неверную оценку
Цепочка из четырёх шагов означает, что ошибка первого шага не остаётся на первом шаге. Она проходит дальше и выходит в виде оценки, у которой уже нет никаких признаков ошибки.
Механика на примере. Клиент сказал «мне нужен тариф на сто разговоров», распознавание услышало «на сто разговоров» как «настой разговоров». Разметка смысла не находит упоминания объёма, чек-лист фиксирует, что менеджер не уточнил потребность, и балл снижается. Менеджер, который всё сделал правильно, получает замечание.
Отсюда практическое требование: обоснование пункта должно приводить цитату из транскрипта, а не пересказ. Человек, читающий обоснование, сразу видит, что цитата бессмысленна, и понимает, где сбой. Без цитаты такая ошибка неотличима от настоящего замечания и накапливается месяцами.
Почему похожие разговоры получают разные баллы
Жалоба «два одинаковых звонка, а оценки разные» звучит регулярно и почти всегда справедлива по форме, но не по сути: разговоры редко бывают одинаковыми настолько, насколько кажется участнику.
Источников расхождения обычно три. Первый — качество записи: на одном звонке распознавание сработало чисто, на другом потеряло ключевую фразу. Второй — формулировки: одно и то же по смыслу сказано словами, которые разметка уверенно распознаёт, и словами, которые на границе. Третий — порядок: пункт чек-листа выполнен, но в необычном месте разговора, и правило его не заметило.
Разбирать такие случаи стоит парами: берутся оба разговора и сравниваются обоснования по спорному пункту. За несколько таких разборов обычно находится систематическая причина, и правится она один раз, а не каждый раз заново.
Сколько разговоров нужно для осмысленного среднего
Средний балл по сотруднику за неделю из пяти звонков — это не оценка сотрудника, а случайное число. Разброс отдельных оценок велик, и на малой выборке он полностью перекрывает разницу между людьми.
Практический ориентир проверяется на своих данных. Возьмите сотрудника с большим числом разговоров, разбейте их случайно на группы по пять, по десять, по тридцать и посмотрите, как расходятся средние по группам. Размер группы, при котором расхождение становится небольшим, и есть минимальная выборка для выводов. Подробно методика и её подводные камни разобраны в статье о том, сколько звонков нужно для достоверного вывода.
Для управления из этого следует простое правило: не сравнивать людей между собой по баллам, пока выборка у каждого не прошла такую проверку. Разбирать конкретный разговор с менеджером можно и нужно всегда — но это другой инструмент, не про среднее.
Что делать с разговорами, которые чек-лист не покрывает
В любом потоке есть звонки, к которым чек-лист неприменим: клиент ошибся номером, звонок технический, разговор длится десять секунд, обсуждается вопрос не из той области. Оценивать их по общему списку — значит портить статистику.
Первое, что нужно, — категория «не оценивается» и правила, по которым разговор в неё попадает. Без такой категории система будет ставить низкие баллы за то, что менеджер не выполнил пункты, неуместные в этом разговоре.
Второе — следить за размером этой категории. Если доля неоцениваемых разговоров велика или растёт, дело не в клиентах: обычно это означает, что чек-лист написан под один сценарий, а поток разнообразнее. Тогда нужен второй чек-лист под второй тип разговоров, а не расширение первого.
Как проверить, что балл не взят с потолка
Три вопроса, которые стоит задать любой системе оценки — своей, купленной или той, что предлагает подрядчик.
- Есть ли обоснование у каждого пункта? Оценка без цитаты непроверяема.
- Совпадает ли оценка с человеческой на калибровочной выборке? Несколько десятков звонков, размеченных руководителем, — минимальная проверка.
- Воспроизводится ли оценка? Один и тот же звонок, прогнанный дважды, должен дать тот же результат.
Калибровку я бы делал так. Руководитель размечает выборку звонков по тому же чек-листу, не глядя на оценки системы. Затем по каждому пункту считается доля совпадений с машинной оценкой. Сравнивать нужно именно по пунктам, а не по итоговому баллу: общий балл может совпасть случайно, когда система ошиблась в двух пунктах в разные стороны. Пункты с низким совпадением разбираются по обоснованиям — и почти всегда оказывается, что виноват не распознаватель, а формулировка пункта, которую руководитель и система понимают по-разному.
Отдельный полезный побочный эффект: когда два руководителя размечают одну и ту же выборку, они сами расходятся в оценках. Это честный потолок, выше которого от машины требовать бессмысленно, — и хороший повод переписать спорные пункты чек-листа, прежде чем винить модель.
Когда автоматическая оценка звонков не окупится
Автоматическая оценка звонков нужна не каждому отделу, и лучше понять это до внедрения. Если в отделе три менеджера и несколько десятков разговоров в день, руководитель способен сам слушать заметную часть звонков, и выигрыш от машины небольшой. Если в компании нет договорённости, что считать хорошим звонком, автоматизация масштабирует разногласия: система будет уверенно ставить баллы по чек-листу, с которым не согласен никто из отдела.
Главный случай, когда оценка не нужна, — баллы не во что превращать. Пример расчёта: по тарифу Эхолитикса от 1,5 ₽ за минуту разговора 20 000 минут в месяц обойдутся от 30 000 ₽. Вопрос не в этой сумме, а в том, изменит ли балл хоть одно решение — тему планёрки, план обучения, разговор с конкретным менеджером. Если нет, это отчёт ради отчёта, и дешевле его не заводить.
Поэтому в 404ai разговор о контроле качества начинают не с чек-листа, а с цели: какой показатель отдела должен измениться — конверсия этапа, доля звонков с назначенным следующим шагом, число жалоб — и как это будет видно через месяц. Пилот идёт на реальных звонках заказчика, с калибровкой по разметке руководителя и заранее оговорённым условием остановки; как устроен этот порядок, описано на странице подхода.
Как AI оценивает звонок — и что из этого следует руководителю
Если балл — это арифметика по вашему чек-листу, то и ответственность за его смысл лежит на чек-листе, записи и калибровке, а не на «умности» модели. Отсюда порядок действий: сначала стереозапись и словарь терминов, потом чек-лист, который руководители понимают одинаково, и только потом сравнение людей по баллам. Сам инструмент в этом порядке занимает скромное место: в Эхолитиксе к каждому пункту прикладывается расшифровка и обоснование, чтобы любую оценку можно было проверить. Проверить свою готовность можно без подрядчика: возьмите десять звонков, попросите двух руководителей независимо оценить их по вашему нынешнему чек-листу и сравните ответы по пунктам. Если они расходятся больше, чем вы готовы простить машине, начинать нужно с чек-листа.