На прослушивание ста звонков по десять минут уходит больше шестнадцати часов, поэтому руководитель слушает единицы записей, а всё остальное, что сказали клиенты, компания хранит и не использует. Транскрибация звонков превращает аудио в текст, с которым можно работать: искать, считать, проверять по чек-листу. Разберу, из каких звеньев состоит транскрипт, где технология ошибается, почему заявленный процент точности мало что решает и как за один день узнать реальную точность на своих записях.
Транскрибация звонков — это текст для машины, а не для чтения
Транскрибация звонков — это автоматический перевод аудиозаписи разговора в текст с разметкой, кто из участников что сказал. От простой расшифровки она отличается назначением: результат нужен не столько для чтения человеком, сколько для машинной обработки — поиска, подсчёта и проверки по правилам.
Разница видна на тех же ста звонках. Прослушать их — шестнадцать с лишним часов. Прочитать сто транскриптов — несколько часов. Прогнать их через набор правил — секунды. Транскрибация не экономит время сама по себе: она открывает операции, которые с аудио невозможны в принципе. Именно поэтому я не советую оценивать сервис по тому, «насколько приятно читать текст», — читать его будет в основном не человек.
Четыре звена, и каждое ошибается по-своему
За словом «транскрибация» стоит не одна технология, а цепочка, и разбирать качество имеет смысл по звеньям: иначе непонятно, что чинить.
- Распознавание речи (ASR). Аудио превращается в поток слов. Здесь возникают ошибки в терминах, названиях, фамилиях и цифрах.
- Разделение говорящих (диаризация). Определяется, где говорит менеджер, а где клиент. Ошибка на этом шаге переворачивает смысл: возражение клиента может оказаться приписано менеджеру.
- Пунктуация и нормализация. Поток слов режется на предложения, «двадцать пять тысяч» становится числом. Без этого шага текст нечитаем и плохо поддаётся правилам.
- Смысловая разметка. В тексте помечаются сущности и события: названа цена, озвучено возражение, зафиксирована договорённость.
Транскрипт без разделения говорящих и без разметки — это просто много текста. Полезным его делает не точность распознавания, а структура поверх неё.
Последнее звено — уже территория речевой аналитики: транскрипт становится оценкой разговора по чек-листу. Как устроена эта надстройка, разобрано в статье о том, что такое речевая аналитика.
До 97% точности — хорошая цифра, которая мало решает
Точность распознавания принято измерять через WER — долю неверно распознанных слов. Для телефонных звонков это хорошая цифра, но замер вендора не заменяет проверку на ваших записях — это касается и Эхо. Но сам по себе процент почти ничего не говорит о том, пригоден ли транскрипт для вашей задачи.
Причина в том, что ошибки распределены неравномерно. Служебные слова распознаются почти безупречно, а страдают ровно те слова, ради которых транскрипт и делается: названия продуктов, фамилии, суммы, сроки. Три процента ошибок, целиком пришедшиеся на цифры, хуже, чем десять процентов, размазанных по союзам.
Моя позиция здесь простая: сравнивать сервисы по общему проценту из презентации бессмысленно. Оценивать качество нужно на своих данных и по своим сущностям — правильно ли распознаётся ваша номенклатура, ваши тарифы, ваши города. Это первое, что стоит проверить на пилоте.
Линия, перебивания, термины и тихий клиент
- Качество линии. Узкополосный кодек телефонии режет частоты сильнее, чем любой шум в помещении. Записи из браузерных звонков распознаются заметно лучше телефонных.
- Перебивания. Когда двое говорят одновременно, диаризация ломается первой. В эмоциональных разговорах — самых интересных для разбора — это происходит чаще всего.
- Своя лексика. Модель не знает, что «эхо» у вас продукт, а не звуковое явление. Лечится словарём терминов, который заводится один раз и поддерживается.
- Тихий собеседник. Если клиент говорит в сторону от трубки, его реплики теряются целиком — и разбор получает только половину разговора.
Что из этого лечится моделью, а что нет, важно понимать до выбора сервиса. Лексика и частично перебивания — да. Кодек телефонии и тихий клиент — нет: здесь помогает только настройка записи. Если АТС пишет разговор в одну дорожку и в низком качестве, смена сервиса распознавания даст меньше, чем запись каждой стороны отдельно. Об этом — в статье об интеграции речевой аналитики с телефонией.
Двадцать записей, чтобы узнать свою точность
Заявленная точность относится к тем записям, на которых её мерили. Ваша телефония, ваши термины и ваши клиенты дадут другое число, и узнать его стоит до того, как строить на транскриптах процессы.
Метод занимает несколько часов. Возьмите двадцать записей разной длины и качества — с шумом, с перебиваниями, с тихим клиентом, а не только лучшие. Расшифруйте их вручную или силами исполнителя — это эталон. Сравните с автоматическим транскриптом и посчитайте долю неверных слов.
Интереснее общей цифры — распределение ошибок. Обычно выясняется, что основная их часть приходится на узкий класс: названия продуктов, фамилии, числа, отраслевые сокращения. Общая точность при этом выглядит прилично, а именно эти слова и нужны для дальнейшей работы. Поэтому считать полезно две величины: по всем словам и отдельно по значимым. Вторая и есть ваша настоящая точность.
Словарь терминов и имён
Самый дешёвый способ поднять полезную точность — не менять модель, а дать ей список слов, которые в вашей области встречаются постоянно, а в обычной речи почти нет.
В список идут названия продуктов и тарифов, имена сотрудников, названия компаний-клиентов, отраслевые сокращения, специфические термины. Обычно это не тысячи, а сотни позиций. Собрать их проще всего из тех же ошибок распознавания: посмотрите, какие слова система стабильно путает на двадцати эталонных записях.
Словарь нужно поддерживать: новый продукт, новый сотрудник, новый крупный клиент добавляются в него сразу. Это одна из тех мелких регулярных операций, которые никто не считает работой, но именно их отсутствие через год объясняет, почему транскрипты стали хуже.
Разговоры на нескольких языках
Смешанная речь — отдельная сложность, о которой обычно вспоминают уже после запуска. Русский разговор с английскими терминами, звонок, где собеседники переходят на другой язык, региональные особенности речи — всё это распознаётся заметно хуже однородного текста.
Худший случай — переключение внутри фразы: система, настроенная на один язык, услышит вставки как искажённые слова того же языка. Результат выглядит как случайный набор слов там, где на самом деле произнесён термин.
Практических обходов два. Первый — тот же словарь: часто встречающиеся иноязычные термины вносятся явно и перестают быть проблемой. Второй — если доля таких разговоров велика, проверить, поддерживает ли система смешанный режим (Эхо, например, распознаёт русский и казахский, в том числе вперемешку), и оценить точность отдельно на этой части потока, а не в среднем.
Где хранятся расшифровки и кто их видит
Транскрипт — это тот же разговор, только в форме, которую легко искать, копировать и пересылать. Поэтому вопрос доступа к нему острее, чем к аудиозаписи: прослушать сто звонков трудно, пролистать сто расшифровок — быстро.
Решить нужно три вещи до запуска. Кто имеет доступ к полным текстам, а кому достаточно агрегированных результатов. Сколько времени расшифровки хранятся и что происходит по истечении срока. Выгружаются ли они куда-то ещё — в CRM, в аналитику, в отчёты, — и кто видит их там.
Отдельно стоит помнить про содержание: в разговорах клиенты называют персональные данные, реквизиты, иногда сведения о здоровье или финансах. Текстовая копия требует того же обращения, что и оригинал, и это стоит отразить в политике обработки данных, а не подразумевать. Правовая сторона записи разговоров разобрана в материале о записи разговоров и 152-ФЗ.
Что текст даёт отделу продаж, чего не даёт аудио
Текст открывает три вещи. Первое — сплошной охват: разобрать можно все звонки, а не выборку в пару процентов, которую успевает послушать руководитель. Второе — поиск: за секунду находятся все разговоры, где прозвучало конкретное возражение или имя конкурента. Третье — счёт: доля звонков с зафиксированным следующим шагом становится обычной метрикой, которую видно в динамике.
Экономику стоит считать на своём объёме. Разбор в Эхо стоит 1,5 ₽ за минуту разговора. Пример: сто звонков по десять минут — это тысяча минут и 1 500 ₽. Сравните с тем, во что обходятся шестнадцать с лишним часов работы сотрудника, который прослушал бы те же записи, — и с тем, что на практике он всё равно прослушает лишь малую часть.
Какой показатель должен измениться, решается до запуска, а не после: доля звонков со следующим шагом, конверсия этапа, число пропущенных горячих обращений. Без такой цели транскрипты превращаются в архив, который удобно искать и который никто не открывает.
Когда транскрибация звонков не окупится
Честно о границах. Если в отделе пара звонков в день, руководитель прослушает их сам, и автоматический разбор не вернёт вложенного времени на настройку. Мы в 404ai в такой ситуации прямо говорим, что внедрение не окупится, и предлагаем вернуться, когда поток вырастет.
Не поможет транскрибация и там, где нет готовности что-то менять по её итогам. Текст всех разговоров, который никто не превращает в изменения скрипта, обучение и задачи менеджерам, — это расход без результата. И если телефония не пишет разговоры или пишет только одну сторону, начинать нужно с записи, а не с выбора сервиса распознавания: из того, чего нет в аудио, текст не появится.
Чего транскрибация не делает
Она не заменяет прослушивание там, где важна интонация: сарказм, сомнение и раздражение в тексте видны плохо. Она не восстанавливает то, чего не было в записи. И она не отвечает на вопрос «почему» — она только даёт материал, на котором этот вопрос можно задать.
Те же закономерности работают и за пределами телефонии — на встречах, где из расшифровки собирается протокол с решениями и задачами. Там к ошибкам распознавания добавляются ошибки извлечения: модель превращает вежливое «подумаем» в договорённость. Как настроить и проверить такую цепочку, — в статье о протоколе встречи с помощью ИИ.
Что проверить на пилоте в первую очередь
Главное, что меняет понимание транскрибации: выбирать сервис нужно не по общему проценту точности, а по тому, правильно ли он распознаёт слова, на которых держится ваша работа. Разумный порядок пилота такой. Сначала двадцать своих записей с ручным эталоном и точность отдельно по названиям, суммам и срокам. Затем словарь терминов и повторный замер. И только потом сплошной разбор, где система находит аномалии, а руководитель слушает те десять звонков, которые она пометила как важные. Если значимые слова после словаря всё ещё путаются, строить на транскриптах оценку менеджеров рано — сначала чинится запись.