Главная
Тарифы О нас Подход Кейсы Контакты растИИшкаблог 404ai Интеграции Глоссарий Разобрать задачу +7 (993) 729-59-59
Аналитика · 404ai

Сколько звонков нужно для достоверных выводов

Случайная выборка в 5% звонков сносно показывает средний уровень отдела и почти ничего не говорит о том, ради чего её обычно слушают: о редких нарушениях, о разнице между двумя менеджерами, о малочисленных группах клиентов. Сколько звонков нужно для достоверных выводов, определяет вопрос, а не размер отдела: оценить одного сотрудника, сравнить двоих и поймать редкое событие — три задачи с разными требованиями к объёму. Ниже — арифметика каждой из них, почему смещённая выборка опаснее маленькой и когда сплошной разбор не нужен.

Сколько звонков нужно, зависит от вопроса, а не от размера отдела

«Мы слушаем выборку — этого достаточно» звучит разумно, пока не спросить, для чего именно достаточно. Прежде чем считать объём, нужно определиться с вопросом, и таких вопросов в контроле качества три.

  • Оценить одного сотрудника. Понять, насколько он в среднем следует чек-листу. Самая простая задача.
  • Сравнить двух сотрудников или две команды. Заметно сложнее: нужно, чтобы разница между ними превышала случайный разброс.
  • Найти редкое событие. Нарушение регламента, конфликт, упущенный крупный клиент. Самая тяжёлая задача, и именно её выборка не решает в принципе.

Что это значит для руководителя: объём выборки выбирается не из того, сколько времени есть у отдела контроля, а из того, какое управленческое решение будет приниматься по цифрам. Премия конкретному человеку, перестановка между командами и проверка на нарушение закона требуют разного.

Вердикт: «слушаем 5%» — это ответ на вопрос о бюджете времени, а не о достоверности.

Для оценки одного менеджера хватает пятидесяти разговоров — с оговорками

Здесь работает интуиция: чем больше, тем точнее, и отдача быстро убывает. По двадцати разговорам общее представление уже складывается, по пятидесяти оценка становится устойчивой, дальнейший рост объёма меняет картину слабо.

Как это выглядит в числах. Пример расчёта: менеджер выполняет пункт чек-листа в половине разговоров. По стандартной формуле погрешности доли с 95-процентной уверенностью оценка по 20 разговорам гуляет примерно на ±22 процентных пункта, по 50 — на ±14, по 200 — на ±7. Чтобы вдвое сузить погрешность, разговоров нужно вчетверо больше.

Что это значит: полсотни разговоров уверенно отличают менеджера, который выполняет пункт почти всегда, от того, кто почти никогда. Для тонких различий их мало. Отсюда и привычный порог в 50 звонков в месяц, ниже которого разбор по человеку перестаёт иметь смысл: меньший объём не отличает закономерность от случайности, и проверить работу проще руками.

Реальный масштаб проблемы виден в кейсе отдела взыскания: до внедрения там разбиралось около 440 звонков в месяц из 22 000, то есть по девять разговоров на каждого из 46 операторов. Из девяти разговоров нельзя сделать ни одного статистического вывода о человеке, а оценки операторов строились именно на них.

Важная оговорка

Всё это верно для случайной выборки. Если разговоры отбираются по жалобам или по проигранным сделкам, объём не спасает: такая выборка смещена по построению и описывает не сотрудника, а совокупность неудач. Увеличение смещённой выборки повышает уверенность в неверном выводе.

Вердикт: оценка по десятку разговоров — это мнение о человеке, оформленное как измерение.

Сравнение двух менеджеров требует на порядок больше разговоров

Здесь требования резко растут, и это неочевидно. Чтобы утверждать, что один сотрудник выполняет пункт чек-листа чаще другого, разница должна быть больше случайного разброса — а он тем больше, чем меньше разговоров у каждого.

Практическое правило: чем меньше разница, которую нужно доказать, тем больше нужно наблюдений. Пример расчёта по стандартной формуле для сравнения двух долей (уровень значимости 5%, мощность 80%): чтобы с разумной надёжностью увидеть разрыв между 40% и 80%, достаточно двух-трёх десятков разговоров у каждого. Чтобы отличить 60% от 70%, нужно уже около 350 у каждого. Разница в несколько процентных пунктов требует сотен разговоров на человека и по большинству отделов не доказывается вовсе.

Отсюда практический вывод для управления: не пытайтесь ранжировать весь отдел по мелким различиям. Разделение на верхнюю, среднюю и нижнюю группы устойчиво, а место в таблице между четвёртым и шестым менеджером — обычно шум. Как превратить устойчивую разницу между группами в эталон для остальных, разобрано в статье «Эталон из данных».

Вердикт: рейтинг отдела с точностью до места — самая популярная таблица из случайных чисел.

Редкое нарушение выборка не находит в принципе

Это тот случай, где выборка не работает не «плохо», а никак. Считается элементарно: доля события умножается на размер выборки.

Звонков в месяцДоля событияВыборка 5%Найдётся в среднем
2 0001%100 звонков1
10 0000,5%500 звонков2–3
10 0000,1%500 звонковменее 1

Вывод из последней строки практический и неприятный: пустой отчёт по редким событиям при выборочном контроле не означает, что их нет. Он означает, что их нечем было увидеть. При доле события 0,1% и выборке в 500 разговоров вероятность не найти ни одного случая — около 60%: примерно в шести месяцах из десяти отчёт будет чистым при том, что нарушения есть. Компания узнаёт о проблеме от клиента, от регулятора или из публикации — то есть тогда, когда реагировать уже поздно.

В том же кейсе отдела взыскания сплошная проверка на соблюдение 230-ФЗ показала признаки нарушений примерно в 0,4% разговоров — около 88 случаев в месяц. На выборке в 2% ожидаемое число находок составляло меньше двух в месяц, поэтому в отчётах их не было, и это принималось за отсутствие проблемы.

По этой же причине не собирается типология клиентов: категория, составляющая 5% базы, в пятипроцентной выборке представлена единицами наблюдений, и отличить её особенности от случайности невозможно.

Вердикт: для редких событий размер выборки не имеет значения, потому что правильный размер — все разговоры.

Смещённая выборка хуже маленькой

Выборку в отделах почти никогда не формируют случайно. Слушают то, на что пожаловались, что сорвалось или что вызвало сомнения у руководителя. Это разумно с точки зрения экономии времени и катастрофично с точки зрения выводов.

  • Средний уровень отдела по такой выборке систематически занижен.
  • Сильные сотрудники в неё почти не попадают, поэтому лучшие практики остаются невидимыми.
  • Успешные разговоры не разбираются, а именно они содержат то, что стоит тиражировать.

Смещение не лечится увеличением объёма — только изменением принципа отбора. Практически это означает либо честную случайную выборку, либо сплошной разбор.

Хорошая аналогия — дегустация на винодельне, где пробуют только бочки, на которые пожаловались покупатели. Вывод «вино у нас в целом так себе» будет получен честно, на большом объёме и будет неверен.

Вердикт: маленькая случайная выборка ошибается в обе стороны, смещённая — всегда в одну.

Случайность выборки проверяется на уже прослушанных разговорах

Смещение обычно не осознаётся: руководитель уверен, что слушает разные разговоры, а на деле выбор диктуется поводом. Проверить это можно на уже прослушанном, не меняя порядок работы.

Возьмите список разобранных за месяц разговоров и сравните его с общим потоком по трём признакам: распределение по сотрудникам, по дням недели и по длительности. Случайная выборка повторяет пропорции потока. Если в разобранном втрое больше длинных разговоров или половина приходится на двух человек, выборка не случайна.

Исправляется это механически: список для разбора формируется заранее и случайно, а не выбирается в момент прослушивания. Разговоры, которые нужно послушать по поводу — жалоба, срыв сделки, — разбираются дополнительно и считаются отдельно, а не вместо случайной выборки.

Вердикт: если выборку составляет человек в момент прослушивания, она случайна ровно настолько, насколько случайно его настроение.

Сотрудника с десятком разговоров оценивают разбором, а не баллом

В любом отделе есть люди с небольшим числом контактов: работают с крупными клиентами, заняты частично, недавно вышли. По ним статистика не собирается, а оценивать их надо.

Ошибка — применять к ним те же пороги и делать выводы по десяти разговорам. Разброс на такой выборке перекрывает любую реальную разницу, и оценка получается случайной, но выглядит как измерение.

Работает смена инструмента, а не подгонка порога. Для малого объёма подходит качественный разбор: не средний балл, а несколько конкретных разговоров, разобранных подробно, с выводами по каждому. Это дольше на одного человека, но при малом числе разговоров и возможно, и полезнее.

Вердикт: средний балл по десяти разговорам точен до второго знака и ошибается в первом.

Сплошной разбор меняет не точность, а список решаемых задач

Сплошной охват снимает вопрос об объёме выборки, и это его главное, но не единственное следствие. Меняется и то, какие задачи вообще становятся решаемыми.

Редкие события перестают быть недоступными: при сплошном разборе в проверку попадают все случаи нарушения, встречающегося в одном проценте разговоров, а не в среднем один из двадцати, как при пятипроцентной выборке. Сравнение сотрудников становится корректным, потому что сравниваются одинаковые по полноте наборы, а не разные выборки.

Появляется и новая задача, которой не было: что делать с объёмом найденного. При сплошном разборе замечаний становится столько, что разобрать их все невозможно, и нужен приоритет. Обычно им становится не тяжесть отдельного случая, а частота: то, что повторяется у многих, чинится процессом, а не разговором с каждым.

Технически сплошной разбор делает речевая аналитика Эхо; по тарифу это 1,5 ₽ за минуту разговора. Пример: 2 000 звонков в месяц по 4 минуты — 8 000 минут, или 12 000 ₽ в месяц за разбор всех разговоров. Эту сумму имеет смысл сравнивать не с зарплатой контролёра, а с ценой той ошибки, которую выборка пропускает.

Вердикт: сплошной разбор окупается не тем, что точнее оценивает известное, а тем, что показывает то, чего в отчётах не было.

Сплошной разбор не нужен, если по его цифрам нечего решать

Было бы нечестно выводить из арифметики выше, что всем нужно разбирать всё. Бывает, что выборка — правильный ответ, а сплошной разбор — лишние расходы.

Первый случай — маленький поток. Если у отдела пара десятков разговоров в неделю, руководитель может прослушать их сам, и автоматизация не вернёт вложенного. Второй — вопрос касается только среднего уровня: если нужно понять, стал ли отдел в целом лучше после обучения, честная случайная выборка ответит на это дешевле. Третий — по результатам никто не будет действовать: если найденные нарушения некому разбирать, а скрипт никто не готов менять, сплошной отчёт превратится в ещё один непрочитанный файл. Четвёртый — задача разовая: оценить новичка после первой недели удобнее по десятку разговоров, прослушанных целиком, чем по статистике.

Я бы начинал не с выбора между выборкой и сплошным разбором, а с вопроса, какое решение будет приниматься по цифрам и что изменится в показателе, если оно окажется верным. Так же устроен наш метод «Цель → метрика» на странице «Как мы работаем»: сначала цель и способ замера, потом инструмент, и отказ от проекта, если объём его не окупит.

Вердикт: разбирать все звонки стоит тогда, когда цена пропущенного случая выше цены разбора, — и ни днём раньше.

При малом потоке статистику заменяет окно наблюдения

Если объём ниже порога, статистика не поможет — и это нормально. Рабочие варианты:

  • Расширить окно. Считать не за месяц, а за квартал: 40 звонков в месяц дают 120 за квартал, и на них уже видны закономерности.
  • Считать по отделу, а не по людям. Общая картина по команде набирается быстрее, чем по каждому сотруднику.
  • Смотреть разговоры целиком. При малом объёме разбор каждого звонка вручную реалистичен и полезнее любых процентов.
  • Не привязывать премию к метрике. На малых числах случайный разброс легко перепутать с работой человека — это самый быстрый способ поссориться с отделом.

Вердикт: маленький поток не требует маленькой статистики — он требует большего окна и честности в том, что по одному человеку выводов пока нет.

Какой вопрос задать своему отчёту по контролю качества

Главное следствие для решения: достоверность отчёта определяется не числом прослушанных разговоров, а тем, совпадает ли объём с вопросом. Одна и та же выборка может быть избыточной для оценки отдела и бесполезной для поиска нарушений — и отчёт об этом не предупредит.

Проверить свой контроль качества можно за один вечер. Выпишите три решения, которые принимались по его данным за последний квартал: премия, замечание, изменение скрипта. Для каждого посмотрите, на скольких разговорах оно основано и была ли выборка случайной. Если премия назначалась по девяти разговорам, а отчёт о нарушениях пуст при выборке в несколько процентов, вы знаете, какой из трёх задач не хватает объёма, и можете посчитать, сколько разговоров для неё нужно, по правилам выше. Какие пункты включать в сам чек-лист, чтобы оценка была сопоставимой, разобрано в статье о чек-листе оценки звонка.

Частые вопросы

Если не нашли ответа — напишите нам в Telegram, ответим за 15 минут.

Порядка пятидесяти разговоров в месяц: по двадцати складывается общее представление, по пятидесяти оценка становится устойчивой, а дальнейший рост объёма меняет картину слабо. Отсюда и берётся привычный порог в 50 звонков, ниже которого разбор теряет смысл — меньший объём не отличает закономерность от случайности. Всё это верно только для случайной выборки: разговоры, отобранные по жалобам, описывают не сотрудника, а совокупность неудач.
Потому что разница между ними должна превышать случайный разброс, а он тем больше, чем меньше разговоров у каждого. Работает правило: чем меньше разница, которую нужно доказать, тем больше нужно наблюдений. Двукратный разрыв виден на нескольких десятках разговоров, а разница в несколько процентных пунктов требует сотен и по большинству отделов не доказывается вовсе. Поэтому деление на верхнюю, среднюю и нижнюю группы устойчиво, а точное место в рейтинге между четвёртым и шестым — обычно шум.
Из-за простой арифметики: доля события умножается на размер выборки. При 10 000 звонков в месяц и доле события 0,1% пятипроцентная выборка в 500 разговоров в среднем не содержит ни одного случая. Практический вывод: пустой отчёт по редким событиям при выборочном контроле означает не отсутствие проблемы, а отсутствие способа её увидеть — и компания узнаёт о ней от клиента, от регулятора или из публикации.
Она смещена по построению, и это опаснее недостаточного объёма, потому что не лечится его увеличением. Средний уровень отдела по такой выборке систематически занижен, сильные сотрудники в неё почти не попадают, а успешные разговоры не разбираются вовсе — хотя именно они содержат то, что стоит тиражировать. Увеличение смещённой выборки лишь повышает уверенность в неверном выводе. Помогает только смена принципа отбора: честная случайная выборка или сплошной разбор.
Не пытаться заменить объём статистикой. Рабочих вариантов четыре: расширить окно наблюдения и считать за квартал вместо месяца; считать по отделу целиком, а не по каждому человеку; разбирать разговоры целиком вручную, что при малом объёме реалистично и полезнее процентов; и не привязывать метрику к премии — на малых числах случайный разброс легко перепутать с работой сотрудника.
Нет, по той же причине, что и найти редкое событие. Категория, составляющая 5% базы, в пятипроцентной выборке представлена единицами наблюдений, и отличить её особенности от случайности невозможно. Типология требует сплошного разбора: только тогда даже малочисленные группы набирают достаточно наблюдений, чтобы по ним можно было строить сценарии работы.

Кейсы из статьи

Разбор, о котором шла речь

Все разборы внедрений

Посмотрим, что видно на вашем объёме

Оценим, каких выводов хватает ваших разговоров, а для каких нужен сплошной разбор — до того, как что-то внедрять.

Разбор задачи — бесплатноОтвет за 15 минут
Разобрать задачу