Случайная выборка в 5% звонков сносно показывает средний уровень отдела и почти ничего не говорит о том, ради чего её обычно слушают: о редких нарушениях, о разнице между двумя менеджерами, о малочисленных группах клиентов. Сколько звонков нужно для достоверных выводов, определяет вопрос, а не размер отдела: оценить одного сотрудника, сравнить двоих и поймать редкое событие — три задачи с разными требованиями к объёму. Ниже — арифметика каждой из них, почему смещённая выборка опаснее маленькой и когда сплошной разбор не нужен.
Сколько звонков нужно, зависит от вопроса, а не от размера отдела
«Мы слушаем выборку — этого достаточно» звучит разумно, пока не спросить, для чего именно достаточно. Прежде чем считать объём, нужно определиться с вопросом, и таких вопросов в контроле качества три.
- Оценить одного сотрудника. Понять, насколько он в среднем следует чек-листу. Самая простая задача.
- Сравнить двух сотрудников или две команды. Заметно сложнее: нужно, чтобы разница между ними превышала случайный разброс.
- Найти редкое событие. Нарушение регламента, конфликт, упущенный крупный клиент. Самая тяжёлая задача, и именно её выборка не решает в принципе.
Что это значит для руководителя: объём выборки выбирается не из того, сколько времени есть у отдела контроля, а из того, какое управленческое решение будет приниматься по цифрам. Премия конкретному человеку, перестановка между командами и проверка на нарушение закона требуют разного.
Вердикт: «слушаем 5%» — это ответ на вопрос о бюджете времени, а не о достоверности.
Для оценки одного менеджера хватает пятидесяти разговоров — с оговорками
Здесь работает интуиция: чем больше, тем точнее, и отдача быстро убывает. По двадцати разговорам общее представление уже складывается, по пятидесяти оценка становится устойчивой, дальнейший рост объёма меняет картину слабо.
Как это выглядит в числах. Пример расчёта: менеджер выполняет пункт чек-листа в половине разговоров. По стандартной формуле погрешности доли с 95-процентной уверенностью оценка по 20 разговорам гуляет примерно на ±22 процентных пункта, по 50 — на ±14, по 200 — на ±7. Чтобы вдвое сузить погрешность, разговоров нужно вчетверо больше.
Что это значит: полсотни разговоров уверенно отличают менеджера, который выполняет пункт почти всегда, от того, кто почти никогда. Для тонких различий их мало. Отсюда и привычный порог в 50 звонков в месяц, ниже которого разбор по человеку перестаёт иметь смысл: меньший объём не отличает закономерность от случайности, и проверить работу проще руками.
Реальный масштаб проблемы виден в кейсе отдела взыскания: до внедрения там разбиралось около 440 звонков в месяц из 22 000, то есть по девять разговоров на каждого из 46 операторов. Из девяти разговоров нельзя сделать ни одного статистического вывода о человеке, а оценки операторов строились именно на них.
Всё это верно для случайной выборки. Если разговоры отбираются по жалобам или по проигранным сделкам, объём не спасает: такая выборка смещена по построению и описывает не сотрудника, а совокупность неудач. Увеличение смещённой выборки повышает уверенность в неверном выводе.
Вердикт: оценка по десятку разговоров — это мнение о человеке, оформленное как измерение.
Сравнение двух менеджеров требует на порядок больше разговоров
Здесь требования резко растут, и это неочевидно. Чтобы утверждать, что один сотрудник выполняет пункт чек-листа чаще другого, разница должна быть больше случайного разброса — а он тем больше, чем меньше разговоров у каждого.
Практическое правило: чем меньше разница, которую нужно доказать, тем больше нужно наблюдений. Пример расчёта по стандартной формуле для сравнения двух долей (уровень значимости 5%, мощность 80%): чтобы с разумной надёжностью увидеть разрыв между 40% и 80%, достаточно двух-трёх десятков разговоров у каждого. Чтобы отличить 60% от 70%, нужно уже около 350 у каждого. Разница в несколько процентных пунктов требует сотен разговоров на человека и по большинству отделов не доказывается вовсе.
Отсюда практический вывод для управления: не пытайтесь ранжировать весь отдел по мелким различиям. Разделение на верхнюю, среднюю и нижнюю группы устойчиво, а место в таблице между четвёртым и шестым менеджером — обычно шум. Как превратить устойчивую разницу между группами в эталон для остальных, разобрано в статье «Эталон из данных».
Вердикт: рейтинг отдела с точностью до места — самая популярная таблица из случайных чисел.
Редкое нарушение выборка не находит в принципе
Это тот случай, где выборка не работает не «плохо», а никак. Считается элементарно: доля события умножается на размер выборки.
| Звонков в месяц | Доля события | Выборка 5% | Найдётся в среднем |
|---|---|---|---|
| 2 000 | 1% | 100 звонков | 1 |
| 10 000 | 0,5% | 500 звонков | 2–3 |
| 10 000 | 0,1% | 500 звонков | менее 1 |
Вывод из последней строки практический и неприятный: пустой отчёт по редким событиям при выборочном контроле не означает, что их нет. Он означает, что их нечем было увидеть. При доле события 0,1% и выборке в 500 разговоров вероятность не найти ни одного случая — около 60%: примерно в шести месяцах из десяти отчёт будет чистым при том, что нарушения есть. Компания узнаёт о проблеме от клиента, от регулятора или из публикации — то есть тогда, когда реагировать уже поздно.
В том же кейсе отдела взыскания сплошная проверка на соблюдение 230-ФЗ показала признаки нарушений примерно в 0,4% разговоров — около 88 случаев в месяц. На выборке в 2% ожидаемое число находок составляло меньше двух в месяц, поэтому в отчётах их не было, и это принималось за отсутствие проблемы.
По этой же причине не собирается типология клиентов: категория, составляющая 5% базы, в пятипроцентной выборке представлена единицами наблюдений, и отличить её особенности от случайности невозможно.
Вердикт: для редких событий размер выборки не имеет значения, потому что правильный размер — все разговоры.
Смещённая выборка хуже маленькой
Выборку в отделах почти никогда не формируют случайно. Слушают то, на что пожаловались, что сорвалось или что вызвало сомнения у руководителя. Это разумно с точки зрения экономии времени и катастрофично с точки зрения выводов.
- Средний уровень отдела по такой выборке систематически занижен.
- Сильные сотрудники в неё почти не попадают, поэтому лучшие практики остаются невидимыми.
- Успешные разговоры не разбираются, а именно они содержат то, что стоит тиражировать.
Смещение не лечится увеличением объёма — только изменением принципа отбора. Практически это означает либо честную случайную выборку, либо сплошной разбор.
Хорошая аналогия — дегустация на винодельне, где пробуют только бочки, на которые пожаловались покупатели. Вывод «вино у нас в целом так себе» будет получен честно, на большом объёме и будет неверен.
Вердикт: маленькая случайная выборка ошибается в обе стороны, смещённая — всегда в одну.
Случайность выборки проверяется на уже прослушанных разговорах
Смещение обычно не осознаётся: руководитель уверен, что слушает разные разговоры, а на деле выбор диктуется поводом. Проверить это можно на уже прослушанном, не меняя порядок работы.
Возьмите список разобранных за месяц разговоров и сравните его с общим потоком по трём признакам: распределение по сотрудникам, по дням недели и по длительности. Случайная выборка повторяет пропорции потока. Если в разобранном втрое больше длинных разговоров или половина приходится на двух человек, выборка не случайна.
Исправляется это механически: список для разбора формируется заранее и случайно, а не выбирается в момент прослушивания. Разговоры, которые нужно послушать по поводу — жалоба, срыв сделки, — разбираются дополнительно и считаются отдельно, а не вместо случайной выборки.
Вердикт: если выборку составляет человек в момент прослушивания, она случайна ровно настолько, насколько случайно его настроение.
Сотрудника с десятком разговоров оценивают разбором, а не баллом
В любом отделе есть люди с небольшим числом контактов: работают с крупными клиентами, заняты частично, недавно вышли. По ним статистика не собирается, а оценивать их надо.
Ошибка — применять к ним те же пороги и делать выводы по десяти разговорам. Разброс на такой выборке перекрывает любую реальную разницу, и оценка получается случайной, но выглядит как измерение.
Работает смена инструмента, а не подгонка порога. Для малого объёма подходит качественный разбор: не средний балл, а несколько конкретных разговоров, разобранных подробно, с выводами по каждому. Это дольше на одного человека, но при малом числе разговоров и возможно, и полезнее.
Вердикт: средний балл по десяти разговорам точен до второго знака и ошибается в первом.
Сплошной разбор меняет не точность, а список решаемых задач
Сплошной охват снимает вопрос об объёме выборки, и это его главное, но не единственное следствие. Меняется и то, какие задачи вообще становятся решаемыми.
Редкие события перестают быть недоступными: при сплошном разборе в проверку попадают все случаи нарушения, встречающегося в одном проценте разговоров, а не в среднем один из двадцати, как при пятипроцентной выборке. Сравнение сотрудников становится корректным, потому что сравниваются одинаковые по полноте наборы, а не разные выборки.
Появляется и новая задача, которой не было: что делать с объёмом найденного. При сплошном разборе замечаний становится столько, что разобрать их все невозможно, и нужен приоритет. Обычно им становится не тяжесть отдельного случая, а частота: то, что повторяется у многих, чинится процессом, а не разговором с каждым.
Технически сплошной разбор делает речевая аналитика Эхо; по тарифу это 1,5 ₽ за минуту разговора. Пример: 2 000 звонков в месяц по 4 минуты — 8 000 минут, или 12 000 ₽ в месяц за разбор всех разговоров. Эту сумму имеет смысл сравнивать не с зарплатой контролёра, а с ценой той ошибки, которую выборка пропускает.
Вердикт: сплошной разбор окупается не тем, что точнее оценивает известное, а тем, что показывает то, чего в отчётах не было.
Сплошной разбор не нужен, если по его цифрам нечего решать
Было бы нечестно выводить из арифметики выше, что всем нужно разбирать всё. Бывает, что выборка — правильный ответ, а сплошной разбор — лишние расходы.
Первый случай — маленький поток. Если у отдела пара десятков разговоров в неделю, руководитель может прослушать их сам, и автоматизация не вернёт вложенного. Второй — вопрос касается только среднего уровня: если нужно понять, стал ли отдел в целом лучше после обучения, честная случайная выборка ответит на это дешевле. Третий — по результатам никто не будет действовать: если найденные нарушения некому разбирать, а скрипт никто не готов менять, сплошной отчёт превратится в ещё один непрочитанный файл. Четвёртый — задача разовая: оценить новичка после первой недели удобнее по десятку разговоров, прослушанных целиком, чем по статистике.
Я бы начинал не с выбора между выборкой и сплошным разбором, а с вопроса, какое решение будет приниматься по цифрам и что изменится в показателе, если оно окажется верным. Так же устроен наш метод «Цель → метрика» на странице «Как мы работаем»: сначала цель и способ замера, потом инструмент, и отказ от проекта, если объём его не окупит.
Вердикт: разбирать все звонки стоит тогда, когда цена пропущенного случая выше цены разбора, — и ни днём раньше.
При малом потоке статистику заменяет окно наблюдения
Если объём ниже порога, статистика не поможет — и это нормально. Рабочие варианты:
- Расширить окно. Считать не за месяц, а за квартал: 40 звонков в месяц дают 120 за квартал, и на них уже видны закономерности.
- Считать по отделу, а не по людям. Общая картина по команде набирается быстрее, чем по каждому сотруднику.
- Смотреть разговоры целиком. При малом объёме разбор каждого звонка вручную реалистичен и полезнее любых процентов.
- Не привязывать премию к метрике. На малых числах случайный разброс легко перепутать с работой человека — это самый быстрый способ поссориться с отделом.
Вердикт: маленький поток не требует маленькой статистики — он требует большего окна и честности в том, что по одному человеку выводов пока нет.
Какой вопрос задать своему отчёту по контролю качества
Главное следствие для решения: достоверность отчёта определяется не числом прослушанных разговоров, а тем, совпадает ли объём с вопросом. Одна и та же выборка может быть избыточной для оценки отдела и бесполезной для поиска нарушений — и отчёт об этом не предупредит.
Проверить свой контроль качества можно за один вечер. Выпишите три решения, которые принимались по его данным за последний квартал: премия, замечание, изменение скрипта. Для каждого посмотрите, на скольких разговорах оно основано и была ли выборка случайной. Если премия назначалась по девяти разговорам, а отчёт о нарушениях пуст при выборке в несколько процентов, вы знаете, какой из трёх задач не хватает объёма, и можете посчитать, сколько разговоров для неё нужно, по правилам выше. Какие пункты включать в сам чек-лист, чтобы оценка была сопоставимой, разобрано в статье о чек-листе оценки звонка.