Как выбрать сервис речевой аналитики: пилот на своих звонках и вопросы вендору
Любое демо речевой аналитики выглядит убедительно. Это нормально: вендор показывает записи, на которых его система работает хорошо — чистый звук, два канала, понятная лексика. Проблема в том, что ваш поток выглядит иначе: моно-запись из старой АТС, шум колл-центра, клиент говорит из машины, а половина звонков вообще заканчивается на автоответчике.
Поэтому выбор сервиса сводится к одному действию: прогнать через кандидатов собственные записи и посмотреть, что получится. Ниже — как организовать такой пилот, что именно проверять и какие вопросы задать до того, как подписывать договор.
Шаг 1. Определите, какую задачу решаете
От этого зависит класс решения, а значит и цена — разброс на рынке стократный. Три типовые задачи и что под них берут.
| Задача | Что нужно | Класс решения |
|---|---|---|
| Понять, о чём звонки, и посчитать целевые обращения | Теги и разметка тем | Опция телефонии или коллтрекинга |
| Оценить работу менеджеров по скрипту | Разбор содержания и чек-лист | AI-сервис разбора разговоров |
| Контролировать контакт-центр на сотни операторов | Собственные модели, установка в контур | Enterprise-платформа |
Разбор классов с примерами — в обзоре рынка. Ошибка выбора класса дороже ошибки выбора вендора внутри класса: сервис за рубль в минуту не оценит работу менеджера, а enterprise-платформа за миллион не нужна отделу из пяти человек.
Сформулируйте задачу одной фразой и одним измеримым результатом: «хочу видеть долю звонков с назначенной встречей по каждому менеджеру». Если такой фразы нет, пилот превратится в разглядывание красивых дашбордов.
Шаг 2. Соберите тестовый набор записей
Главная ошибка пилота — отдать вендору красивые звонки. Нужны репрезентативные, а лучше с перекосом в сложные.
Рабочий набор — 30–50 записей, в котором обязательно есть:
- Пять-семь худших звонков, где менеджер сдался или нагрубил. Именно на них проверяется, ловит ли система провалы.
- Два-три образцовых разговора. Если система занижает балл там, где вы точно знаете, что разговор отличный, — калибровка не сойдётся.
- Недозвоны и очень короткие звонки. Проверка на то, не тарифицируется ли пустое и не портят ли такие записи статистику.
- Разговоры с автоответчиком и переводом на другого сотрудника. Самая частая причина кривых оценок.
- Записи с шумом: улица, открытый офис, плохая связь.
- Отраслевую лексику: названия ЖК, моделей, препаратов, программ — то, на чём спотыкается общее распознавание.
Один и тот же набор отдаётся всем кандидатам. Иначе сравнение бессмысленно.
Шаг 3. Что проверять на своих записях
| Что смотреть | Как проверить | Красный флаг |
|---|---|---|
| Качество распознавания | Прочитать три расшифровки целиком, сверяя с аудио | Теряются целые реплики, а не отдельные слова |
| Определение ролей | Взять звонок с IVR и переводом | Автоответчик засчитан менеджеру, роли перепутаны |
| Оценка по чек-листу | Сверить 5 звонков с собственной ручной оценкой | Расхождение больше чем на треть по большинству звонков |
| Воспроизводимость | Прогнать один и тот же звонок дважды | Разные оценки на одной записи |
| Отраслевая лексика | Поиск по названиям и терминам в расшифровках | Термины не распознаются, теги не срабатывают |
| Скорость | Замерить время от загрузки до готового разбора | Часы вместо минут при небольшом объёме |
Два пункта в этой таблице обычно решают исход пилота.
Определение ролей. Если на моно-записи система склеивает автоответчик, секретаря и менеджера в одного говорящего, все оценки поедут: менеджер получит претензию за фразу робота. Проверяется за пять минут на одном звонке с переводом.
Воспроизводимость. Оценка одной и той же записи должна совпадать при повторном прогоне. Разъезжающиеся баллы означают, что на этих цифрах нельзя строить ни премию, ни разговор с менеджером.
Шаг 4. Вопросы вендору
Список, который можно скопировать и пройти по нему на созвоне. Ответы записывайте — потом сравните.
Про деньги
- Сколько стоит минута при моём объёме и как меняется цена при росте?
- Тарифицируются ли недозвоны, короткие звонки и разговоры с автоответчиком?
- Что происходит при превышении пакета: блокировка, доплата, какая?
- Переносится ли неиспользованный остаток минут?
- Есть ли платёж за подключение, настройку, обучение?
- Есть ли минимальный срок договора и что при досрочном расторжении?
Про продукт
- Могу ли я изменить чек-лист сам или это работа поддержки, и сколько она стоит?
- Как система понимает, кто говорит, на моно-записях?
- Есть ли готовый словарь под мою отрасль или всё настраивается с нуля?
- Что происходит с оценкой, если звонок начался с IVR или был переведён?
- Можно ли выгрузить данные — расшифровки, оценки, факты — и в каком формате?
Про данные
- Где физически хранятся аудио и расшифровки?
- Какая модель используется для анализа текста и где она размещена?
- Уходит ли текст расшифровки за пределы России?
- Сколько хранятся записи и можно ли настроить срок?
- Что происходит с данными при расторжении договора?
Про работу
- Сколько времени от договора до первого отчёта?
- Кто настраивает чек-лист на старте?
- Как быстро отвечает поддержка и в каком канале?
Вопрос про язык модели задают редко, а он существенный: часть сервисов отправляет текст расшифровки в зарубежные языковые модели. Само аудио при этом может действительно лежать в России, и формально вендор не обманывает, говоря «данные хранятся в РФ».
Где прячутся доплаты
Названная цена за минуту редко оказывается итоговой. Типовые статьи, о которых стоит спросить заранее.
| Статья | Как выглядит в договоре |
|---|---|
| Подключение и настройка | Разовый платёж, иногда сопоставимый с годовой подпиской |
| Настройка чек-листа | Часы работы поддержки по прайсу |
| Интеграция с вашей CRM или АТС | Отдельный проект, если коннектора нет из коробки |
| Хранение записей | Плата за объём сверх включённого |
| Дополнительные пользователи | Цена за место поверх минут |
| Превышение пакета | Тариф за минуту сверх лимита выше базового |
Самая неприятная из них — настройка чек-листа по прайсу поддержки. Чек-лист меняется вместе со скриптом, то есть регулярно, и если каждая правка стоит денег, через полгода вы перестанете его трогать, а вместе с этим обесценятся оценки.
Шаг 5. Как сравнить двух вендоров без самообмана
Пилот у двух кандидатов одновременно даёт больше, чем последовательные демо, но требует дисциплины.
- Один и тот же набор записей обоим, без исключений.
- Один и тот же чек-лист, переведённый в термины каждой системы.
- Слепая сверка. Оцените десять звонков вручную до того, как увидите результаты систем, и сравнивайте с этой оценкой, а не друг с другом.
- Одинаковый срок. Две недели каждому, без продления «мы тут ещё донастроим».
- Сравнение по таблице из шага 3, а не по общему впечатлению от интерфейса.
Интерфейс, кстати, стоит смотреть в последнюю очередь. Он влияет на удовольствие от работы, но не на то, верны ли оценки, а привыкают к любому за неделю.
Красные флаги
- Отказ дать пилот на ваших записях. Единственная уважительная причина — enterprise-контур с длинным внедрением; во всех остальных случаях это плохой знак.
- Демо только на записях вендора. Смотреть можно, делать выводы нельзя.
- Точность «99%» без уточнения, что именно измерялось. Точность распознавания слов, реплик и смысловых оценок — три разные величины.
- Цена только после подписания NDA. Обычно означает, что она зависит от того, насколько вы готовы платить.
- Невозможность выгрузить свои данные. Через год смена вендора будет означать потерю архива.
- Обещание «настроим всё за вас». Чек-лист без вашего участия будет чужим, а работать с ним вашему отделу.
Сколько времени занимает выбор
Реалистичный график для AI-сервиса: неделя на формулировку задачи и сбор записей, две недели на пилот у двух кандидатов, неделя на сравнение и переговоры. Итого около месяца.
Для enterprise-платформы добавляется согласование безопасности и юристов — от трёх месяцев.
Затягивать дольше смысла нет. Речевая аналитика относится к тем инструментам, где первый же отчёт по своим звонкам даёт больше информации, чем месяц сравнения презентаций.
Вопросы и ответы
- Можно ли выбрать сервис, не проводя пилот?
- Можно, но это лотерея. Качество распознавания и оценок сильно зависит от вашего звука, лексики и того, как записаны разговоры. Ни один отзыв не отвечает на вопрос, как система сработает именно на вашем потоке.
- Сколько звонков нужно для пилота?
- 30–50 записей достаточно, если набор собран правильно: с худшими разговорами, недозвонами, автоответчиком и шумом. Тысяча одинаковых чистых звонков покажет меньше.
- Что важнее при выборе — точность распознавания или качество разбора?
- Разбор. Современные движки распознают достаточно хорошо для смыслового анализа; принципиально различается то, что система делает с текстом дальше.
- Как проверить, что оценкам можно доверять?
- Сверить с собственной ручной оценкой десяти звонков и прогнать один и тот же звонок дважды. Расхождение с вашей оценкой калибруется правкой чек-листа, разные баллы на одной записи — повод отказаться.
- Обязательно ли хранить данные в России?
- Записи разговоров содержат персональные данные, и требования 152-ФЗ распространяются на них. Спрашивать нужно отдельно про аудио и отдельно про текст расшифровки: они могут храниться и обрабатываться в разных местах.
- Что делать, если бюджета на сервис нет совсем?
- Начать с ручного замера: чек-лист из семи пунктов и выборка в тридцать звонков дадут первую картину за день работы. Дальше будет понятнее, что именно автоматизировать и стоит ли.