Точность распознавания русской речи
в шумном торговом зале.
Какие цифры честные, какие — маркетинг, и какие вопросы задать вендору, чтобы не купить кота в мешке.
Первый вопрос любого технического директора к речевой аналитике: «А какая точность?» Правильный ответ сложнее одной цифры — и вендор, который отвечает одной цифрой без оговорок, уже должен насторожить.
Как вообще меряют точность
Базовая метрика — WER (word error rate): доля ошибочно распознанных слов. Точность «по словам» = 100% − WER. Важно понимать: WER всегда меряется на конкретном типе аудио. Одна и та же модель покажет разные цифры на студийной записи, телефонной линии и бейдже в шумном зале.
Реалистичные цифры для русской речи
| Условия записи | Точность по словам | Комментарий |
|---|---|---|
| Телефония, гарнитура оператора | 97%+ | чистый канал, раздельные дорожки спикеров |
| Аудио-бейдж, торговый зал | 94–97% | фоновая музыка, гул, перекрытия реплик |
| Зал в час пик, речь вполголоса | ниже 94% | честный вендор помечает такие записи флагом качества |
Если вам обещают «99% в любых условиях» — это либо лабораторный замер на чистой речи, либо маркетинг. В зале с музыкой и параллельными разговорами физику не обманешь: часть слов теряется даже у человека-расшифровщика.
Что реально влияет на точность
- Расстояние до микрофона. Бейдж на груди сотрудника слышит его почти идеально, клиента — хуже. Поэтому реплики эксперта распознаются точнее реплик клиента.
- Перекрытия речи. Когда говорят одновременно, ошибки растут у любой модели. Хорошие системы помечают такие фрагменты, а не выдают их за чистый текст.
- Словарь домена. Названия SKU, акций и профессиональный сленг модель должна выучить на ваших данных — иначе «трейд-ин» превратится в «рейтинг».
- Кодек и канал. Узкополосная телефония режет частоты; современные кодеки (Opus) распознаются заметно лучше.
Почему WER — не главная метрика
Для бизнеса важнее точность оценки, а не транскрипта. Чек-лист «назвал цену», «предложил акцию», «попрощался» устойчив к единичным ошибкам распознавания: чтобы верно оценить пункт, не нужно идеально расшифровать каждое слово.
Чек-лист вопросов вендору
- Какая точность на наших записях, а не на вашем демо-стенде? (Просите прогнать пилотный пул.)
- Как помечаются фрагменты низкого качества звука? Попадают ли они в оценку?
- Как модель учит наш словарь: SKU, акции, названия конкурентов?
- Какая согласованность оценок с нашими аудиторами после калибровки? Как устроена апелляция?
- Дообучается ли модель на наших правках?
Как это устроено у нас — в FAQ Frontline и методологии QA.
Возьмём ваши реальные аудио — покажем транскрипты и точность на демо.
Обсудим вашу задачу?
Письмо откроется сразу — ответим в течение рабочего дня.