Top.Mail.Ru
Медиа imot.io
AI и коммуникации

Точность распознавания речи 95%: почему это только начало работы

Когда вендор говорит «95% точности распознавания», цифра звучит убедительно. Пока не посчитаешь: это 5 неправильных слов на каждые 100. В деловом звонке длиной 7–8 минут при средней скорости разговорной речи 125–150 слов в минуту набегает около 1000 слов. При 95% точности — 50 ошибок на один разговор. Не «почти идеально». Ровно 50 мест, где что-то могло пойти не так.

Но это ещё не вся история. Проблема глубже, чем просто число ошибок. Она в том, как мы их считаем, где в реальности система теряет точность и что ошибки вообще значат для последующей аналитики.

Что такое WER и почему его недостаточно

Стандартная метрика качества транскрибации называется WER — доля ошибок на уровне слов. Формула простая: количество неправильно распознанных слов (замены, вставки, пропуски) делится на общее число слов в эталонной записи.

Метрика существует десятилетиями и прижилась по понятной причине — её легко считать и легко сравнивать. Хотите выбрать между двумя системами? Прогоните одинаковый тест, сравните WER. Хотите проследить, как улучшается модель от версии к версии? WER покажет динамику.

Но у неё есть фундаментальный изъян, о котором AssemblyAI написали развёрнуто: WER считает все ошибки одинаково ценными. Перепутать «ну» и «нуу» — одна ошибка. Перепутать «согласен» и «не согласен» — тоже одна ошибка. Формально идентично, по последствиям — небо и земля.

Пример из реальной практики: система распознала «подумают» вместо «подумаю». Формально — ошибка, смысл сохранился примерно. Теперь другой пример: «буду» вместо «не буду». Тоже одна ошибка по WER. Только клиент сказал одно, а в транскрипте стоит прямо противоположное.

Этот разрыв стал особенно заметен, когда AssemblyAI выпустил новую версию своей модели Universal-3 Pro. Часть клиентов вернулась с жалобой: бенчмарки показывают, что новая модель хуже старой. Начали разбираться — оказалось, что модель стала точнее по смыслу, но у неё изменился стиль транскрипции: «доктор» вместо «д-р», «тысяча триста» вместо «1300». Оба варианта верны. WER считал это ошибкой. Семантически — всё правильно.

Исследования на базе академических корпусов подтверждают ту же картину: WER-ориентированная оценка систематически занижает реальные успехи моделей в передаче смысла. Когда нужна не точная копия произнесённого, а правильно понятый смысл — WER измеряет не то.

Именно поэтому ScienceDirect приводит в числе известных ограничений метрики её нечувствительность к семантической и синтаксической корректности текста. А в обзоре на Speechmatics прямо называют проблему: «WER наказывает модель за правильные варианты, которые просто не совпадают с референсным транскриптом слово в слово».

Лаборатория и реальная телефония – два разных мира

Второй крупный разрыв — между условиями тестирования и реальной работой системы.

Большинство бенчмарков строятся на чистых записях. LibriSpeech — это аудиокниги, читаемые вслух в тихой студии одним диктором. На таких данных OpenAI Whisper Large-v3 показывает около 2–3% WER. Звучит впечатляюще. Исследования с реальными телефонными звонками рисуют другую картину: точность Whisper на компрессированном телефонном аудио падает до 43–54%. Именно такие данные приводит исследование на Vexascribe, сравнивавшее производительность на разных типах аудио.

Deepgram в своём руководстве для покупателей ASR-систем прямо формулирует: производственная деградация точности при переходе от лабораторных условий к реальному развёртыванию составляет от 2,8 до 5,7 раза. Система с 3% WER на аудиокнигах на телефонных переговорах может давать 15–20%.

Откуда берётся такой разрыв? Как минимум три фактора работают одновременно.

Телефонная компрессия. Большинство звонков через телефонию или VoIP передаётся на частоте 8 кГц. Это вдвое ниже, чем полоса студийной записи. Узкополосный формат сам по себе добавляет 8–12 процентных пунктов к WER по сравнению с широкополосным аудио, даже без учёта шума. Компрессия кодеком ещё больше искажает сигнал. Исследование Frontiers in Signal Processing показало, что при сочетании сетевых помех и компрессии WER растёт прямо пропорционально уровню джиттера и потерь пакетов.

Фоновый шум. Каждые 10 дБ роста уровня шума снижают точность распознавания на 8–12 процентных пунктов. В call-центре с открытым планировочным пространством, дома у менеджера на удалёнке или в офисе клиента — условия постоянно меняются. Deepgram в своём анализефиксирует: при низком шуме WER составляет ~18%, при среднем — 26%, при высоком — до 35%.

Спонтанная речь. Аудиокниги читаются по тексту: чёткая дикция, законченные предложения, никаких «эм», «ну», оговорок, самоисправлений. Деловой разговор — другая история. Собеседники перебивают друг друга, делают паузы в середине фразы, используют профессиональный жаргон, аббревиатуры и термины, которых нет в базовой обучающей выборке модели. AssemblyAI в своём обзоре прямо предупреждает: «Академические датасеты не способны предсказать точность в полевых условиях — они не включают перекрёстную речь, низкочастотные микрофоны и фоновый шум».

Итог: цифры из рекламного листка и реальная точность на ваших звонках — это не одна и та же величина. Разрыв может быть в разы.

Почему ошибки неравнозначны

Вернёмся к тому, с чего начали. 50 ошибок на разговор из 1000 слов. Но не все эти ошибки равны по последствиям.

Есть класс ошибок, которые почти безвредны для последующей работы: «эм» вместо «ну», «сказал» вместо «произнёс», пропуск слова-паразита в конце фразы. Смысл сохранён, тег сработает, аналитика пройдёт нормально.

Есть ошибки с умеренным эффектом: неправильно распознанное числительное, перепутанная форма глагола. Конкретный контекст важен — иногда такая ошибка критична, иногда нет.

И есть ошибки, которые разрушают смысл полностью. Именно они опасны для аналитики.

Вот несколько реальных паттернов, которые встречаются в деловой телефонии:

Клиент говорит «не готов подписать» — система распознаёт «готов подписать». Звонок автоматически тегируется как «успешная сделка».

Менеджер произносит название продукта или конкурента — система транскрибирует похожее по звучанию слово. Тег по ключевому слову не срабатывает. Весь этот пласт разговоров выпадает из выборки.

Клиент называет сумму или срок — цифра распознаётся неверно. В CRM попадают неправильные данные.

Академические исследования подтверждают: ASR-системы демонстрируют значительно более высокий уровень ошибок именно на редких словах и именованных сущностях — названиях продуктов, именах людей, специфических терминах. Они редко встречаются в обучающих данных, поэтому модель «видела» их мало и не уверена в распознавании. Обзор на ResearchGate, опирающийся на работы 2021–2024 годов, показывает: системы стабильно занижают точность именно на тех словах, которые чаще всего важны для бизнес-аналитики.

Семантические ошибки как отдельная метрика

Именно поэтому сообщество разработчиков ASR в последние годы активно двигается к метрикам, которые оценивают сохранение смысла, а не буквальное совпадение слов.

Deepgram в 2024 году опубликовал развёрнутый материал о семантическом показателе ошибок как о следующей ключевой метрике для разработчиков платформ. Суть: система оценивает, сохранился ли смысл высказывания, используя векторные представления предложений и косинусное сходство, а не побуквенное сравнение.

Параллельно развивается несколько академических подходов:

Google на конференции ICASSP 2024 представил метод оценки транскрипций с помощью языковой модели — LLM проверяет, сохранил ли транскрипт намерение говорящего по сравнению с эталоном.

SeMaScore (Sasindran et al., 2024) комбинирует традиционный WER с посегментным семантическим сходством — и показывает более высокую корреляцию с реальной пользой транскрипции, чем чистый WER.

Interspeech 2023 включил отдельную секцию по perceptual и task-oriented оценке семантических метрик для ASR, что говорит о зрелости темы.

AssemblyAI в 2026 году выпустил руководство по выбору STT-системы, где прямо рекомендует использовать WER только в связке с Semantic WER и Missed Entity Rate — метрикой пропущенных именованных сущностей.

Практическая разница между метриками становится очевидна на конкретном примере: когда ASR транскрибирует «встреча в 15:00» как «встреча в 17:00», WER фиксирует 20% ошибок (одно слово из пяти неправильно). Семантическая метрика покажет полный провал: критическая информация — время — передана неверно. Именно для задачи (запись во встречу, занесение в CRM) транскрипция стопроцентно неверна.

Что происходит с аналитикой при плохом WER

Плохая транскрипция — это не только эстетическая проблема «некрасивого текста». Это прямой удар по всем задачам, которые строятся поверх транскрибации.

Речевая аналитика работает в несколько этапов: сначала аудио превращается в текст, потом на этот текст навешиваются теги, потом по тегам строится статистика. Каждый этап зависит от качества предыдущего.

Исследования в области обработки естественного языка фиксируют: при ошибках ASR, когда WER превышает 10%, деградация качества последующих задач — классификации тем, определения намерений, поиска ключевых слов — составляет 15–30%. Deepgram в материале по production метрикам приводит аналогичные данные: задачи по обнаружению намерений и классификации тональности деградируют на 15–25 абсолютных процентных пункта без корректной обработки границ предложений.

Это работает через несколько механизмов.

Пропущенный тег. Система ищет в тексте ключевое слово, например «доставка» или «возврат», чтобы пометить разговор определённой темой. Если ключевое слово распознано как что-то другое — тег не срабатывает. Звонок уходит в «некатегоризованные». Руководитель смотрит на долю обращений по возврату — видит 3%. Реальная цифра — 8%. Решение принимается на основе неверных данных.

Сбой в классификации тональности. Одна из задач речевой аналитики — определить, доволен клиент или нет. Если ключевые маркеры недовольства («не устраивает», «разочарован», «хотел бы получить объяснение») распознаны неверно или пропущены — звонок может быть классифицирован как нейтральный. Проблема остаётся невидимой.

Ошибка в разметке по этапам скрипта. В чек-листах обычно есть последовательность шагов: приветствие — выяснение потребности — презентация — работа с возражением — закрытие. Если ключевая фраза этапа не распознана, весь звонок получает неправильную разметку. Статистика по соблюдению скрипта оказывается искажённой.

Проблема с редкими, но важными словами. Названия конкретных продуктов, имена сотрудников, специфические термины отрасли — именно они чаще всего важны для анализа. И именно они чаще всего ошибаются. Система хорошо распознаёт «встреча», «стоимость», «договор» — потому что встречала эти слова миллионы раз. Название специфического программного продукта, редкого препарата или нишевого финансового инструмента — другое дело.

Как LLM помогает, но не решает всё

Современные системы распознавания речи часто включают в пайплайн языковую модель на этапе постобработки: сырой текст из акустической модели доводится до ума с помощью LLM. Это реально помогает — исправляются ошибки пунктуации, восстанавливаются логичные формы слов, иногда угадываются явные искажения.

Но у этого подхода есть предел.

Если акустическая модель распознала «Клименко» как «Климов», LLM исправит это только если у неё есть контекст: например, ранее в разговоре звучало «Алексей Клименко» и имя уже зафиксировано в транскрипте. Без контекста — LLM просто оставит «Климов», потому что это тоже валидное русское имя.

Если название продукта звучит как редкое слово, которого нет в обучающих данных языковой модели, она его угадает как что-то похожее. «Нексиум» может превратиться в «Нексус». «Амоксиклав» — в что угодно со схожей фонетикой.

Ещё острее стоит проблема с аббревиатурами, названиями компаний и отраслевыми терминами, которые не совпадают с правилами «стандартного» русского языка. Транскрипция без специализации будет бороться с ними постоянно.

Зачем нужны доменные словари

Решение, которое давно зарекомендовало себя в ASR-системах — специализированные словари. Это не полный переобучение модели, а относительно лёгкий слой дополнительного контекста: список терминов, имён, аббревиатур и словосочетаний, характерных для конкретной отрасли или компании.

Deepgram в отдельном материале приводит данные: использование ограниченного словаря и кастомизация под домен даёт 20–30% улучшения точности без переобучения модели. NVIDIA в документации по Riva ASR подтверждает: кастомизация через доменные словари — стандартный способ улучшить распознавание специфических терминов.

Академические работы по восстановлению именованных сущностей показывают ещё более значительные цифры: подход с RAG (retrieval-augmented generation) для коррекции ошибок именованных сущностей даёт 42% относительного улучшения точности на редких именованных объектах.

Как это работает на практике: перед распознаванием системе передаётся список слов с приоритетом. Когда акустический сигнал неоднозначен — система предпочитает слова из словаря похожим по звучанию словам из общего лексикона. Менеджер говорит название своего продукта — система «знает», что это слово, и выбирает его, а не фонетически близкое, но случайное слово.

Это принципиально важно для контакт-центров с узкой специализацией: медицина, юриспруденция, финансы, технические продажи. Там доля критически важных редких терминов в разговоре выше, чем в среднем по обучающей выборке модели. И именно там WER на обобщённых тестах даёт наиболее оптимистичную и наиболее обманчивую картину.

Как это работает в imot.io

В imot.io транскрибация — первый шаг. Аудио из звонка превращается в текст, и дальше вся аналитика строится именно на этом тексте: теги, чек-листы, разметка по этапам скрипта, поиск по ключевым словам.

Качество этого первого шага определяет всё остальное.

Мы работаем с реальной телефонией — а значит, с 8 кГц, кодеком, фоновым шумом и спонтанной речью. Именно поэтому на протяжении нескольких лет мы собирали доменные словари по ключевым индустриям, с которыми работаем: медицина, девелопмент, финансы, образование, телекоммуникации.

Словари включают: названия препаратов, процедур и диагнозов для медицинских центров; наименования жилых комплексов, застройщиков и типов планировок для девелоперов; специфическую терминологию финансовых продуктов и страхования; названия тарифов, оборудования и технических параметров для телеком-операторов.

Это не переобучение модели под каждого клиента — это кастомизация, которая работает на уровне словарей и постобработки. Результат: термины, которые стандартная модель распознаёт с ошибкой, у нас попадают в транскрипт правильно. Теги срабатывают точнее. Выборки для анализа полные.

Кроме того, имот.io использует LLM-постобработку поверх транскрипта: это помогает исправлять ошибки, которые акустическая модель допустила в контекстно-зависимых случаях. Но мы понимаем предел этого инструмента — LLM исправляет ошибки, когда контекст достаточен. Словарь страхует в ситуациях, когда его нет.

Что стоит проверить при выборе STT-решения

На рынке много систем с красивыми цифрами на лендинге. Вот что стоит уточнить у любого вендора, прежде чем принимать решение.

На каком аудио тестировалась точность? Если ответ — «на LibriSpeech» или «на наших внутренних чистых тестах» — это не ваша точность. Попросите прогнать модель на реальных записях ваших звонков или хотя бы на телефонном аудио близкого качества.

Есть ли поддержка доменных словарей? Если ваши разговоры насыщены специфической терминологией — общая модель будет ошибаться именно там, где ошибки критичны. Спросите, как именно кастомизируется словарь, насколько это сложно и кто это делает.

Какие метрики они используют? Только WER — красный флаг для аналитических задач. Если вендор не говорит про точность именованных сущностей, про семантическое качество — вы рискуете оценивать систему по метрике, которая не измеряет то, что вам нужно.

Как ведёт себя система на ваших голосах? Акцент, диалектные особенности, темп речи — всё это влияет на точность. Исследование Interspeech 2025 по акцентной вариации зафиксировало 29% WER для нигерийского варианта английского и 26% для шотландского. Русский язык имеет собственные региональные особенности, которые стандартные модели обрабатывают неодинаково.

Как вы узнаете, что точность деградирует? У надёжных систем должен быть мониторинг: если качество транскрипции начинает падать (смена оборудования на стороне клиентов, переход на другой тип телефонии), вы должны это увидеть раньше, чем аналитика начнёт врать.

Итоги

Речевая аналитика строится поверх транскрибации. Качество транскрипции определяет качество всего, что на неё опирается. Это не технический нюанс — это основа.

Несколько практических выводов.

95% точности на лабораторных данных — это стартовая точка, не гарантия. На реальной телефонии те же системы показывают значительно более скромные результаты. Разрыв, зафиксированный Deepgram, — от 2,8 до 5,7 раза — это не исключение, а норма перехода из контролируемой среды в производственную.

WER — необходимая, но недостаточная метрика. Она не различает ошибки по тяжести. Перепутать «не буду» и «буду» — одна ошибка по WER, катастрофа по последствиям. Для оценки реальной пользы транскрипции нужны семантические метрики: Semantic WER, Missed Entity Rate, задачно-ориентированная оценка.

Ошибки в редких, но важных словах — самый опасный класс ошибок для аналитики. Названия продуктов, имена, термины — именно они чаще всего пропадают из тегов и выборок, искажая статистику.

Доменные словари — реальный рабочий инструмент. Deepgram фиксирует 20–30% прирост точности при кастомизации под домен без переобучения модели. Это доступно, и это работает.

LLM на постобработке помогает, но не заменяет хорошую базовую точность. Языковая модель исправляет ошибки в контекстно-зависимых ситуациях, но не угадает редкий термин, которого не было в её обучающих данных.

Прежде чем оценивать систему по цифрам на сайте — попросите прогнать её на ваших реальных звонках. Это займёт день. Зато следующие годы аналитики будут строиться на данных, а не на иллюзии точности.
Источники

Deepgram — ASR Buyer’s Guide: From Benchmarks to Production Tests 2026 — данные о деградации точности от лабораторных условий к production (2.8–5.7x)

Deepgram — Speech Recognition Accuracy: Production Metrics & Optimization 2025 — деградация 15–25 пп при задачах NLP, влияние шума

Deepgram — Semantic Error Rate: The Next ASR Accuracy Metric for Platform Builders — метрика сохранения смысла в ASR

Deepgram — Limited Vocabulary Speech Recognition: 20–30% Better Accuracy in Production — эффект доменных словарей

Deepgram — Noise-Robust Speech Recognition Techniques: Benchmark to Production Guide — WER при разных уровнях шума

AssemblyAI — Word Error Rate is Broken: How to Actually Evaluate STT in 2026 — критика WER, Semantic WER, Missed Entity Rate

AssemblyAI — How Accurate Is Speech-to-Text in 2026? — сравнение точности на чистом и телефонном аудио

Google Research — Assessing ASR Performance with Meaning Preservation (ICASSP 2024) — LLM-оценка сохранения намерения говорящего

Speechmatics — The Problem with Word Error Rate (WER) — ограничения WER как стандартной метрики

ISCA Archive — Perceptual and Task-Oriented Assessment of a Semantic Metric for ASR Evaluation (Interspeech 2023) — perceptual-оценка семантических метрик

arxiv — Semantic Distance: A New Metric for ASR Performance Analysis (2021) — семантическая дистанция как метрика ASR

arxiv — Retrieval Augmented Correction of Named Entity Speech Recognition Errors (2024) — RAG-подход к коррекции именованных сущностей, +42% точности

Frontiers in Signal Processing — Performance Evaluation of ASR on Integrated Noise-Network Distorted Speech (2022) — влияние сетевых помех на WER

VirtualSpeech — Average Speaking Rate and Words Per Minute — средняя скорость разговорной речи 125–150 слов/мин

Vexascribe — How Accurate Is Whisper in 2026? (WER Benchmarks Explained) — падение точности Whisper на телефонном аудио

ScienceDirect — Word Error Rate: Overview and Limitations — академический обзор ограничений WER