Перейти к содержанию
Clever Text
Замеры

Точность распознавания речи: как мы её измеряем

Мы не пишем «точность 99%». Такая цифра ничего не сообщает, пока не сказано, на какой записи она получена. Ниже — доля ошибок по типам каналов связи и условия, в которых её можно повторить.

Как читать цифры

Доля ошибок в словах, а не «процент точности»

WER показывает, какая часть слов распознана неверно: пропущена, добавлена лишней или заменена другой. Чем меньше — тем лучше. Пять строк ниже соответствуют пяти способам подключиться к совещанию.

Условия записи Открытая модель CleverText Разница
Студийный звук 11,0% 5,4% −5,6 п.п.
Браузер / веб-подключение 11,9% 7,9% −4,0 п.п.
Спикерфон в переговорной 17,0% 11,9% −5,1 п.п.
Настольный телефон 16,9% 13,4% −3,5 п.п.
Мобильная связь, узкая полоса 19,8% 16,6% −3,2 п.п.

Разница указана в процентных пунктах. Больше всего выигрыш там, где универсальные модели проседают сильнее всего: на телефонии и в переговорных.

Имена и термины

Отдельная метрика для фамилий и специальных слов

Общий процент ошибок скрывает главную боль делопроизводства: перевранные фамилии и названия. Поэтому мы меряем их отдельно.

74% → 94%
доля верно распознанных имён собственных после загрузки словаря встречи
−48%
снижение доли ошибок на репликах, где звучат фамилии и редкие термины
0,97 / 0,76
полнота извлечения поручений и принятых решений во внутренней оценке
Методика

Условия, в которых цифры можно повторить

Замер без описания условий — это реклама, а не измерение. Полную методику с параметрами моделирования каналов высылаем по запросу.

Запросить методику замера
Набор данных
Открытый корпус русской речи Golos, тестовая часть — включая записи с дальнего микрофона.
Моделирование каналов
Телефонные кодеки, сужение полосы, отражения звука в помещении, фоновый шум.
Что считается ошибкой
Пропущенное, лишнее и неверно распознанное слово после приведения текста к единому виду.
Задержка в прямом эфире
Промежуточный текст появляется за 0,35–0,51 секунды. Итоговая точность равна точности обработки записи.
Скорость обработки записи
Примерно в триста раз быстрее реального времени на серверной видеокарте.

Частые вопросы

Что такое WER и почему «точность 99%» ничего не значит?
WER (word error rate) — доля ошибок в словах: сколько слов система вставила лишними, потеряла или распознала неверно, поделённое на общее число слов. Цифра «точность 99%» бессмысленна без указания, на какой записи её получили: на чистой студийной начитке её показывает почти любая современная система, а на телефонном канале не показывает никто.
На каком материале вы замеряли точность?
Основа — открытый набор русской речи Golos, к которому применяется моделирование реальных каналов связи: телефонные кодеки, сужение полосы, отражения звука в помещении, фоновый шум. Это позволяет сравнивать системы на одинаковых условиях и воспроизводить замер.
С чем вы сравниваете свои результаты?
С популярной открытой русскоязычной моделью, запущенной без дополнительной настройки, на том же самом наборе. Сравнений с коммерческими системами других поставщиков мы не публикуем: корректно замерить их в одинаковых условиях мы не можем, а некорректное сравнение хуже его отсутствия.
Какая точность будет на наших записях?
Зависит от того, как к вам подключаются участники и насколько специфична ваша терминология. Поэтому мы не называем цифру заранее, а замеряем на ваших записях до договора и показываем результат.
Насколько точно система извлекает поручения?
Извлечение поручений измеряется не через WER, а через полноту и точность извлечения. Во внутренней оценке F1 по поручениям составил 0,97, по принятым решениям — 0,76. Решения даются труднее: в живом разговоре договорённость часто формулируется расплывчато.

Посчитаем точность на ваших записях

Пришлите несколько типичных записей совещаний — вернём расшифровку и посчитаем долю ошибок именно на вашем материале.

Запросить демонстрацию