Распознавание речи и автоматический протокол совещания
Пока участники расходятся, протокол уже готов: темы, решения, поручения с исполнителем и сроком. Русская речь распознаётся и там, где обычные модели сдаются — спикерфон в переговорной, телефон, мобильная связь.
Универсальное распознавание речи разваливается на реальном совещании
Массовые модели учили на чистой студийной записи. Но переговоры идут иначе: полудуплексный спикерфон в углу переговорной, коллега на громкой связи из машины, подрядчик по городскому телефону. Точность падает — и в протоколе появляются чужие фамилии, перевранные суммы и несуществующие поручения.
Мы обучали модель на этом звуке специально. Телефонные кодеки, эхо и реверберация переговорных, узкая полоса мобильной связи, фоновый шум. Отдельный этап обучения — дальнее поле: микрофон в трёх метрах от говорящего. Поэтому там, где универсальная модель теряет до 9 пунктов точности, CleverText держит результат.
Точнее на всех пяти профилях связи
Точность считаем долей ошибок распознавания (WER: чем меньше, тем лучше) на пяти профилях, которые воспроизводят реальные каналы связи. Слева — популярная открытая русскоязычная модель, справа — CleverText. Набор один и тот же.
| Условия записи | Открытая модель | CleverText | Разница |
|---|---|---|---|
| Студийный звук | 11,0% | 5,4% | −5,6 п.п. |
| Браузер / WebRTC | 11,9% | 7,9% | −4,0 п.п. |
| Спикерфон в переговорной | 17,0% | 11,9% | −5,1 п.п. |
| Настольный SIP-телефон | 16,9% | 13,4% | −3,5 п.п. |
| Мобильная связь, узкая полоса | 19,8% | 16,6% | −3,2 п.п. |
Внутренние замеры на наборе Golos test с моделированием каналов связи. Методику присылаем по запросу. Точность на конкретной встрече зависит от канала и загруженного словаря терминов.
От звука в переговорной до поручения в работе
Заточена под совещания
Знает ваши фамилии и термины
Расшифровка в прямом эфире
Кто что сказал
Протокол, а не полотно текста
Три шага — и ни одной минуты ручной расшифровки
Подключается к вашей видеосвязи
Слышит каждого участника отдельно — и тех, кто в браузере, и тех, кто дозвонился с мобильного или сидит в переговорной у спикерфона.
Расшифровывает по ходу встречи
Текст идёт в реальном времени, с именами участников, вашей терминологией и расставленной пунктуацией. Ждать окончания совещания не нужно.
Отдаёт готовый протокол
Темы, принятые решения, поручения с исполнителем и сроком, открытые вопросы. Структурированно — забирайте в свою систему и рассылайте.
Начните в облаке — переедете на свой сервер, когда решите
Модель, качество распознавания и способ подключения одинаковые. При переезде в своём коде вы меняете только адрес.
Без закупки сервера с GPU
Подключение за день, оплата по подписке. Тендер на оборудование, согласование бюджета и монтаж в стойку — потом и по желанию.
- Ускорители NVIDIA A100 в российском дата-центре
- Данные не покидают территорию России
- Изолированный контур под 152-ФЗ — по запросу
- Переезд в свой контур без переделки интеграции
Записи не выходят за периметр
Движок ставится на ваше оборудование и работает автономно — в том числе в сети, физически отключённой от интернета.
- Работа без доступа в интернет
- Ни телеметрии, ни обращений наружу
- Веса модели передаются вместе с поставкой
- Стартовая конфигурация — одна карта NVIDIA L4
Встраивается в вашу видеосвязь, а не заменяет её
Подключение идёт по открытому gRPC-интерфейсу. Медиа-инфраструктуру, лицензии на ВКС и привычки пользователей менять не придётся — CleverText добавляет расшифровку поверх того, что уже работает.
- Протокол
- gRPC с двунаправленным потоком. Запрос возможностей, передача аудио, приём расшифровки и готового протокола.
- Аудио
- PCM 16 кГц моно. Источники — веб-участники, SIP-телефоны, аппаратные кодеки переговорных.
- Контекст встречи
- Повестка, участники, словарь терминов и вложенные документы передаются на старте сессии.
- Результат
- Текст с временными метками, события по спикерам и итоговый протокол в JSON.
Где это окупается быстрее всего
Госсектор и регулируемые отрасли
Крупный бизнес
Распределённые команды
Переговорные и залы
Частые вопросы
Чем стенограмма отличается от протокола совещания?
Можно ли установить распознавание речи в закрытом контуре, без доступа в интернет?
С какими системами видеоконференций работает CleverText?
Как соблюдаются требования 152-ФЗ?
Какая точность распознавания русской речи?
Нужно ли переобучать модель под нашу терминологию?
Проверьте на своих записях
Пришлите пару записей совещаний и список ваших терминов — вернём расшифровку и протокол, чтобы вы сравнили с тем, что есть сейчас.
Запросить демонстрацию