Перейти к содержанию
Clever Text
Отечественная разработка · для организаций

Распознавание речи и автоматический протокол совещания

Пока участники расходятся, протокол уже готов: темы, решения, поручения с исполнителем и сроком. Русская речь распознаётся и там, где обычные модели сдаются — спикерфон в переговорной, телефон, мобильная связь.

Установка в вашем контуре Требования 152-ФЗ
5 из 5
профилей связи точнее открытой модели
94%
имён и терминов распознаются верно
< 1 сек
задержка живой расшифровки
≈300×
быстрее реального времени на записи
В чём подвох обычной транскрибации

Универсальное распознавание речи разваливается на реальном совещании

Массовые модели учили на чистой студийной записи. Но переговоры идут иначе: полудуплексный спикерфон в углу переговорной, коллега на громкой связи из машины, подрядчик по городскому телефону. Точность падает — и в протоколе появляются чужие фамилии, перевранные суммы и несуществующие поручения.

Мы обучали модель на этом звуке специально. Телефонные кодеки, эхо и реверберация переговорных, узкая полоса мобильной связи, фоновый шум. Отдельный этап обучения — дальнее поле: микрофон в трёх метрах от говорящего. Поэтому там, где универсальная модель теряет до 9 пунктов точности, CleverText держит результат.

Замеры точности

Точнее на всех пяти профилях связи

Точность считаем долей ошибок распознавания (WER: чем меньше, тем лучше) на пяти профилях, которые воспроизводят реальные каналы связи. Слева — популярная открытая русскоязычная модель, справа — CleverText. Набор один и тот же.

Условия записи Открытая модель CleverText Разница
Студийный звук 11,0% 5,4% −5,6 п.п.
Браузер / WebRTC 11,9% 7,9% −4,0 п.п.
Спикерфон в переговорной 17,0% 11,9% −5,1 п.п.
Настольный SIP-телефон 16,9% 13,4% −3,5 п.п.
Мобильная связь, узкая полоса 19,8% 16,6% −3,2 п.п.

Внутренние замеры на наборе Golos test с моделированием каналов связи. Методику присылаем по запросу. Точность на конкретной встрече зависит от канала и загруженного словаря терминов.

−48%
ошибок на репликах с фамилиями и редкими терминами, когда загружен словарь встречи
74% → 94%
рост узнаваемости имён собственных. Словарь подключается на старте встречи, переобучать модель не нужно
0,97
F1 по извлечению поручений во внутренней оценке. По решениям — 0,76
Возможности

От звука в переговорной до поручения в работе

01

Своя модель, а не перепродажа API

Мы обучаем модель сами и передаём её веса вместе с поставкой. Никакой зависимости от чужого облачного сервиса, его тарифов и его доступности завтра.
02

Заточена под совещания

Спикерфон, переговорная, SIP-телефония, мобильный мост. Мы учили модель ровно на тех каналах, где проходят ваши встречи, а не на студийных начитках.
03

Знает ваши фамилии и термины

Загрузите список сотрудников, продуктов и внутренних сокращений — и распознавание имён вырастет с 74% до 94%. Без переобучения, словарь применяется на старте встречи.
04

Расшифровка в прямом эфире

Текст появляется по ходу разговора, задержка меньше секунды. Итоговая точность при этом такая же, как при офлайн-обработке записи.
05

Кто что сказал

Каждая реплика привязана к участнику. Даже когда четверо говорят в один микрофон в переговорной — спикеры разделяются по голосу.
06

Протокол, а не полотно текста

Темы, решения, поручения с исполнителем и сроком, открытые вопросы. Структурировано и машиночитаемо — сразу в вашу систему.
Как это устроено

Три шага — и ни одной минуты ручной расшифровки

01

Подключается к вашей видеосвязи

Слышит каждого участника отдельно — и тех, кто в браузере, и тех, кто дозвонился с мобильного или сидит в переговорной у спикерфона.

02

Расшифровывает по ходу встречи

Текст идёт в реальном времени, с именами участников, вашей терминологией и расставленной пунктуацией. Ждать окончания совещания не нужно.

03

Отдаёт готовый протокол

Темы, принятые решения, поручения с исполнителем и сроком, открытые вопросы. Структурированно — забирайте в свою систему и рассылайте.

Развёртывание

Начните в облаке — переедете на свой сервер, когда решите

Модель, качество распознавания и способ подключения одинаковые. При переезде в своём коде вы меняете только адрес.

Облако

Без закупки сервера с GPU

Подключение за день, оплата по подписке. Тендер на оборудование, согласование бюджета и монтаж в стойку — потом и по желанию.

  • Ускорители NVIDIA A100 в российском дата-центре
  • Данные не покидают территорию России
  • Изолированный контур под 152-ФЗ — по запросу
  • Переезд в свой контур без переделки интеграции
Как устроено облако
Свой сервер

Записи не выходят за периметр

Движок ставится на ваше оборудование и работает автономно — в том числе в сети, физически отключённой от интернета.

  • Работа без доступа в интернет
  • Ни телеметрии, ни обращений наружу
  • Веса модели передаются вместе с поставкой
  • Стартовая конфигурация — одна карта NVIDIA L4
Требования и установка
Интеграция

Встраивается в вашу видеосвязь, а не заменяет её

Подключение идёт по открытому gRPC-интерфейсу. Медиа-инфраструктуру, лицензии на ВКС и привычки пользователей менять не придётся — CleverText добавляет расшифровку поверх того, что уже работает.

Описание интерфейса
Протокол
gRPC с двунаправленным потоком. Запрос возможностей, передача аудио, приём расшифровки и готового протокола.
Аудио
PCM 16 кГц моно. Источники — веб-участники, SIP-телефоны, аппаратные кодеки переговорных.
Контекст встречи
Повестка, участники, словарь терминов и вложенные документы передаются на старте сессии.
Результат
Текст с временными метками, события по спикерам и итоговый протокол в JSON.
Кому подходит

Где это окупается быстрее всего

Госсектор и регулируемые отрасли

Изолированный контур, записи совещаний не уходят наружу.

Крупный бизнес

Сотни совещаний в неделю — и ни одного секретаря за расшифровкой.

Распределённые команды

Половина участников на мобильной связи — и это больше не проблема.

Переговорные и залы

Спикерфоны и аппаратные SIP-кодеки вместо гарнитур у каждого.

Частые вопросы

Чем стенограмма отличается от протокола совещания?
Стенограмма — дословная запись всего, что прозвучало, с указанием говорящих и времени. Протокол — краткий официальный документ: обсуждённые темы, принятые решения, поручения с исполнителем и сроком, открытые вопросы. CleverText готовит из одной записи оба документа, поэтому выбирать заранее не нужно.
Можно ли установить распознавание речи в закрытом контуре, без доступа в интернет?
Да. Движок ставится на сервер организации и работает полностью автономно: обращений наружу нет, телеметрия не собирается. Обновления передаются дистрибутивом и устанавливаются вручную — так же, как в изолированных сетях обновляют любое другое программное обеспечение.
С какими системами видеоконференций работает CleverText?
С любой, которая умеет отдавать звук участников. Подключение идёт по программному интерфейсу gRPC, менять вашу систему видеосвязи и переучивать сотрудников не требуется. Дозвонившиеся с телефона и переговорные с аппаратными кодеками обрабатываются наравне с участниками из браузера.
Как соблюдаются требования 152-ФЗ?
При установке на вашем сервере записи вообще не покидают организацию, поэтому вопрос передачи данных не возникает. В облаке обработка идёт на наших серверах в российском дата-центре, записи не передаются третьим лицам и не используются для обучения моделей. Для проектов с персональными данными выделяем отдельный контур и приводим его к нужному уровню защищённости — состав мер определяется по вашей модели угроз.
Какая точность распознавания русской речи?
На записях совещаний доля ошибок в словах составляет от 5,4% на чистом звуке до 16,6% на узкополосной мобильной связи. Мы не заявляем «99% точности»: эта цифра ничего не значит без указания канала записи. Точность на ваших данных проверяем на ваших же записях до договора.
Нужно ли переобучать модель под нашу терминологию?
Нет. Список фамилий, названий продуктов и внутренних сокращений загружается как словарь на старте встречи. На нашем тесте это повышает узнаваемость имён собственных с 74% до 94%. Переобучение модели не требуется и не оплачивается отдельно.

Проверьте на своих записях

Пришлите пару записей совещаний и список ваших терминов — вернём расшифровку и протокол, чтобы вы сравнили с тем, что есть сейчас.

Запросить демонстрацию