Перейти к содержанию
Clever Text
Для технических специалистов

Интеграция: программный интерфейс gRPC

CleverText подключается к вашей системе видеосвязи по открытому описанному интерфейсу. Ниже — что передавать, что придёт в ответ и на что рассчитывать по нагрузке.

Сценарии подключения

Три способа отдать звук

01

Поток во время встречи

Ваш сервер видеосвязи отдаёт голос участников по мере разговора и получает текст обратно. Так работает живая расшифровка.

02

Обработка записи

Готовый файл встречи отправляется целиком и обрабатывается быстрее реального времени. Подходит для архива.

03

Участник-протоколист

В конференцию заходит служебный участник, который слышит всех и ведёт запись. Вариант для систем, которые не отдают звук наружу.

Что передаётся

Описание интерфейса

Интерфейс двусторонний: вы отправляете звук и сведения о встрече, в ответ получаете текст по мере распознавания. Полное описание с примерами вызовов высылаем вместе с тестовым доступом.

Начало сессии
Повестка, список участников, словарь терминов и вложенные документы встречи.
Звук
PCM 16 кГц, один канал, кадры по 20–40 миллисекунд, с признаком участника.
Промежуточный текст
Уточняется по ходу фразы. Задержка 0,35–0,51 секунды.
Окончательный текст
Фраза целиком, с отметками времени и говорящим. Больше не меняется.
Итог встречи
Протокол в машиночитаемом виде: темы, решения, поручения, открытые вопросы.
Запрос возможностей
Перед началом работы можно узнать, какие функции доступны на этой установке.
Нагрузка

На что рассчитывать при планировании

Одновременные встречи
До 8 на одной NVIDIA A100 80 ГБ с формированием протокола, до 16 при распознавании без него.
Обработка записи
Примерно в триста раз быстрее реального времени.
Восстановление связи
Сессия возобновляется с отметки времени, распознанное не теряется.
Защита канала
Шифрование и проверка сторон по сертификатам вашего удостоверяющего центра.

Частые вопросы

Нужно ли менять нашу систему видеоконференций?
Нет. CleverText не заменяет систему видеосвязи и не встраивается в её код. Он подключается сбоку и получает звук участников, поэтому медиа-инфраструктура, лицензии и привычки сотрудников остаются прежними.
В каком формате передаётся звук?
Несжатый звук PCM, 16 кГц, один канал, кадрами по 20–40 миллисекунд. Исходные телефонные кодеки G.711, G.722 и Opus обрабатываются после декодирования на стороне вашей системы видеосвязи.
Что возвращает система во время встречи?
Промежуточный текст, который уточняется по ходу фразы, и окончательный текст фразы с отметками времени и признаком говорящего. После завершения встречи приходит собранный протокол в машиночитаемом виде.
Что будет, если связь с движком прервётся посреди встречи?
Сессия возобновляется с указанной отметки времени, уже распознанный текст не теряется. Система видеосвязи при этом продолжает работать: расшифровка идёт отдельным потоком и на саму конференцию не влияет.
Почему в описании интерфейса встречается прежнее название?
Внутренние идентификаторы интерфейса остались от первой версии продукта. Мы намеренно их не переименовываем: имя пакета входит в адрес вызова, и его смена разом сломала бы связь у всех, кто уже подключился. Пользователь эти идентификаторы не видит, а на совместимость они работают.

Пришлём описание интерфейса и тестовый доступ

Напишите, какая у вас система видеосвязи и как вы планируете забирать результат, — подберём сценарий подключения.

Получить тестовый доступ