Whisper плюс диаризация
Распознавание речи Whisper и разделение по говорящим (pyannote): в тексте видно, где реплика одного человека, а где другого.
Собственный продукт · Звонки и планёрки
Час совещания — это час прослушивания, если нужно вытащить, кто что пообещал. Сервис расшифровывает запись, разделяет говорящих и отдаёт готовый текст с таймкодами: дальше по нему можно искать, цитировать и собирать протокол.
Задача
Разговоры, планёрки и вебинары длятся часами, а типовые онлайн-расшифровщики принимают короткие куски: мы проверяли лимиты сервисов из первой десятки выдачи — там обычно 10–30 минут на файл. Длинную запись приходится резать вручную, а потом руками же склеивать текст.
Проверить можно самому. Сервис открыт и работает — можно загрузить свою запись и посмотреть, что получится. Продукт открыт по адресу audio.scifinews.ru.
Что делали
Это не обёртка над чужим API: распознавание и разделение говорящих считаются на нашем оборудовании, поэтому длина файла упирается в наши правила, а не в чужой тариф.
Распознавание речи Whisper и разделение по говорящим (pyannote): в тексте видно, где реплика одного человека, а где другого.
RTX 2060 на 12 ГБ, 2070 и 3070 — задачи распределяются между ними, длинная запись не блокирует остальную очередь.
Ограничения выставлены нами и указаны прямо на сервисе — совещание или вебинар целиком не нужно резать на куски.
Архив с записями можно загрузить одной пачкой, а не по одному файлу за раз.
SRT и VTT — субтитры к видео, TXT — читаемый текст, JSON — для дальнейшей обработки, ZIP — всё сразу.
Вход, свои файлы, повторное скачивание результата — а не одноразовая форма, где расшифровка теряется после закрытия вкладки.
Результат
Ниже только те цифры, которые мы сами замерили или зафиксировали в коде и документах продукта. Под каждой стоит источник. Отзывов и логотипов клиентов на этой странице нет — подтверждённых у продукта пока нет, а рисовать их мы не станем.
2 ГБ
максимальный размер одного файла
Источник: лимит опубликован на самом сервисе
24 ч
максимальная длительность записи
Источник: лимит опубликован на самом сервисе
1000
файлов в одном архиве за загрузку
Источник: лимит опубликован на самом сервисе
10–30 мин
типовой лимит у сервисов из первой десятки выдачи — то, с чем мы сравнивались
Источник: наш замер конкурентов, C:\audio-seo
Чего мы не обещаемМы не публикуем процент точности распознавания: замера, который можно предъявить, у нас нет, а чужую цифру перепечатывать нечестно. Точность зависит от качества записи и телефонной линии — как у любого распознавания речи.
Ограничения, о которых честнее сказать сразуСкорость на длинных записях зависит от загрузки очереди: видеокарт три, и когда они заняты, задача ждёт. Для потока звонков это учитывается отдельно.
Остальные продукты
Каждый можно открыть и попробовать — это не концепции и не питчи.
Что дальше
Текст сам по себе экономит время, но выводы из него делает уже речевая аналитика: возражения, отработка скрипта, слабые места разговора.
Заявка
Напишите, что за записи и сколько их — звонки, совещания, вебинары. Скажем, как быстро это пройдёт через очередь.