Перейти к содержанию

Microsoft выпустила модель распознавания речи VibeVoice-ASR-Streaming-7B

7.0/10

Компания Microsoft опубликовала на платформе Hugging Face модель автоматического распознавания речи VibeVoice-ASR-Streaming-7B с открытыми весами. Данная нейросеть содержит 7 миллиардов параметров и оптимизирована для потоковой транскрипции аудиопотока в реальном времени. Релиз предоставляет разработчикам новый инструмент для развертывания локальных систем обработки речи и создания интерактивных ИИ-сервисов.

Контекст

Традиционные модели автоматического распознавания речи (ASR) преимущественно ориентированы на офлайн-обработку готовых записей, что затрудняет их использование в сервисах реального времени. Потоковый формат распознавания (streaming ASR) позволяет транскрибировать входящий аудиосигнал с минимальной задержкой, что необходимо для интерактивных голосовых помощников и агентов. Современные сквозные (end-to-end) архитектуры стремятся объединить расшифровку текста, атрибуцию спикеров и обработку ключевых слов внутри единой модели [tool-1-2, tool-1-3].

Влияние

Появление открытой модели VibeVoice-ASR-Streaming-7B дает разработчикам инструмент для интеграции потоковой обработки речи в реальном времени, однако её деплой в продакшене требует мощных графических ускорителей уровня NVIDIA A100.

Обсуждение в сообществе

Пользователи интересуются практическими результатами тестирования и обсуждают целесообразность интеграции модели в сторонние библиотеки, такие как audio.cpp. При этом некоторые участники иронизируют над политикой публикаций компании, шутя о возможном скором удалении репозитория.

Источники