Microsoft представила VibeVoice-ASR для распознавания речи

Привет! Команда Microsoft Research презентовала VibeVoice-ASR — нейросетевую модель, способную распознавать речь и разделять спикеров. Я, Илья, основатель ArtGeneration.me и увлечённый фанат нейросетей, создал портативную версию стемы, которую тестировал на Windows. Я использовал Whisper для транскрипций своих видео, но его качество немного разочаровывало.

VibeVoice-ASR уникальна: она обрабатывает до 60 минут аудио за один проход, предоставляя структурированную транскрипцию с отметками, кто говорит. Модель использует двойную систему токенизации и контекстное окно в 64K токенов, что позволяет избегать обрывов контекста.

Модель поддерживает 51 язык, включая русский. Она пригодится подкастерам, аналитикам и разработчикам, предлагая автоматическое создание субтитров и четкие временные метки для каждого сегмента речи. Я подготовил русифицированную версию VibeVoice-ASR Portable, которая делает установку простой и быстрой. Приглашаю вас ознакомиться с технологией — делитесь мнением в комментариях!

Понравилась статья? Поделиться с друзьями:
Сайт для студентов