OpenMOSS выпустила модель для транскрибации и диаризации в один проход
Команда OpenMOSS анонсировала MOSS-Transcribe-Diarize — модель на 0,9B параметров, которая объединяет транскрибацию речи, определение спикеров и расстановку таймкодов в единый процесс без промежуточных этапов. Вместо каскадного конвейера из трёх отдельных моделей (ASR, диаризация, выравнивание) новая архитектура работает за один проход и обрабатывает до 90 минут непрерывного аудио без предварительной нарезки на чанки.
Модель поддерживает 50+ языков с автоматическим распознаванием и управляющие промпты. Это упрощает построение голосовых AI-пайплайнов для ассистентов совещаний, транскрибации звонков и видеоаналитики, снижая накопление ошибок на стыках между компонентами.
Источник: источник
Новости этого рынка выходят у нас в телеграме первыми — @wikicompass.