Nvidia выпустила модель для разметки спикеров в аудио на 100 млн параметров
Nvidia открыла веса модели Nemotron 3 Diarization, которая размечает аудиозаписи по говорящим — определяет, кто и когда говорит, включая моменты перебивания. Модель работает на потоке, различает до восьми собеседников (вдвое больше, чем предыдущая версия) и обрабатывает записи неограниченной длины фрагментами по 80 миллисекунд.
Архитектура основана на 31-слойном трансформерном энкодере с RoPE — на выходе модель выдаёт для каждых 10 мс вероятность речи каждого участника. Метки говорящих остаются анонимными, но приложение может связать их с конкретными именами через заранее определённый список спикеров.
Источник: Machinelearning
Что мы знаем о компании
NVIDIA
- инженер
- Даниэль Хан
Новости этого рынка выходят у нас в телеграме первыми — @wikicompass.