2026-09-24 · NVIDIA · ИТ и разработка

Nvidia выпустила модель для разметки спикеров в аудио на 100 млн параметров

Nvidia выпустила модель для разметки спикеров в аудио на 100 млн параметров

Nvidia открыла веса модели Nemotron 3 Diarization, которая размечает аудиозаписи по говорящим — определяет, кто и когда говорит, включая моменты перебивания. Модель работает на потоке, различает до восьми собеседников (вдвое больше, чем предыдущая версия) и обрабатывает записи неограниченной длины фрагментами по 80 миллисекунд.

Архитектура основана на 31-слойном трансформерном энкодере с RoPE — на выходе модель выдаёт для каждых 10 мс вероятность речи каждого участника. Метки говорящих остаются анонимными, но приложение может связать их с конкретными именами через заранее определённый список спикеров.

Источник: Machinelearning

Что мы знаем о компании NVIDIA
инженер
Даниэль Хан

Новости этого рынка выходят у нас в телеграме первыми — @wikicompass.

Все новости