Google запустил Gemini 3.8 Flash TTS с 2000 голосами и клонированием
Google выпустил две модели синтеза речи Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS. Flash предназначена для творческой работы с режиссурой по строкам и характеризацией персонажей, Flash-Lite оптимизирована для больших объёмов с фокусом на цену. Модели генерируют голос по текстовому описанию, поддерживают более 100 языков и диалектов, располагают 2000 готовых голосов с региональными вариантами, клонируют голос по 30-секундному сэмплу с водяным знаком SynthID и воспроизводят естественные звуки — смех, вздохи, перебивания.
По бенчмаркам Hume AI и Voice Arena модели занимают первые места по качеству и акцентам, особенно на азиатских и латиноамериканских языках. Клонирование голоса недоступно в ЕС, Великобритании, Швейцарии, Индии, Иллинойсе и Техасе.
Источник: Метаверсище и ИИще
Новости этого рынка выходят у нас в телеграме первыми — @wikicompass.
Комментарии из открытых обсуждений в телеграме, приведены дословно. Мнение авторов не редакция.