ElevenLabs выпустила модель озвучки v4
ElevenLabs выпустила v4 и v4 Turbo: больше 90 языков вместо 70, клонирование голоса по десяти секундам записи и звук без паузы перед ответом.
ElevenLabs выпустила новую модель озвучки v4 и облегчённую версию v4 Turbo 28 сентября. Она поддерживает больше 90 языков вместо 70 у прошлой версии v3, самый заметный скачок качества — в японском, бразильском португальском, мандаринском и кантонском. Голос теперь можно клонировать по десяти секундам записи, а не по более длинному образцу, как раньше.
Мне тут интереснее снижение задержки, чем рост числа языков: в голосовых агентах пользователь чувствует паузу перед ответом в первую же секунду разговора. У v4 звук начинает генерироваться сразу, как только языковая модель выдаёт первые слова ответа, а не после того, как весь текст готов. Клонировать голос по десяти секундам записи вместо долгой сессии тоже практично: с коротким образцом проще быстро собрать голос для агента поддержки, не заставляя человека наговаривать длинный текст.
Источник: techcrunch.com
Бесплатный курс
Хватит читать про ИИ — начни строить с ним
Бесплатный курс Claude Code: свой первый сайт, инструмент или игра — без программирования. Без апсейлов и кросс-сейлов — здесь нечего купить.
Начать →
Автор
Евгений Арсентьев
PhD · CEO, digital health
Статьи · Свежие статьи