← Все новости·2026-09-24·3 мин чтения

Gemini научили создавать голоса с нуля по описанию

Google DeepMind выпустил модели Gemini 3.8 Flash TTS для создания голоса с нуля по текстовому описанию, на тесте Hume AI они заняли первое место по качеству звучания.

aigoogle-deepmindtext-to-speech

Google DeepMind выпустил две новые модели синтеза речи, Gemini 3.8 Flash TTS и облегчённую Flash-Lite TTS. Голос теперь собирают с нуля по словесному описанию акцента и характера, а для точного повтора чужого голоса достаточно тридцатисекундной записи при подтверждённом согласии автора. На тесте Hume AI по дизайну голоса старшая модель заняла первое место с оценкой 71.4, и обе версии уже доступны через Gemini API и Google AI Studio.

Голос по текстовому описанию убирает необходимость в студии и актёре, если в продукте нужна озвучка. Я подключаю голосовые модели в свои проекты через API, и любопытно одно ограничение. Клонирование голоса недоступно в нескольких регионах мира и требует явного согласия автора, это скорее защита от подделки, чем лазейка. Первое место в одном бенчмарке ещё не значит живое звучание в длинном диалоге, это стоит проверить на слух перед тем, как ставить модель в продукт.

Источник: blog.google

Бесплатный курс

Хватит читать про ИИ — начни строить с ним

Бесплатный курс Claude Code: свой первый сайт, инструмент или игра — без программирования. Без апсейлов и кросс-сейлов — здесь нечего купить.

Начать →
ЕАЕвгений Арсентьев

Автор

Евгений Арсентьев

PhD · CEO, digital health