GitHub-радар
IndexTTS 2.5: клонирование голоса из одного аудио
Index Team из Bilibili выпустил IndexTTS-2.5 — опенсорс TTS-модель, которая клонирует голос по одному аудиофрагменту и синтезирует речь с 8 управляемыми эмоциями.
IndexTTS-2.5 — опенсорс TTS-модель от Index Team (Bilibili) с нулевым клонированием голоса: одного референсного аудиофрагмента достаточно, чтобы модель захватила тон и тембр голоса. Поддерживает 8 режимов эмоций — счастье, грусть, злость и другие, задаются в промпте. Есть управление скоростью речи и фонетическим произношением. Языки: китайский, английский, японский, испанский, арабский. Русский язык не поддерживается. Требует Python 3.10–3.11 и CUDA-видеокарту ~6 ГБ. Установка: клонировать репозиторий с GitHub, uv sync, запустить инференс через Python.
Зачем это вайб-кодеру
Если вы делаете видео или подкасты на английском и хотите синтезировать уникальный голос или сохранять единый голос ведущего между эпизодами — IndexTTS-2.5 делает это из одного аудиосемпла без облачных сервисов. Полезна для дублирования, озвучки или построения локального TTS-пайплайна с контролем эмоций. Важно: русский язык не поддерживается — для русскоязычной озвучки нужна другая модель.
Как поставить
Скопируйте и отправьте своему агенту — Claude Code, Codex, любому:
Установи IndexTTS-2.5 от Index Team (Bilibili): https://huggingface.co/IndexTeam/IndexTTS-2.5 — следуй README на GitHub, загрузи веса, и синтезируй фрагмент 'Hello, this is a test of voice cloning' с клонированием из референсного аудио. Спроси меня, если нужен референсный файл.
Нужна NVIDIA видеокарта от 6 ГБ видеопамяти — MacBook без дискретной NVIDIA не подойдёт.
Открыть на Hugging Face▌ Ещё находки