Alibaba снизила цены на голосовые модели Qwen Audio 3.1
Alibaba выпустила пять моделей Qwen-Audio-3.1 для распознавания и синтеза речи и снизила цены: TTS почти на 70%, реальное время на 85%, ASR до 95%.
Alibaba выпустила пять новых аудио-моделей линейки Qwen-Audio-3.1. Модели ASR и ASR-Next распознают речь на нескольких языках и диалектах и различают говорящих по голосу и по эмоциям, а TTS и TTS-Next озвучивают текст и переносят голос между языками с управлением интонацией через обычный текстовый запрос. Вместе с релизом Alibaba снизила цены: TTS подешевел примерно на 70%, модель реального времени — примерно на 85%, а ASR — до 95%.
Тут ценность не в новом качестве, а в цене: в источнике нет ни одного бенчмарка, только список функций и новые тарифы на API. Я слежу за такими релизами, потому что голосовой канал у агентов остаётся одним из самых дорогих мест в цепочке, и снижение цены на 70-95% на разных моделях этот счёт заметно меняет. Но цифры пока только от самой Alibaba, без независимой проверки, и я бы сначала прогнал задачи на своих кейсах, а потом переносил их в продакшн.
Источник: the-decoder.com
Бесплатный курс
Хватит читать про ИИ — начни строить с ним
Бесплатный курс Claude Code: свой первый сайт, инструмент или игра — без программирования. Без апсейлов и кросс-сейлов — здесь нечего купить.
Начать →
Автор
Евгений Арсентьев
PhD · CEO, digital health
Статьи · Свежие статьи