GitHub-радар

Youdao выпустила модель для распознавания речи на лету

NetEase Youdao показала потоковую модель распознавания речи с задержкой меньше секунды — ставится бесплатно и расшифровывает звук почти вживую.

01netease-youdao/Confucius4-R2T2 4005.8k загрузок/мес2B параметровautomatic-speech-recognition

Confucius4-R2T2 — по словам авторов, «быстрая и точная потоковая модель распознавания речи» (true streaming ASR). Сделала её команда NetEase Youdao — китайского сервиса словарей и переводов. Модель слушает речь короткими кусками, от восьмидесяти миллисекунд до двух секунд, и сразу выдаёт текст — не ждёт конца фразы и не переписывает уже сказанное. Задержка в среднем от 200 до 600 миллисекунд, а точность авторы называют близкой к обычному, не потоковому распознаванию. В основе лежит модель Qwen3-ASR на 1,7 миллиарда параметров от Alibaba, дообученная командой Youdao. Кроме китайского и английского распознаёт ещё десяток языков, включая русский. Весит модель около двух миллиардов параметров — это немного, ставится на обычный ноутбук.

Зачем это вайб-кодеру

Для нашей контент-фабрики это про субтитры и озвучку в реальном времени: текст выходит с задержкой меньше секунды, значит подходит для живых трансляций или быстрой расшифровки роликов. Сильная сторона — скорость: другие потоковые модели такую задержку редко держат. Слабая сторона — модель в первую очередь заточена под китайский и английский, для русского точность так же строго не гарантирована. Поставить можно бесплатно и без чужих ключей, но потребуется Docker и немного возни с настройкой — это не готовое приложение в одну кнопку.

Как поставить

Скопируйте и отправьте своему агенту — Claude Code, Codex, любому:

Поставь мне модель распознавания речи Confucius4-R2T2 от NetEase Youdao: https://huggingface.co/netease-youdao/Confucius4-R2T2 — разверни её локально по инструкции из карточки (через Docker) и покажи, как отправить ей аудио и получить текст почти в реальном времени.

Обычный ноутбук от 8 ГБ оперативки — модель весит около 4 ГБ.

Открыть на Hugging Face