GitHub-радар
Youdao выпустила модель для распознавания речи на лету
NetEase Youdao показала потоковую модель распознавания речи с задержкой меньше секунды — ставится бесплатно и расшифровывает звук почти вживую.
Confucius4-R2T2 — по словам авторов, «быстрая и точная потоковая модель распознавания речи» (true streaming ASR). Сделала её команда NetEase Youdao — китайского сервиса словарей и переводов. Модель слушает речь короткими кусками, от восьмидесяти миллисекунд до двух секунд, и сразу выдаёт текст — не ждёт конца фразы и не переписывает уже сказанное. Задержка в среднем от 200 до 600 миллисекунд, а точность авторы называют близкой к обычному, не потоковому распознаванию. В основе лежит модель Qwen3-ASR на 1,7 миллиарда параметров от Alibaba, дообученная командой Youdao. Кроме китайского и английского распознаёт ещё десяток языков, включая русский. Весит модель около двух миллиардов параметров — это немного, ставится на обычный ноутбук.
Зачем это вайб-кодеру
Для нашей контент-фабрики это про субтитры и озвучку в реальном времени: текст выходит с задержкой меньше секунды, значит подходит для живых трансляций или быстрой расшифровки роликов. Сильная сторона — скорость: другие потоковые модели такую задержку редко держат. Слабая сторона — модель в первую очередь заточена под китайский и английский, для русского точность так же строго не гарантирована. Поставить можно бесплатно и без чужих ключей, но потребуется Docker и немного возни с настройкой — это не готовое приложение в одну кнопку.
Как поставить
Скопируйте и отправьте своему агенту — Claude Code, Codex, любому:
Поставь мне модель распознавания речи Confucius4-R2T2 от NetEase Youdao: https://huggingface.co/netease-youdao/Confucius4-R2T2 — разверни её локально по инструкции из карточки (через Docker) и покажи, как отправить ей аудио и получить текст почти в реальном времени.
Обычный ноутбук от 8 ГБ оперативки — модель весит около 4 ГБ.
Открыть на Hugging Face▌ Ещё находки