GitHub-радар
Audio8 ASR Infinite: бесконечный поток моделей распознавания речи
Edge0 опубликовала долговременно стабильную потоковую ASR-модель, которая не даёт длинному аудио превратиться в кашу к концу записи.
Edge0 опубликовала долговременно стабильную потоковую ASR-модель, которая не даёт длинному аудио превратиться в кашу к концу записи. Audio8 ASR Infinite — это онлайн-модель распознавания речи, разработанная Edge0, которая в реальном времени преобразует аудиосигнал в соответствующий текст. Благодаря потоковой модели она способна обрабатывать данные с высокой скоростью декодирования (12,5 Гц). При этом она также поддерживает настройку задержки (240–560 мс) и умеет распознавать как китайский, так и английский язык. Модель относительно небольшая — всего около 4 миллиардов параметров. Однако, поскольку это не готовое приложение, развернуть её можно только на собственном сервере через Docker, запустив как лёгкий потоковый сервис. Мы также предоставляем веб-демонстрацию.
Зачем это вайб-кодеру
Эта модель создана для транскрибации длинного аудио — интервью, прямых эфиров, встреч и так далее, — чтобы длинная запись не доставляла проблем при расшифровке. Благодаря низкой задержке (менее 1 секунды) субтитры появляются практически в реальном времени, и вы не упускаете остальную часть речи. К сожалению, для этого придётся разворачивать окружение в Docker, а не просто установить приложение.
Как поставить
Скопируйте и отправьте своему агенту — Claude Code, Codex, любому:
Разверни у себя модель Audio8 ASR Infinite от компании Edge0: https://huggingface.co/Edge0/Audio8-ASR-Infinite — собери окружение по их инструкции с Docker, запусти веб-демо и покажи, как она распознаёт мою речь в реальном времени.
Обычный ноутбук от 8 ГБ оперативки — сами веса модели занимают около 8 ГБ. Но для расшифровки в реальном времени пригодится видеокарта: в собственных примерах разработчик запускает модель именно на ней, на одном процессоре ответ будет с заметной задержкой.
Открыть на Hugging Face▌ Ещё находки