Google выпустил Gemini 3.5 Transcribe
Новая модель распознаёт речь с ошибкой 2,6%, поддерживает 85+ языков, разделяет трёх говорящих и работает в реальном времени на 70% быстрее предшественника.
Google выпустил Gemini 3.5 Transcribe — модель распознавания речи с ошибкой 2,6% на предзаписанном аудио и 4% в стриминге реального времени, поддержкой 85+ языков и разделением речи до трёх говорящих с временными метками. Модель убирает слова-паразиты, автоматически расставляет знаки препинания и работает с задержкой меньше секунды — на 70% быстрее предшественника Chirp 3.
Модель уже встроена в LangChain, Vercel, LiveKit и Pipecat, идёт в Gboard и Chrome. Доступна через два API: gemini-3.5-transcribe-live для стриминга и gemini-3.5-transcribe для предзаписанного аудио. Профессиональная точность расшифровки в реальном времени стала доступна как стандартный API — не как дорогой специализированный сервис.
Источник: blog.google
Бесплатный курс
Хватит читать про ИИ — начни строить с ним
Бесплатный курс Claude Code: свой первый сайт, инструмент или игра — без программирования. Без апсейлов и кросс-сейлов — здесь нечего купить.
Начать →
Автор
Евгений Арсентьев
PhD · CEO, digital health
Статьи · Свежие статьи