← Все новости·2026-08-26·2 мин чтения

Google выпустил Gemini 3.5 Transcribe

Новая модель распознаёт речь с ошибкой 2,6%, поддерживает 85+ языков, разделяет трёх говорящих и работает в реальном времени на 70% быстрее предшественника.

googlespeechtranscriptionapi

Google выпустил Gemini 3.5 Transcribe — модель распознавания речи с ошибкой 2,6% на предзаписанном аудио и 4% в стриминге реального времени, поддержкой 85+ языков и разделением речи до трёх говорящих с временными метками. Модель убирает слова-паразиты, автоматически расставляет знаки препинания и работает с задержкой меньше секунды — на 70% быстрее предшественника Chirp 3.

Модель уже встроена в LangChain, Vercel, LiveKit и Pipecat, идёт в Gboard и Chrome. Доступна через два API: gemini-3.5-transcribe-live для стриминга и gemini-3.5-transcribe для предзаписанного аудио. Профессиональная точность расшифровки в реальном времени стала доступна как стандартный API — не как дорогой специализированный сервис.

Источник: blog.google

Бесплатный курс

Хватит читать про ИИ — начни строить с ним

Бесплатный курс Claude Code: свой первый сайт, инструмент или игра — без программирования. Без апсейлов и кросс-сейлов — здесь нечего купить.

Начать →
ЕАЕвгений Арсентьев

Автор

Евгений Арсентьев

PhD · CEO, digital health