OpenAI выпустила новые модели распознавания речи
OpenAI выпустила GPT Transcribe с ошибкой 3,31% слов — на 0,7 пункта лучше предшественника, цена снижена на 25%. ElevenLabs, Google и Mistral по-прежнему точнее.
OpenAI выпустила GPT Transcribe и GPT Live Transcribe — модели, которые превращают голос в текст. GPT Transcribe обрабатывает аудио в 34 раза быстрее реального времени, ошибается в 3,31% слов — на 0,7 пункта меньше предшественника — и подешевел на 25%, до $0,0045 за минуту. GPT Live Transcribe работает в реальном времени и поддерживает потоковую передачу аудио.
Обе модели принимают текстовый контекст для повышения точности, поддерживают ключевые слова и несколько языков. По бенчмарку AA-WER: ElevenLabs Scribe v2 ошибается в 2,3% слов, Google Gemini 3 Pro — в 2,9%, Mistral Voxtral Small — в 3,0% и стоит дешевле ($0,003/мин). OpenAI уступает всем трём конкурентам и по точности, и по цене.
В отличие от чат-ботов, где OpenAI задаёт тон, в распознавании речи лидируют другие компании. Это показывает, что ни одна лаборатория не доминирует сразу во всех направлениях: рынок AI становится всё более специализированным, а значит, у узкофокусных игроков — ElevenLabs, Mistral — есть реальное конкурентное преимущество даже против OpenAI.
Источник: the-decoder.com
Бесплатный курс
Хватит читать про ИИ — начни строить с ним
Бесплатный курс Claude Code: свой первый сайт, инструмент или игра — без программирования. Без апсейлов и кросс-сейлов — здесь нечего купить.
Начать →
Автор
Евгений Арсентьев
PhD · Генеральный директор digital health-платформы · ИИ-трансформация
Статьи · Свежие статьи