← All news·2026-07-29·3 min read

OpenAI выпустила новые модели распознавания речи

OpenAI выпустила GPT Transcribe с ошибкой 3,31% слов — на 0,7 пункта лучше предшественника, цена снижена на 25%. ElevenLabs, Google и Mistral по-прежнему точнее.

aiopenaiречьаудио

OpenAI выпустила GPT Transcribe и GPT Live Transcribe — модели, которые превращают голос в текст. GPT Transcribe обрабатывает аудио в 34 раза быстрее реального времени, ошибается в 3,31% слов — на 0,7 пункта меньше предшественника — и подешевел на 25%, до $0,0045 за минуту. GPT Live Transcribe работает в реальном времени и поддерживает потоковую передачу аудио.

Обе модели принимают текстовый контекст для повышения точности, поддерживают ключевые слова и несколько языков. По бенчмарку AA-WER: ElevenLabs Scribe v2 ошибается в 2,3% слов, Google Gemini 3 Pro — в 2,9%, Mistral Voxtral Small — в 3,0% и стоит дешевле ($0,003/мин). OpenAI уступает всем трём конкурентам и по точности, и по цене.

В отличие от чат-ботов, где OpenAI задаёт тон, в распознавании речи лидируют другие компании. Это показывает, что ни одна лаборатория не доминирует сразу во всех направлениях: рынок AI становится всё более специализированным, а значит, у узкофокусных игроков — ElevenLabs, Mistral — есть реальное конкурентное преимущество даже против OpenAI.

Source: the-decoder.com

Free course

Stop reading about AI — start building with it

The free Claude Code course: your first site, tool or game — no coding. No upsells, no cross-sells — nothing to buy here.

Start free →
EAEvgenii Arsentev

Author

Evgenii Arsentev

PhD · AI transformation executive