28 июля 2026 г.
Транскрипцию теперь выбирают под сценарий: у OpenAI live-поток и batch разошлись по моделям
28 июля OpenAI выложила в API сразу 2 модели распознавания речи. GPT-Live-Transcribe затачивали под живой поток с низкой задержкой, GPT-Transcribe - под готовые файлы и batch-нагрузки. Обе, по словам компании, лучше держат контекст на реальном звуке: акценты, короткие фразы, числа, узкие термины, громкий фон.

OpenAI Developers
@openaidevs
Выпускаем две новые модели транскрипции в API: • GPT-Live-Transcribe: сделана под живую расшифровку с низкой задержкой. • GPT-Transcribe: заточена под асинхронную расшифровку готовых аудиофайлов и пакетные задачи. Обе модели лучше понимают контекст и точнее расшифровывают реальное аудио - разные акценты, разные языки, в том числе короткие фразы, числа, узкие термины и речь на громком фоне.
· 440,3 тыс. просмотров
Почему это важно: Раньше разработчик брал одну модель распознавания и подгонял её под оба режима: и под живой диалог, и под ночную пачку записей. Теперь режим определяет саму модель, и выбор делается один раз при проектировании фичи. Список улучшений бьёт ровно по местам, где расшифровка ломается в проде: номер заказа, фамилия, название препарата, реплика на два слова, оператор в шумном зале. Как это измеряли, на каких языках и насколько лучше прежних моделей, в анонсе не говорят. Про цену и лимиты тоже молчат.
Не хотите разбираться сами? Внедряем ИИ в ваш бизнес: задачи без лимита, одна цена в месяц, отмена в любой момент.
Что дальше: Соберите 20 минут своего худшего звука: шум, акценты, номера счетов, внутренние термины. Прогоните обеими моделями и посчитайте ошибки отдельно по цифрам и именам собственным - именно там разница будет видна.
Первоисточник
