./новости · 28 июля 2026 г.
новость
Живую транскрипцию OpenAI вынесла в отдельную модель: в API теперь две модели под разные режимы
источник: @openaidevs · X·
машинная выжимка · сверена с источником

OpenAI Developers
@openaidevs
Выпускаем две новые модели транскрипции в API: • GPT-Live-Transcribe: сделана под живую расшифровку с низкой задержкой. • GPT-Transcribe: заточена под асинхронную расшифровку готовых аудиофайлов и пакетные задачи. Обе модели лучше понимают контекст и точнее расшифровывают реальное аудио - разные акценты, разные языки, в том числе короткие фразы, числа, узкие термины и речь на громком фоне.
· 8,1 тыс. просмотров
28 июля OpenAI добавила в API две модели транскрипции: GPT-Live-Transcribe и GPT-Transcribe. Первая сделана под живой поток с низкой задержкой, вторая под готовые аудиофайлы и пакетные прогоны. Обе, по словам компании, лучше понимают контекст и точнее держат акценты, короткие фразы, числа, узкие термины и речь на громком фоне.
Почему это важно: Список того, что чинили, читается как список жалоб на распознавание речи: акценты, короткие фразы, номера, профессиональный жаргон, шум в записи. На таком материале расшифровку до сих пор дочищали руками или подпирали словарями терминов. Теперь выбор идёт не по компромиссу «точность против задержки», а по режиму работы: диктовка в реальном времени зовёт одну модель, ночной разбор архива звонков - другую. Ни цен, ни лимитов, ни одной цифры по точности в анонсе нет.
Что дальше: Замер на вечер: взять свою худшую запись - шум, акцент, куча номеров - и прогнать её через GPT-Transcribe и через текущий пайплайн, потом сверить обе расшифровки с ручной. Живой режим проверять отдельно: там важна не только точность, но и задержка на своём канале.
первоисточник
