10 сентября 2026 г.
Голосовые агенты отвечают быстрее: GPT-Live-1 снизил задержку до 0,798 секунды
10 сентября 2026 года OpenAI открыла GPT-Live-1 в API: опубликованный замер даёт 0,798 секунды до начала ответа после реплики пользователя. Модель ведёт full-duplex разговоры, поддерживает custom voices и телефонию. Голосовая сессия стоит $0,05 за минуту, backend-модель и инструменты оплачиваются отдельно.

GPT-Realtime-2.1 начинал отвечать через 1,41 секунды. **Теперь.** GPT-Live-1 показывает 0,798 секунды в опубликованном замере и ведёт разговор в обе стороны одновременно.
Для приложения GPT-Live отвечает за стиль разговора, а backend хранит бизнес-правила и инструменты. Responses delegation автоматически передаёт задачи выбранной Responses-модели. Client delegation подключает собственную модель, agent harness или сервис. OpenAI также показала связку GPT-Live-1 с @openai/codex-sdk: контекст попадает в Codex thread, а ответ возвращается через session.commentary.append.
Запуск. WebRTC quickstart требует Node.js ≥22.6, `npm install openai express` и переменную `OPENAI_API_KEY`. После `node server.mjs` открывается `http://localhost:3000`, где Start conversation запускает разговор.
Телефонный агент требует включённого GPT-Live SIP и направленного в него SIP trunk. Входящие звонки приходят событием `live.transport.incoming` с `data.session_id`. Прямое SIP-подключение требует TLS и SRTP. Custom voices OpenAI выдаёт по запросу через отдел продаж.
Первые замеры. Artificial Analysis получил 97,3% для GPT-Live-1 с Sol (low) и 94,9% с Astra (medium) в тесте пауз, перебиваний и очередности реплик. Сооснователь и CTO Speak Эндрю Хсу сообщил почти о 80% меньшем числе перебиваний ученика во время пауз на размышление в Live Tutor Lessons по сравнению с прежними системами с поочерёдными репликами.
Цена и лимиты. Сессия стоит $0,05 за минуту с посекундным расчётом без округления. Tier 1 допускает 25 одновременных сессий, Tier 2 50, Tier 3 200, Tier 4 300, Tier 5 500. Free не поддерживается.
Дальше GPT-Live-1 ведёт к голосовым приложениям, где стиль разговора задаёт модель, а бизнес-правила и инструменты живут в подключаемом backend.
Первоисточник
