16 сентября 2026 г.
Выбирать голосовую модель стало проще: справочник свёл API, цены и открытые веса
16 сентября 2026 года Mahimai Raja опубликовал публичный справочник realtime S2S-моделей. В нём собраны hosted API, управление диалогом, цены, open weights и runnable-примеры. Данные проверены 15 сентября 2026 года, вызовы моделей не запускались.

Раньше потоковая передача выглядела достаточным признаком разговора в обе стороны. Теперь справочник отделяет native S2S от каскада audio → STT → LLM → TTS и full-duplex: поток сам по себе не означает одновременное слушание и говорение.
Подключение. GPT-Realtime-2.1 принимает и отдаёт звук, умеет function calling, держит контекст до 128 000 токенов и выдаёт до 32 000 токенов. Для браузерного OpenAI Realtime нужен сервер, который принимает SDP от браузера и создаёт сессию через `/v1/realtime/calls`; стандартный API key остаётся на сервере. Сессия ограничена 60 минутами, а после первого audio-ответа голос модели изменить нельзя.
Другой путь. Gemini 3.8 Live доступна как стабильная модель с ID `gemini-3.8-live`, работает через Live API и function calling. При миграции с Gemini 3.1 Flash Live нужно убрать `thinking_level`. Live API держит состояние в WebSocket, принимает raw 16-bit PCM 16 kHz и отдаёт raw 16-bit PCM 24 kHz; для client-to-server Google предлагает WebSocket с ephemeral tokens.
Цены. - GPT-Realtime-2.1: $32 за 1 млн входных audio-токенов и $64 за 1 млн выходных, текстовые токены стоят $4 и $24 соответственно (цены OpenAI API, 17.09.2026). - Gemini 3.8 Live: $3 за 1 млн входных audio-токенов или $0.005 за минуту, $12 за 1 млн выходных или $0.018 за минуту (цены Gemini API, 17.09.2026). - Ultravox: 30 бесплатных минут, затем $0.05 за минуту и до 5 одновременных звонков (цены Ultravox, 17.09.2026).
Для рабочего прототипа теперь нужно выбрать не только модель, но и схему разговора, серверную обвязку и единицу тарификации.
Дальше сравнение должно перейти от публичных условий к реальным вызовам моделей.
Первоисточник
