5 октября 2026 г.
Свой разговорник перед поездкой: урок по сборке приложения на Gemini Live API
Голосовое приложение для подготовки к поездке: по уроку Питера Янга можно собрать тренажёр на 100 фраз для выбранного языка.

Peter Yang
@petergyang
Я собрал приложение с ИИ для изучения языков: оно учит меня японскому через живые голосовые звонки. В новом уроке подробно показываю, как я его сделал: → Проработал ключевые экраны с помощью своего скилла spec → Подключил Gemini Live API для голосового общения → Создал картинки в виде диорам с Nano Banana Повторяйте за мной, чтобы собрать собственное приложение и выучить 100 фраз на любом языке перед поездкой. 📌 Смотрите: https://youtu.be/GiaDdNvsadA
· 1,8 тыс. просмотров
Питер Янг собрал приложение, в котором учит японский через живой голосовой разговор с ИИ.
В уроке от 5 октября он разбирает сборку своего тренажёра. Голосовой разговор работает через Gemini Live API, а картинки в виде диорам Янг создаёт с Nano Banana. Для проработки ключевых экранов он использует собственный скилл spec: инструкцию для ИИ-агента.
Разговор вслух. Live API поддерживает 70 языков, перебивание ответа голосом и текстовые расшифровки обеих сторон разговора. Можно собрать тренажёр под язык предстоящей поездки, как в уроке Янга с японским.
Google предлагает готовый пример голосового приложения `gemini-live-ephemeral-tokens-websocket`. Порядок запуска из официального репозитория, проверенный в фактуре 5 октября:
1. Выполнить `uv venv` и активировать окружение `.venv`. 2. Установить зависимости командой `uv pip install -r requirements.txt`. 3. Записать `GEMINI_API_KEY` в файл `.env`. 4. Запустить `uv run server.py` и открыть `localhost:8000`.
Рецепт для агента. Google выпустила скилл для разработки с Live API. Команда установки: `npx skills add google-gemini/gemini-skills --skill gemini-live-api-dev --global`. Скилл покрывает подключение через WebSocket, передачу аудио потоком и перебивание ответа голосом.
В официальных инструкциях для JavaScript и Python подключение начинается с сообщения `setup`, где задаются модель и `responseModalities: ['AUDIO']`. Затем приложение отправляет голос через `realtimeInput`. Live API принимает аудио PCM с частотой 16 kHz и возвращает PCM с частотой 24 kHz.
Платный голосовой режим Gemini 3.8 Live и Gemini 3.1 Flash Live Preview по прайсу от 1 октября стоит $0,005 за минуту входного аудио и $0,018 за минуту ответа. Google также указывает цены за миллион аудиотокенов: $3 за вход и $12 за выход. У этих моделей есть Free Tier, как и у Gemini 2.5 Flash Native Audio, для которой платные аудиотокены стоят столько же.
Для иллюстраций рецепт уже требует замены модели. Янг использует Nano Banana, но Google назначила отключение исходной `gemini-2.5-flash-image` на 2 октября 2026 года. В качестве замены компания предлагает Gemini 3.1 Flash Image или Gemini 3.1 Flash Lite Image.
Урок ведёт от проработки экранов до голосового тренажёра для подготовки к поездке.
Первоисточник
