23 сентября 2026 г.
Gemini даёт собрать голос для приложения текстом: до 200 клонов в проекте
22 сентября Google вывела Gemini 3.8 Flash TTS в общий доступ с поддержкой 130 языков. В Google AI Studio голос создаётся текстовым описанием и возвращается как `voice_...` для вставки в код. Flash-Lite TTS работает с 101 языком и заменяет `gemini-3.1-flash-tts-preview`.
Раньше Google предлагал `gemini-3.1-flash-tts-preview`. Теперь Gemini предлагает Flash-Lite TTS для низкой задержки и цены, а Flash TTS рассчитана на диалекты и многоголосые сценарии.
Голос как ресурс. В AI Studio Voice Design собирает голос по текстовому описанию. Клон хранится в проекте год, лимит составляет 200 голосов. Режим без хранения возвращает `voicekey_...`, который действует 7 дней.
Для Voice Replication нужны две записи одного взрослого человека: чистый референс от 10 до 30 секунд и отдельная запись согласия. Google рекомендует WAV 24 кГц, mono, 16-bit. Режим недоступен в Illinois, Texas, EEA, Великобритании, Швейцарии и Индии.
В API дословный текст передают в `input`, стиль реплики в `speech_metadata`, а голос в `generation_config.speech_config`. Voice Design работает через `google-genai` 2.25.0+, `@google/genai` 2.24.0+ или POST-запрос к `/v1beta/voices`; Flash TTS принимает только текст и отдаёт только аудио, с лимитом 8 192 входных и 16 384 выходных токена.
Цена до конца года. Flash TTS стоит $0.50 за миллион входных текстовых токенов и $9 за миллион аудиотокенов. Flash-Lite стоит те же $0.50 и $6.
С 1 января 2027 Google удвоит цены на обе модели TTS.
* Meta Platforms Inc. признана в РФ экстремистской организацией, её деятельность запрещена; Facebook и Instagram заблокированы. Meta AI и другие продукты компании — продукты этой организации.
Первоисточник
