2 сентября 2026 г.
Голос клонируется с 15 секунд записи: Inworld открыла Realtime TTS-2 всем
Realtime TTS-2 вышла из превью в общий доступ: клон голоса собирается с фрагмента в 5–15 секунд.

🚨 AI News | TestingCatalog
@testingcatalog
Inworld выпустила Realtime TTS-2 с упором на разборчивость и TTS-2 Flash для низкой задержки и больших объёмов. > Inworld Realtime TTS-2 делает реалистичный клон голоса по фрагменту в 5–15 секунд. > Профессиональное клонирование голоса тоже в бете, ему нужно 10 минут аудио. > Встроенный тег verbatim правильно читает номера заказов и коды.
Realtime TTS-2 сегодня открыта всем: теперь это модель №1 на Artificial Analysis и самый быстрый TTS в мире в своём классе. Исследовательское превью использовали куда активнее, чем мы ждали. Этот опыт вернулся в исследования, и сегодняшняя открытая модель — самый большой скачок в истории Inworld.
· 4,3 тыс. просмотров
Пятнадцати секунд чужой речи хватает, чтобы синтезатор заговорил этим голосом.
Inworld вывела Realtime TTS-2 из исследовательского превью в общий доступ и поставила рядом вторую модель, TTS-2 Flash. Первую затачивали под разборчивость речи, вторую под скорость ответа и поток запросов.
Клон голоса с одного фрагмента. Быстрый вариант снимает голос с записи в 5–15 секунд. Профессиональное клонирование пока в бете, и ему нужно 10 минут аудио.
Номера читаются по знакам. Встроенный тег verbatim заставляет модель произносить номер заказа и код так, как они записаны. Тег работает там, где бот диктует клиенту номер брони или код из письма.
Inworld ссылается на Artificial Analysis: там Realtime TTS-2 стоит первой среди моделей своего класса. Компания говорит, что превью использовали активнее, чем она рассчитывала, и этот опыт ушёл в новую версию.
Профессиональный клон голоса остаётся в бете.
Первоисточник
