9 сентября 2026 г.
HeyGen обучает голос аватара под вас: нужны минимум 20 минут записей
Professional Voice Clone работает через API в закрытом превью: доступ подключает команда HeyGen, а слот для голоса покупается отдельно.

HeyGen
@heygen
Голос оставался главным слабым местом реалистичных аватаров. Professional Voice Clone решает эту проблему: отдельная голосовая модель, которую обучают на 20 минутах записей вашего голоса. В двух из этих дублей говорит Джош. В двух других — клон. Включите звук. Теперь в превью через API HeyGen ↓
HeyGen Professional Voice Clone До сих пор голос оставался главным слабым местом реалистичных аватаров. Отдельная голосовая модель учится на 20 минутах записей одного человека и даёт аватару голос, который действительно звучит как ваш. Теперь доступно через API: https://developers.heygen.com/docs/voices/professional-voice-clone
· 2,6 тыс. просмотров
На 9 сентября HeyGen предлагает обучать голос аватара на 1–10 записях одного человека общей длительностью от 20 минут.
Прежний Instant Clone создаёт голос из короткой записи на модели Starfish. Новый Professional Clone обучает отдельный адаптер HeyGen Voice под конкретного человека. Через API клону можно передавать текст для озвучки, например реплики аватара в приложении.
Как получить доступ. Сначала нужно создать API key нужного workspace, запросить username через `GET /v3/users/me` и передать его команде превью. До создания клона нужно купить слот в разделе Developers → Usage: один голос занимает один слот. Без свободного слота API вернёт `resource_limit_reached`.
Дальше клон создаётся и озвучивает текст по такой схеме:
1. Загрузить записи через `POST /v3/assets` и получить для них `asset_id`. 2. Передать записи в `POST /v3/models/audio/voices`, указав `mode=professional`, имя в `name`, язык в `language` и записи в `audio`. 3. Проверять `GET /v3/models/audio/voices/{voice_id}`, пока голос не получит статус `ACTIVE`. 4. Отправить `voice_id`, `text` и `language` в `POST /v3/models/audio/tts`. API вернёт ссылку на готовый WAV-файл.
Расходы после обучения. По условиям на 9 сентября синтез стоит 0,6 API credits за минуту аудио. Каждый слот включает пять обучений за месячный расчётный период, включая первоначальное. Неудачные обучения бесплатны.
Один запрос принимает от 1 до 5000 символов. Для воспроизведения по мере генерации есть `/tts/stream`, который передаёт аудио частями через SSE. Каждый из двух способов синтеза допускает 30 запросов в минуту на участника workspace.
Если после окончания подписки на дополнительные слоты голос выходит за лимит workspace, вернуть озвучку можно покупкой слота или удалением другого Professional Voice. До этого API отвечает `voice_expired`.
Первоисточник: [документация HeyGen Professional Voice Clone](https://developers.heygen.com/docs/voices/professional-voice-clone).
Instant Clone из короткой записи остаётся доступен на всех API-планах HeyGen.
Первоисточник
