1 октября 2026 г.
ИИ-агенты собирают ролики кодом: HeyGen проверяет результат на человеческих эталонах
18 сентября HeyGen выпустил Code2Video с 168 человеческими роликами для сравнения с работами ИИ-агентов.

HeyGen
@heygen
В сентябре мы выпустили три инструмента для тех, кто создаёт продукты. Open source связку для аватара, который общается в реальном времени, с GPT-Live-1 от OpenAI Code2Video Benchmark вместе с Kaggle: проверяем, действительно ли ИИ делает хорошие видео И Professional Voice Clone для API Подробнее: https://www.heygen.com/blog/heygen-september-2026-release
· 1,1 тыс. просмотров
Агент пишет код ролика, HyperFrames превращает его в MP4, а Code2Video сравнивает результат с работами людей.
HeyGen собрал человеческие эталоны в 8 категориях продуктового видео. Теперь агенты получают те же брифы и скилл HyperFrames для сборки роликов кодом. По замерам HeyGen от 18 сентября, все участвовавшие модели уступили человеческим работам.
Ролик через агента. Скилл устанавливается командой `npx skills add heygen-com/hyperframes`. Для локального проекта нужны Node.js 22+ и FFmpeg. Последовательность сборки:
1. `npx hyperframes init my-video` 2. `cd my-video` 3. `npx hyperframes preview` 4. `npx hyperframes render`
Kaggle хранит трассы и логи запусков Code2Video и ведёт рейтинг моделей. HeyGen и Kaggle опубликовали эталонные композиции, брифы и judge API. Запуск собственной модели с тем же оценщиком HeyGen обозначил как будущую возможность.
Говорящий аватар. В сентябре HeyGen также выпустил open source связку LiveAvatar с GPT-Live-1 от OpenAI. Готовое демо работает как преподаватель японского с голосом и анимированными карточками слов. Для своего сценария достаточно изменить `server/prompts/instructions.md` и `greeting.md`, затем перезапустить сервер.
Демо запускается из репозитория HeyGen командами `pnpm install`, `pnpm run setup` и `pnpm dev`. Нужны Node.js от 20.12, pnpm и ключи LiveAvatar и OpenAI с доступом к `gpt-live-1`. После запуска на `localhost:5173` нажимают Start и разрешают микрофон.
Professional Voice Clone добавляет в API обучаемую копию голоса. Для обучения нужны от 1 до 10 записей одного человека общей длительностью от 20 минут. Файлы загружают через Assets API, затем вызывают `POST /v3/models/audio/voices` с `mode: professional` и проверяют статус до `ACTIVE`.
Готовый голос выдаёт WAV через `POST /v3/models/audio/tts` или поток аудио через `POST /v3/models/audio/tts/stream`. По документации HeyGen от 9 сентября, каждый голос занимает платный слот с 5 обучениями за месячный расчётный период, включая первое. Неудачные обучения не списываются, синтез стоит 0,6 API credits за минуту.
Официальная инструкция Professional Voice Clone содержит готовый промпт для настройки через Claude Code, Codex или Cursor.
Первоисточник
