21 сентября 2026 г.
Видео из кода у моделей выходит мёртвым: в Code2Video Bench лидер набрал 0,32 из 1
HeyGen вместе с Google DeepMind и Kaggle выложила Code2Video Bench: 16 моделей пишут код для роликов, и ни одна не догнала человека.

HeyGen
@heygen
Код модели написать могут. Отрендерится ли он в видео, которое стоит смотреть, вопрос отдельный. Code2Video bench меряет именно это. Сделали вместе с google deepmind и @kaggle.
попробовали бы hyperframes, знали бы: агентный видеостек строится на кодогенерации но код уровня SWE-bench и код, который превращается в живое видео, это две разные вещи мы собрали Code2Video Bench вместе с Google DeepMind и @Kaggle фронтир-лаборатории наконец смогут подтянуться в агентных видеозадачах
· 4,1 тыс. просмотров
Ни одна из 16 моделей не сняла ролик уровня человека. Лучший результат в замере: 0,32 из единицы.
HeyGen опубликовала Code2Video Bench 18.09.2026 вместе с Google DeepMind и Kaggle. Бенч проверяет, как модель пишет HTML и React, который потом рендерится в моушен-графику.
Раньше мерили тикеты. SWE-bench считает, закрыла ли модель задачу в репозитории. Здесь считают, смотрится ли результат: 168 человеческих референс-композиций разложены по восьми битам продуктового лонча, от хука до брендового аутро.
Разрыв с человеком такой, что доля побед теряет смысл, поэтому лидерборд на Kaggle от 21.09.2026 считает Elo. Наверху GPT-5.5 с 1574,5. Явного победителя нет: топ-4 укладываются в 12 Elo друг от друга при доверительном интервале около ±13, а открытые веса (qwen3.8-max, kimi-k3 и ещё две) отстают от первого места меньше чем на 50 Elo.
Ломается на вёрстке. Следование брифу модели почти закрыли: по оси Prompt-Intent они стоят кучно. Расходятся на Composition и Craft: тайминг между битами плывёт, текст наезжает сам на себя, вёрстка выходит мелкой и осторожной.
Прогнать свой ролик можно тем же способом, что авторы: `npx skills add heygen-com/hyperframes`, нужны Node.js 22+ и FFmpeg, дальше `npx hyperframes init`, `preview` и `render`. Оценивает не обычная VLM, а обученная HeyGen модель-судья по пяти осям: с людьми она совпадает в 82% случаев против 75% у VLM.
Kaggle ведёт лидерборд дальше и обещает открыть прогон собственной модели тем же судьёй.
Первоисточник
