18 августа 2026 г.
Открытая модель на 30B обошла GPT-5.5 в сборке 3D-миров: 59,3% против 57,3%
Ни GPT-5.5, ни Qwen3.8-Max не взяли и 60% на новом бенчмарке 3D-миров. Первое место заняла открытая модель на 30B.

Модели попросили собрать интерактивный 3D-мир по описанию обычными словами. GPT-5.5 довела дело до конца в 57,3% попыток.
Собрать мир целиком, от поиска ассетов до расстановки объектов, у больших закрытых моделей пока не выходит. Планку в 60% на VWE-Bench не перешёл никто из них.
Как считали. VWE-Bench собран из 2 616 3D-ассетов, 323 миров-заготовок с ручной разметкой и 6 828 запросов. Тестовый сплит содержит 254 кейса. Агенту дают ровно пять действий со сценой: найти ассет, добавить, повернуть, сдвинуть, удалить. Рендер во всех прогонах один, в Blender.
Pass@1, то есть доля задач, решённых с первой попытки, по таблице статьи (замер авторский):
- VibeWorlder-30B-A3B: 59,3% - GPT-5.5: 57,3% - Qwen3.8-Max: 56,9% - Gemini 3.1-pro: 42,7% - VibeWorlder-8B: 41,4%
Размер перестал решать. Раньше прибавку на таких задачах покупали числом параметров. Теперь модель на 30B, дообученная в VibeWorlding-Gym на проверяемых наградах, обходит закрытые модели на их же поле.
Ломаются на коллизиях. Объекты у всех моделей заезжают друг в друга: чистая расстановка держится в диапазоне 59–68%. Авторы называют безколлизионное редактирование сцены главной нерешённой проблемой.
Прогнать можно у себя. Код и окружение открыты в репозитории usail-hkust/VibeWorlding-Gym, веса тянутся командой `huggingface-cli download usail-hkust/VibeWorlder-30B-A3B`. Локально поднимаются два сервиса, рендер в Blender 4.2 и поиск ассетов, дальше прогон идёт в две команды: main.py и eval.py. Пока к весам почти никто не притрагивался, 21 скачивание за первый месяц.
Первоисточник