Сегодня 07 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Tencent выпустила открытую ИИ-модель, которая создаёт целые 3D-миры по одному изображению

На этой неделе китайская компания Tencent представила новую ИИ-модель с открытым исходным кодом HunyuanWorld-Voyager. С её помощью можно генерировать 3D-видеоряд из одного исходного изображения, управляя траекторией камеры для «изучения» виртуальных сцен. Алгоритм одновременно генерирует видео в формате RGB и информацию о глубине (RGB-D), что позволяет осуществлять 3D-реконструкцию без использования традиционных методов моделирования.

 Источник изображений: Tencent

Источник изображений: Tencent

На самом деле результаты работы HunyuanWorld-Voyager не являются настоящими 3D-моделями, но создаётся аналогичный эффект. ИИ-алгоритм генерирует 2D-видеокадры, которые сохраняют пространственную согласованность, как если бы камера перемещалась в реальном 3D-пространстве. В каждой генерации создаётся всего 49 кадров, т.е. примерно две секунды видео. По данным Tencent, несколько клипов могут быть объединены в последовательности продолжительностью «несколько минут». Объекты сохраняют своё положение, когда камера перемещается вокруг них, перспектива изменяется корректно, как если бы это происходило в реальной 3D-среде. Хотя результатом работы является видео с картами глубины, а не полноценные 3D-модели, эти данные можно преобразовывать в 3D-облака точек для дальнейшей реконструкции.

Система работает на основе одного исходного изображения и заданной пользователем траектории камеры. Можно задать движение камеры вперёд, назад, влево, вправо или поворот, для чего предусмотрен интерфейс управления. Система объединяет данные об изображении и глубине с другими данными для формирования видеоряда, отражающего движение камеры, которое задал пользователь.

Основным ограничением всех ИИ-моделей на базе архитектуры Transformer является то, что они в основном имитируют паттерны, найденные в данных для обучения, что ограничивает их возможности в плане «обобщения», т.е. применения этих шаблонов в новых ситуациях, которые не встречались при обучении. Для обучения HunyuanWorld-Voyager исследователи задействовали более 100 тыс. видеоклипов, включая компьютерные сцены на движке Unreal Engine. По сути они обучали ИИ-алгоритм имитировать движение 3D-камер в среде видеоигр.

Большинство ИИ-генераторов, таких как Sora, создают выглядящие правдоподобно кадры друг за другом, не пытаясь отслеживать или поддерживать пространственную согласованность. В отличие от этого HunyuanWorld-Voyager обучен распознавать и воспроизводить закономерности пространственной согласованности, но с добавлением обратной геометрической связи. Когда он генерирует каждый кадр, осуществляется преобразование выходных данных в точечный 3D-объект, после чего эти точки проецируются обратно в 2D для использования в будущих кадрах.

Такой подход заставляет ИИ-модель сопоставлять изученные ранее шаблоны с геометрически согласованными проекциями, полученными в процессе работы. Это обеспечивает гораздо лучшую пространственную согласованность, чем у других ИИ-генераторов видео. Однако в основе подхода всё же лежит сопоставление паттернов, основанное на геометрических ограничениях, а не полноценное «понимание» 3D. Это объясняет, почему ИИ-модель может сохранять согласованность в течение нескольких минут, но с трудом справляется с поворот сцены на 360°. Ошибки при сопоставлении с образцом накапливаются на протяжении многих кадров до тех пор, пока геометрические ограничения уже не могут поддерживать согласованность.

По данным Tencent, HunyuanWorld-Voyager использует в работе два основных блока, работающих совместно. Во-первых, система генерирует цветное видео и информацию о глубине одновременно, чтобы убедиться, что они идеально совпадают. Во-вторых, используется то, что Tencent называет «глобальным кэшем» — растущая коллекция точечных 3D-моделей, созданных из ранее сгенерированных кадров. В процессе генерации новых кадров это облако 3D-точек проецируется обратно в 2D с нового ракурса камеры для создания изображений, показывающих то, что должно быть видно на основе предыдущих кадров. Затем модель использует эти проекции для проверки согласованности, обеспечивая соответствие новых кадров уже сгенерированным.

HunyuanWorld-Voyager развивает идеи более ранней ИИ-модели Tencent HunyuanWorld 1.0, которая была выпущена в июле. Алгоритм также является частью более масштабной экосистемы Tencent Hunyuan, которая также включает в себя алгоритмы Hunyuan3D-2 для генерации 3D-объектов по текстовому описанию и HunyuanVideo для генерации видео.

Для обеспечения работоспособности HunyuanWorld-Voyager требуются значительные вычислительные мощности. Tencent рекомендует использовать не менее 60 Гбайт видеопамяти для получения 3D-сцен с разрешением 540p или 80 Гбайт видеопамяти для повышения качества картинки. Получить доступ к исходному коду ИИ-модели и сопутствующей документации можно на портале Hugging Face. Как и другие ИИ-модели семейства Hunyuan, новый алгоритм поставляется с существенными лицензионными ограничениями. К примеру, лицензия запрещает использовать HunyuanWorld-Voyager в ЕС, Великобритании и Южной Корее. Отдельного лицензирования требует коммерческое использование, предполагающее обслуживание более 100 млн пользователей в месяц.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Huawei представила ускоренную HarmonyOS 7 с ИИ-агентами, защитой от мошенников и новым интерфейсом 4 мин.
«Погибнут многие храбрые рыцари»: многострадальная MMO по League of Legends превратилась для Riot Games в поход за Святым Граалем 13 мин.
Новый трейлер подтвердил дату выхода Airframe Ultra — ретрофутуристического гоночного боевика, который выглядит как дитя Road Rash и «Акиры» 3 ч.
«Базис» приобрёл 70 % разработчика ИИ-платформы наблюдаемости Proto Observability 4 ч.
Рост облачного рынка России резко замедлился — не хватает «железа» и «дешёвых» денег 5 ч.
Первая за 20 лет новая Onimusha не разочаровала Capcom продажами — миллион копий Onimusha: Way of the Sword за один день 7 ч.
Valheim 2 не будет — разработчики продолжат расширять оригинальную Valheim 8 ч.
В нашумевшем кошачьем роглайке Mewgenics появился официальный перевод на русский язык — новый бесплатный контент и первое дополнение на подходе 10 ч.
Ведьмак стал вампиром: один из первых модов для The Blood of Dawnwalker подарил главному герою лицо Геральта 11 ч.
Apple решила увеличить прибыльность App Store, но пока неизвестно, каким образом 15 ч.
Анонсированы смарт-часы Huawei Watch 6 и 6 Pro с поддержкой ЭКГ по цене от $417 10 мин.
Xiaomi бросила вызов складному iPhone: представлен широкоформатный Xiaomi 18 Fold с чипом Xring O3, LPDDR6 и 200-Мп камерой 2 ч.
Производители смартфонов массово игнорируют требования ЕС — более 80 % устройств не имеют данных о ремонте 2 ч.
LG представила 14" ноутбук Gram Book AI 2026 с чипом Intel Wildcat Lake и автономностью до 30 часов 2 ч.
Производители памяти не успевают за спросом — зато их выручка взлетела на 60 % во втором квартале 2 ч.
Репортаж со стенда Acer на IFA 2026: гибрид консоли и ноутбука DualPlay Mini, сверхлёгкий Swift, мини-ПК на Nvidia и другие новинки 4 ч.
Перед анонсом складного iPhone Huawei представила трёхстворчатый Mate XT 2 с чипом Kirin 9050 Pro и 10,2" экраном 4 ч.
NVIDIA инвестировала в разработчика оптических коммутаторов iPronics 5 ч.
Huawei представила широкоформатный, но не складной смартфон Pura X View 6 ч.
США обвинили Huawei в 20 годах кражи технологий конкурентов — лучших «промышленных шпионов» премировали 6 ч.