Технологии
Технология Hunyuan-GameCraft от Tencent – это дикий AI для генерации игровых видео
Команда Hunyuan от Tencent выпустила нечто действительно амбициозное: новую технологию под названием Hunyuan-GameCraft. Это не о генерации статических изображений или коротких клипов. Это о создании игровых видеоопытов из простых текстовых подсказок. Напишите “лодка на озере”, и в следующий момент вы будете управлять этой лодкой по спокойным водам в реальном времени.
Это вводит реальное управление в видео, сгенерированное искусственным интеллектом, добавляя движение, перспективу и игровой поток в опыт. Благодаря моделям диффузии и большому количеству кадров из игр, GameCraft объединяет генерацию видео с помощью ИИ с управлением в реальном времени.
Что такое Hunyuan-GameCraft от Tencent?
Hunyuan-GameCraft – это модель генерации видео на основе диффузии, разработанная командой ИИ Tencent. Что отличает ее, так это возможность генерировать управляемую видеосцену, используя только текстовую или изображенную подсказку. Как только сцена создана, вы можете исследовать ее, используя клавиатуру и мышь, как легкую версию игры.
Например, модель может принять подсказку “снежный лесной тропа” и вывести непрерывное видео, похожее на игровой процесс. Вы можете двигаться вперед, поворачивать влево или вправо, и модель генерирует каждый новый кадр на основе вашего ввода. Нет традиционного 3D-движка за этим. Видео развивается на основе ваших действий.
Что она может действительно делать
Hunyuan-GameCraft от Tencent поддерживает виды от первого и третьего лица, с плавными переходами между ними. Вы можете исследовать пейзажи, городские улицы, поля битвы или даже научно-фантастические среды. Каждое движение, такое как взгляд вокруг или ходьба, связано с системой предсказания модели.
Управление знакомо, поскольку вы можете использовать клавиши WASD или стрелки, чтобы двигаться и смотреть вокруг. ИИ обрабатывает остальное. За кулисами он читает ваши входные данные как сигналы движения и строит каждый кадр на основе этого. Тренировочные данные включают более миллиона видеоклипов из более чем 100 популярных игр. Такое широкое воздействие помогает модели понять разные визуальные стили (например, киберпанковские города, средневековые замки или природные пейзажи) и реконструировать их правдоподобно.
В демонстрациях, выпущенных до сих пор, сцены разнообразны и визуально богаты. Вы видите среды, такие как городские улицы, снежные пейзажи, берега рек и многое другое. Это feels близко к движению через кат-сцену или предварительно отрендеренный игровой уровень. Но важно рассматривать эти как предварительные просмотры исследований. То, что мы видим, является высоко отредактированным выводом. Все еще неясно, насколько последовательным или стабильным будет качество по широкому спектру подсказок или более длинным взаимодействиям.
Мы видели другие проекты, направленные на аналогичные цели. Модели WHAM и Muse от Microsoft (MSFT ) фокусируются на предсказании будущих кадров игрового процесса на основе изученных правил. Odyssey – это еще один недавний пример, который превращает видео в исследуемую сцену, используя ИИ.
Как работает Hunyuan GameCraft за кулисами?
Hunyuan-GameCraft построен на основе сложной генерации видео с помощью ИИ (моделей диффузии) с особыми трюками. Основная идея заключается в том, что она рассматривает ваши входные данные с клавиатуры и мыши как часть видео “контекста” или истории. Технически она преобразует эти управления в сигнал движения камеры, чтобы знать, как вы хотите изменить точку зрения. Затем она предсказывает следующие кадры видео кадр за кадром, расширяя клип в направлении, в котором вы “двигаете” его.
Чтобы сцена не прыгала вокруг, модель использует метод, основанный на истории. Она помнит, где вы остановились (немного как удержание состояния игры в памяти), чтобы мир не внезапно телепортировался в другое место. Они называют это “гибридным условным состоянием”. По сути, она время от времени подает старые кадры обратно в себя, чтобы важные детали (например, положение объектов и освещение) оставались последовательными, пока вы идете. Создатели также убедились, что модель может работать быстрее, дистиллируя ее (т.е. уменьшая большую модель до меньшей, более быстрой). Таким образом она может поспевать за вашими нажатиями клавиш в реальном времени, учитывая мощную видеокарту.
Вкратце, вы даете ей начальную картинку или текстовую подсказку и последовательность нажатий клавиш. Затем ИИ продолжает предсказывать новые изображения, чтобы казалось, что вы ходите или смотрите вокруг сцены. Благодаря особым трюкам с историей, игровой мир остается примерно последовательным во времени. Например, если вы идете по коридору или поворачиваете на 180°, стены и пол останутся на месте, не глючат. Команда показывает, что она даже сохраняет 3D-последовательность в течение долгого времени, что впечатляет для сгенерированного видео.
Случаи использования
Итак, что могут сделать геймеры и разработчики с этой технологией? На базовом уровне это творческий инструмент. Дизайнеры игр могли бы использовать его для прототипирования новых сред или идей уровней мгновенно. Писатели и режиссеры могли бы генерировать раскадровки или кат-сцены, просто набирая описания, а затем корректируя их, “играя” через сцену. Для геймеров это может быть веселым способом испытать пользовательские мини-игры, которые вы создаете на лету (например, “я хочу битву с драконом на Марсе” и внезапно вы можете контролировать это). Это также может помочь обучить других ИИ: например, мы могли бы обучать роботов или агентов в бесконечных виртуальных мирах, которые ИИ создает.
Еще нет публичного веб-приложения, и технологии все еще нуждаются в большем совершенствовании в плане визуального качества и отзывчивости. В демонстрациях из других подобных моделей, когда камера движется слишком далеко или поворачивает слишком сильно, сцена может начать разрушаться. Гибридное условное состояние Hunyuan уменьшает это, но большие сдвиги перспективы все еще могут вызвать текстурные глюки или искаженную геометрию. Сейчас это работает лучше всего как предварительный просмотр исследований, что-то, что показывает, что возможно, а не полностью игровой опыт.
Окончательные мысли
На этой стадии концепция солидна. Есть видимый потенциал в том, как входное видео может быть сформировано, чтобы выглядеть и чувствоваться как игровой процесс. Но это все еще рано. Это демонстрация исследований, а не законченный продукт. Генерация в реальном времени в высоком разрешении для длительных игровых сессий все еще является техническим вызовом.











