Технології
Tencent’s GameCraft – дика технологія штучного інтелекту для генерації ігрових відео
Команда Hunyuan компанії Tencent випустила щось справді амбітне: нову технологію під назвою Hunyuan-GameCraft. Це не про генерацію штучним інтелектом статичних зображень або коротких кліпів. Це про створення ігрових відео-досвідів з простих текстових підказок. Напишіть “човен на озері”, і наступної миті ви керуватимете цим човном по спокійних водах в реальному часі.
Це вводить реальний контроль у відео, згенероване штучним інтелектом, привнося рух, перспективу та ігровий процес у досвід. Підтримувана дифузійними моделями та великомасштабними ігровими відео, GameCraft поєднує генерацію відео штучним інтелектом з реальним контролем гравця.
Що таке Hunyuan-GameCraft компанії Tencent?
Hunyuan-GameCraft – це модель генерації відео на основі дифузії, розроблена командою штучного інтелекту компанії Tencent. Що відрізняє її – це можливість генерації керованої відео-сцени за допомогою простої текстової або зображенної підказки. Як тільки сцена створена, ви можете досліджувати її за допомогою клавіатури та миші, як легку версію ігрового процесу.
Наприклад, модель може взяти підказку “сніжний лісовий шлях” і вивести безперервне відео, яке виглядає як ігровий процес. Ви можете рухатися вперед, повертатися вліво чи вправо, і модель генерує кожний новий кадр на основі вашого вводу. Тут немає традиційного 3D-двигуна. Відео розвивається на основі ваших дій.
Що воно може зробити насправді
Hunyuan-GameCraft компанії Tencent підтримує види від першої та третьої особи, з плавними переходами між ними. Ви можете досліджувати ландшафти, вулиці міст, поля битв або навіть науково-фантастичні середовища. Кожен рух, як от оглянути навколо або ходити, пов’язаний з системою передбачення моделі.
Керування знайомі, оскільки ви можете використовувати клавіші WASD або стрілки для руху та огляду навколо. Штучний інтелект обробляє все інше. За лаштунками він читає ваш ввід як рухомі підказки та будує кожний кадр на основі цього. Тренувальні дані включають понад мільйон відеокліпів з понад 100 популярних ігор. Таке широке висвітлення допомагає моделі зрозуміти різні візуальні стилі (як кіберпанківські міста, середньовічні замки чи природні ландшафти) та реалістично їх відтворити.
У демонстраціях, випущених досі, сцени різноманітні та візуально багаті. Ви бачите середовища, як вулиці міст, сніжні ландшафти, річкові береги та інше. Це нагадує рух через кат-сцену або попередньо відтворений ігровий рівень. Але важливо розглядати ці демопрограми як дослідницькі попередні версії. Те, що ми бачимо, – це високооброблений вивід. Все ще неясно, наскільки послідовною та стабільною буде якість у широкому діапазоні підказок або триваліших взаємодій.
Ми бачили інші проекти, спрямовані на подібні цілі. Моделі WHAM та Muse компанії Microsoft (MSFT ) фокусуються на передбаченні майбутніх кадрів ігрового процесу на основі вивчених правил. Odyssey – це ще один недавній приклад, який перетворює відео на досліджувану сцену за допомогою штучного інтелекту.
Як працює Hunyuan GameCraft за лаштунками?
Hunyuan-GameCraft побудований на основі фанкової генерації відео штучним інтелектом (дифузійні моделі) з особливими трюками. Основна ідея полягає в тому, що він обробляє ваш ввід з клавіатури/миші як частину відео-“контексту” або історії. Технічно він перетворює ці керування на сигнал руху камери, щоб знати, як ви хочете змінити точку зору. Потім він передбачає наступні кадри відео кадр за кадром, розширюючи кліп у напрямку, яким ви “рухаєте” його.
Щоб сцена не стрибала, модель використовує метод, заснований на історії. Вона пам’ятає, де ви зупинилися (трохи як утримання стану гри в пам’яті), щоб світ не раптово телепортувався в інше місце. Їх називають “гібридним умовуванням історії”. По суті, вона періодично підгодовує старі кадри собі, щоб важливі деталі (як позиція об’єктів та освітлення) залишилися послідовними, коли ви рухаєтеся. Створили також модель, щоб вона могла працювати швидше за допомогою дистиляції (тобто зменшення великої моделі до меншої, швидшої). Таким чином вона може слідкувати за вашими натисками клавіш у (майже) реальному часі, якщо у вас є потужна графічна карта.
У короткому, ви даєте йому початкове зображення або текстову підказку та послідовність натисків клавіш. Штучний інтелект потім продовжує передбачати нові зображення, щоб воно виглядало так, як ніби ви рухаєтеся або оглядаєте сцену. Завдяки особливому трюку з історією ігровий світ залишається приблизно послідовним з часом. Наприклад, якщо ви йдете вниз коридором або повертаєтеся на 180°, стіни та підлога залишаються на місці, а не глючать. Команда демонструє, що це навіть зберігає 3D-послідовність протягом тривалого часу, що досить вражаюче для згенерованого відео.
Варіанти використання
Ітак, що можуть зробити з цією технологією геймери та розробники? На базовому рівні це творчий інструмент. Дизайнери ігор можуть використовувати його для прототипування нових середовищ або ідей рівнів миттєво. Сценаристи та режисери можуть генерувати сторіборди або кат-сцени, просто написавши описи, а потім налаштувати їх, “граючи” через сцену. Для геймерів це може бути забавним способом пережити користувальницькі міні-ігри, які ви створюєте на льоту (як “я хочу битву з драконом на Марсі” і раптом ви можете контролювати це). Це також може допомогти тренувати інших штучних інтелектів: наприклад, ми могли б тренувати роботів або агентів у нескінченних віртуальних світах, які штучний інтелект генерує.
Все ще немає публічної веб-демонстрації, а технологія все ще потребує більшої доопрацювання щодо візуальної якості та реакції. У демонстраціях інших подібних моделей, коли камера рухається занадто далеко або повертається занадто сильно, сцена може почати розбиватися. Гібридне умовування історії компанії Hunyuan зменшує це, але великі зрушення перспективи все ще можуть спричинити текстурні глюки або викривлену геометрію. Наразі це працює найкраще як дослідницька попередня версія, щось, що показує, що можливе, а не повністю ігровий досвід.
Остатні думки
На цій стадії концепція солідна. Є видима потенціал у тому, як вводу-залежне відео можна сформувати, щоб воно виглядало та відчувалося як ігровий процес. Але це все ще рано. Це дослідницька демонстрація, а не закінчений продукт. Генерація у реальному часі на високій роздільності для тривалих ігрових сесій все ще є технічною проблемою.











