Tecnologia
La tecnologia di gioco di Tencent è una tecnologia AI selvaggia per la generazione di video giocabili
Il team di Hunyuan di Tencent ha rilasciato qualcosa di veramente ambizioso: una nuova tecnologia chiamata Hunyuan-GameCraft. Questo non riguarda la generazione di immagini fisse o clip brevi da parte dell’AI. Si tratta di creare esperienze video giocabili a partire da semplici prompt di testo. Scrivi “una barca su un lago” e il momento successivo, ti troverai a guidare quella barca attraverso acque calme in tempo reale.
Introduce il controllo in tempo reale nella generazione di video AI, portando movimento, prospettiva e flusso simile a un gioco nell’esperienza. Supportato da modelli di diffusione e footage di gioco su larga scala, GameCraft combina la generazione di video AI con il controllo del giocatore in tempo reale.
Cosa è Hunyuan-GameCraft di Tencent?
Hunyuan-GameCraft è un modello di generazione di video basato sulla diffusione sviluppato dal team di intelligenza artificiale di Tencent. Ciò che lo distingue è la capacità di generare una scena video controllabile utilizzando solo un prompt di testo o un’immagine. Una volta creata la scena, puoi esplorarla utilizzando la tastiera e il mouse, come una versione leggera di un gioco giocabile.
Ad esempio, il modello può prendere il prompt “un sentiero nella foresta innevata” e output un video continuo che sembra gameplay. Puoi muoverti in avanti, girare a sinistra o a destra e il modello genera ogni nuovo frame in base al tuo input. Non c’è un tradizionale motore 3D dietro di questo. Il video evolve in base alle tue azioni.
Cosa può fare effettivamente
Hunyuan-GameCraft di Tencent supporta viste in prima e terza persona, con transizioni fluide tra loro. Puoi esplorare paesaggi, strade cittadine, campi di battaglia o anche ambienti di fantascienza. Ogni movimento come guardare intorno o camminare è legato al sistema di previsione del modello.
I controlli sono familiari, poiché puoi utilizzare le tasti WASD o le frecce per muoverti e guardare intorno. L’AI gestisce il resto. Dietro le quinte, sta leggendo i tuoi input come segnali di movimento e costruendo ogni frame in base a quello. I dati di training includono oltre un milione di clip video da più di 100 giochi popolari. Quella vasta esposizione è ciò che aiuta il modello a comprendere diversi stili visivi (come città cyberpunk, castelli medievali o paesaggi naturali) e a ricostruirli in modo credibile.
Nelle demo rilasciate finora, le scene sono variegate e ricche di dettagli visivi. Vedi ambienti come strade cittadine, paesaggi innevati, rive dei fiumi e altro ancora. Si sente vicino a muoversi attraverso una scena o un livello di gioco pre-renderizzato. Ma è importante considerare queste come anteprime di ricerca. Ciò che stiamo vedendo è output altamente curato. Non è ancora chiaro quanto consistente o stabile sarebbe la qualità attraverso una vasta gamma di prompt o interazioni più lunghe.
Abbiamo visto altri progetti che mirano a obiettivi simili. I modelli WHAM e Muse di Microsoft (MSFT ) si concentrano sulla previsione dei frame di gameplay futuri in base a regole apprese. Odyssey è un altro esempio recente che trasforma un video in una scena esplorabile utilizzando l’AI.
Come funziona Hunyuan GameCraft dietro le quinte?
Hunyuan-GameCraft è costruito su una tecnologia di generazione di video AI (modelli di diffusione) con trucchi speciali. L’idea chiave è che tratta i tuoi input da tastiera/mouse come parte del “contesto” o della storia del video. Tecnicamente, converte quei controlli in un tipo di segnale di movimento della telecamera in modo che sappia come vuoi che la prospettiva cambi. Quindi prevede i prossimi frame del video frame per frame, estendendo il clip nella direzione in cui “ti muovi”.
Per evitare che la scena salti intorno, il modello utilizza un metodo basato sulla storia. Ricorda dove ti sei fermato (un po’ come tenere lo stato del gioco in memoria) in modo che il mondo non si teletrasporti improvvisamente da un’altra parte. Lo chiamano “condizionamento ibrido della storia”. Fondamentalmente, a volte riporta i vecchi frame dentro di sé in modo che i dettagli importanti (come la posizione degli oggetti e l’illuminazione) rimangano coerenti mentre ti muovi. Gli sviluppatori hanno anche assicurato che il modello possa essere eseguito più velocemente distillandolo (cioè riducendo un modello grande in uno più piccolo e veloce). In questo modo può tenere il passo con i tuoi input da tastiera in (quasi) tempo reale, dato un GPU potente.
In sintesi, fornisci un’immagine o un prompt di testo iniziale e una sequenza di pressioni dei tasti. L’AI continua a prevedere nuove immagini in modo che sembri che tu stia camminando o guardando intorno alla scena. Grazie al trucco speciale della storia, il mondo del gioco rimane approssimativamente coerente nel tempo. Ad esempio, se cammini lungo un corridoio o ti giri di 180°, i muri e il pavimento rimarranno al loro posto invece di glitchare. Il team mostra che mantiene anche la coerenza 3D per un lungo periodo, il che è abbastanza impressionante per un video generato.
Casi d’uso
Quindi, cosa possono fare i giocatori e gli sviluppatori con questa tecnologia? A un livello di base, è uno strumento creativo. I designer di giochi potrebbero utilizzarlo per prototipare nuovi ambienti o idee di livelli istantaneamente. Gli scrittori e i registi potrebbero generare storyboard o scene di cutscene semplicemente digitando descrizioni e poi modificarle “giocando” attraverso la scena. Per i giocatori, potrebbe essere un modo divertente per sperimentare mini-giochi personalizzati che crei al volo (come “voglio una lotta con un drago su Marte” e improvvisamente puoi controllarlo). Potrebbe anche aiutare ad addestrare altre AI: ad esempio, potremmo addestrare robot o agenti in mondi virtuali infiniti che l’AI crea.
Non c’è ancora un’applicazione web pubblica e la tecnologia necessita ancora di ulteriore raffinamento in termini di qualità visiva e reattività. Nelle demo di altri modelli simili, quando la telecamera si muove troppo lontano o ruota troppo, la scena può iniziare a rompersi. La condizionamento ibrido della storia di Hunyuan riduce questo, ma grandi spostamenti prospettici possono ancora causare glitch di texture o geometria distorta. Al momento, funziona meglio come un’anteprima di ricerca, qualcosa che mostra cosa è possibile, piuttosto che un’esperienza completamente giocabile.
Pensieri finali
A questo stadio, il concetto è solido. C’è un potenziale visibile in come l’input-driven video possa essere plasmato per sembrare e sentirsi come gameplay. Ma è ancora presto. Questo è un demo di ricerca, non un prodotto finito. La generazione in tempo reale ad alta risoluzione per sessioni di gioco prolungate è ancora una sfida tecnica.











