Technologie
Tencents GameCraft ist wilde AI-Technologie für generierbare Videospiele
Tencents Hunyuan-Team hat etwas wirklich Ambitioniertes veröffentlicht: eine neue Technologie namens Hunyuan-GameCraft. Es geht hier nicht darum, dass künstliche Intelligenz (KI) stillstehende Bilder oder kurze Clips generiert. Es geht darum, spielbare Videoerfahrungen aus einfachen Textprompts zu erstellen. Schreiben Sie “ein Boot auf einem See” und im nächsten Moment steuern Sie dieses Boot über ruhige Gewässer in Echtzeit.
Es führt Echtzeitsteuerung in KI-generierte Videos ein und bringt Bewegung, Perspektive und spielähnlichen Fluss in die Erfahrung. Unterstützt durch Diffusionsmodelle und groß angelegte Spielvideos, kombiniert GameCraft KI-Videoerstellung mit Echtzeit-Steuerung durch den Spieler.
Was ist Tencents Hunyuan-GameCraft?
Hunyuan-GameCraft ist ein diffusionsbasiertes Videoerstellungsmodell, das von Tencents KI-Team entwickelt wurde. Was es auszeichnet, ist die Fähigkeit, eine steuerbare Videoszene mithilfe eines Text- oder Bildprompts zu generieren. Sobald die Szene erstellt ist, können Sie sie mit der Tastatur und der Maus erkunden, ähnlich wie ein leichtes Spiel.
Beispielsweise kann das Modell den Prompt “ein schneebedeckter Waldweg” nehmen und einen kontinuierlichen Videoclip ausgeben, der wie Gameplay aussieht. Sie können vorwärts gehen, nach links oder rechts schauen, und das Modell generiert jeden neuen Frame basierend auf Ihrer Eingabe. Es gibt keinen herkömmlichen 3D-Engine dahinter. Das Video entwickelt sich basierend auf Ihren Aktionen.
Was es eigentlich kann
Tencents Hunyuan-GameCraft unterstützt First-Person- und Third-Person-Perspektiven, mit nahtlosen Übergängen zwischen ihnen. Sie können Landschaften, Stadtstraßen, Schlachtfelder oder sogar Science-Fiction-Umwelten erkunden. Jede Bewegung wie Umschauen oder Gehen ist mit dem Vorhersagesystem des Modells verbunden.
Die Steuerung ist vertraut, da Sie die WASD- oder Pfeiltasten verwenden können, um sich zu bewegen und umzuschauen. Die KI übernimmt den Rest. Im Hintergrund liest sie Ihre Eingaben als Bewegungssignale und baut jeden Frame basierend darauf auf. Die Trainingsdaten umfassen über eine Million Videoclips aus mehr als 100 beliebten Spielen. Diese breite Ausstellung ist es, was dem Modell hilft, unterschiedliche visuelle Stile (wie Cyberpunk-Städte, mittelalterliche Burgen oder Naturlandschaften) zu verstehen und sie glaubwürdig zu rekonstruieren.
In den bisher veröffentlichten Demos sind die Szenen vielfältig und visuell reich. Sie sehen Umgebungen wie Stadtstraßen, schneebedeckte Landschaften, Flussufer und mehr. Es fühlt sich an, als ob man durch eine Zwischensequenz oder ein vorgerendertes Spiellevel bewegt. Es ist jedoch wichtig, diese als Forschungsvorschauen zu betrachten. Was wir sehen, ist stark kuratiertes Ausgabe. Es ist noch nicht klar, wie konsistent oder stabil die Qualität über eine breite Palette von Prompts oder längere Interaktionen hinweg wäre.
Wir haben andere Projekte gesehen, die ähnliche Ziele verfolgen. Microsofts WHAM- und Muse-Modelle konzentrieren sich auf die Vorhersage zukünftiger Gameplay-frames basierend auf gelernten Regeln. Odyssey ist ein weiteres jüngstes Beispiel, das ein Video in eine erkundbare Szene mithilfe von KI umwandelt.
Wie funktioniert Hunyuan GameCraft im Hintergrund?
Hunyuan-GameCraft basiert auf fortschrittlicher Videoerstellungs-KI (Diffusionsmodellen) mit speziellen Tricks. Die grundlegende Idee besteht darin, Ihre Tastatur- und Maus-Eingaben als Teil des Video-“Kontexts” oder der Geschichte zu behandeln. Technisch gesehen wandelt es diese Steuerungen in eine Art Kamera-Bewegungssignal um, damit es weiß, wie Sie die Perspektive ändern möchten. Dann vorhersagt es die nächsten Video-frames frame für frame, indem es den Clip in die Richtung erweitert, in die Sie ihn “bewegen”.
Um zu verhindern, dass die Szene herumspringt, verwendet das Modell eine historische Methode. Es erinnert sich, wo Sie aufgehört haben (ein bisschen wie das Halten des Spielzustands im Speicher), damit die Welt nicht plötzlich an einem anderen Ort teleportiert wird. Sie nennen dies “hybride historische Bedingung”. Im Wesentlichen füttert es gelegentlich die alten Frames wieder in sich selbst ein, damit wichtige Details (wie die Position von Objekten und Beleuchtung) konsistent bleiben, während Sie gehen. Die Ersteller haben auch sichergestellt, dass das Modell durch Destillation (d. h. das Verkleinern eines großen Modells in ein kleineres, schnelleres) schneller laufen kann. Auf diese Weise kann es mit Ihren Tastenanschlägen in (fast) Echtzeit mithalten, vorausgesetzt, Sie haben eine leistungsstarke Grafikkarte.
Kurz gesagt, Sie geben ihm ein Startbild oder einen Textprompt und eine Sequenz von Tastenanschlägen. Die KI generiert dann kontinuierlich neue Bilder, sodass es aussieht, als ob Sie durch die Szene gehen oder umschauen. Dank des speziellen Historien-Tricks bleibt die Spielwelt grob konsistent über die Zeit. Zum Beispiel bleiben die Wände und der Boden an Ort und Stelle, anstatt zu glitchen, wenn Sie einen Flur hinuntergehen oder sich um 180° drehen. Das Team zeigt, dass es sogar 3D-Konsistenz über eine lange Zeit aufrechterhält, was für generierte Videos ziemlich beeindruckend ist.
Anwendungsfälle
Was können also Gamer und Entwickler mit dieser Technologie machen? Auf grundlegender Ebene ist es ein kreatives Werkzeug. Spieldesigner könnten es verwenden, um neue Umgebungen oder Levelideen sofort zu prototypisieren. Schriftsteller und Regisseure könnten Storyboards oder Zwischenszenen generieren, indem sie Beschreibungen tippen und dann durch die Szene “spielen”. Für Gamer könnte es eine lustige Möglichkeit sein, benutzerdefinierte Minispiele zu erleben, die Sie spontan erstellen (wie “Ich will einen Drachenkampf auf dem Mars” und plötzlich können Sie das steuern). Es könnte auch helfen, andere KIs zu trainieren: Zum Beispiel könnten wir Roboter oder Agenten in endlosen virtuellen Welten trainieren, die die KI spinnt.
Es gibt noch keine öffentliche Webanwendung, und die Technologie benötigt noch mehr Feinabstimmung in Bezug auf visuelle Qualität und Reaktionszeit. In Demos von ähnlichen Modellen kann die Szene anfangen, zusammenzubrechen, wenn die Kamera zu weit bewegt oder zu sehr rotiert wird. Hunyuans hybride historische Bedingung reduziert dies, aber große Perspektivverschiebungen können immer noch Texturenglitches oder verformte Geometrie verursachen. Im Moment funktioniert es am besten als Forschungsvorschau, etwas, das zeigt, was möglich ist, anstatt eine vollständig spielbare Erfahrung.
Schlussgedanken
In diesem Stadium ist das Konzept solide. Es gibt sichtbares Potenzial in der Art und Weise, wie inputgesteuerte Videos geformt werden können, um wie Gameplay auszusehen und sich anzufühlen. Aber es ist noch früh. Dies ist eine Forschungsdemo, kein fertiges Produkt. Echtzeit-Generierung in hoher Auflösung für verlängerte Spielsitzungen ist immer noch eine technische Herausforderung.











