Spiele
Roblox veröffentlicht drei Sicherheitsmodelle als Open Source für die ROOST Model Community
Roblox hat aktualisierte Versionen von drei Open-Source‑Vertrauens‑ und‑Sicherheitsmodellen der ROOST Model Community beigetragen, zusammen mit einem neuen Evaluierungs‑Datensatz, den andere Plattformen zur Bewertung ihrer eigenen Klassifikatoren nutzen können, das Unternehmen kündigte am 19. August 2026 an.
Die Veröffentlichung umfasst Version 2.0 des PII‑Classifiers von Roblox, der Versuche erkennt, persönliche Informationen im Chat zu teilen oder anzufordern; Version 2 von Roblox Sentinel, seinem Frühwarnsystem für Kindesgefährdung; und Version 3 seines Echtzeit‑Sprachsicherheitsklassifikators. Versionen aller drei laufen bereits in der Produktion bei Roblox. ROOST, kurz für Robust Open Online Safety Tools, ist die gemeinnützige Organisation, der Roblox Anfang 2025 zusammen mit Google, OpenAI und anderen als Gründungsmitglied beigetreten ist; ihre Modell‑Community verteilt offene, prüfbare Sicherheitsmodelle, die jede Organisation einsetzen kann.
Die herausragende Verbesserung betrifft den PII Classifier. Während Version 1.0 Nachrichten isoliert bewertete, liest Version 2.0 jede Zielnachricht im Kontext ihrer umgebenden Mehrbenutzer‑Konversation, eine Änderung, die darauf abzielt, verschleierte Umgehungsversuche zu erfassen, die nur im Zusammenhang Sinn ergeben, etwa wenn ein Spieler eine Einladung zu einem Server außerhalb der Plattform über zwei Nachrichten hinweg buchstabiert. Synthetische Trainingsdaten erweiterten die Sprachunterstützung von 17 auf 189 Sprachen, und die F1‑Score des Modells in Roblox’ interner Evaluation stieg von 63,41 auf 90,52. Das Modell basiert auf der XLM‑RoBERTa‑Large‑Architektur mit etwa 560 Millionen Parametern und wird unter der Apache‑2.0‑Lizenz bereitgestellt, mit Sigmoid‑Ausgaben für drei Kategorien: nach PII fragen, PII geben und Nutzer von der Plattform wegführen.
Ein Benchmark, der auf Umgehung ausgerichtet ist
Zusammen mit dem Modell veröffentlichte Roblox den Roblox PII Safety for Chat Benchmark, einen reinen Evaluierungs‑Datensatz mit 39 202 vollständig synthetischen englischen Unterhaltungen, aufgeteilt in 24 518 sichere und 14 684 unsichere Beispiele. Die Datensatz‑Beschreibung weist darauf hin, dass keine Roblox‑Nutzer‑Chat‑Daten enthalten sind; jede Unterhaltung wurde erzeugt, um Umgehungstechniken nachzubilden, die in Online‑Chats vorkommen, darunter phonetische Rechtschreibung, Homoglyphen, Leerzeichen zwischen Buchstaben, umgekehrter Text, codierte Sprache und über Gesprächsrunden verteilte Informationen.
Das Design des Benchmarks schließt eine Lücke in bestehenden PII‑Evaluierungen, von denen die meisten die Extraktion benannter Entitäten testen: die E‑Mail‑Adresse finden, die Telefonnummer markieren. Risiken in Online‑Chats treten häufig auf, bevor ein extrahierbarer Identifikator vorhanden ist, und Zeichenketten, die wie Identifikatoren aussehen, sind in Spielen oft harmlos: Song‑IDs, XP‑Summen, Server‑Codes, Rollenspiel‑Adressen. Harte Negative im Datensatz teilen absichtlich Oberflächensignale mit echten Verstößen, sodass ein Modell, das nur auf Schlüsselwörter oder numerische Muster reagiert, scheitert. Nur der Zielsprecher wird klassifiziert, was bedeutet, dass ein Modell, das ein gesamtes Gespräch markiert, sobald irgendein Teilnehmer PII erwähnt, ebenfalls die Zuordnungsaufgabe verfehlt.
Im neuen Benchmark gibt Roblox an, dass sein v2‑Classifier eine F1‑Score von 0,8882 erzielt, verglichen mit 0,6469 für das eigene v1.0 und 0,6624 für Qwen3Guard‑Gen‑8B, das nächstbeste gelistete Modell, während Meta’s Llama Guard 4 12B bei 0,5456 und OpenAI’s Datenschutz‑Filter bei 0,5816 liegen. Diese Zahlen sind von Roblox selbst auf ihrem eigenen Benchmark gemeldet, und die Datensatz‑Beschreibung weist darauf hin, dass die synthetische Verteilung nicht den Produktions‑Traffic widerspiegelt.
Sentinel 2.0 verkürzt Tuning‑Durchläufe von einer Stunde auf drei Minuten
Roblox Sentinel, das frühe Signale potenzieller Kindesgefährdung erkennt, bevor Nachrichten explizit werden, wechselt zu Version 2 mit einer überarbeiteten Tuning‑Pipeline. Die Anzahl der Kombinationsfunktionen, also der Aggregatoren, die viele pro‑Beobachtung‑Scores zu einem einzigen Risikoscore zusammenfassen, steigt von zwei auf sechs, und Beobachtungen werden nun einmal pro Durchlauf kodiert, anstatt für jede Konfiguration neu berechnet zu werden. In Roblox’ Beispiel wurde ein Durchlauf über 324 Konfigurationen in weniger als drei Minuten abgeschlossen, gegenüber fast einer Stunde zuvor, und der ROC‑AUC stieg von 0,894 bei den Standardeinstellungen auf 0,996 mit der besten vom Durchlauf ermittelten Konfiguration.
Die Versionshinweise dokumentieren engere Breaking Changes neben den Features. Python 3.10 ist nun die Mindestversion, Argumente nach dem ersten sind bei den Haupt‑API‑Aufrufen nur noch als Schlüsselwort zulässig, und mehrere Spalten der Grid‑Search‑Ausgabe wurden umbenannt, nachdem eine Index‑Größen‑Spalte stillschweigend eine Evaluierungs‑Spalte in Version 1.0 überschrieben hatte. Version 2 speichert zudem das Korpus mit gespeicherten Indizes, sodass Score‑Erklärungen den übereinstimmenden Text nach einem Neuladen statt einer Zeilennummer benennen, und es werden Dockerfiles für GPU‑ und CPU‑nur‑Bereitstellungen bereitgestellt.
Der voice safety classifier, den Roblox zufolge seit seiner ersten Open‑Source‑Veröffentlichung 2024 mehr als 72 000 Mal heruntergeladen wurde, moderiert nun Sprach‑Chat in 30 Sprachen und acht Verletzungskategorien mit integrierter Spracherkennung. Die Modell‑Karte berichtet von einem Recall von 61 % bei einer strengen Fehlalarm‑Rate von 1 % über alle 30 Sprachen hinweg, ermöglicht durch maschinell gekennzeichnete Trainingsdaten, die mit menschlicher Beschriftung für Qualität skaliert wurden. Obwohl das zugrunde liegende Modell von 94,6 Millionen auf 320 Millionen Parameter wuchs, hält die Modell‑Distillation es schnell genug für Echtzeit‑Erkennung. Die Karte veröffentlicht Recall‑ und Präzisionswerte pro Sprache und weist darauf hin, dass der Klassifikator 16 kHz Mono‑WAV‑Eingaben in Segmenten bis zu 15 Sekunden erwartet, mit einem Maximum von 30 Sekunden.
Die Veröffentlichung nach Zahlen
- 17 → 189: Sprachunterstützung im PII‑Classifier, Version 1.0 zu 2.0
- 63.41 → 90.52: PII‑Classifier‑F1‑Score in Roblox’ interner Evaluation
- 39,202: synthetische Unterhaltungen im neuen Benchmark (24 518 sicher, 14 684 unsicher)
- 2 → 6: Score‑Kombinationsfunktionen in Sentinel Version 2
- 0.894 → 0.996: Sentinel ROC‑AUC, Standardeinstellungen versus beste durch Sweep ermittelte Konfiguration
- 30: Sprachen, die vom voice safety classifier v3 abgedeckt werden, bei 61 % Recall und 1 % Fehlalarm‑Rate
- 94.6M → 320M: zugrunde liegende Parameterzahl im voice classifier, ausgeglichen durch Distillation
- 72,000+: Downloads des voice safety classifier seit seiner Open‑Source‑Veröffentlichung 2024
Wie Roblox’ Open‑Source‑Sicherheitsinitiative hierher kam
Roblox veröffentlicht kontinuierlich Produktions‑Sicherheitsmodelle als Open Source – Sentinel im August 2025 und den ursprünglichen PII‑Classifier im November desselben Jahres – und diese Veröffentlichung fügt aktualisierte Versionen beider sowie seines voice safety classifier zur ROOST Model Community hinzu. Roblox kündigte seine Gründungsmitgliedschaft in der Initiative im Februar 2025 an und argumentierte damals, dass Sicherheits‑Tools gemeinsame Infrastruktur und kein Wettbewerbsvorteil sein sollten. Sentinel wurde im August 2025 Open Source gestellt, und der ursprüngliche PII‑Classifier folgte im November. Der voice safety classifier ist älter als die ROOST‑Vereinbarung, wurde erstmals 2024 veröffentlicht und im Juni 2026 auf seine dritte Version aktualisiert.
Roblox sagt, der Anreiz wirke in beide Richtungen: In den 12 Monaten bis zum 7. August 2026 kamen fast 70 % der von ihnen erkannten Kindesgefährdungs‑Fälle durch Sentinels Frühwarnung zustande, und Version 2 integriert Feedback anderer ROOST‑Mitglieder zu Evaluation und Scoring. Der Beitrag erscheint, während die Moderationspraktiken der Plattform zunehmende regulatorische Aufmerksamkeit in Europa erhalten, wo Roblox sich den strengsten EU‑Plattformregeln annähert. Alle drei Modelle und der Benchmark stehen jetzt auf Hugging Face und GitHub unter der Apache‑2.0‑Lizenz zur Verfügung.











