Spellen
Roblox maakt drie veiligheidsmodellen open source voor de ROOST Model Community
Roblox heeft bijgewerkte versies van drie open‑source trust‑and‑safety‑modellen bijgedragen aan de ROOST Model Community, samen met een nieuwe evaluatiedataset die andere platformen kunnen gebruiken om hun eigen classifiers te benchmarken, het bedrijf kondigde dit aan op 19 augustus 2026.
De uitgave omvat versie 2.0 van Roblox’ PII‑classifier, die pogingen detecteert om persoonlijke informatie te delen of op te vragen in chat; versie 2 van Roblox Sentinel, het vroegtijdige waarschuwingssysteem voor kindermisbruik; en versie 3 van de realtime stemveiligheids‑classifier. Versies van alle drie draaien al in productie op Roblox. ROOST, een afkorting voor Robust Open Online Safety Tools, is de non‑profit waar Roblox begin 2025 als oprichterslid bij kwam, samen met Google, OpenAI en anderen; de modelcommunity verspreidt open, inspecteerbare veiligheidsmodellen die elke organisatie kan inzetten.
De belangrijkste verbetering betreft de PII Classifier. Waar versie 1.0 berichten afzonderlijk evalueerde, leest versie 2.0 elk doelbericht binnen de omliggende multi‑user‑conversatie, een wijziging die gericht is op het opvangen van geobfusceerde omzeilpogingen die alleen in context logisch zijn, zoals een speler die een uitnodiging voor een externe server over twee beurten spelt. Synthetische trainingsdata breidden de taalondersteuning uit van 17 naar 189 talen, en de F1‑score van het model in Roblox’ interne evaluatie steeg van 63,41 naar 90,52. Het model is gebouwd op de XLM‑RoBERTa‑Large‑architectuur met ongeveer 560 miljoen parameters en wordt geleverd onder de Apache 2.0‑licentie, met sigmoid‑uitgangen over drie categorieën: vragen om PII, geven van PII, en gebruikers naar buiten het platform leiden.
A Benchmark Built Around Evasion
Naast het model publiceerde Roblox de Roblox PII Safety for Chat Benchmark, een uitsluitend evaluatiedataset met 39.202 volledig synthetische Engelstalige gesprekken, onderverdeeld in 24.518 veilige en 14.684 onveilige voorbeelden. De dataset‑card vermeldt dat er geen chatgegevens van Roblox‑gebruikers zijn opgenomen; elk gesprek is gegenereerd om omzeilingstechnieken die in online chat voorkomen te modelleren, waaronder fonetisch spellen, homoglyphen, spaties tussen letters, omgekeerde tekst, gecodeerde taal en informatie verdeeld over gespreksturnen.
Het ontwerp van de benchmark richt zich op een leemte in bestaande PII‑evaluaties, waarvan de meeste named‑entity‑extractie testen: vind het e‑mailadres, markeer het telefoonnummer. Risico’s in online‑chat verschijnen vaak voordat er een extraheerbare identifier is, en strings die op identifiers lijken in games zijn vaak onschadelijk: song‑ID’s, XP‑totalen, servercodes, role‑play‑adressen. Hard‑negatieven in de dataset delen opzettelijk oppervlakkige signalen met echte overtredingen, waardoor een model dat reageert op sleutelwoorden of numerieke patronen faalt. Alleen de doel‑spreker wordt geclassificeerd, wat betekent dat een model dat een volledige conversatie markeert zodra een deelnemer PII vermeldt, ook de toewijzingstaak niet haalt.
Op de nieuwe benchmark meldt Roblox dat zijn v2‑classifier een F1‑score van 0,8882 behaalt, tegenover 0,6469 voor de eigen v1.0 en 0,6624 voor Qwen3Guard‑Gen‑8B, het op één na beste model in de lijst, met Meta’s Llama Guard 4 12B op 0,5456 en OpenAI’s privacy‑filter op 0,5816. Deze cijfers zijn de door Roblox zelf gerapporteerde resultaten op haar eigen benchmark, en de dataset‑card geeft aan dat de synthetische verdeling geen productie‑verkeer weerspiegelt.
Sentinel 2.0 Cuts Tuning Sweeps From an Hour to Three Minutes
De Roblox Sentinel, die vroege signalen van mogelijke kindermisbruik markeert voordat berichten expliciet worden, gaat naar versie 2 met een herwerkte afstemmings‑pipeline. Het aantal combinatiefuncties, de aggregatoren die vele per‑observatie‑scores omzetten in één risico‑score, groeit van twee naar zes, en observaties worden nu eenmaal per run gecodeerd in plaats van voor elke configuratie opnieuw berekend. In Roblox’ voorbeeld duurde een run over 324 configuraties minder dan drie minuten, tegenover bijna een uur, en steeg de ROC‑AUC van 0,894 bij standaardinstellingen naar 0,996 met de beste configuratie die de run identificeerde.
De release‑notes documenteren kleinere breaking changes naast de nieuwe functies. Python 3.10 is nu de minimale versie, argumenten na de eerste zijn alleen keyword‑only bij de hoofd‑API‑calls, en verschillende kolommen van de grid‑search‑output werden hernoemd nadat een index‑size‑kolom stilzwijgend een evaluatie‑kolom in versie 1.0 overschreef. Versie 2 bewaart ook de corpus met opgeslagen indexen, zodat score‑uitleg de overeenkomende tekst benoemt na een herlaad in plaats van een rijnummer, en er worden Dockerfiles meegeleverd voor GPU‑ en CPU‑only‑implementaties.
De voice safety classifier, waarvan Roblox aangeeft dat deze sinds de eerste open‑source‑release in 2024 meer dan 72.000 keer is gedownload, modereert nu spraak‑chat in 30 talen en acht overtredingscategorieën met ingebouwde taaldetectie. De model‑card meldt een recall van 61 % bij een strikte false‑positive‑rate van 1 % over alle 30 talen, aangedreven door machinaal gelabelde trainingsdata die is opgeschaald met handmatige labeling voor kwaliteit. Hoewel het onderliggende model is gegroeid van 94,6 miljoen naar 320 miljoen parameters, houdt model‑distillatie het snel genoeg voor realtime detectie. De card publiceert per‑taal recall‑ en precisiecijfers en vermeldt dat de classifier 16 kHz mono WAV‑input verwacht in segmenten tot 15 seconden, met een maximum van 30 seconden.
The Release by the Numbers
- 17 → 189: taalondersteuning in de PII‑classifier, versie 1.0 naar 2.0
- 63.41 → 90.52: F1‑score van de PII‑classifier in Roblox’ interne evaluatie
- 39,202: synthetische gesprekken in de nieuwe benchmark (24.518 veilig, 14.684 onveilig)
- 2 → 6: score‑combinatiefuncties in Sentinel versie 2
- 0.894 → 0.996: Sentinel ROC‑AUC, standaardinstellingen versus beste gesweept‑configuratie
- 30: talen ondersteund door voice safety classifier v3, met 61 % recall en een false‑positive‑rate van 1 %
- 94.6M → 320M: onderliggende parameter‑aantal in de voice‑classifier, gecompenseerd door distillatie
- 72,000+: downloads van de voice‑classifier sinds de open‑source‑release in 2024
How Roblox’s Open-Source Safety Push Got Here
Roblox heeft geleidelijk productie‑veiligheidsmodellen als open source uitgebracht — Sentinel in augustus 2025 en de oorspronkelijke PII‑classifier in november — en deze uitgave voegt bijgewerkte versies van beide toe, plus de voice‑safety‑classifier, aan de ROOST Model Community. Roblox kondigde haar oprichterslidmaatschap in het initiatief aan in februari 2025, met het argument dat veiligheids‑tools gedeelde infrastructuur moeten zijn in plaats van een concurrentievoordeel. Sentinel werd in augustus 2025 open‑source gemaakt, en de oorspronkelijke PII‑classifier volgde in november. De voice‑safety‑classifier bestaat al vóór de ROOST‑regeling, werd voor het eerst uitgebracht in 2024 en in juni 2026 geüpgraded naar versie 3.
Roblox stelt dat de prikkel in beide richtingen werkt: in de 12 maanden tot 7 augustus 2026 kwam bijna 70 % van de kindermisbruik‑gevallen die het detecteerde voort uit Sentinel’s vroege detectie, en versie 2 integreert feedback van andere ROOST‑leden over evaluatie en scoring. De bijdrage komt op een moment dat de moderatiepraktijken van het platform steeds meer regelgevende aandacht in Europa krijgen, waar Roblox naar de strengste platformregels van de EU toe beweegt. Alle drie de modellen en de benchmark zijn nu beschikbaar op Hugging Face en GitHub onder de Apache 2.0‑licentie.











