Spil

Roblox gør tre sikkerhedsmodeller open source for ROOST Model Community

Føj Gaming.net til dine foretrukne kilder på Google

Roblox har bidraget med opdaterede versioner af tre open‑source tillids‑og‑sikkerhedsmodeller til ROOST Model Community, sammen med et nyt evalueringsdatasæt, som andre platforme kan bruge til at benchmarke deres egne klassifikatorer, meddelte virksomheden den 19. august 2026.

Udgivelsen omfatter version 2.0 af Roblox’ PII‑klassifikator, som opdager forsøg på at dele eller anmode om personlige oplysninger i chat; version 2 af Roblox Sentinel, deres tidlige advarselssystem for børnefare; og version 3 af deres real‑time stemmesikkerhedsklassifikator. Versionerne af alle tre kører allerede i produktion på Roblox. ROOST, forkortelse for Robust Open Online Safety Tools, er den nonprofitorganisation, som Roblox blev medstifter af i begyndelsen af 2025 sammen med Google, OpenAI og andre; dens model‑fællesskab distribuerer åbne, gennemsigtige sikkerhedsmodeller, som enhver organisation kan implementere.

Den mest markante forbedring tilhører PII‑klassifikatoren. Hvor version 1.0 evaluerede beskeder isoleret, læser version 2.0 hver målbesked i konteksten af den omgivende fler‑bruger‑samtale, en ændring der har til formål at fange obfuskere omgåelsesforsøg, som kun giver mening i kontekst, f.eks. en spiller der staver en invitation til en ekstern server over to beskeder. Syntetisk træningsdata udvidede sprogunderstøttelsen fra 17 sprog til 189, og modellens F1‑score på Roblox’ interne evaluering steg fra 63,41 til 90,52. Modellen er bygget på XLM‑RoBERTa‑Large‑arkitekturen med cirka 560 millioner parametre og udgives under Apache 2.0‑licensen, med sigmoid‑output over tre kategorier: anmodning om PII, deling af PII og dirigering af brugere uden for platformen.

Et benchmark bygget omkring omgåelse

Sammen med modellen offentliggjorde Roblox Roblox PII Safety for Chat Benchmark, et udelukkende evaluerings‑datasæt bestående af 39.202 fuldstændigt syntetiske engelske samtaler, opdelt i 24.518 sikre og 14.684 usikre eksempler. Datasæt‑kortet angiver, at ingen Roblox‑bruger‑chatdata er inkluderet; hver samtale blev genereret for at modellere omgåelsesteknikker set i online‑chat, herunder fonetisk stavning, homoglyffer, mellemrum i bogstaver, omvendt tekst, kodet sprog og information spredt over samtaleture.

Benchmarkens design sigter mod et hul i eksisterende PII‑evalueringer, hvor de fleste tester navngivet‑entity‑udtræk: find e‑mailadressen, tag telefonnummeret. Risiko i online‑chat opstår ofte før nogen udtræknings‑identifikator er til stede, og streng‑lignende strenge i spil er ofte harmløse: sang‑ID’er, XP‑totaler, serverkoder, rollespils‑adresser. Hårde negative eksempler i datasættet deler bevidst overfladiske signaler med ægte overtrædelser, så en model der kun reagerer på nøgleord eller numeriske mønstre fejler. Kun den målrettede taler klassificeres, hvilket betyder at en model der flagger en hel samtale, så snart nogen deltager nævner PII, også fejler i attribution‑opgaven.

På det nye benchmark rapporterer Roblox, at deres v2‑klassifikator opnår en F1 på 0,8882 sammenlignet med 0,6469 for deres egen v1.0 og 0,6624 for Qwen3Guard‑Gen‑8B, den næstbedste model på listen, mens Meta’s Llama Guard 4 12B ligger på 0,5456 og OpenAI’s privatlivsfilter på 0,5816. Disse tal er Roblox’ egne rapporter på deres eget benchmark, og datasæt‑kortet bemærker, at den syntetiske fordeling ikke afspejler produktions‑trafik.

Sentinel 2.0 reducerer tuning‑sweeps fra en time til tre minutter

Roblox Sentinel, som flagger tidlige signaler om potentiel børnefare, før beskeder bliver eksplicitte, går over til version 2 med en omarbejdet tuning‑pipeline. Antallet af kombineringsfunktioner, aggregaterne der omdanner mange per‑observation‑scores til en enkelt risikoscore, vokser fra to til seks, og observationer kodes nu én gang per sweep i stedet for at blive genberegnet for hver konfiguration. I Roblox’ eksempel afsluttede en sweep over 324 konfigurationer på under tre minutter, ned fra næsten en time, og ROC‑AUC steg fra 0,894 på standardindstillinger til 0,996 med den bedste konfiguration, som sweep’en identificerede.

Udgivelsesnoterne dokumenterer smallere breaking changes sammen med funktionerne. Python 3.10 er nu minimumsversionen, argumenter efter det første er kun nøgleord på hoved‑API‑kald, og flere kolonner i grid‑search‑output blev omdøbt efter at en indeks‑størrelses‑kolonne tavst overskrev en evaluerings‑kolonne i version 1.0. Version 2 bevarer også korpuset med gemte indekser, så score‑forklaringer navngiver den matchede tekst efter en genindlæsning i stedet for et rækkenummer, og den leveres med Docker‑files til GPU‑ og CPU‑kun‑implementeringer.

Stemmesikkerhedsklassifikatoren, som Roblox siger er blevet downloadet mere end 72.000 gange siden den første gang blev gjort open source i 2024, modererer nu stemme‑chat på tværs af 30 sprog og otte overtrædelses‑kategorier med indbygget sprogdetektion. Modelkortet rapporterer 61 % recall ved en streng falsk‑positiv‑rate på 1 % på tværs af alle 30 sprog, drevet af maskin‑mærket træningsdata opskaleret med menneskelig mærkning for kvalitet. Selvom den underliggende model voksede fra 94,6 millioner til 320 millioner parametre, holder model‑destillation den hurtig nok til real‑time detektion. Kortet offentliggør recall‑ og precision‑tal per sprog og bemærker, at klassifikatoren forventer 16 kHz mono WAV‑input i segmenter på op til 15 sekunder, med et maksimum på 30 sekunder.

Udgivelsen i tal

  • 17 → 189: sprogunderstøttelse i PII‑klassifikatoren, version 1.0 til 2.0
  • 63.41 → 90.52: PII‑klassifikatorens F1‑score i Roblox’ interne evaluering
  • 39,202: syntetiske samtaler i det nye benchmark (24.518 sikre, 14.684 usikre)
  • 2 → 6: score‑kombineringsfunktioner i Sentinel version 2
  • 0.894 → 0.996: Sentinel ROC‑AUC, standardindstillinger versus bedste sweep‑konfiguration
  • 30: sprog dækket af stemmesikkerhedsklassifikator v3, med 61 % recall og 1 % falsk‑positiv‑rate
  • 94.6M → 320M: underliggende parameterantal i stemmeklassifikatoren, udlignet af destillation
  • 72,000+: downloads af stemmesikkerhedsklassifikatoren siden dens open‑source‑udgivelse i 2024

Hvordan Roblox’ open‑source sikkerhedsinitiativer kom hertil

Roblox har løbende frigivet produktions‑sikkerhedsmodeller som open source — Sentinel i august 2025 og den oprindelige PII‑klassifikator i november samme år — og denne udgivelse tilføjer opdaterede versioner af begge samt deres stemmesikkerhedsklassifikator til ROOST Model Community. Roblox annoncerede sit stiftende medlemskab i initiativet i februar 2025 og argumenterede dengang for, at sikkerhedsværktøjer bør være delt infrastruktur frem for en konkurrencefordel. Sentinel blev open source i august 2025, og den oprindelige PII‑klassifikator fulgte i november. Stemmesikkerhedsklassifikatoren er ældre end ROOST‑arrangementet, først udgivet i 2024 og opgraderet til sin tredje version i juni 2026.

Roblox siger, at incitamentet fungerer begge veje: i de 12 måneder, der sluttede den 7. august 2026, kom næsten 70 % af de børne‑fare‑sager, de opdagede, gennem Sentinels tidlige detektion, og version 2 inkorporerer feedback fra andre ROOST‑medlemmer om evaluering og scoring. Bidraget lander, mens platformens moderationspraksis møder stigende regulatorisk opmærksomhed i Europa, hvor Roblox bevæger sig tættere på EU’s strengeste platformregler. Alle tre modeller og benchmarken er nu tilgængelige på Hugging Face og GitHub under Apache 2.0‑licensen.

Ethan Lockhart er en AI-genereret analytiker på Gaming.net, der dækker navngivne udviklinger i spilmotor-fremgang, værktøjsfrigivelse, middleware-meddelelser og tekniske økosystemskift.

Ethan rapporterer om specifikke nyheder — SDK-opdateringer, motorlicensændringer, udvikleradoptionstrends og værktøjsintegrationer — og beskriver, hvordan disse begivenheder påvirker udviklere og slutbrugere.

Artikler skrevet af Ethan Lockhart er AI-genereret og gennemgået af Gaming.net's redaktionelle team for at sikre specifikke, tekniske nøjagtighed og professionel dækning af spiludviklingsteknologier knyttet til verificerbare kilder.