Spill
Roblox gjør tre sikkerhetsmodeller åpen kildekode for ROOST-modellfellesskapet
Roblox har bidratt med oppdaterte versjoner av tre åpen kildekode‑tillit‑og‑sikkerhetsmodeller til ROOST Model Community, sammen med et nytt evalueringsdatasett som andre plattformer kan bruke til å benchmarke sine egne klassifikatorer, kunngjorde selskapet 19. august 2026.
Utgivelsen omfatter versjon 2.0 av Roblox sin PII‑klassifikator, som oppdager forsøk på å dele eller etterspørre personlig informasjon i chat; versjon 2 av Roblox Sentinel, deres tidlige varselsystem for barnemishandling; og versjon 3 av den sanntids‑stemmesikkerhetsklassifikatoren. Versjoner av alle tre kjører allerede i produksjon på Roblox. ROOST, en forkortelse for Robust Open Online Safety Tools, er den ideelle organisasjonen Roblox ble med som stiftende medlem tidlig i 2025 sammen med Google, OpenAI og andre; modellfellesskapet distribuerer åpne, inspiserbare sikkerhetsmodeller som enhver organisasjon kan sette i drift.
Hovedforbedringen tilhører PII Classifier. Hvor versjon 1.0 evaluerte meldinger isolert, leser versjon 2.0 hver målmelding i konteksten av den omkringliggende flerbruker‑samtalen, en endring som skal fange opp obfuskert omgåelsesforsøk som kun gir mening i sammenheng, for eksempel en spiller som staver ut en invitasjon til en ekstern server over to meldinger. Syntetiske treningsdata utvidet språkstøtten fra 17 språk til 189, og modellens F1‑score i Roblox sin interne evaluering steg fra 63,41 til 90,52. Modellen er bygget på XLM‑RoBERTa‑Large‑arkitekturen med omtrent 560 millioner parametere og distribueres under Apache 2.0‑lisensen, med sigmoid‑utganger over tre kategorier: etterspør PII, gir PII, og dirigerer brukere utenfor plattformen.
En benchmark bygget rundt omgåelse
Sammen med modellen publiserte Roblox Roblox PII Safety for Chat Benchmark, et kun‑evalueringsdatasett med 39 202 fullstendig syntetiske engelske samtaler, delt inn i 24 518 trygge og 14 684 utrygge eksempler. Datasett‑kortet oppgir at ingen Roblox‑bruker‑chat‑data er inkludert; hver samtale ble generert for å modellere omgåelsesteknikker som observeres i nett‑chat, inkludert fonetisk staving, homoglyfer, bokstavavstand, omvendt tekst, kodet språk og informasjon spredt over samtaleturer.
Benchmark‑designet retter seg mot et hull i eksisterende PII‑evalueringer, hvor de fleste tester navngitt‑entitets‑uttrekk: finn e‑postadressen, merk telefonnummeret. Risiko i nett‑chat oppstår ofte før noen ekstraherbare identifikatorer finnes, og streng‑liknende strenger i spill er ofte harmløse: sang‑ID‑er, XP‑summer, serverkoder, rollespill‑adresser. Hard‑negative eksempler i datasettet deler bevisst overfladiske signaler med ekte brudd, slik at en modell som utløses av nøkkelord eller numeriske mønstre mislykkes. Kun mål‑taleren klassifiseres, noe som betyr at en modell som flagger en hel samtale når noen deltaker nevner PII også mislykkes i attribusjonsoppgaven.
På den nye benchmarken rapporterer Roblox at deres v2‑klassifikator oppnår en F1‑score på 0,8882 sammenlignet med 0,6469 for deres egen v1.0 og 0,6624 for Qwen3Guard‑Gen‑8B, den nest beste modellen i listen, mens Meta sin Llama Guard 4 12B får 0,5456 og OpenAI‑s personvernfilter får 0,5816. Disse tallene er Roblox sine egne rapporterte resultater på deres egen benchmark, og datasett‑kortet bemerker at den syntetiske fordelingen ikke representerer produksjonstrafikk.
Sentinel 2.0 reduserer tuning‑sveiper fra en time til tre minutter
Roblox Sentinel, som flagger tidlige signaler om potensiell barnemishandling før meldingene blir eksplisitte, går over til versjon 2 med en omarbeidet tuning‑pipeline. Antallet kombineringsfunksjoner, aggregatorene som omdanner mange per‑observasjons‑score til en enkelt risikoscore, øker fra to til seks, og observasjoner blir nå kodet én gang per sveip i stedet for å bli rekalkulert for hver konfigurasjon. I Roblox sitt eksempel ble et sveip over 324 konfigurasjoner fullført på under tre minutter, ned fra nesten en time, og ROC‑AUC steg fra 0,894 på standardinnstillinger til 0,996 med den beste konfigurasjonen sveipen identifiserte.
Utgivelsesnotatene dokumenterer smalere breaking‑changes ved siden av funksjonene. Python 3.10 er nå minimumsversjon, argumenter etter det første er kun nøkkelord på hoved‑API‑kallene, og flere kolonner i grid‑search‑output ble omdøpt etter at en indeks‑størrelses‑kolonne stille overskrev en evalueringskolonne i versjon 1.0. Versjon 2 lagrer også korpuset med lagrede indekser, slik at score‑forklaringer navngir den matchede teksten etter en gjenlasting i stedet for et rad‑nummer, og den leveres med Docker‑filer for GPU‑ og kun‑CPU‑distribusjoner.
Stemmesikkerhetsklassifikatoren voice safety classifier, som Roblox oppgir har blitt lastet ned mer enn 72 000 ganger siden den først ble gjort åpen kildekode i 2024, modererer nå stemme‑chat på 30 språk og åtte overtredelses‑kategorier med innebygd språkdeteksjon. Modellkortet rapporterer 61 % recall ved en streng 1 % falsk‑positiv‑rate på tvers av alle 30 språk, drevet av maskin‑merkede treningsdata som er skalert opp med menneskelig merking for kvalitet. Selv om den underliggende modellen vokste fra 94,6 millioner til 320 millioner parametere, holder modell‑destillasjon den rask nok for sanntids‑deteksjon. Kortet publiserer recall‑ og presisjons‑tall per språk og bemerker at klassifikatoren forventer 16 kHz mono WAV‑input i segmenter på opptil 15 sekunder, med en maksgrense på 30 sekunder.
Utgivelsen i tall
- 17 → 189: språkstøtte i PII‑klassifikatoren, versjon 1.0 til 2.0
- 63.41 → 90.52: PII‑klassifikatorens F1‑score i Roblox sin interne evaluering
- 39,202: syntetiske samtaler i den nye benchmarken (24,518 trygge, 14,684 utrygge)
- 2 → 6: score‑kombineringsfunksjoner i Sentinel versjon 2
- 0.894 → 0.996: Sentinel ROC‑AUC, standardinnstillinger versus beste sveip‑konfigurasjon
- 30: språk dekket av stemmesikkerhetsklassifikator v3, med 61 % recall og 1 % falsk‑positiv‑rate
- 94.6M → 320M: underliggende parameterantall i stemmeklassifikatoren, kompensert av destillasjon
- 72,000+: nedlastinger av stemmesikkerhetsklassifikatoren siden den ble gjort åpen kildekode i 2024
Hvordan Roblox sin åpen‑kilde‑sikkerhetsinnsats kom hit
Roblox har jevnt og trutt publisert produksjons‑sikkerhetsmodeller som åpen kildekode — Sentinel i august 2025 og den originale PII‑klassifikatoren i november samme år — og denne utgivelsen legger til oppdaterte versjoner av begge samt stemmesikkerhetsklassifikatoren i ROOST Model Community. Roblox kunngjorde sitt stiftende medlemskap i initiativet i februar 2025, og argumenterte da for at sikkerhetsverktøy bør være delt infrastruktur snarere enn en konkurransefordel. Sentinel ble gjort åpen kildekode i august 2025, og den originale PII‑klassifikatoren fulgte i november. Stemmesikkerhetsklassifikatoren er eldre enn ROOST‑arrangementet, ble først utgitt i 2024 og oppgradert til sin tredje versjon i juni 2026.
Roblox sier at insentivet fungerer i begge retninger: per 12 månedersperioden som sluttet 7. august 2026 kom nesten 70 % av barne‑mishandlingssakene de oppdaget gjennom Sentinels tidlige deteksjon, og versjon 2 innlemmer tilbakemeldinger fra andre ROOST‑medlemmer om evaluering og scoring. Bidraget kommer mens plattformens moderasjonspraksis møter økende regulatorisk oppmerksomhet i Europa, hvor Roblox beveger seg nærmere EUs strengeste plattformsregler. Alle tre modellene og benchmarken er nå tilgjengelige på Hugging Face og GitHub under Apache 2.0‑lisensen.











