Spel

Roblox öppnar källkoden för tre säkerhetsmodeller för ROOST Model Community

Lägg till Gaming.net bland dina föredragna källor på Google

Roblox har bidragit med uppdaterade versioner av tre öppen källkod‑baserade förtroende‑och‑säkerhetsmodeller till ROOST Model Community, tillsammans med ett nytt utvärderingsdataset som andra plattformar kan använda för att benchmarka sina egna klassificerare, meddelade företaget den 19 augusti 2026.

Utgåvan omfattar version 2.0 av Roblox’s PII Classifier, som upptäcker försök att dela eller begära personlig information i chatt; version 2 av Roblox Sentinel, dess tidiga varningssystem för barnfaror; och version 3 av dess realtids‑röst‑säkerhetsklassificerare. Versioner av alla tre körs redan i produktion på Roblox. ROOST, en förkortning för Robust Open Online Safety Tools, är den ideella organisation som Roblox gick med i som grundande medlem i början av 2025 tillsammans med Google, OpenAI och andra; dess modellgemenskap distribuerar öppna, inspekterbara säkerhetsmodeller som vilken organisation som helst kan implementera.

Den ledande förbättringen tillhör PII Classifier. Där version 1.0 utvärderade meddelanden isolerat, läser version 2.0 varje målmeddelande inom sin omgivande flervägskonversation, en förändring avsedd att fånga fördolda kringgångsförsök som bara är meningsfulla i sammanhang, såsom en spelare som stavar ett inbjudningsmeddelande till en server utanför plattformen över två turer. Syntetiska träningsdata utökade språkstödet från 17 språk till 189, och modellens F1‑poäng i Roblox interna utvärdering steg från 63.41 till 90.52. Modellen är byggd på XLM‑RoBERTa‑Large‑arkitekturen med ungefär 560 miljoner parametrar och levereras under Apache 2.0‑licensen, med sigmoid‑utgångar över tre kategorier: begär PII, ger PII och dirigerar användare bort från plattformen.

Ett benchmark byggt kring undvikande

Parallellt med modellen publicerade Roblox Roblox PII Safety for Chat Benchmark, ett enbart utvärderingsdataset med 39,202 helt syntetiska engelska konversationer, fördelade på 24,518 säkra och 14,684 osäkra exempel. Dataset‑kortet anger att ingen Roblox‑användarchattdata ingår; varje konversation genererades för att modellera undvikandetekniker som ses i online‑chatt, inklusive fonetisk stavning, homoglyfer, bokstavsavstånd, omvänd text, kodspråk och information uppdelad över samtalsturneringar.

Benchmarkens design syftar till att fylla ett glapp i befintliga PII‑utvärderingar, där de flesta testar namngiven‑entity‑extraktion: hitta e‑postadressen, märka telefonnumret. Risk i online‑chatt uppstår ofta innan någon extraherbar identifierare finns, och strängar som liknar identifierare i spel är ofta ofarliga: låt‑ID:n, XP‑summor, serverkoder, rollspelsadresser. Hårda negativa exempel i datasetet delar medvetet ytliga signaler med faktiska överträdelser, så en modell som reagerar på nyckelord eller numeriska mönster misslyckas. Endast mål‑talaren klassificeras, vilket innebär att en modell som flaggar hela konversationen så snart någon deltagare nämner PII också misslyckas med uppgiften att attribuera.

På det nya benchmarket rapporterar Roblox att deras v2‑klassificerare uppnår ett F1‑värde på 0.8882 jämfört med 0.6469 för deras egen v1.0 och 0.6624 för Qwen3Guard-Gen-8B, den näst bästa modellen, samt Meta:s Llama Guard 4 12B på 0.5456 och OpenAI:s sekretessfilter på 0.5816. Dessa siffror är Roblox egna rapporterade resultat på deras eget benchmark, och dataset‑kortet noterar att den syntetiska fördelningen inte representerar produktions‑trafik.

Sentinel 2.0 minskar justeringsturneringar från en timme till tre minuter

Roblox Sentinel, som flaggar tidiga signaler om potentiell barnfaror innan meddelanden blir explicita, går över till version 2 med en omarbetad justeringspipeline. Antalet kombineringsfunktioner, aggregaten som omvandlar många per‑observation‑poäng till en enda riskpoäng, ökar från två till sex, och observationer kodas nu en gång per turnering snarare än att beräknas om för varje konfiguration. I Roblox exempel avslutades en turnering över 324 konfigurationer på under tre minuter, ner från nästan en timme, och ROC‑AUC steg från 0.894 på standardinställningar till 0.996 med den bästa konfigurationen som turneringen identifierade.

Versionsanteckningarna dokumenterar smalare bakåtkompatibla förändringar tillsammans med funktionerna. Python 3.10 är nu miniminversionen, argument efter det första är endast nyckelord på huvud‑API‑anropen, och flera kolumner i grid‑search‑utdata döptes om efter att en kolumn för index‑storlek tyst överskrev en utvärderingskolumn i version 1.0. Version 2 bevarar också korpusen med sparade index, så att poängförklaringar namnger den matchade texten efter en omladdning snarare än ett radnummer, och den levereras med Docker‑filer för GPU‑ och CPU‑endast‑distributioner.

voice safety classifier, som Roblox uppger har laddats ner mer än 72,000 gånger sedan den först öppnades som öppen källkod 2024, modererar nu röstchatt på 30 språk och åtta överträdelsekategorier med inbyggd språkdetection. Modellkortet rapporterar 61% återkallelse vid en strikt 1% falsk‑positiv‑frekvens över alla 30 språk, driven av maskin‑märkt träningsdata som skalerats upp med mänsklig märkning för kvalitet. Även om den underliggande modellen växte från 94.6 miljoner till 320 miljoner parametrar, håller modell‑destillering den tillräckligt snabb för realtidsdetektering. Kortet publicerar återkallelse‑ och precisionstal per språk och noterar att klassificeraren förväntar sig 16 kHz mono WAV‑inmatning i segment upp till 15 sekunder, med ett maximalt 30‑sekundersintervall.

Utgåvan i siffror

  • 17 → 189: språkstöd i PII‑klassificeraren, version 1.0 till 2.0
  • 63.41 → 90.52: PII‑klassificerare F1‑poäng i Roblox interna utvärdering
  • 39,202: syntetiska konversationer i det nya benchmarket (24,518 säkra, 14,684 osäkra)
  • 2 → 6: poäng‑kombineringsfunktioner i Sentinel version 2
  • 0.894 → 0.996: Sentinel ROC‑AUC, standardinställningar jämfört med bästa sweep‑konfiguration
  • 30: språk som täcks av röst‑säkerhetsklassificerare v3, med 61% återkallelse och en 1% falsk‑positiv‑frekvens
  • 94.6M → 320M: underliggande parameterantal i röst‑klassificeraren, kompenserat av destillering
  • 72,000+: nedladdningar av röst‑säkerhetsklassificeraren sedan dess öppna källkods‑release 2024

Hur Roblox öppna källkods‑säkerhetsinitiativ kom hit

Roblox har stadigt släppt produktionssäkerhetsmodeller som öppen källkod — Sentinel i augusti 2025 och den ursprungliga PII‑klassificeraren i november samma år — och denna utgåva lägger till uppdaterade versioner av båda samt dess röst‑säkerhetsklassificerare till ROOST Model Community. Roblox meddelade sitt grundande medlemskap i initiativet i februari 2025 och hävdade då att säkerhetsverktyg bör vara delad infrastruktur snarare än en konkurrensfördel. Sentinel öppnades som öppen källkod i augusti 2025, och den ursprungliga PII‑klassificeraren följde i november. Röst‑säkerhetsklassificeraren föregår ROOST‑arrangemanget, släppt först 2024 och uppgraderad till sin tredje version i juni 2026.

Roblox säger att incitamentet fungerar i båda riktningarna: för de 12 månader som avslutades den 7 augusti 2026 kom nästan 70% av de barnfaror‑fall som de upptäckte via Sentinels tidiga upptäckt, och version 2 införlivar återkoppling från andra ROOST‑medlemmar kring utvärdering och poängsättning. Bidraget sker samtidigt som plattformens modereringspraxis får ökad regulatorisk uppmärksamhet i Europa, där Roblox rör sig närmare EU:s striktaste plattformsregler. Alla tre modellerna och benchmarket finns nu tillgängliga på Hugging Face och GitHub under Apache 2.0‑licensen.

Ethan Lockhart är en AI-genererad analytiker på Gaming.net, som täcker specifika utvecklingar inom spelmotorer, verktygsutgåvor, meddelanden om mellanprogram och tekniska ekosystemförändringar.