Igre
Roblox objavljuje otvorenim izvorom tri sigurnosna modela za ROOST Model Community
Roblox je doprinio ažuriranim verzijama tri otvorena modela za povjerenje i sigurnost zajednici ROOST Model Community, uz novi evaluacijski skup podataka koji druge platforme mogu koristiti za usporedbu vlastitih klasifikatora, objavila je tvrtka 19. kolovoza 2026.
Izdanjem su pokriveni verzija 2.0 Robloxovog PII klasifikatora, koji otkriva pokušaje dijeljenja ili traženja osobnih podataka u chatu; verzija 2 Roblox Sentinela, njegovog sustava ranog upozorenja za opasnost djece; i verzija 3 njegovog klasifikatora sigurnosti glasovnih komunikacija u stvarnom vremenu. Verzije sva tri već rade u produkciji na Robloxu. ROOST, skraćenica za Robust Open Online Safety Tools, neprofitna je organizacija kojoj se Roblox pridružio kao osnivač početkom 2025. zajedno s Googleom, OpenAI i drugima; njegova zajednica modela distribuira otvorene, pregledne sigurnosne modele koje bilo koja organizacija može implementirati.
Glavnu poboljšanje donosi PII klasifikator. Dok je verzija 1.0 ocjenjivala poruke izolirano, verzija 2.0 čita svaku ciljanu poruku unutar okolnog višekorisničkog razgovora, promjena usmjerena na otkrivanje zamaskiranih pokušaja zaobilaženja koji imaju smisla samo u kontekstu, poput igrača koji kroz dva poteza ispisuje poziv na server izvan platforme. Sintetički podaci za treniranje proširili su podršku jezika s 17 na 189, a F1 rezultat modela na Robloxovoj internoj evaluaciji porastao je s 63,41 na 90,52. Model je izgrađen na arhitekturi XLM‑RoBERTa‑Large s otprilike 560 milijuna parametara i distribuira se pod licencom Apache 2.0, s sigmoidnim izlazima kroz tri kategorije: traženje PII, davanje PII i usmjeravanje korisnika izvan platforme.
Mjerilo izgrađeno oko izbjegavanja
Uz model, Roblox je objavio Roblox PII Safety for Chat Benchmark, dataset namijenjen isključivo evaluaciji koji sadrži 39 202 potpuno sintetična engleska razgovora, podijeljena na 24 518 sigurnih i 14 684 nesigurnih primjera. Kartica skupa podataka navodi da ne sadrži podatke iz Robloxovih korisničkih chatova; svaki razgovor je generiran kako bi modelirao tehnike izbjegavanja viđene u online chatu, uključujući fonetsko pravopis, homoglife, razmake između slova, preokrenuti tekst, kodirani jezik i informacije raspoređene kroz razgovorne poteze.
Dizajn benchmarka cilja prazninu u postojećim PII evaluacijama, od kojih većina testira prepoznavanje imenovanih entiteta: pronalaženje adrese e‑pošte, označavanje broja telefona. Rizik u online chatu često se pojavi prije nego što se pojavi bilo koji izvučivi identifikator, a nizovi slični identifikatorima u igrama često su benigni: ID‑ovi pjesama, ukupni XP, kodovi servera, adrese za igranje uloga. Teški negativni primjeri u skupu podataka namjerno dijele površinske signale s pravim kršenjima, pa model koji reagira na ključne riječi ili numeričke uzorke ne uspijeva. Klasificira se samo ciljni govornik, što znači da model koji označava cijeli razgovor kad god bilo koji sudionik spomene PII također ne uspijeva zadatak atribucije.
Na novom benchmarku, Roblox izvještava da njegov v2 klasifikator postiže F1 od 0,8882 naspram 0,6469 za vlastitu v1.0 i 0,6624 za Qwen3Guard‑Gen‑8B, sljedeći najbolji model na popisu, dok Meta‑ov Llama Guard 4 12B ima 0,5456, a OpenAI‑jev filter privatnosti 0,5816. Ti podaci su Robloxovi vlastiti rezultati na njihovom benchmarku, a kartica skupa podataka napominje da sintetička distribucija ne predstavlja promet u produkciji.
Sentinel 2.0 skraćuje podešavanje s jednog sata na tri minute
Roblox Sentinel, koji označava rane signale potencijalne opasnosti za djecu prije nego što poruke postanu eksplicitne, prelazi na verziju 2 s preuređenim procesom podešavanja. Broj kombinacijskih funkcija, agregatora koji pretvaraju mnoge ocjene po opažanju u jedinstvenu ocjenu rizika, raste s dva na šest, a opažanja se sada kodiraju jednom po pregledu umjesto da se izračunavaju za svaku konfiguraciju. U Robloxovom primjeru, pregled kroz 324 konfiguracije završio je za manje od tri minute, umjesto gotovo jednog sata, a ROC‑AUC je porastao s 0,894 na zadanim postavkama na 0,996 s najboljom konfiguracijom koju je pregled otkrio.
Bilješke o izdanju dokumentiraju sužene promjene koje narušavaju kompatibilnost uz nove značajke. Python 3.10 je sada minimalna verzija, argumenti nakon prvog su isključivo ključne riječi u glavnim API pozivima, a nekoliko stupaca izlaza pretrage mreže preimenovano je nakon što je stupac veličine indeksa tiho prepisao stupac evaluacije u verziji 1.0. Verzija 2 također čuva korpus s spremljenim indeksima, pa objašnjenja ocjena nazivaju podudarni tekst nakon ponovnog učitavanja umjesto broja retka, i distribuira Dockerfile‑ove za GPU i isključivo CPU implementacije.
Klasifikator sigurnosti glasovnog chata, za koji Roblox navodi da je preuzet više od 72 000 puta otkako je prvi put objavljen kao otvoreni izvor 2024., sada moderira glasovni chat na 30 jezika i osam kategorija kršenja uz ugrađeno prepoznavanje jezika. Kartica modela izvještava o 61 % odzivu pri strogom 1 % stopi lažnih pozitivnih rezultata na svih 30 jezika, potaknutom podacima za treniranje označenim strojem, proširenim ljudskim označavanjem radi kvalitete. Iako je temeljni model narastao s 94,6 milijuna na 320 milijuna parametara, destilacija modela ga održava dovoljno brzim za detekciju u stvarnom vremenu. Kartica objavljuje podatke o odzivu i preciznosti po jeziku i napominje da klasifikator očekuje mono WAV ulaz od 16 kHz u segmentima do 15 sekundi, s maksimalnim trajanjem od 30 sekundi.
Izdanja po brojkama
- 17 → 189: podrška jezika u PII klasifikatoru, verzija 1.0 do 2.0
- 63.41 → 90.52: F1 rezultat PII klasifikatora na Robloxovoj internoj evaluaciji
- 39,202: sintetičnih razgovora u novom benchmarku (24 518 sigurnih, 14 684 nesigurnih)
- 2 → 6: funkcija kombiniranja ocjena u Sentinel verziji 2
- 0.894 → 0.996: Sentinel ROC‑AUC, zadane postavke naspram najbolje konfiguracije iz pregleda
- 30: jezika pokriveno od strane glasovnog klasifikatora v3, s 61 % odziva i 1 % stopom lažnih pozitivnih
- 94.6M → 320M: broj temeljnih parametara u glasovnom klasifikatoru, kompenzirano destilacijom
- 72,000+: preuzimanja glasovnog klasifikatora od njegovog otvorenog izdanja 2024.
Kako je Robloxov otvoreni sigurnosni poticaj došao ovdje
Roblox je kontinuirano objavljivao proizvodne sigurnosne modele kao otvoreni izvor — Sentinel u kolovozu 2025. i izvorni PII klasifikator tog studenog — a ovo izdanje dodaje ažurirane verzije oba, uz glasovni klasifikator sigurnosti, u ROOST Model Community. Roblox je najavio svoje osnivačko članstvo u inicijativi u veljači 2025., ističući tada da sigurnosni alati trebaju biti zajednička infrastruktura, a ne konkurentska prednost. Sentinel je otvorenog koda objavljen u kolovozu 2025., a izvorni PII klasifikator uslijedio je tog studenog. Glasovni klasifikator sigurnosti prethodi ROOST aranžmanu, prvi put objavljen 2024., a nadograđen na treću verziju u lipnju 2026.
Roblox navodi da se poticaj kreće u oba smjera: za razdoblje od 12 mjeseci zaključno s 7. kolovoza 2026., gotovo 70 % slučajeva opasnosti za djecu koje je otkrio došao je putem ranog otkrivanja Sentinel-a, a verzija 2 uključuje povratne informacije od drugih ROOST članova o evaluaciji i ocjenjivanju. Doprinos dolazi u trenutku kada prakse moderiranja platforme privlače sve veću regulatornu pažnju u Europi, gdje Roblox približava svoje pravilo najstrožim EU pravilima. Sva tri modela i benchmark sada su dostupni na Hugging Face i GitHub pod licencom Apache 2.0.











