Giochi
Roblox rende open source tre modelli di sicurezza per la comunità di modelli ROOST
Roblox ha contribuito con versioni aggiornate di tre modelli open source di fiducia e sicurezza alla ROOST Model Community, insieme a un nuovo dataset di valutazione che altre piattaforme possono utilizzare per confrontare i propri classificatori, ha annunciato l’azienda il 19 agosto 2026.
Il rilascio comprende la versione 2.0 del PII Classifier di Roblox, che rileva i tentativi di condividere o richiedere informazioni personali in chat; la versione 2 di Roblox Sentinel, il suo sistema di allerta precoce per il pericolo verso i minori; e la versione 3 del suo classificatore di sicurezza vocale in tempo reale. Le versioni di tutti e tre i modelli sono già in produzione su Roblox. ROOST, abbreviazione di Robust Open Online Safety Tools, è l’organizzazione no‑profit a cui Roblox si è unito come membro fondatore all’inizio del 2025 insieme a Google, OpenAI e altri; la sua comunità di modelli distribuisce modelli di sicurezza aperti e ispezionabili che qualsiasi organizzazione può implementare.
L’innovazione principale riguarda il PII Classifier. Mentre la versione 1.0 valutava i messaggi in isolamento, la versione 2.0 legge ogni messaggio target all’interno della conversazione multi‑utente circostante, una modifica mirata a intercettare tentativi di elusione offuscati che hanno senso solo nel contesto, ad esempio un giocatore che scrive un invito a un server esterno in due turni. I dati sintetici di addestramento hanno ampliato il supporto linguistico da 17 a 189 lingue, e il punteggio F1 del modello nella valutazione interna di Roblox è passato da 63,41 a 90,52. Il modello è basato sull’architettura XLM‑RoBERTa‑Large con circa 560 milioni di parametri e viene distribuito sotto licenza Apache 2.0, con uscite sigmoid su tre categorie: richiesta di PII, fornitura di PII e indirizzamento degli utenti fuori dalla piattaforma.
Un benchmark costruito attorno all’evasione
Insieme al modello, Roblox ha pubblicato il Roblox PII Safety for Chat Benchmark, un dataset esclusivamente di valutazione composto da 39.202 conversazioni sintetiche in inglese, suddivise in 24.518 esempi sicuri e 14.684 non sicuri. La scheda del dataset specifica che non sono inclusi dati di chat di utenti Roblox; ogni conversazione è stata generata per modellare le tecniche di evasione osservate nelle chat online, inclusi ortografia fonetica, omoglifi, spaziatura delle lettere, testo invertito, linguaggio codificato e informazioni suddivise tra turni conversazionali.
Il design del benchmark colma una lacuna nelle valutazioni PII esistenti, la maggior parte delle quali testa l’estrazione di entità nominate: trova l’indirizzo email, etichetta il numero di telefono. Il rischio nelle chat online spesso appare prima che sia possibile estrarre un identificatore, e stringhe simili a identificatori nei giochi sono frequentemente innocue: ID di canzoni, totali XP, codici server, indirizzi di role‑play. I cosiddetti “hard negatives” nel dataset condividono deliberatamente segnali superficiali con violazioni genuine, così un modello che reagisce a parole chiave o pattern numerici fallisce. Solo l’oratore target è classificato, il che significa che un modello che segnala l’intera conversazione ogni volta che un partecipante menziona PII non riesce nel compito di attribuzione.
Nel nuovo benchmark, Roblox riporta che il suo classificatore v2 ottiene un F1 di 0,8882 contro 0,6469 per la sua versione 1.0 e 0,6624 per Qwen3Guard‑Gen‑8B, il modello successivo migliore elencato, con Meta Llama Guard 4 12B a 0,5456 e il filtro privacy di OpenAI a 0,5816. Queste cifre sono i risultati dichiarati da Roblox sul proprio benchmark, e la scheda del dataset osserva che la distribuzione sintetica non rappresenta il traffico di produzione.
Sentinel 2.0 riduce le scansioni di sintonizzazione da un’ora a tre minuti
Roblox Sentinel, che segnala segnali precoci di potenziale pericolo per i minori prima che i messaggi diventino espliciti, passa alla versione 2 con una pipeline di sintonizzazione rielaborata. Il numero di funzioni di combinazione, gli aggregatori che trasformano molti punteggi per osservazione in un unico punteggio di rischio, cresce da due a sei, e le osservazioni ora vengono codificate una sola volta per scansione anziché ricalcolate per ogni configurazione. Nell’esempio di Roblox, una scansione su 324 configurazioni è terminata in meno di tre minuti, rispetto a quasi un’ora in precedenza, e il ROC‑AUC è salito da 0,894 con le impostazioni predefinite a 0,996 con la migliore configurazione individuata dalla scansione.
Le note di rilascio documentano modifiche breaking più contenute accanto alle nuove funzionalità. Python 3.10 è ora la versione minima, gli argomenti dopo il primo sono solo keyword nelle chiamate API principali, e diverse colonne di output della ricerca a griglia sono state rinominate dopo che una colonna di dimensione indice aveva silenziosamente sovrascritto una colonna di valutazione nella versione 1.0. La versione 2 conserva inoltre il corpus con indici salvati, così le spiegazioni dei punteggi nominano il testo corrispondente dopo un ricaricamento anziché un numero di riga, e fornisce Dockerfile per distribuzioni GPU e solo CPU.
Il voice safety classifier, che Roblox afferma sia stato scaricato più di 72.000 volte dal suo primo rilascio open source nel 2024, ora modera le chat vocali in 30 lingue e otto categorie di violazione con rilevamento linguistico integrato. La scheda del modello riporta un recall del 61 % a un rigoroso tasso di falsi positivi dell’1 % su tutte le 30 lingue, grazie a dati di addestramento etichettati automaticamente e poi raffinati con etichettatura umana per la qualità. Sebbene il modello sottostante sia cresciuto da 94,6 milioni a 320 milioni di parametri, la distillazione mantiene la velocità sufficiente per il rilevamento in tempo reale. La scheda pubblica i valori di recall e precisione per lingua e specifica che il classificatore accetta input WAV mono a 16 kHz in segmenti fino a 15 secondi, con un massimo di 30 secondi.
Il rilascio in cifre
- 17 → 189: supporto linguistico nel PII Classifier, dalla versione 1.0 alla 2.0
- 63.41 → 90.52: punteggio F1 del PII Classifier nella valutazione interna di Roblox
- 39,202: conversazioni sintetiche nel nuovo benchmark (24,518 sicure, 14,684 non sicure)
- 2 → 6: funzioni di combinazione dei punteggi nella versione 2 di Sentinel
- 0.894 → 0.996: ROC‑AUC di Sentinel, impostazioni predefinite vs migliore configurazione scansionata
- 30: lingue coperte dal voice safety classifier v3, con recall del 61 % e tasso di falsi positivi dell’1 %
- 94.6M → 320M: numero di parametri sottostanti nel voice classifier, compensato dalla distillazione
- 72,000+: download del voice safety classifier dalla sua pubblicazione open source del 2024
Come è arrivata l’iniziativa open source di sicurezza di Roblox
Roblox ha rilasciato costantemente modelli di sicurezza in produzione come open source — Sentinel nell’agosto 2025 e il PII Classifier originale a novembre dello stesso anno — e questo rilascio aggiunge versioni aggiornate di entrambi più il suo voice safety classifier alla ROOST Model Community. Roblox ha annunciato la sua adesione fondante all’iniziativa nel febbraio 2025, sostenendo allora che gli strumenti di sicurezza dovrebbero essere infrastrutture condivise piuttosto che vantaggi competitivi. Sentinel è stato rilasciato come open source nell’agosto 2025, e il PII Classifier originale è seguito a novembre. Il voice safety classifier precede l’accordo ROOST, pubblicato per la prima volta nel 2024 e aggiornato alla sua terza versione nel giugno 2026.
Roblox afferma che l’incentivo funziona in entrambe le direzioni: al termine dei 12 mesi chiusi il 7 agosto 2026, quasi il 70 % dei casi di pericolo per i minori rilevati è stato individuato dalla prima rilevazione di Sentinel, e la versione 2 incorpora feedback di altri membri ROOST sulla valutazione e sul punteggio. Il contributo arriva mentre le pratiche di moderazione della piattaforma attirano crescente attenzione normativa in Europa, dove Roblox sta avvicinandosi alle regole più severe dell’UE per le piattaforme. Tutti e tre i modelli e il benchmark sono ora disponibili su Hugging Face e GitHub sotto licenza Apache 2.0.











