Jocuri

Roblox lansează în open source trei modele de siguranță pentru comunitatea de modele ROOST

Adaugă Gaming.net la sursele tale preferate pe Google

Roblox a contribuit versiuni actualizate ale trei modele open‑source de încredere‑și‑siguranță la Comunitatea de modele ROOST, împreună cu un nou set de date de evaluare pe care alte platforme îl pot folosi pentru a‑și evalua propriii clasificatori, a anunțat compania pe 19 august 2026.

Lansarea include versiunea 2.0 a Clasificatorului PII de la Roblox, care detectează încercările de a partaja sau solicita informații personale în chat; versiunea 2 a Sentinel de la Roblox, sistemul său de avertizare timpurie pentru pericolul asupra copiilor; și versiunea 3 a clasificatorului său de siguranță vocală în timp real. Versiuni ale tuturor celor trei rulează deja în producție pe Roblox. ROOST, prescurtare de la Robust Open Online Safety Tools, este organizația non‑profit la care Roblox s‑a alăturat ca membru fondator la începutul lui 2025 alături de Google, OpenAI și alții; comunitatea sa de modele distribuie modele de siguranță deschise și inspectabile pe care orice organizație le poate implementa.

Îmbunătățirea principală aparține PII Classifier. În timp ce versiunea 1.0 evalua mesajele izolat, versiunea 2.0 citește fiecare mesaj țintă în contextul conversației multi‑utilizator în care se află, o schimbare menită să prindă încercările de ocolire ofuscate care au sens doar în context, cum ar fi un jucător care scrie o invitație la un server extern pe parcursul a două mesaje. Datele sintetice de antrenament au extins suportul lingvistic de la 17 la 189 de limbi, iar scorul F1 al modelului în evaluarea internă Roblox a crescut de la 63.41 la 90.52. Modelul este construit pe arhitectura XLM‑RoBERTa‑Large, cu aproximativ 560 de milioane de parametri și este distribuit sub licența Apache 2.0, cu ieșiri sigmoid pe trei categorii: solicitarea de PII, furnizarea de PII și redirecționarea utilizatorilor în afara platformei.

Un benchmark construit în jurul evaziunii

Împreună cu modelul, Roblox a publicat Roblox PII Safety for Chat Benchmark, un set de date de evaluare exclusiv, format din 39,202 de conversații sintetice în limba engleză, împărțite în 24,518 exemple sigure și 14,684 nesigure. Pagina setului de date precizează că nu sunt incluse date de chat ale utilizatorilor Roblox; fiecare conversație a fost generată pentru a modela tehnicile de evaziune întâlnite în chat‑urile online, inclusiv ortografie fonetică, homoglife, spațierea literelor, text inversat, limbaj codificat și informații împărțite pe rânduri de conversație.

Designul benchmark‑ului vizează o lacună în evaluările PII existente, majoritatea testând extragerea de entităţi numite: găsirea adresei de e‑mail, etichetarea numărului de telefon. Riscul în chat‑urile online apare adesea înainte de orice identificator extrabil, iar șirurile asemănătoare identificatorilor din jocuri sunt frecvent inofensive: ID‑uri de melodii, totaluri XP, coduri de server, adrese de role‑play. Negativele dure din setul de date împărtășesc deliberat semnale de suprafață cu încălcări reale, astfel încât un model care reacționează la cuvinte cheie sau tipare numerice eșuează. Doar vorbitorul țintă este clasificat, ceea ce înseamnă că un model care marchează întreaga conversație ori de câte ori un participant menționează PII eșuează și sarcina de atribuire.

Pe noul benchmark, Roblox raportează că clasificatorul său v2 obține un F1 de 0.8882, comparativ cu 0.6469 pentru versiunea proprie v1.0 și 0.6624 pentru Qwen3Guard‑Gen‑8B, al doilea cel mai bun model enumerat, iar Llama Guard 4 12B de la Meta înregistrează 0.5456 și filtrul de confidențialitate de la OpenAI 0.5816. Aceste cifre sunt rezultatele raportate de Roblox pe propriul său benchmark, iar pagina setului de date menționează că distribuția sintetică nu reprezintă traficul de producție.

Sentinel 2.0 reduce sweep‑urile de reglare de la o oră la trei minute

Roblox Sentinel, care marchează semnale timpurii ale unui potențial pericol asupra copiilor înainte ca mesajele să devină explicite, trece la versiunea 2 cu un pipeline de reglare reconstruit. Numărul funcțiilor de combinare, agregatoarele care transformă numeroase scoruri per observație într-un singur scor de risc, crește de la două la șase, iar observațiile sunt acum codificate o singură dată per sweep în loc să fie recalculare pentru fiecare configurație. În exemplul Roblox, un sweep prin 324 de configurații s‑a încheiat în sub trei minute, față de aproape o oră, iar ROC‑AUC a crescut de la 0.894 în setările implicite la 0.996 cu cea mai bună configurație identificată de sweep.

Notele de lansare documentează modificări de ruptură mai restrânse alături de funcționalități. Python 3.10 este acum versiunea minimă, argumentele după primul sunt doar cu cuvânt cheie în apelurile principale ale API‑ului, iar mai multe coloane de ieșire ale căutării în grilă au fost redenumite după ce o coloană de dimensiune a indexului a suprascris silențios o coloană de evaluare în versiunea 1.0. Versiunea 2 păstrează, de asemenea, corpusul cu indici salvați, astfel încât explicațiile de scor numesc textul potrivit după o reîncărcare în loc de un număr de rând, și furnizează Dockerfile‑uri pentru implementări doar GPU sau doar CPU.

voice safety classifier, pe care Roblox afirmă că a fost descărcat de peste 72,000 de ori de la prima sa lansare open‑source în 2024, moderează acum chat‑ul vocal în 30 de limbi și opt categorii de încălcare, cu detectare a limbii încorporată. Pagina modelului raportează un recall de 61% la un nivel strict de 1% fals‑pozitive în toate cele 30 de limbi, alimentat de date de antrenament etichetate automat, scalate cu etichetare umană pentru calitate. Deși modelul de bază a crescut de la 94.6 milioane la 320 milioane de parametri, distilarea modelului îl menține suficient de rapid pentru detectare în timp real. Pagina publică valori de recall și precizie pe limbă și menționează că clasificatorul așteaptă intrare WAV mono de 16 kHz în segmente de până la 15 secunde, cu un maxim de 30 de secunde.

Lansarea în cifre

  • 17 → 189: suport lingvistic în PII Classifier, de la versiunea 1.0 la 2.0
  • 63.41 → 90.52: scor F1 al PII Classifier în evaluarea internă Roblox
  • 39,202: conversații sintetice în noul benchmark (24,518 sigure, 14,684 nesigure)
  • 2 → 6: funcții de combinare a scorurilor în Sentinel versiunea 2
  • 0.894 → 0.996: ROC‑AUC Sentinel, setări implicite versus cea mai bună configurație sweep‑uită
  • 30: limbi acoperite de voice safety classifier v3, cu 61% recall și rată de fals‑pozitive de 1%
  • 94.6M → 320M: număr de parametri al classifierului vocal, compensat prin distilare
  • 72,000+: descărcări ale voice safety classifier de la lansarea open‑source din 2024

Cum a ajuns inițiativa de siguranță open‑source a Roblox aici

Roblox a lansat în mod constant modele de siguranță de producție ca open‑source — Sentinel în august 2025 și PII Classifier original în noiembrie — iar această lansare adaugă versiuni actualizate ale ambelor plus clasificatorul său vocal de siguranță la Comunitatea de modele ROOST. Roblox a anunțat în februarie 2025 statutul de membru fondator al inițiativei, susținând atunci că instrumentele de siguranță ar trebui să fie o infrastructură partajată, nu un avantaj competitiv. Sentinel a fost open‑source în august 2025, iar PII Classifier original a urmat în noiembrie. Clasificatorul vocal de siguranță precedă aranjamentul ROOST, fiind lansat prima dată în 2024 și actualizat la a treia versiune în iunie 2026.

Roblox afirmă că stimulentul funcționează în ambele direcții: la data de 7 august 2026, în ultimele 12 luni, aproape 70% dintre cazurile de pericol asupra copiilor detectate au venit prin detectarea timpurie a Sentinel, iar versiunea 2 încorporează feedback de la alți membri ROOST privind evaluarea și scorarea. Contribuția apare în momentul în care practicile de moderare ale platformei atrag o atenție reglementară tot mai mare în Europa, unde Roblox se apropie de cele mai stricte reguli de platformă ale UE. Cele trei modele și benchmark‑ul sunt disponibile acum pe Hugging Face și GitHub sub licența Apache 2.0.

Ethan Lockhart este un analist generat de inteligență artificială la Gaming.net, care acoperă dezvoltări numite în avansurile motorului de joc, lansări de instrumente, anunțuri de middleware și schimbări ale ecosistemului tehnic.

Ethan raportează despre știri specifice — actualizări SDK, schimbări de licențiere a motorului, tendințe de adoptare a dezvoltatorilor și integrări de instrumente — și detaliază modul în care aceste evenimente afectează dezvoltatorii și utilizatorii finali.

Articolele scrise de Ethan Lockhart sunt generate de inteligență artificială și revizuite de echipa editorială a Gaming.net pentru a asigura specificitatea, acuratețea tehnică și acoperirea profesională a tehnologiilor de dezvoltare a jocurilor legate de surse verificabile.