Gry
Roblox udostępnia otwarto trzy modele bezpieczeństwa dla społeczności modeli ROOST
Roblox przekazał zaktualizowane wersje trzech otwarto‑źródłowych modeli zaufania i bezpieczeństwa do społeczności modeli ROOST, wraz z nowym zestawem danych ewaluacyjnych, którego inne platformy mogą używać do benchmarkowania własnych klasyfikatorów, ogłosiła firma 19 sierpnia 2026 r.
Wydanie obejmuje wersję 2.0 klasyfikatora PII Roblox, który wykrywa próby udostępniania lub żądania danych osobowych w czacie; wersję 2 Sentinel Roblox, jego system wczesnego ostrzegania o zagrożeniu dla dzieci; oraz wersję 3 klasyfikatora bezpieczeństwa głosu w czasie rzeczywistym. Wersje wszystkich trzech modeli są już uruchomione w produkcji na Roblox. ROOST, skrót od Robust Open Online Safety Tools, to organizacja non‑profit, do której Roblox dołączył jako członek założycielski na początku 2025 razem z Google, OpenAI i innymi; jej społeczność modeli rozpowszechnia otwarte, możliwe do wglądu modele bezpieczeństwa, które każda organizacja może wdrożyć.
Najważniejszą poprawą jest Klasyfikator PII. Gdzie wersja 1.0 oceniała wiadomości w izolacji, wersja 2.0 czyta każdą docelową wiadomość w kontekście otaczającej ją rozmowy wieloużytkownikowej, co ma na celu wykrywanie ukrytych prób obejścia, które mają sens tylko w kontekście, np. gracz rozpisujący zaproszenie na serwer spoza platformy w dwóch kolejnych wypowiedziach. Syntetyczne dane treningowe rozszerzyły wsparcie językowe z 17 do 189 języków, a wynik F1 modelu w wewnętrznej ocenie Roblox wzrósł z 63,41 do 90,52. Model oparty jest na architekturze XLM‑RoBERTa‑Large, liczy około 560 milionów parametrów i jest udostępniany na licencji Apache 2.0, z wyjściami sigmoidowymi w trzech kategoriach: żądanie danych osobowych, udostępnianie danych osobowych oraz kierowanie użytkowników poza platformę.
A Benchmark Built Around Evasion
Wraz z modelem Roblox opublikował Roblox PII Safety for Chat Benchmark, zestaw danych wyłącznie do ewaluacji, zawierający 39 202 w pełni syntetycznych rozmów po angielsku, podzielonych na 24 518 przykładów bezpiecznych i 14 684 niebezpiecznych. Karta zestawu danych podaje, że nie zawiera ona żadnych danych z czatów użytkowników Roblox; każda rozmowa została wygenerowana w celu odzwierciedlenia technik omijania obserwowanych w czatach online, w tym fonetycznego zapisu, homoglifów, odstępów między literami, odwróconego tekstu, języka kodowanego oraz podziału informacji na kolejne wypowiedzi.
Projekt benchmarku adresuje lukę w istniejących ocenach PII, które w większości testują wydobywanie nazwanych jednostek: znajdź adres e‑mail, oznacz numer telefonu. Ryzyko w czatach online często pojawia się przed tym, jak pojawi się jakikolwiek identyfikowalny element, a ciągi podobne do identyfikatorów w grach są często nieszkodliwe: identyfikatory piosenek, sumy XP, kody serwerów, adresy role‑play. Trudne negatywy w zestawie danych celowo dzielą powierzchowne sygnały z prawdziwymi naruszeniami, więc model reagujący jedynie na słowa kluczowe lub wzorce numeryczne zawodzi. Tylko docelowy mówca jest klasyfikowany, co oznacza, że model flagujący całą rozmowę, gdy jakikolwiek uczestnik wspomni o danych osobowych, również nie spełnia zadania atrybucji.
W nowym benchmarku Roblox podaje, że jego klasyfikator v2 uzyskał F1 = 0,8882 w porównaniu do 0,6469 dla własnej wersji 1.0 oraz 0,6624 dla Qwen3Guard‑Gen‑8B, kolejnego najlepszego modelu w zestawieniu, przy czym Llama Guard 4 12B od Meta osiągnął 0,5456, a filtr prywatności OpenAI 0,5816. Są to wyniki podane przez Roblox na własnym benchmarku, a karta zestawu danych zaznacza, że syntetyczna dystrybucja nie odzwierciedla ruchu produkcyjnego.
Sentinel 2.0 Cuts Tuning Sweeps From an Hour to Three Minutes
Roblox Sentinel, który wykrywa wczesne sygnały potencjalnego zagrożenia dla dzieci, zanim wiadomości staną się explicite, przechodzi do wersji 2 z przeprojektowanym procesem strojenia. Liczba funkcji łączenia wyników, agregatorów przekształcających wiele ocen per obserwacja w jedną ocenę ryzyka, rośnie z dwóch do sześciu, a obserwacje są teraz kodowane raz na przegląd zamiast przeliczać je dla każdej konfiguracji. W przykładzie Roblox przegląd obejmujący 324 konfiguracje zakończył się w mniej niż trzy minuty, w porównaniu do prawie godziny, a ROC‑AUC wzrosło z 0,894 przy ustawieniach domyślnych do 0,996 przy najlepszej konfiguracji wykrytej w przeglądzie.
Notatki wydania opisują węższe zmiany łamiące w połączeniu z nowymi funkcjami. Python 3.10 jest teraz minimalną wersją, argumenty po pierwszym są wyłącznie słowami kluczowymi w głównych wywołaniach API, a kilka kolumn wyjściowych wyszukiwania siatki zostało przemianowanych po tym, jak kolumna rozmiaru indeksu cicho nadpisała kolumnę oceny w wersji 1.0. Wersja 2 zachowuje również korpus z zapisanymi indeksami, więc wyjaśnienia wyników podają nazwę dopasowanego tekstu po ponownym załadowaniu zamiast numeru wiersza, a dodatkowo udostępnia Dockerfile dla wdrożeń GPU i wyłącznie CPU.
Klasyfikator bezpieczeństwa głosu, który według Roblox został pobrany ponad 72 000 razy od pierwszego otwarto‑źródłowego wydania w 2024, teraz moderuje czat głosowy w 30 językach i ośmiu kategoriach naruszeń, z wbudowanym wykrywaniem języka. Karta modelu podaje 61 % czułości przy ścisłym wskaźniku fałszywych alarmów 1 % we wszystkich 30 językach, napędzane danymi treningowymi oznaczonymi maszynowo, które zostały rozszerzone o ręczne etykietowanie w celu zapewnienia jakości. Choć podstawowy model rozrósł się z 94,6 miliona do 320 milionów parametrów, destylacja modelu utrzymuje go wystarczająco szybkim do wykrywania w czasie rzeczywistym. Karta publikuje wyniki czułości i precyzji dla każdego języka oraz informuje, że klasyfikator oczekuje wejścia mono WAV 16 kHz w segmentach do 15 sekund, z maksymalnym limitem 30 sekund.
The Release by the Numbers
- 17 → 189: wsparcie językowe w klasyfikatorze PII, wersja 1.0 do 2.0
- 63.41 → 90.52: wynik F1 klasyfikatora PII w wewnętrznej ocenie Roblox
- 39,202: syntetyczne rozmowy w nowym benchmarku (24 518 bezpiecznych, 14 684 niebezpiecznych)
- 2 → 6: funkcje łączenia wyników w Sentinel wersja 2
- 0.894 → 0.996: ROC‑AUC Sentinel, ustawienia domyślne vs najlepsza konfiguracja przeszukiwana
- 30: języki obsługiwane przez klasyfikator bezpieczeństwa głosu v3, przy 61 % czułości i 1 % wskaźniku fałszywych alarmów
- 94.6M → 320M: liczba parametrów bazowego klasyfikatora głosu, zredukowana dzięki destylacji
- 72,000+: pobrań klasyfikatora bezpieczeństwa głosu od jego otwarto‑źródłowego wydania w 2024 r.
How Roblox’s Open-Source Safety Push Got Here
Roblox systematycznie udostępniał modele bezpieczeństwa w produkcji jako otwarto‑źródłowe — Sentinel w sierpniu 2025 i pierwotny klasyfikator PII w listopadzie tego samego roku — a to wydanie dodaje zaktualizowane wersje obu oraz klasyfikatora bezpieczeństwa głosu do społeczności modeli ROOST. Roblox ogłosił swój status członka założycielskiego w inicjatywie w lutym 2025, argumentując wtedy, że narzędzia bezpieczeństwa powinny być wspólną infrastrukturą, a nie przewagą konkurencyjną. Sentinel został udostępniony jako otwarto‑źródłowy w sierpniu 2025, a pierwotny klasyfikator PII pojawił się w listopadzie. Klasyfikator bezpieczeństwa głosu istnieje przed ustaleniami ROOST, został po raz pierwszy wydany w 2024 i zaktualizowany do trzeciej wersji w czerwcu 2026.
Roblox twierdzi, że zachęta działa w obu kierunkach: na koniec 12‑miesięcznego okresu zakończonego 7 sierpnia 2026, prawie 70 % przypadków zagrożenia dla dzieci wykrytych przez platformę pochodziło z wczesnego wykrywania Sentinel, a wersja 2 uwzględnia opinie innych członków ROOST dotyczące ewaluacji i punktacji. Wkład pojawia się, gdy praktyki moderacyjne platformy przyciągają rosnącą uwagę regulacyjną w Europie, gdzie Roblox zbliża się do najostrzejszych regulacji platform UE. Wszystkie trzy modele oraz benchmark są już dostępne na Hugging Face i GitHub na licencji Apache 2.0.











