Game
Roblox Membuka Sumber Tiga Model Keamanan untuk Komunitas Model ROOST
Roblox telah menyumbangkan versi terbaru dari tiga model kepercayaan‑dan‑keamanan sumber terbuka ke Komunitas Model ROOST, bersama dengan dataset evaluasi baru yang dapat digunakan platform lain untuk mengukur classifier mereka, perusahaan mengumumkan pada 19 Agustus 2026.
Rilis ini mencakup versi 2.0 dari PII Classifier milik Roblox, yang mendeteksi upaya berbagi atau meminta informasi pribadi dalam obrolan; versi 2 dari Roblox Sentinel, sistem peringatan dini untuk bahaya anak; dan versi 3 dari classifier keamanan suara waktu nyata. Versi ketiganya sudah berjalan dalam produksi di Roblox. ROOST, singkatan dari Robust Open Online Safety Tools, adalah organisasi nirlaba yang bergabung dengan Roblox sebagai anggota pendiri pada awal 2025 bersama Google, OpenAI, dan lainnya; komunitas modelnya mendistribusikan model keamanan terbuka yang dapat diperiksa dan dapat diterapkan oleh organisasi mana pun.
Perbaikan utama terdapat pada PII Classifier. Di mana versi 1.0 mengevaluasi pesan secara terpisah, versi 2.0 membaca setiap pesan target dalam konteks percakapan multi‑pengguna di sekitarnya, perubahan yang bertujuan menangkap upaya bypass yang disamarkan dan hanya masuk akal dalam konteks, seperti pemain yang menuliskan undangan server di luar platform dalam dua giliran. Data pelatihan sintetis memperluas dukungan bahasa dari 17 bahasa menjadi 189, dan skor F1 model pada evaluasi internal Roblox naik dari 63,41 menjadi 90,52. Model ini dibangun di atas arsitektur XLM‑RoBERTa‑Large dengan sekitar 560 juta parameter dan dirilis di bawah lisensi Apache 2.0, dengan output sigmoid pada tiga kategori: meminta PII, memberikan PII, dan mengarahkan pengguna ke luar platform.
Benchmark yang Dibangun di Sekitar Pengelakan
Bersamaan dengan model tersebut, Roblox menerbitkan Roblox PII Safety for Chat Benchmark, sebuah dataset hanya untuk evaluasi berisi 39.202 percakapan bahasa Inggris sintetis penuh, terbagi menjadi 24.518 contoh aman dan 14.684 contoh tidak aman. Kartu dataset menyatakan tidak ada data obrolan pengguna Roblox yang termasuk; setiap percakapan dihasilkan untuk meniru teknik pengelakan yang terlihat dalam obrolan daring, termasuk ejaan fonetik, homoglif, spasi huruf, teks terbalik, bahasa kode, dan informasi yang terbagi di beberapa giliran percakapan.
Desain benchmark ini menargetkan kesenjangan dalam evaluasi PII yang ada, kebanyakan menguji ekstraksi entitas bernama: temukan alamat email, tandai nomor telepon. Risiko obrolan daring sering muncul sebelum ada identifier yang dapat diekstrak, dan string mirip identifier dalam game sering bersifat tidak berbahaya: ID lagu, total XP, kode server, alamat roleplay. Negatif keras dalam dataset secara sengaja berbagi sinyal permukaan dengan pelanggaran nyata, sehingga model yang bereaksi pada kata kunci atau pola numerik akan gagal. Hanya pembicara target yang diklasifikasikan, artinya model yang menandai seluruh percakapan setiap kali ada peserta yang menyebut PII juga gagal dalam tugas atribusi.
Pada benchmark baru, Roblox melaporkan classifier v2-nya menghasilkan F1 sebesar 0.8882 dibandingkan 0.6469 untuk v1.0 miliknya sendiri dan 0.6624 untuk Qwen3Guard-Gen-8B, model terbaik berikutnya, dengan Meta Llama Guard 4 12B pada 0.5456 dan filter privasi OpenAI pada 0.5816. Angka-angka tersebut adalah hasil yang dilaporkan Roblox sendiri pada benchmarknya, dan kartu dataset mencatat bahwa distribusi sintetis tidak mewakili lalu lintas produksi.
Sentinel 2.0 Memotong Penyetelan dari Satu Jam menjadi Tiga Menit
Roblox Sentinel, yang menandai sinyal dini potensi bahaya anak sebelum pesan menjadi eksplisit, beralih ke versi 2 dengan pipeline penyetelan yang direvisi. Jumlah fungsi penggabungan, yaitu agregator yang mengubah banyak skor per‑observasi menjadi satu skor risiko, meningkat dari dua menjadi enam, dan observasi kini dienkode sekali per penyetelan alih‑alih dihitung ulang untuk setiap konfigurasi. Dalam contoh Roblox, satu penyetelan melintasi 324 konfigurasi selesai dalam waktu kurang dari tiga menit, turun dari hampir satu jam, dan ROC‑AUC naik dari 0.894 pada pengaturan default menjadi 0.996 dengan konfigurasi terbaik yang diidentifikasi oleh penyetelan tersebut.
Catatan rilis mencatat perubahan breaking yang lebih sempit bersamaan dengan fitur-fitur baru. Python 3.10 kini menjadi versi minimum, argumen setelah yang pertama hanya dapat diberikan sebagai kata kunci pada pemanggilan API utama, dan beberapa kolom output pencarian grid diubah namanya setelah kolom ukuran indeks secara diam‑diam menimpa kolom evaluasi pada versi 1.0. Versi 2 juga menyimpan korpus dengan indeks yang disimpan, sehingga penjelasan skor menyebutkan teks yang cocok setelah pemuatan ulang alih‑alih nomor baris, dan dilengkapi Dockerfile untuk penyebaran GPU dan CPU‑only.
voice safety classifier, yang menurut Roblox telah diunduh lebih dari 72.000 kali sejak pertama kali dibuka sumbernya pada 2024, kini memoderasi obrolan suara dalam 30 bahasa dan delapan kategori pelanggaran dengan deteksi bahasa bawaan. Kartu model melaporkan recall 61% pada tingkat false‑positive ketat 1% di semua 30 bahasa, didorong oleh data pelatihan berlabel mesin yang ditingkatkan dengan pelabelan manusia untuk kualitas. Meskipun model dasarnya tumbuh dari 94,6 juta menjadi 320 juta parameter, distilasi model membuatnya tetap cukup cepat untuk deteksi waktu nyata. Kartu tersebut mempublikasikan angka recall dan presisi per bahasa serta mencatat bahwa classifier mengharapkan input WAV mono 16 kHz dalam segmen hingga 15 detik, dengan maksimum 30 detik.
Rilis dalam Angka
- 17 → 189: dukungan bahasa pada PII Classifier, versi 1.0 ke 2.0
- 63.41 → 90.52: skor F1 PII Classifier pada evaluasi internal Roblox
- 39,202: percakapan sintetis dalam benchmark baru (24,518 aman, 14,684 tidak aman)
- 2 → 6: fungsi penggabungan skor pada Sentinel versi 2
- 0.894 → 0.996: ROC-AUC Sentinel, pengaturan default versus konfigurasi terbaik hasil penyetelan
- 30: bahasa yang didukung oleh voice safety classifier v3, dengan recall 61% dan tingkat false‑positive 1%
- 94.6M → 320M: jumlah parameter dasar pada voice classifier, dikompensasi oleh distilasi
- 72,000+: unduhan voice safety classifier sejak rilis sumber terbuka 2024
Bagaimana Upaya Keamanan Sumber Terbuka Roblox Mencapai Titik Ini
Roblox secara konsisten merilis model keamanan produksi sebagai sumber terbuka — Sentinel pada Agustus 2025 dan PII Classifier asli pada November tahun itu — dan rilis ini menambahkan versi terbaru keduanya serta voice safety classifier ke Komunitas Model ROOST. Roblox mengumumkan keanggotaan pendiriannya dalam inisiatif tersebut pada Februari 2025, dengan argumen bahwa alat keamanan harus menjadi infrastruktur bersama, bukan keunggulan kompetitif. Sentinel dibuka sumbernya pada Agustus 2025, dan PII Classifier asli diikuti pada November. Voice safety classifier sudah ada sebelum pengaturan ROOST, pertama kali dirilis pada 2024 dan ditingkatkan ke versi ketiga pada Juni 2026.
Roblox menyatakan insentif ini bersifat dua arah: pada 12 bulan yang berakhir 7 Agustus 2026, hampir 70% kasus bahaya anak yang terdeteksi berasal dari deteksi dini Sentinel, dan versi 2 mengintegrasikan masukan dari anggota ROOST lainnya mengenai evaluasi dan penilaian. Kontribusi ini muncul saat praktik moderasi platform menghadapi perhatian regulasi yang meningkat di Eropa, di mana Roblox mendekati aturan platform paling ketat di UE. Semua tiga model dan benchmark kini tersedia di Hugging Face dan GitHub di bawah lisensi Apache 2.0.











