Oyunlar
Roblox, ROOST Model Community için Üç Güvenlik Modelini Açık Kaynak Haline Getiriyor
Roblox üç açık kaynaklı güven ve emniyet modelinin güncellenmiş sürümlerini ROOST Model Community’ye, ayrıca diğer platformların kendi sınıflandırıcılarını karşılaştırmak için kullanabileceği yeni bir değerlendirme veri kümesiyle birlikte, 19 Ağustos 2026 tarihinde duyurdu.
Bu sürüm, sohbette kişisel bilgi paylaşma veya talep etme girişimlerini tespit eden Roblox’un PII Sınıflandırıcısı 2.0 sürümünü; çocuk istismarı için erken uyarı sistemi olan Roblox Sentinel’in 2. sürümünü; ve gerçek zamanlı ses güvenliği sınıflandırıcısının 3. sürümünü kapsıyor. Üç modelin de sürümleri hâlihazırda Roblox’ta üretimde çalışıyor. ROOST, Robust Open Online Safety Tools (Sağlam Açık Çevrimiçi Güvenlik Araçları) ifadesinin kısaltmasıdır ve Roblox, Google, OpenAI ve diğerleriyle birlikte 2025 başında kurucu üye olarak katıldığı kar amacı gütmeyen bir kuruluştur; model topluluğu, herhangi bir kuruluşun dağıtabileceği açık, incelenebilir güvenlik modelleri dağıtıyor.
Öne çıkan iyileştirme PII Sınıflandırıcısı‘na aittir. 1.0 sürümü mesajları tek başına değerlendirirken, 2.0 sürümü hedef mesajı çevresindeki çoklu‑kullanıcı sohbeti içinde okur; bu değişiklik, yalnızca bağlam içinde anlamlı olan, örneğin bir oyuncunun iki turda platform dışı bir sunucu davetini heceleyerek verdiği gizlenmiş atlatma girişimlerini yakalamayı amaçlar. Sentetik eğitim verileri, dil desteğini 17 dilden 189 dile genişletti ve modelin Roblox iç değerlendirmesindeki F1 skoru 63.41’den 90.52’ye yükseldi. Model, yaklaşık 560 milyon parametreli XLM‑RoBERTa‑Large mimarisi üzerine inşa edilmiştir ve Apache 2.0 lisansı altında sunulmaktadır; üç kategoriye (Kişisel Bilgi Talep Etme, Kişisel Bilgi Verme, Kullanıcıyı Platform Dışına Yönlendirme) sigmoid çıktılar üretir.
Evadeye Dayalı Bir Benchmark
Modelin yanında, Roblox Roblox PII Safety for Chat Benchmark‘i yayınladı; bu, yalnızca değerlendirme amaçlı kullanılan, 39.202 tamamen sentetik İngilizce sohbetten oluşan bir veri kümesidir ve 24.518 güvenli, 14.684 güvensiz örnek içerir. Veri kümesi kartı, hiçbir Roblox kullanıcı sohbet verisinin dahil edilmediğini belirtiyor; her sohbet, çevrimiçi sohbette görülen atlatma tekniklerini modellemek üzere üretildi, örneğin fonetik heceleme, homoglifler, harf arası boşluk, ters metin, kodlu dil ve bilgi parçalanması.
Benchmark, mevcut PII değerlendirmelerindeki bir boşluğu hedef alıyor; çoğu sadece adlandırılmış varlık çıkarımını (e‑posta adresi bul, telefon numarasını işaretle) test eder. Çevrimiçi sohbet riski, çıkarılabilir bir tanımlayıcı ortaya çıkmadan önce sıklıkla görülür ve oyunlardaki tanımlayıcı benzeri dizgiler genellikle zararsızdır (şarkı kimlikleri, XP toplamları, sunucu kodları, rol‑oyun adresleri). Veri kümesindeki “hard negative” örnekler, gerçek ihlallerle yüzey sinyallerini paylaşacak şekilde tasarlanmıştır; bu yüzden sadece anahtar kelimelere veya sayısal desenlere dayalı bir model başarısız olur. Sadece hedef konuşmacı sınıflandırılır; bu da herhangi bir katılımcı PII bahsederse tüm sohbeti işaretleyen bir modelin atıf görevini de başarısız kılar.
Yeni benchmarkta, Roblox v2 sınıflandırıcısının F1 skoru 0.8882 iken, kendi v1.0 sürümü 0.6469 ve bir sonraki en iyi model olan Qwen3Guard‑Gen‑8B 0.6624, Meta’nın Llama Guard 4 12B modeli 0.5456 ve OpenAI’nin gizlilik filtresi 0.5816 olarak raporlanmıştır. Bu rakamlar, Roblox’un kendi benchmarkunda raporladığı sonuçlardır ve veri kümesi kartı, sentetik dağılımın üretim trafiğini temsil etmediğini belirtir.
Sentinel 2.0, Ayar Taramalarını Bir Saatten Üç Dakikaya Düşürüyor
Roblox Sentinel, mesajlar açık hale gelmeden önce potansiyel çocuk istismarının erken sinyallerini işaretleyen sistem, sürüm 2 ile yeniden yapılandırılmış bir ayar boru hattına geçiyor. Birleştirme işlevlerinin (birçok gözlem skorunu tek bir risk skoruna dönüştüren toplayıcıların) sayısı iki’den altıya yükseliyor ve gözlemler artık her konfigürasyon için yeniden hesaplanmak yerine bir tarama başına bir kez kodlanıyor. Roblox örneğinde, 324 konfigürasyon üzerinden yapılan bir tarama üç dakikanın altında tamamlandı; bu, neredeyse bir saatten büyük bir düşüş ve ROC‑AUC değeri varsayılan ayarlarda 0.894 iken en iyi tarama konfigürasyonu ile 0.996’ya yükseldi.
Sürüm notları, özelliklerin yanında dar kapsamlı kırılma değişikliklerini belgeledi. Python 3.10 artık minimum sürüm, ana API çağrılarında ilk argümandan sonraki tüm argümanlar sadece anahtar‑kelime olarak kullanılabiliyor ve birkaç ızgara‑arama (grid‑search) çıktı sütunu, 1.0 sürümünde sessizce bir değerlendirme sütununu üzerine yazan indeks‑boyut sütunu nedeniyle yeniden adlandırıldı. Sürüm 2 ayrıca indeksleri kaydedilmiş bir korpusla sürdürerek, skor açıklamalarının eşleşen metni satır numarası yerine yeniden yükleme sonrası adlandırmasını sağlıyor ve GPU ve yalnızca CPU dağıtımları için Dockerfile’lar sunuyor.
Ses güvenliği sınıflandırıcısı, Roblox’un 2024’te açık kaynak haline getirdiği modelin 72.000’den fazla kez indirildiğini belirtiyor ve artık 30 dilde ve sekiz ihlal kategorisinde yerleşik dil algılama ile ses sohbetini denetliyor. Model kartı, tüm 30 dilde %61 geri çağırma oranını %1 sahte‑pozitif oranıyla rapor ediyor; bu, kalite için insan etiketlemesiyle ölçeklendirilmiş makine‑etiketli eğitim verileri sayesinde sağlanıyor. Alttaki model 94.6 milyondan 320 milyon parametreye büyümüş olsa da, model distilasyonu gerçek‑zaman tespiti için yeterince hızlı tutuyor. Kart, dil başına geri çağırma ve kesinlik değerlerini yayınlıyor ve sınıflandırıcının 15 saniyeye kadar segmentlerde 16 kHz mono WAV girişi beklediğini, maksimum sürenin 30 saniye olduğunu belirtiyor.
Sayılarla Sürüm
- 17 → 189: PII Sınıflandırıcıda dil desteği, sürüm 1.0’dan 2.0’a
- 63.41 → 90.52: Roblox iç değerlendirmesindeki PII Sınıflandırıcı F1 skoru
- 39,202: yeni benchmarktaki sentetik sohbet sayısı (24,518 güvenli, 14,684 güvensiz)
- 2 → 6: Sentinel sürüm 2’deki skor‑birleştirme işlevleri
- 0.894 → 0.996: Sentinel ROC‑AUC, varsayılan ayarlar vs. en iyi tarama konfigürasyonu
- 30: ses güvenliği sınıflandırıcı v3’ün kapsadığı diller, %61 geri çağırma ve %1 sahte‑pozitif oranı
- 94.6M → 320M: ses sınıflandırıcıdaki temel parametre sayısı, distilasyonla denge sağlandı
- 72,000+: 2024 açık kaynak sürümünden bu yana ses güvenliği sınıflandırıcısının indirme sayısı
Açık Kaynak Güvenlik Çabası Roblox’ta Nasıl Gelişti
Roblox, üretim güvenlik modellerini açık kaynak olarak düzenli bir şekilde yayımlıyor — Sentinel Ağustos 2025’te, orijinal PII Sınıflandırıcı Kasım 2025’te — ve bu sürüm, ikisinin güncellenmiş sürümlerini ve ses güvenliği sınıflandırıcısını ROOST Model Community’ye ekliyor. Roblox, bu girişime kurucu üyeliğini Şubat 2025’te duyurmuş, o dönemde güvenlik araçlarının rekabet avantajı yerine ortak altyapı olarak paylaşılması gerektiğini savunmuştu. Sentinel, Ağustos 2025’te açık kaynak haline getirildi ve orijinal PII Sınıflandırıcı o Kasım’da takiben yayımlandı. Ses güvenliği sınıflandırıcısı, ROOST düzenlemesinden önce 2024’te ilk kez yayımlandı ve Haziran 2026’da üçüncü sürümüne yükseltildi.
Roblox, teşvikin iki yönlü olduğunu belirtiyor: 7 Ağustos 2026 tarihine kadar olan 12 aylık dönemde tespit ettiği çocuk istismarı vakalarının neredeyse %70’i Sentinel’in erken tespiti sayesinde ortaya çıktı ve sürüm 2, diğer ROOST üyelerinden gelen değerlendirme ve puanlama geri bildirimlerini içeriyor. Katkı, platformun denetleme uygulamaları Avrupa’da artan düzenleyici ilgiyle karşı karşıya olduğu bir dönemde geliyor; Roblox şu anda AB’nin en sıkı platform kurallarına daha yakın bir konuma geliyor. Üç model ve benchmark, şimdi Hugging Face ve GitHub’da Apache 2.0 lisansı altında mevcut.











