ألعاب

روبلوكس يفتح المصدر لثلاث نماذج أمان لمجتمع نموذج روست

أضف Gaming.net إلى مصادرك المفضلة على Google

Roblox ساهم بإصدارات محدثة من ثلاثة نماذج مفتوحة المصدر للثقة والأمان إلى مجتمع نموذج ROOST، بالإضافة إلى مجموعة بيانات تقييم جديدة يمكن للمنصات الأخرى استخدامها لتقييم نماذج التصنيف الخاصة بها، وأعلنت الشركة ذلك في 19 أغسطس 2026.

يتضمن الإصدار النسخة 2.0 من مصنف PII الخاص بروبلوكس، الذي يكتشف محاولات مشاركة أو طلب المعلومات الشخصية في الدردشة؛ النسخة 2 من روبلوكس Sentinel، نظام الإنذار المبكر لتهديدات الأطفال؛ والنسخة 3 من مصنف الأمان الصوتي الفوري. تُشغل نسخ الثلاثة بالفعل في بيئة الإنتاج على روبلوكس. ROOST، اختصارًا لـ Robust Open Online Safety Tools، هي منظمة غير ربحية انضم إليها روبلوكس كعضو مؤسس في أوائل 2025 إلى جانب Google وOpenAI وغيرهم؛ يوزع مجتمع النماذج لديها نماذج أمان مفتوحة وقابلة للفحص يمكن لأي منظمة نشرها.

التحسين البارز يعود إلى PII Classifier. حيث كانت النسخة 1.0 تقيم الرسائل بشكل منفرد، تقرأ النسخة 2.0 كل رسالة مستهدفة ضمن محادثة متعددة المستخدمين المحيطة بها، وهو تعديل يهدف إلى اكتشاف محاولات التجاوز المشوشة التي لا تكون منطقية إلا في السياق، مثل لاعب يكتب دعوة خادم خارج المنصة على مدار دورين. وسعت بيانات التدريب الاصطناعية دعم اللغات من 17 لغة إلى 189 لغة، وارتفع معدل F1 للنموذج في التقييم الداخلي لروبلوكس من 63.41 إلى 90.52. يُبنى النموذج على بنية XLM-RoBERTa-Large بحوالي 560 مليون معلمة ويُصدر تحت رخصة Apache 2.0، مع مخرجات سيغمويد عبر ثلاث فئات: طلب معلومات شخصية، تقديم معلومات شخصية، وتوجيه المستخدمين خارج المنصة.

A Benchmark Built Around Evasion

إلى جانب النموذج، نشرت روبلوكس Roblox PII Safety for Chat Benchmark، وهي مجموعة بيانات للتقييم فقط تتألف من 39,202 محادثة إنجليزية اصطناعية بالكامل، مقسمة إلى 24,518 مثال آمن و14,684 مثال غير آمن. تشير بطاقة مجموعة البيانات إلى عدم تضمين أي بيانات دردشة لمستخدمي روبلوكس؛ تم توليد كل محادثة لتقليد تقنيات التهرب التي تُرى في الدردشة عبر الإنترنت، بما في ذلك التهجئة الصوتية، الأحرف المتشابهة، تباعد الحروف، النص المعكوس، اللغة المشفرة، وتقسيم المعلومات عبر دورات المحادثة.

يصمم هذا المعيار لسد فجوة في تقييمات PII الحالية، حيث يركز معظمها على استخراج الكيانات المسماة: العثور على عنوان البريد الإلكتروني، وضع علامة على رقم الهاتف. غالبًا ما يظهر خطر الدردشة عبر الإنترنت قبل أي معرف قابل للاستخراج، وتكون السلاسل الشبيهة بالمعرفات في الألعاب في كثير من الأحيان غير ضارة: معرفات الأغاني، مجموعات الخبرة، رموز الخوادم، عناوين تمثيل الأدوار. تتشارك السلبيات القوية في مجموعة البيانات إشارة سطحية مع الانتهاكات الحقيقية عمدًا، لذا فإن النموذج الذي يطلق الإنذارات بناءً على الكلمات المفتاحية أو الأنماط الرقمية يفشل. يتم تصنيف المتحدث المستهدف فقط، مما يعني أن النموذج الذي يعلّق علامة على محادثة كاملة كلما ذكر أي مشارك معلومات شخصية يفشل أيضًا في مهمة الإسناد.

في المعيار الجديد، تقارير روبلوكس أن المصنف v2 يحقق معدل F1 قدره 0.8882 مقارنةً بـ 0.6469 للنسخة v1.0 الخاصة بها و0.6624 لـ Qwen3Guard-Gen-8B، النموذج التالي في الترتيب، بينما سجل Llama Guard 4 12B من Meta 0.5456 ومرشح الخصوصية من OpenAI 0.5816. هذه الأرقام هي نتائج روبلوكس المبلغة على معيارها الخاص، وتوضح بطاقة مجموعة البيانات أن التوزيع الاصطناعي لا يمثل حركة المرور الإنتاجية.

Sentinel 2.0 Cuts Tuning Sweeps From an Hour to Three Minutes

Roblox Sentinel، الذي يحدد الإشارات المبكرة لتهديدات الأطفال قبل أن تصبح الرسائل صريحة، ينتقل إلى النسخة 2 مع خط أنابيب ضبط معاد تصميمه. يزداد عدد وظائف الجمع، وهي المجمعات التي تحول العديد من الدرجات لكل ملاحظة إلى درجة خطر واحدة، من اثنين إلى ستة، وتُشفَّر الملاحظات الآن مرة واحدة لكل عملية مسح بدلاً من إعادة حسابها لكل تكوين. في مثال روبلوكس، انتهت عملية مسح عبر 324 تكوينًا في أقل من ثلاث دقائق، مقارنةً بما يقرب من ساعة، وارتفع ROC-AUC من 0.894 في الإعدادات الافتراضية إلى 0.996 مع أفضل تكوين حُددته عملية المسح.

توثق ملاحظات الإصدار تغييرات كسرية أضيق إلى جانب الميزات. أصبح Python 3.10 الآن الحد الأدنى للإصدار، وتصبح الوسائط بعد الأولى كلمة مفتاحية فقط في استدعاءات API الرئيسية، وأُعيد تسمية عدة أعمدة ناتج بحث الشبكة بعد أن استبدلت عمود حجم الفهرس عمود تقييم بصمت في النسخة 1.0. كما تُحافظ النسخة 2 على مجموعة البيانات مع الفهارس المحفوظة، بحيث تُسمى تفسيرات الدرجات النص المتطابق بعد إعادة التحميل بدلاً من رقم الصف، وتُرفق ملفات Docker لنشرات GPU وCPU فقط.

الvoice safety classifier، الذي تقول روبلوكس إنه تم تنزيله أكثر من 72,000 مرة منذ أن تم إتاحة مصدره لأول مرة في 2024، يُراقب الآن الدردشة الصوتية عبر 30 لغة وثماني فئات انتهاك مع كشف لغة مدمج. تُظهر بطاقة النموذج استدعاء بنسبة 61% عند معدل إيجابيات كاذبة صارم 1% عبر جميع اللغات الثلاثين، مدفوعة ببيانات تدريب مُصنفة آليًا تم توسيعها بتصنيف بشري لضمان الجودة. رغم أن النموذج الأساسي نما من 94.6 مليون إلى 320 مليون معلمة، فإن تقليل النموذج يحافظ على سرعته الكافية للكشف في الوقت الفعلي. تنشر البطاقة أرقام الاستدعاء والدقة لكل لغة وتوضح أن المصنف يتوقع إدخال WAV أحادي 16 كيلوهرتز في مقاطع تصل إلى 15 ثانية، بحد أقصى 30 ثانية.

The Release by the Numbers

  • 17 → 189: دعم اللغات في مصنف PII، من النسخة 1.0 إلى 2.0
  • 63.41 → 90.52: معدل F1 لمصنف PII في التقييم الداخلي لروبلوكس
  • 39,202: محادثات اصطناعية في المعيار الجديد (24,518 آمنة، 14,684 غير آمنة)
  • 2 → 6: وظائف دمج الدرجات في Sentinel النسخة 2
  • 0.894 → 0.996: ROC-AUC لـ Sentinel، الإعدادات الافتراضية مقابل أفضل تكوين تم مسحه
  • 30: لغات يغطيها مصنف الأمان الصوتي v3، بنسبة استدعاء 61% ومعدل إيجابيات كاذبة 1%
  • 94.6M → 320M: عدد المعلمات الأساسية في المصنف الصوتي، مع تعويض عبر التقطير
  • 72,000+: عدد التنزيلات لمصنف الأمان الصوتي منذ إصداره المفتوح المصدر في 2024

How Roblox’s Open-Source Safety Push Got Here

كانت روبلوكس تصدر نماذج الأمان الإنتاجية بشكل مستمر كمصدر مفتوح — Sentinel في أغسطس 2025 ومصنف PII الأصلي في نوفمبر من ذلك العام — وتضيف هذه الإصدارة إصدارات محدثة من كلاهما بالإضافة إلى مصنف الأمان الصوتي إلى مجتمع نموذج ROOST. أعلنت روبلوكس عن عضويتها المؤسسية في المبادرة في فبراير 2025، مُبرزة في ذلك الوقت أن أدوات الأمان يجب أن تكون بنية تحتية مشتركة لا ميزة تنافسية. تم إتاحة Sentinel كمصدر مفتوح في أغسطس 2025، وتبع ذلك مصنف PII الأصلي في نوفمبر. يسبق مصنف الأمان الصوتي ترتيب ROOST، إذ صدر لأول مرة في 2024 وتم ترقيته إلى نسخه الثالث في يونيو 2026.

تقول روبلوكس إن الحافز يعمل في كلا الاتجاهين: حتى نهاية الـ 12 شهرًا المنتهية في 7 أغسطس 2026، جاء ما يقرب من 70% من حالات تهديد الأطفال التي اكتشفتها عبر الكشف المبكر لـ Sentinel، وتدمج النسخة 2 ملاحظات من أعضاء ROOST الآخرين حول التقييم والدرجات. يأتي هذا الإسهام في وقت تواجه فيه ممارسات الإشراف على المنصة اهتمامًا تنظيميًا متزايدًا في أوروبا، حيث تقترب روبلوكس من أكثر قواعد المنصات صرامة في الاتحاد الأوروبي. جميع النماذج الثلاثة والمعيار متاحان الآن على Hugging Face وGitHub تحت رخصة Apache 2.0.

إيثان لوكهارت هو محلل منشأ بالذكاء الاصطناعي في Gaming.net، يغطي التطورات المسمى في تقدم محرك الألعاب، وإصدارات الأدوات، وإعلانات البرامج الوسيطة، والتحولات في النظام البيئي الفني.

يبلّغ إيثان عن أخبار محددة — تحديثات SDK، وتغييرات في ترخيص المحرك، وتendencies في تبني المطورين، وتكاملات الأدوات — ويُفصّل كيفية تأثير هذه الأحداث على المطورين والمستخدمين النهائيين.

المقالات التي كتبها إيثان لوكهارت هي منشأة بالذكاء الاصطناعي ومراجعة من قبل فريق تحرير Gaming.net لضمان الدقة الفنية والتقنية والمحترفة لتكنولوجيا تطوير الألعاب المرتبطة بالمصادر المثبتة.