खेल

Roblox ने ROOST मॉडल समुदाय के लिए तीन सुरक्षा मॉडल ओपन‑सोर्स किए

Gaming.net को Google पर अपने पसंदीदा स्रोतों में जोड़ें

Roblox ने ROOST मॉडल समुदाय को तीन ओपन‑सोर्स ट्रस्ट‑एंड‑सेफ्टी मॉडल के अद्यतन संस्करण प्रदान किए हैं, साथ ही एक नया मूल्यांकन डेटासेट भी जारी किया है जिसे अन्य प्लेटफ़ॉर्म अपने वर्गीकर्ताओं का बेंचमार्क बनाने के लिए उपयोग कर सकते हैं, कंपनी ने 19 अगस्त 2026 को घोषणा की।

इस रिलीज़ में Roblox के PII क्लासिफायर का संस्करण 2.0 शामिल है, जो चैट में व्यक्तिगत जानकारी साझा करने या माँगने के प्रयासों का पता लगाता है; Roblox Sentinel का संस्करण 2, जो बाल दुर्व्यवहार के शुरुआती संकेतों के लिए चेतावनी प्रणाली है; और इसका रीयल‑टाइम वॉइस सुरक्षा क्लासिफायर का संस्करण 3। इन तीनों के सभी संस्करण पहले से ही Roblox पर उत्पादन में चल रहे हैं। ROOST, जिसका पूरा अर्थ Robust Open Online Safety Tools है, एक गैर‑लाभकारी संस्था है जिसमें Roblox ने 2025 की शुरुआत में Google, OpenAI और अन्य के साथ संस्थापक सदस्य के रूप में शामिल हुआ; इसकी मॉडल समुदाय खुले, निरीक्षण योग्य सुरक्षा मॉडल वितरित करता है जिन्हें कोई भी संगठन तैनात कर सकता है।

मुख्य सुधार PII क्लासिफायर को मिलता है। जहाँ संस्करण 1.0 ने संदेशों को अलग‑अलग मूल्यांकित किया, संस्करण 2.0 प्रत्येक लक्ष्य संदेश को उसके आसपास के बहु‑उपयोगकर्ता वार्तालाप के भीतर पढ़ता है, यह परिवर्तन संदर्भ में ही समझ में आने वाले छिपे हुए बायपास प्रयासों को पकड़ने के लिए किया गया है, जैसे कि कोई खिलाड़ी दो बारी में प्लेटफ़ॉर्म‑बाहरी सर्वर आमंत्रण को अक्षर‑दर‑अक्षर लिखता है। सिंथेटिक प्रशिक्षण डेटा ने भाषा समर्थन को 17 से बढ़ाकर 189 किया, और Roblox के आंतरिक मूल्यांकन पर मॉडल का F1 स्कोर 63.41 से 90.52 तक बढ़ गया। मॉडल XLM‑RoBERTa‑Large आर्किटेक्चर पर लगभग 560 मिलियन पैरामीटर के साथ निर्मित है और Apache 2.0 लाइसेंस के तहत उपलब्ध है, जिसमें तीन श्रेणियों के लिए सिग्मॉइड आउटपुट होते हैं: PII माँगना, PII देना, और उपयोगकर्ताओं को प्लेटफ़ॉर्म‑बाहरी निर्देशित करना।

चालाकी के इर्द‑गिर्द निर्मित बेंचमार्क

मॉडल के साथ, Roblox ने Roblox PII Safety for Chat Benchmark प्रकाशित किया, जो केवल मूल्यांकन के लिए 39,202 पूरी तरह से सिंथेटिक अंग्रेज़ी वार्तालापों का डेटासेट है, जिसे 24,518 सुरक्षित और 14,684 असुरक्षित उदाहरणों में विभाजित किया गया है। डेटासेट कार्ड में कहा गया है कि कोई भी Roblox उपयोगकर्ता चैट डेटा शामिल नहीं है; प्रत्येक वार्तालाप को ऑनलाइन चैट में देखी गई चालाकी तकनीकों को मॉडल करने के लिए उत्पन्न किया गया, जिसमें ध्वन्यात्मक वर्तनी, होमोग्लिफ़, अक्षर अंतर, उल्टा पाठ, कोडित भाषा, और वार्तालाप के चरणों में विभाजित जानकारी शामिल हैं।

बेंचमार्क का डिज़ाइन मौजूदा PII मूल्यांकनों में मौजूद अंतर को लक्षित करता है, जिनमें से अधिकांश नामित‑इकाई निष्कर्षण की जाँच करते हैं: ई‑मेल पता ढूँढ़ना, फोन नंबर को टैग करना। ऑनलाइन‑चैट जोखिम अक्सर किसी भी निकाले जा सकने वाले पहचानकर्ता से पहले ही प्रकट हो जाता है, और खेलों में पहचानकर्ता‑समान स्ट्रिंग्स अक्सर निरापद होते हैं: गीत आईडी, XP कुल, सर्वर कोड, रोल‑प्ले पते। डेटासेट में कठोर नकारात्मक उदाहरण जानबूझकर वास्तविक उल्लंघनों के समान सतही संकेत साझा करते हैं, इसलिए कीवर्ड या संख्यात्मक पैटर्न पर प्रतिक्रिया देने वाला मॉडल विफल रहता है। केवल लक्ष्य वक्ता को वर्गीकृत किया जाता है, जिसका अर्थ है कि जब भी कोई प्रतिभागी PII का उल्लेख करता है, पूरे वार्तालाप को चिह्नित करने वाला मॉडल भी अभिकरण कार्य में विफल रहता है।

नए बेंचमार्क पर, Roblox ने रिपोर्ट किया कि उसका v2 क्लासिफायर 0.8882 का F1 स्कोर प्राप्त करता है, जबकि उसका स्वयं का v1.0 0.6469 और अगला‑सबसे अच्छा मॉडल Qwen3Guard-Gen-8B 0.6624 है, Meta के Llama Guard 4 12B का स्कोर 0.5456 और OpenAI के प्राइवेसी फ़िल्टर का 0.5816 है। ये आँकड़े Roblox द्वारा अपने बेंचमार्क पर स्वयं रिपोर्ट किए गए परिणाम हैं, और डेटासेट कार्ड में उल्लेख है कि सिंथेटिक वितरण उत्पादन ट्रैफ़िक को प्रतिबिंबित नहीं करता।

Sentinel 2.0 ने ट्यूनिंग स्विप्स को एक घंटे से तीन मिनट में घटा दिया

Roblox Sentinel, जो संदेशों के स्पष्ट होने से पहले संभावित बाल दुर्व्यवहार के शुरुआती संकेतों को चिन्हित करता है, संस्करण 2 में एक पुनः डिज़ाइन किए गए ट्यूनिंग पाइपलाइन के साथ जाता है। संयोजन फ़ंक्शन की संख्या, अर्थात् कई प्रति‑निरीक्षण स्कोर को एकल जोखिम स्कोर में बदलने वाले एग्रीगेटर, दो से बढ़कर छह हो गई, और अब निरीक्षणों को प्रत्येक कॉन्फ़िगरेशन के लिए पुनः गणना करने के बजाय प्रत्येक स्विप में एक बार एन्कोड किया जाता है। Roblox के उदाहरण में, 324 कॉन्फ़िगरेशन पर एक स्विप तीन मिनट से कम में समाप्त हुआ, जो लगभग एक घंटे से कम है, और ROC‑AUC डिफ़ॉल्ट सेटिंग्स पर 0.894 से बढ़कर स्विप द्वारा पहचाने गए सर्वोत्तम कॉन्फ़िगरेशन पर 0.996 हो गया।

रिलीज़ नोट्स में फीचर्स के साथ संकीर्ण ब्रेकिंग परिवर्तन भी दस्तावेज़ित किए गए हैं। Python 3.10 अब न्यूनतम संस्करण है, पहले के बाद के तर्क मुख्य API कॉल में केवल कीवर्ड‑आधारित हैं, और कई ग्रिड‑सर्च आउटपुट कॉलम का नाम बदल दिया गया था क्योंकि संस्करण 1.0 में एक इंडेक्स‑साइज़ कॉलम ने चुपचाप एक मूल्यांकन कॉलम को ओवरराइट कर दिया था। संस्करण 2 कॉर्पस को सहेजे गए इंडेक्स के साथ भी बनाए रखता है, इसलिए स्कोर व्याख्याएँ पुनः लोड के बाद मिलते हुए पाठ का नाम देती हैं न कि पंक्ति संख्या, और यह GPU और CPU‑केवल डिप्लॉयमेंट के लिए Dockerfiles प्रदान करता है।

The वॉइस सुरक्षा क्लासिफायर, जिसे Roblox कहता है कि 2024 में पहली बार ओपन‑सोर्स होने के बाद से 72,000 से अधिक बार डाउनलोड किया गया है, अब अंतर्निहित भाषा पहचान के साथ 30 भाषाओं और आठ उल्लंघन श्रेणियों में वॉइस चैट को मॉडरेट करता है। मॉडल कार्ड रिपोर्ट करता है कि सभी 30 भाषाओं में 1% सख्त फॉल्स‑पॉज़िटिव दर पर 61% रिकॉल प्राप्त हुआ, जो गुणवत्ता के लिए मानव लेबलिंग के साथ स्केल किए गए मशीन‑लेबल्ड प्रशिक्षण डेटा द्वारा संचालित है। यद्यपि आधारभूत मॉडल पैरामीटर 94.6 मिलियन से बढ़कर 320 मिलियन हो गया, मॉडल डिस्टिलेशन इसे रीयल‑टाइम डिटेक्शन के लिए पर्याप्त तेज़ रखता है। कार्ड प्रत्येक भाषा के लिए रिकॉल और प्रिसिशन आँकड़े प्रकाशित करता है और नोट करता है कि क्लासिफायर 16 kHz मोनो WAV इनपुट को अधिकतम 15 सेकंड के सेगमेंट में अपेक्षित करता है, अधिकतम 30 सेकंड तक।

संख्याओं में रिलीज़

  • 17 → 189: PII क्लासिफायर में भाषा समर्थन, संस्करण 1.0 से 2.0 तक
  • 63.41 → 90.52: Roblox के आंतरिक मूल्यांकन पर PII क्लासिफायर का F1 स्कोर
  • 39,202: नए बेंचमार्क में सिंथेटिक वार्तालाप (24,518 सुरक्षित, 14,684 असुरक्षित)
  • 2 → 6: Sentinel संस्करण 2 में स्कोर‑संयोजन फ़ंक्शन
  • 0.894 → 0.996: Sentinel ROC‑AUC, डिफ़ॉल्ट सेटिंग्स बनाम सर्वश्रेष्ठ स्विप कॉन्फ़िगरेशन
  • 30: वॉइस सुरक्षा क्लासिफायर v3 द्वारा कवर की गई भाषाएँ, 61% रिकॉल और 1% फॉल्स‑पॉज़िटिव दर के साथ
  • 94.6M → 320M: वॉइस क्लासिफायर में आधारभूत पैरामीटर संख्या, डिस्टिलेशन द्वारा संतुलित
  • 72,000+: 2024 के ओपन‑सोर्स रिलीज़ के बाद से वॉइस सुरक्षा क्लासिफायर के डाउनलोड

Roblox की ओपन‑सोर्स सुरक्षा पहल यहाँ तक कैसे पहुँची

Roblox लगातार उत्पादन सुरक्षा मॉडल को ओपन‑सोर्स के रूप में जारी कर रहा है — Sentinel अगस्त 2025 में और मूल PII क्लासिफायर उसी नवंबर में — और इस रिलीज़ में दोनों के अद्यतन संस्करण तथा उसका वॉइस सुरक्षा क्लासिफायर ROOST मॉडल समुदाय में जोड़े गए हैं। Roblox ने फरवरी 2025 में इस पहल में अपनी संस्थापक सदस्यता की घोषणा की, उस समय तर्क देते हुए कि सुरक्षा उपकरण साझा बुनियादी ढांचा होना चाहिए न कि प्रतिस्पर्धात्मक लाभ। Sentinel को अगस्त 2025 में ओपन‑सोर्स किया गया, और मूल PII क्लासिफायर उसी नवंबर में जारी हुआ। वॉइस सुरक्षा क्लासिफायर ROOST व्यवस्था से पहले का है, पहली बार 2024 में रिलीज़ हुआ और जून 2026 में इसका तीसरा संस्करण अपग्रेड किया गया।

Roblox कहता है कि यह प्रोत्साहन दोनों दिशाओं में काम करता है: 7 अगस्त 2026 को समाप्त 12 महीनों के अनुसार, लगभग 70% बाल‑दुर्व्यवहार मामलों का पता Sentinel के शुरुआती पता लगाने से लगा, और संस्करण 2 में मूल्यांकन और स्कोरिंग पर अन्य ROOST सदस्यों की प्रतिक्रिया शामिल की गई है। यह योगदान तब आया है जब प्लेटफ़ॉर्म की मॉडरेशन प्रथाएँ यूरोप में बढ़ते नियामक ध्यान का सामना कर रही हैं, जहाँ Roblox EU के सबसे कड़े प्लेटफ़ॉर्म नियमों के करीब जा रहा है। सभी तीन मॉडल और बेंचमार्क अब Hugging Face और GitHub पर Apache 2.0 लाइसेंस के तहत उपलब्ध हैं।

इथन लॉकहार्ट गेमिंग.नेट में एक एआई-जनरेटेड विश्लेषक है, जो गेम इंजन उन्नति, टूलिंग रिलीज़, मिडलवेयर घोषणाओं और तकनीकी पारिस्थितिकी परिवर्तनों में नामित विकासों को कवर करता है।