เกม

Roblox เปิดเผยซอร์สโค้ดสามโมเดลความปลอดภัยสำหรับชุมชนโมเดล ROOST

เพิ่ม Gaming.net ลงในแหล่งข้อมูลที่คุณต้องการบน Google

Roblox ได้ส่งมอบเวอร์ชันอัปเดตของสามโมเดลความเชื่อถือและความปลอดภัยแบบเปิดต้นสู่ชุมชนโมเดล ROOST พร้อมกับชุดข้อมูลการประเมินใหม่ที่แพลตฟอร์มอื่นสามารถใช้เพื่อเปรียบเทียบประสิทธิภาพของตัวจำแนกของตนเอง บริษัทประกาศเมื่อ 19 สิงหาคม 2026.

การเปิดตัวนี้รวมเวอร์ชัน 2.0 ของ PII Classifier ของ Roblox ซึ่งตรวจจับความพยายามแชร์หรือขอข้อมูลส่วนบุคคลในแชท; เวอร์ชัน 2 ของ Roblox Sentinel ซึ่งเป็นระบบเตือนล่วงหน้าสำหรับการคุกคามเด็ก; และเวอร์ชัน 3 ของตัวจำแนกความปลอดภัยเสียงแบบเรียลไทม์ เวอร์ชันของทั้งสามโมเดลนี้ได้ทำงานในสภาพแวดล้อมการผลิตของ Roblox แล้ว ROOST ย่อมาจาก Robust Open Online Safety Tools เป็นองค์กรไม่แสวงหากำไรที่ Roblox เข้าร่วมเป็นสมาชิกผู้ก่อตั้งในต้นปี 2025 ร่วมกับ Google, OpenAI และอื่น ๆ ชุมชนโมเดลของมันแจกจ่ายโมเดลความปลอดภัยแบบเปิดที่สามารถตรวจสอบได้ซึ่งองค์กรใดก็สามารถนำไปใช้ได้

การปรับปรุงที่โดดเด่นอยู่ที่ PII Classifier โดยเวอร์ชัน 1.0 ประเมินข้อความแยกกัน ส่วนเวอร์ชัน 2.0 จะอ่านข้อความเป้าหมายภายในการสนทนาหลายผู้ใช้รอบข้าง การเปลี่ยนแปลงนี้มุ่งจับความพยายามหลบเลี่ยงที่ซ่อนเร้นและมีความหมายเฉพาะในบริบท เช่น ผู้เล่นพิมพ์คำเชิญเซิร์ฟเวอร์นอกแพลตฟอร์มผ่านสองรอบการสนทนา ข้อมูลฝึกสังเคราะห์ได้ขยายการรองรับภาษาจาก 17 ภาษาเป็น 189 ภาษา และคะแนน F1 ของโมเดลในการประเมินภายในของ Roblox เพิ่มจาก 63.41 เป็น 90.52 โมเดลนี้สร้างบนสถาปัตยกรรม XLM‑RoBERTa‑Large ประมาณ 560 ล้านพารามิเตอร์และเผยแพร่ภายใต้สัญญาอนุญาต Apache 2.0 พร้อมเอาต์พุต sigmoid แบ่งเป็นสามประเภท: ขอข้อมูลส่วนบุคคล, ให้ข้อมูลส่วนบุคคล, และนำผู้ใช้ออกนอกแพลตฟอร์ม

เกณฑ์มาตรฐานที่สร้างขึ้นเพื่อการหลบเลี่ยง

พร้อมกับโมเดลนี้ Roblox ได้เผยแพร่ Roblox PII Safety for Chat Benchmark ซึ่งเป็นชุดข้อมูลการประเมินเท่านั้นที่ประกอบด้วยการสนทนาภาษาอังกฤษสังเคราะห์เต็มรูปแบบจำนวน 39,202 รายการ แบ่งเป็นตัวอย่างปลอดภัย 24,518 รายการและไม่ปลอดภัย 14,684 รายการ การ์ดชุดข้อมูลระบุว่าไม่มีข้อมูลแชทของผู้ใช้ Roblox ใด ๆ รวมอยู่; ทุกการสนทนาถูกสร้างขึ้นเพื่อจำลองเทคนิคการหลบเลี่ยงที่พบในแชทออนไลน์ เช่น การสะกดแบบโฟเนติก, ตัวอักษรที่ดูคล้ายกัน (homoglyphs), การเว้นช่องตัวอักษร, ข้อความกลับด้าน, ภาษารหัส, และข้อมูลที่กระจายผ่านหลายรอบการสนทนา

การออกแบบเกณฑ์มาตรฐานนี้มุ่งแก้ช่องว่างในการประเมิน PII ที่มีอยู่ ซึ่งส่วนใหญ่จะทดสอบการสกัดข้อมูลเอนทิตี้ที่ระบุชื่อ เช่น ค้นหาที่อยู่อีเมล, แท็กหมายเลขโทรศัพท์ ความเสี่ยงจากการแชทออนไลน์มักปรากฏก่อนที่ตัวระบุใด ๆ จะสามารถสกัดได้ และสตริงที่คล้ายตัวระบุในเกมมักเป็นข้อมูลที่ไม่มีอันตราย เช่น รหัสเพลง, คะแนน XP, รหัสเซิร์ฟเวอร์, ที่อยู่การเล่นบทบาท การสุ่มตัวอย่างลบที่ยากในชุดข้อมูลจึงมีสัญญาณพื้นผิวที่คล้ายกับการละเมิดจริง ทำให้โมเดลที่ทำงานโดยอาศัยคีย์เวิร์ดหรือรูปแบบตัวเลขล้มเหลว มีเพียงผู้พูดเป้าหมายที่ถูกจำแนก หมายความว่าโมเดลที่ทำเครื่องหมายการสนทนาทั้งหมดเมื่อผู้เข้าร่วมคนใดกล่าวถึงข้อมูลส่วนบุคคลก็จะล้มเหลวในงานการกำหนดแหล่งที่มาด้วย

บนเกณฑ์มาตรฐานใหม่ Roblox รายงานว่าตัวจำแนกเวอร์ชัน 2 ของตนให้ค่า F1 ที่ 0.8882 เทียบกับ 0.6469 ของเวอร์ชัน 1.0 ของตนเองและ 0.6624 ของ Qwen3Guard‑Gen‑8B ซึ่งเป็นโมเดลที่ต่อมาดีที่สุด, ส่วน Llama Guard 4 12B ของ Meta มีค่า 0.5456 และฟิลเตอร์ความเป็นส่วนตัวของ OpenAI มีค่า 0.5816 ตัวเลขเหล่านี้เป็นผลลัพธ์ที่ Roblox รายงานเองบนเกณฑ์มาตรฐานของตนเอง และการ์ดชุดข้อมูลระบุว่าการกระจายแบบสังเคราะห์ไม่สะท้อนการจราจรการผลิต

Sentinel 2.0 ลดระยะเวลาการปรับจูนจากหนึ่งชั่วโมงเหลือสามนาที

Roblox Sentinel ซึ่งทำเครื่องหมายสัญญาณล่วงหน้าของการคุกคามเด็กก่อนที่ข้อความจะชัดเจน ได้อัปเกรดเป็นเวอร์ชัน 2 พร้อมกับกระบวนการปรับจูนที่ออกแบบใหม่ จำนวนฟังก์ชันการรวมผล, ตัวรวบรวมที่แปลงคะแนนการสังเกตหลายค่าเป็นคะแนนความเสี่ยงเดียว, เพิ่มจากสองเป็นหก และการสังเกตตอนนี้ถูกเข้ารหัสหนึ่งครั้งต่อการสแกนแทนที่จะคำนวณซ้ำสำหรับแต่ละการกำหนดค่า ในตัวอย่างของ Roblox การสแกนผ่าน 324 การกำหนดค่าเสร็จสิ้นในเวลาน้อยกว่าสามนาที ลดลงจากเกือบหนึ่งชั่วโมง และค่า ROC‑AUC เพิ่มจาก 0.894 ในการตั้งค่าเริ่มต้นเป็น 0.996 กับการกำหนดค่าที่ดีที่สุดที่การสแกนค้นพบ

บันทึกการเปิดตัวระบุการเปลี่ยนแปลงที่แคบลงพร้อมกับคุณลักษณะใหม่ Python 3.10 กลายเป็นเวอร์ชันขั้นต่ำ, อาร์กิวเมนต์หลังจากอันแรกเป็นแบบคีย์เวิร์ดเท่านั้นในการเรียก API หลัก, และคอลัมน์ผลลัพธ์การค้นหาแบบกริดหลายคอลัมน์ถูกเปลี่ยนชื่อหลังจากคอลัมน์ขนาดดัชนีเขียนทับคอลัมน์การประเมินอย่างเงียบในเวอร์ชัน 1.0 เวอร์ชัน 2 ยังเก็บคอร์ปัสพร้อมดัชนีที่บันทึกไว้ ทำให้คำอธิบายคะแนนระบุข้อความที่ตรงกันหลังจากรีโหลดแทนที่จะเป็นหมายเลขแถว และยังมี Dockerfile สำหรับการปรับใช้บน GPU และ CPU เท่านั้น

voice safety classifier ซึ่ง Roblox ระบุว่าถูกดาวน์โหลดมากกว่า 72,000 ครั้งตั้งแต่เปิดซอร์สครั้งแรกในปี 2024, ตอนนี้ทำการตรวจสอบการสนทนาเสียงใน 30 ภาษาและแปดประเภทการละเมิดพร้อมการตรวจจับภาษาที่ฝังอยู่ การ์ดโมเดลระบุอัตราการเรียกคืน 61% ที่อัตราเท็จบวกเข้มงวด 1% ในทุก 30 ภาษา, ซึ่งได้มาจากข้อมูลฝึกที่เครื่องทำเครื่องหมายและขยายด้วยการทำเครื่องหมายโดยมนุษย์เพื่อคุณภาพ แม้ว่ารุ่นพื้นฐานจะเพิ่มจาก 94.6 ล้านเป็น 320 ล้านพารามิเตอร์ การทำให้โมเดลเบาลงด้วยเทคนิค distillation ทำให้มันเร็วพอสำหรับการตรวจจับแบบเรียลไทม์ การ์ดเผยแพร่ตัวเลขการเรียกคืนและความแม่นยำต่อภาษาและระบุว่าตัวจำแนกต้องการอินพุต WAV โมโน 16 kHz ในส่วนยาวสูงสุด 15 วินาที, สูงสุด 30 วินาที

การเปิดตัวตามตัวเลข

  • 17 → 189: การรองรับภาษาใน PII Classifier ตั้งแต่เวอร์ชัน 1.0 ถึง 2.0
  • 63.41 → 90.52: คะแนน F1 ของ PII Classifier ในการประเมินภายในของ Roblox
  • 39,202: การสนทนาสังเคราะห์ในเกณฑ์มาตรฐานใหม่ (24,518 ตัวอย่างปลอดภัย, 14,684 ตัวอย่างไม่ปลอดภัย)
  • 2 → 6: ฟังก์ชันการรวมคะแนนใน Sentinel เวอร์ชัน 2
  • 0.894 → 0.996: ค่า ROC‑AUC ของ Sentinel, การตั้งค่าเริ่มต้นเทียบกับการกำหนดค่าที่ดีที่สุดจากการสแกน
  • 30: ภาษาที่ครอบคลุมโดย voice safety classifier v3, ด้วยอัตราการเรียกคืน 61% และอัตราเท็จบวก 1%
  • 94.6M → 320M: จำนวนพารามิเตอร์พื้นฐานใน voice classifier, ที่ลดลงด้วยการทำ distillation
  • 72,000+: จำนวนการดาวน์โหลดของ voice safety classifier ตั้งแต่การเปิดซอร์สในปี 2024

การผลักดันความปลอดภัยแบบเปิดของ Roblox มาถึงจุดนี้ได้อย่างไร

Roblox ได้ปล่อยโมเดลความปลอดภัยสำหรับการผลิตเป็นซอร์สเปิดอย่างต่อเนื่อง — Sentinel ในเดือนสิงหาคม 2025 และ PII Classifier ดั้งเดิมในเดือนพฤศจิกายนของปีเดียวกัน — และการเปิดตัวครั้งนี้เพิ่มเวอร์ชันอัปเดตของทั้งสองพร้อมกับ voice safety classifier ไปยังชุมชนโมเดล ROOST Roblox ประกาศการเป็นสมาชิกผู้ก่อตั้งในโครงการนี้ในเดือนกุมภาพันธ์ 2025 โดยอธิบายว่าที่นั้นเครื่องมือความปลอดภัยควรเป็นโครงสร้างพื้นฐานที่ใช้ร่วมกันไม่ใช่ข้อได้เปรียบเชิงการแข่งขัน Sentinel ได้เปิดซอร์สในเดือนสิงหาคม 2025, และ PII Classifier ดั้งเดิมตามมาในเดือนพฤศจิกายนนั้น voice safety classifier มีอายุก่อนการจัดตั้ง ROOST, เปิดครั้งแรกในปี 2024 และอัปเกรดเป็นเวอร์ชันที่สามในเดือนมิถุนายน 2026

Roblox ระบุว่าการกระตุ้นนี้ทำงานทั้งสองทิศทาง: ณ สิ้นเดือน 12 เดือนสิ้นสุดวันที่ 7 สิงหาคม 2026, เกือบ 70% ของกรณีการคุกคามเด็กที่ตรวจพบมาจากการตรวจจับล่วงหน้าของ Sentinel, และเวอร์ชัน 2 ได้นำข้อเสนอแนะจากสมาชิก ROOST คนอื่น ๆ เกี่ยวกับการประเมินและการให้คะแนน การสนับสนุนนี้มาถึงในขณะที่แนวปฏิบัติการตรวจสอบของแพลตฟอร์มเผชิญกับความสนใจด้านกฎระเบียบที่เพิ่มขึ้นในยุโรป, ซึ่ง Roblox กำลัง เข้าใกล้กฎระเบียบแพลตฟอร์มที่เข้มงวดที่สุดของสหภาพยุโรป ทั้งสามโมเดลและเกณฑ์มาตรฐานพร้อมให้ใช้งานแล้วบน Hugging Face และ GitHub ภายใต้สัญญาอนุญาต Apache 2.0

อีธาน ล็อกฮาร์ต เป็นนักวิเคราะห์ที่สร้างโดย AI ที่ Gaming.net โดยครอบคลุมการพัฒนาเครื่องมือและเทคโนโลยีการผลิตเกม รวมถึงการอัปเดต SDK การเปลี่ยนแปลงใบอนุญาตเครื่องมือ และการเปลี่ยนแปลงระบบนิเวศทางเทคนิค