Trò chơi
Roblox Mở Nguồn Ba Mô Hình An Toàn cho Cộng Đồng Mô Hình ROOST
Roblox đã đóng góp các phiên bản cập nhật của ba mô hình tin cậy và an toàn mã nguồn mở cho Cộng đồng Mô hình ROOST, cùng với một bộ dữ liệu đánh giá mới mà các nền tảng khác có thể dùng để đo lường các bộ phân loại của mình, công ty công bố vào ngày 19 tháng 8 năm 2026.
Bản phát hành bao gồm phiên bản 2.0 của Bộ phân loại PII của Roblox, công cụ phát hiện các nỗ lực chia sẻ hoặc yêu cầu thông tin cá nhân trong trò chuyện; phiên bản 2 của Roblox Sentinel, hệ thống cảnh báo sớm về nguy cơ lạm dụng trẻ em; và phiên bản 3 của bộ phân loại an toàn giọng nói thời gian thực. Các phiên bản của ba mô hình này đã được triển khai trong môi trường sản xuất trên Roblox. ROOST, viết tắt của Robust Open Online Safety Tools, là tổ chức phi lợi nhuận mà Roblox tham gia với tư cách thành viên sáng lập vào đầu năm 2025 cùng với Google, OpenAI và các đối tác khác; cộng đồng mô hình của nó cung cấp các mô hình an toàn mở, có thể kiểm tra mà bất kỳ tổ chức nào cũng có thể triển khai.
Cải tiến nổi bật thuộc về PII Classifier. Trong khi phiên bản 1.0 đánh giá các tin nhắn riêng lẻ, phiên bản 2.0 đọc mỗi tin nhắn mục tiêu trong ngữ cảnh của cuộc trò chuyện đa người xung quanh, một thay đổi nhằm phát hiện các nỗ lực vượt qua bị làm mờ mà chỉ có ý nghĩa trong ngữ cảnh, chẳng hạn một người chơi gõ ra lời mời tham gia máy chủ ngoài nền tảng qua hai lượt trò chuyện. Dữ liệu huấn luyện tổng hợp đã mở rộng hỗ trợ ngôn ngữ từ 17 ngôn ngữ lên 189, và điểm F1 của mô hình trên đánh giá nội bộ của Roblox đã tăng từ 63.41 lên 90.52. Mô hình được xây dựng trên kiến trúc XLM‑RoBERTa‑Large với khoảng 560 triệu tham số và được phát hành dưới giấy phép Apache 2.0, với đầu ra sigmoid cho ba danh mục: yêu cầu PII, cung cấp PII và hướng người dùng ra ngoài nền tảng.
Một Bảng Đánh Giá Xây Dựng Xung Quanh Việc Lách Lối
Cùng với mô hình, Roblox công bố Roblox PII Safety for Chat Benchmark, một bộ dữ liệu chỉ dùng để đánh giá gồm 39,202 cuộc trò chuyện tiếng Anh hoàn toàn tổng hợp, chia thành 24,518 mẫu an toàn và 14,684 mẫu không an toàn. Thẻ dữ liệu cho biết không có dữ liệu trò chuyện của người dùng Roblox được bao gồm; mọi cuộc trò chuyện đều được tạo ra để mô phỏng các kỹ thuật lách lối được thấy trong trò chuyện trực tuyến, bao gồm cách viết phiên âm, ký tự đồng dạng, cách cách chữ, văn bản đảo ngược, ngôn ngữ mã hoá và thông tin được chia nhỏ qua các lượt trò chuyện.
Thiết kế của bảng đánh giá nhằm lấp đầy khoảng trống trong các đánh giá PII hiện có, phần lớn chỉ kiểm tra việc trích xuất thực thể có tên: tìm địa chỉ email, gắn thẻ số điện thoại. Rủi ro trong trò chuyện trực tuyến thường xuất hiện trước khi có bất kỳ định danh nào có thể trích xuất được, và các chuỗi giống định danh trong trò chơi thường vô hại: ID bài hát, tổng XP, mã máy chủ, địa chỉ roleplay. Các mẫu tiêu cực khó trong bộ dữ liệu cố ý chia sẻ các tín hiệu bề mặt với các vi phạm thực sự, vì vậy một mô hình chỉ phản hồi dựa trên từ khóa hoặc mẫu số sẽ thất bại. Chỉ người nói mục tiêu được phân loại, nghĩa là một mô hình gắn cờ toàn bộ cuộc trò chuyện khi bất kỳ người tham gia nào đề cập đến PII cũng sẽ không đáp ứng được nhiệm vụ gán nhãn.
Trên bảng đánh giá mới, Roblox báo cáo bộ phân loại v2 đạt điểm F1 là 0,8882 so với 0,6469 của phiên bản v1.0 và 0,6624 của Qwen3Guard‑Gen‑8B, mô hình kế tiếp tốt nhất được liệt kê, trong khi Llama Guard 4 12B của Meta đạt 0,5456 và bộ lọc quyền riêng tư của OpenAI đạt 0,5816. Những con số này là kết quả do Roblox tự báo cáo trên bảng đánh giá của mình, và thẻ dữ liệu lưu ý rằng phân phối tổng hợp không phản ánh lưu lượng sản xuất.
Sentinel 2.0 Rút Thời Gian Tinh Chỉnh Từ Một Giờ Xuống Ba Phút
Roblox Sentinel, công cụ đánh dấu các tín hiệu sớm của nguy cơ lạm dụng trẻ em trước khi các tin nhắn trở nên rõ ràng, đã chuyển lên phiên bản 2 với quy trình tinh chỉnh được thiết kế lại. Số lượng hàm kết hợp, các bộ tổng hợp chuyển nhiều điểm số mỗi quan sát thành một điểm rủi ro duy nhất, tăng từ hai lên sáu, và các quan sát hiện được mã hoá một lần cho mỗi lần quét thay vì tính lại cho mỗi cấu hình. Trong ví dụ của Roblox, một lần quét qua 324 cấu hình hoàn thành trong vòng chưa đầy ba phút, giảm đáng kể so với gần một giờ, và ROC‑AUC tăng từ 0,894 ở cài đặt mặc định lên 0,996 với cấu hình tốt nhất mà lần quét xác định.
Các ghi chú phát hành ghi lại những thay đổi phá vỡ hẹp hơn cùng với các tính năng. Python 3.10 hiện là phiên bản tối thiểu, các đối số sau đối số đầu tiên chỉ chấp nhận dạng từ khóa trên các lời gọi API chính, và một số cột đầu ra tìm kiếm lưới đã được đổi tên sau khi một cột kích thước chỉ mục vô tình ghi đè lên một cột đánh giá trong phiên bản 1.0. Phiên bản 2 cũng duy trì corpus với các chỉ mục đã lưu, vì vậy phần giải thích điểm số sẽ đặt tên cho văn bản khớp sau khi tải lại thay vì số hàng, và nó cung cấp Dockerfile cho việc triển khai trên GPU và chỉ CPU.
The voice safety classifier, mà Roblox cho biết đã được tải xuống hơn 72,000 lần kể từ khi lần đầu tiên được mở nguồn vào năm 2024, hiện hiện thực kiểm duyệt trò chuyện giọng nói trên 30 ngôn ngữ và tám danh mục vi phạm với tính năng phát hiện ngôn ngữ tích hợp. Thẻ mô hình báo cáo độ thu hồi 61% ở mức tỷ lệ dương tính giả nghiêm ngặt 1% trên tất cả 30 ngôn ngữ, dựa trên dữ liệu huấn luyện được gán nhãn máy mở rộng bằng gán nhãn thủ công để đảm bảo chất lượng. Mặc dù mô hình nền tảng tăng từ 94,6 triệu lên 320 triệu tham số, việc rút gọn mô hình vẫn giữ cho nó đủ nhanh cho phát hiện thời gian thực. Thẻ công bố các số liệu thu hồi và độ chính xác theo ngôn ngữ và lưu ý bộ phân loại yêu cầu đầu vào WAV mono 16 kHz trong các đoạn tối đa 15 giây, với thời gian tối đa 30 giây.
Bản Phát Hành Bằng Các Số Liệu
- 17 → 189: hỗ trợ ngôn ngữ trong PII Classifier, phiên bản 1.0 tới 2.0
- 63.41 → 90.52: điểm F1 của PII Classifier trên đánh giá nội bộ của Roblox
- 39,202: cuộc trò chuyện tổng hợp trong bảng đánh giá mới (24,518 an toàn, 14,684 không an toàn)
- 2 → 6: hàm kết hợp điểm số trong Sentinel phiên bản 2
- 0.894 → 0.996: ROC‑AUC của Sentinel, cài đặt mặc định so với cấu hình quét tốt nhất
- 30: ngôn ngữ được hỗ trợ bởi voice safety classifier v3, với độ thu hồi 61% và tỷ lệ dương tính giả 1%
- 94.6M → 320M: số lượng tham số nền tảng trong voice classifier, được giảm bớt bằng kỹ thuật distillation
- 72,000+: lượt tải xuống của voice safety classifier kể từ khi được mở nguồn vào năm 2024
Cách Roblox Đưa Đẩy An Toàn Mã Nguồn Mở Đến Đây
Roblox đã liên tục phát hành các mô hình an toàn sản xuất dưới dạng mã nguồn mở — Sentinel vào tháng 8 năm 2025 và PII Classifier gốc vào tháng 11 cùng năm — và bản phát hành này bổ sung các phiên bản cập nhật của cả hai cùng với voice safety classifier vào Cộng đồng Mô hình ROOST. Roblox công bố thành viên sáng lập trong sáng kiến này vào tháng 2 năm 2025, lập luận rằng công cụ an toàn nên là hạ tầng chung thay vì lợi thế cạnh tranh. Sentinel đã được mở nguồn vào tháng 8 năm 2025, và PII Classifier gốc tiếp theo vào tháng 11 năm đó. Voice safety classifier xuất hiện trước thỏa thuận ROOST, lần đầu được phát hành vào năm 2024 và nâng cấp lên phiên bản thứ ba vào tháng 6 năm 2026.
Roblox cho biết động lực hoạt động hai chiều: tính đến 12 tháng kết thúc vào ngày 7 tháng 8 năm 2026, gần 70% các trường hợp nguy cơ lạm dụng trẻ em mà họ phát hiện đã đến thông qua việc phát hiện sớm của Sentinel, và phiên bản 2 đã tích hợp phản hồi từ các thành viên ROOST khác về đánh giá và tính điểm. Đóng góp này xuất hiện khi các thực tiễn kiểm duyệt của nền tảng đang đối mặt với sự chú ý ngày càng tăng của các cơ quan quản lý ở châu Âu, nơi Roblox đang tiến gần hơn tới các quy tắc nền tảng nghiêm ngặt nhất của EU. Ba mô hình và bảng đánh giá hiện đã có sẵn trên Hugging Face và GitHub dưới giấy phép Apache 2.0.











