游戏
Roblox 开源三款安全模型至 ROOST 模型社区
Roblox 已向 ROOST 模型社区贡献了三款开源信任与安全模型的更新版本,并提供了一个新的评估数据集,供其他平台用于对其分类器进行基准测试。公司于 2026 年 8 月 19 日宣布。
本次发布包括 Roblox 的 PII 分类器 2.0 版(用于检测聊天中共享或索取个人信息的尝试);Roblox Sentinel 第 2 版(其儿童危害早期预警系统);以及其实时语音安全分类器第 3 版。三者的版本已在 Roblox 生产环境中运行。ROOST(Robust Open Online Safety Tools 的缩写)是 Roblox 于 2025 年初与 Google、OpenAI 等共同创立的非营利组织;其模型社区分发可公开检查的安全模型,任何组织均可部署。
此次亮点改进来自 PII 分类器。1.0 版在孤立的消息上进行评估,而 2.0 版则读取目标消息所在的多用户对话上下文,此改动旨在捕捉仅在上下文中有意义的隐藏绕过尝试,例如玩家在两轮对话中拼出平台外服务器邀请。合成训练数据将语言支持从 17 种扩展至 189 种,模型在 Roblox 内部评估中的 F1 分数从 63.41 提升至 90.52。该模型基于 XLM‑RoBERTa‑Large 架构,约 5.6 亿参数,采用 Apache 2.0 许可证发布,使用 sigmoid 输出三类: 请求 PII、提供 PII、以及引导用户离开平台。
围绕规避的基准测试
除了模型外,Roblox 还发布了 Roblox PII Safety for Chat Benchmark,这是一个仅用于评估的数据集,包含 39,202 条完全合成的英文对话,分为 24,518 条安全示例和 14,684 条不安全示例。数据集说明中指出未包含任何 Roblox 用户聊天数据;所有对话均为模拟在线聊天中出现的规避技术生成,包括音标拼写、同形异义字符、字母间距、倒序文本、编码语言以及跨回合的信息拆分。
该基准的设计旨在填补现有 PII 评估的空白,后者大多测试命名实体抽取:寻找电子邮件地址、标记电话号码。在线聊天风险往往在任何可提取标识符出现之前就已显现,而游戏中的类似标识符的字符串常常是无害的:歌曲 ID、经验值总量、服务器代码、角色扮演地址。数据集中的硬负例刻意与真实违规共享表面信号,因此仅依据关键词或数字模式触发的模型会失效。仅对目标说话者进行分类,这意味着一旦任何参与者提及 PII,整个对话被标记的模型也会在归属任务中失效。
在新基准上,Roblox 报告其 v2 分类器的 F1 为 0.8882,而其 v1.0 为 0.6469,次佳模型 Qwen3Guard-Gen-8B 为 0.6624,Meta 的 Llama Guard 4 12B 为 0.5456,OpenAI 的隐私过滤器为 0.5816。这些数据均为 Roblox 在自建基准上的报告结果,数据集说明中指出合成分布并不代表生产流量。
Sentinel 2.0 将调优扫描时间从一小时缩短至三分钟
Roblox Sentinel 在消息变得明确之前标记潜在儿童危害的早期信号,升级至第 2 版并重新设计调优流水线。组合函数的数量(将多个观测得分聚合为单一风险得分的聚合器)从 2 增至 6,且观测现在在每次扫描时仅编码一次,而不再为每个配置重新计算。在 Roblox 的示例中,对 324 种配置的扫描在不到三分钟内完成,远低于近一小时的原耗时,ROC‑AUC 从默认设置的 0.894 提升至扫描识别的最佳配置的 0.996。
发布说明在列出新特性的同时记录了较小的破坏性更改。Python 3.10 现为最低版本,主 API 调用中首个参数之后的参数仅接受关键字形式;此外,若干网格搜索输出列被重命名,因为在 1.0 版中,一个索引大小列悄然覆盖了评估列。第 2 版还保留了带有已保存索引的语料库,因此得分解释在重新加载后会显示匹配的文本而非行号,并提供用于 GPU 与仅 CPU 部署的 Dockerfile。
语音安全分类器,Roblox 表示自 2024 年首次开源以来已下载超过 72,000 次,现可对 30 种语言和八类违规进行语音聊天监管,并内置语言检测。模型卡显示,在所有 30 种语言中,以严格的 1% 假阳性率实现了 61% 的召回率,这得益于机器标注的训练数据并通过人工标注提升质量。尽管底层模型参数从 9.46 亿增长至 3.2 亿,模型蒸馏使其仍足够快速以实现实时检测。卡片公布了各语言的召回率和精确率,并指出分类器接受 16 kHz 单声道 WAV 输入,片段最长 15 秒,最大时长 30 秒。
发布数据概览
- 17 → 189: PII 分类器的语言支持,从 1.0 版到 2.0 版
- 63.41 → 90.52: Roblox 内部评估中 PII 分类器的 F1 分数
- 39,202: 新基准中的合成对话(24,518 条安全,14,684 条不安全)
- 2 → 6: Sentinel 第 2 版中的得分组合函数
- 0.894 → 0.996: Sentinel ROC‑AUC,默认设置与最佳扫描配置的对比
- 30: 语音安全分类器 v3 支持的语言数量,召回率 61%,假阳性率 1%
- 94.6M → 320M: 语音分类器的底层参数量,经过蒸馏后保持性能
- 72,000+: 语音安全分类器自 2024 年开源以来的下载次数
Roblox 开源安全举措的演进历程
Roblox 一直在稳步将生产安全模型以开源方式发布——Sentinel 于 2025 年 8 月开源,原始 PII 分类器于同年 11 月开源——本次发布将两者的更新版本以及语音安全分类器加入 ROOST 模型社区。Roblox 于 2025 年 2 月宣布成为该倡议的创始成员,并当时主张安全工具应作为共享基础设施,而非竞争优势。Sentinel 于 2025 年 8 月开源,原始 PII 分类器随后于 11 月开源。语音安全分类器早于 ROOST 合作关系,首次于 2024 年发布,并于 2026 年 6 月升级至第三版。
Roblox 表示该激励机制是双向的:截至 2026 年 8 月 7 日的 12 个月内,近 70% 的儿童危害案件是通过 Sentinel 的早期检测发现的,第 2 版还整合了其他 ROOST 成员在评估和评分方面的反馈。此贡献正值平台的内容审核实践在欧洲受到日益严格的监管关注,Roblox 正在 逐步接近欧盟最严格的平台规则。三款模型及基准数据现已在 Hugging Face 与 GitHub 上以 Apache 2.0 许可证提供。











