ゲーム

Roblox、ROOSTモデルコミュニティ向けに3つの安全モデルをオープンソース化

Gaming.net を Google の優先ソースに追加

Roblox は、ROOST Model Community に 3 つのオープンソースの信頼と安全モデルの更新版を提供し、他のプラットフォームが自社の分類器をベンチマークできる新しい評価データセットも併せて発表したと、同社は2026年8月19日に発表した。

今回のリリースは、チャットで個人情報の共有や取得を試みる行為を検出する Roblox の PII Classifier バージョン 2.0、子どもの危険を早期に警告する Roblox Sentinel バージョン 2、リアルタイム音声安全分類器のバージョン 3 を含む。3 つすべてのバージョンはすでに Roblox の本番環境で稼働している。ROOST は Robust Open Online Safety Tools の略称で、2025 年初頭に Google、OpenAI などと共に創設メンバーとして Roblox が参加した非営利団体であり、そのモデルコミュニティは、あらゆる組織が導入できるオープンで検査可能な安全モデルを配布している。

注目すべき改善は PII Classifier にある。バージョン 1.0 がメッセージを単独で評価していたのに対し、バージョン 2.0 は対象メッセージをその周囲のマルチユーザー会話全体の中で読み取るようになり、文脈上でのみ意味を持つ隠蔽された回避試行(例として、プレイヤーが 2 回のターンにわたってオフプラットフォームのサーバー招待を綴るなど)を捕捉できるようになった。合成トレーニングデータにより言語サポートは 17 言語から 189 言語へ拡大し、Roblox の内部評価におけるモデルの F1 スコアは 63.41 から 90.52 に上昇した。モデルは XLM‑RoBERTa‑Large アーキテクチャ上に構築され、パラメータは約 5.6 億で、Apache 2.0 ライセンスの下で提供され、シグモイド出力は「PII の要求」「PII の提供」「ユーザーをオフプラットフォームへ誘導」の 3 カテゴリに分かれる。

回避行為に焦点を当てたベンチマーク

モデルと同時に、Roblox は Roblox PII Safety for Chat Benchmark を公開した。これは評価専用のデータセットで、39,202 件の完全に合成された英語会話から構成され、24,518 件が安全、14,684 件が危険と分類されている。データセットカードには Roblox ユーザーのチャットデータは含まれていないと記載されており、すべての会話はオンラインチャットで見られる回避手法(音声的綴り、同形文字、文字間隔、逆文字、暗号化言語、会話ターンにまたがる情報分割など)をモデル化するために生成された。

このベンチマークの設計は、既存の PII 評価のギャップを狙っている。多くの評価は固有表現抽出(例:メールアドレスを見つけ、電話番号にタグ付け)をテストするが、オンラインチャットのリスクは抽出可能な識別子が現れる前に顕在化することが多く、ゲーム内の識別子らしき文字列はしばしば無害(楽曲 ID、XP 合計、サーバーコード、ロールプレイ用アドレス)である。データセットのハードネガティブは意図的に実際の違反と表面的なシグナルを共有しているため、キーワードや数値パターンに反応するモデルは失敗する。対象スピーカーのみが分類対象となるため、任意の参加者が PII に言及しただけで会話全体をフラグ付けするモデルも属性付与タスクに失敗する。

新しいベンチマークにおいて、Roblox は自社の v2 分類器が F1 スコア 0.8882 を記録したと報告している。これは自社の v1.0(0.6469)や次点の Qwen3Guard-Gen-8B(0.6624)、Meta の Llama Guard 4 12B(0.5456)、OpenAI のプライバシーフィルタ(0.5816)と比較して上回っている。これらの数値は Roblox が自らのベンチマークで得た結果であり、データセットカードには合成分布が本番トラフィックを表すものではないと記載されている。

Sentinel 2.0 がチューニングスイープを1時間から3分に短縮

Roblox Sentinel は、メッセージが明示的になる前に子どもの危険の早期シグナルをフラグ付けするもので、チューニングパイプラインを再設計したバージョン 2 に移行した。スコアを単一のリスクスコアに統合する集約関数の数は 2 から 6 に増え、観測は各構成ごとに再計算するのではなく、スイープごとに一度だけエンコードされるようになった。Roblox の例では、324 の構成を横断するスイープが 1 時間近くかかっていたものが 3 分未満で完了し、デフォルト設定の ROC‑AUC が 0.894 から、スイープで特定された最適構成で 0.996 に上昇した。

リリースノートでは、機能とともに限定的な破壊的変更が記載されている。Python 3.10 が最低バージョンとなり、メイン API 呼び出しでは最初の引数以降はキーワード専用になる。また、バージョン 1.0 でインデックスサイズ列が評価列を静かに上書きしたため、いくつかのグリッドサーチ出力列が名称変更された。バージョン 2 ではコーパスが保存されたインデックスとともに永続化されるため、スコア説明は行番号ではなく再読み込み後のマッチテキストを示すようになり、GPU と CPU のみのデプロイ用 Dockerfile も提供されている。

voice safety classifier は、Roblox が 2024 年に初めてオープンソース化して以来 72,000 回以上ダウンロードされたとされ、現在は組み込みの言語検出機能により 30 言語と 8 つの違反カテゴリにわたって音声チャットをモデレートする。モデルカードによれば、30 言語すべてで偽陽性率 1% の厳格な条件下でリコール率 61% を達成しており、機械ラベル付けされたトレーニングデータを人手で品質確認したことでスケールアップされた。基礎モデルは 9,460 万パラメータから 3.2 億パラメータに拡大したが、モデル蒸留によりリアルタイム検出に十分な速度を保っている。カードでは言語別のリコール率と適合率が公開され、分類器は 16 kHz のモノラル WAV を最大 15 秒のセグメント(最大 30 秒)で入力とすることが期待されている。

数値で見るリリース

  • 17 → 189: PII Classifier の言語サポート(バージョン 1.0 から 2.0)
  • 63.41 → 90.52: Roblox の内部評価における PII Classifier の F1 スコア
  • 39,202: 新しいベンチマークにおける合成会話数(安全 24,518 件、危険 14,684 件)
  • 2 → 6: Sentinel バージョン 2 のスコア結合関数数
  • 0.894 → 0.996: Sentinel の ROC‑AUC(デフォルト設定 vs. 最適スイープ構成)
  • 30: voice safety classifier v3 が対応する言語数(リコール率 61%、偽陽性率 1%)
  • 94.6M → 320M: 音声分類器の基礎パラメータ数(蒸留により調整)
  • 72,000+: 2024 年のオープンソースリリース以降の voice safety classifier のダウンロード数

Roblox のオープンソース安全推進がここに至るまで

Roblox は、2025 年 8 月に Sentinel、同年 11 月にオリジナルの PII Classifier をオープンソースとして本番安全モデルを継続的にリリースしてきており、今回のリリースでは両者の更新版と音声安全分類器を ROOST Model Community に追加した。Roblox は 2025 年 2 月にこのイニシアチブへの創設メンバーシップを発表し、当時は安全ツールは競争上の優位性ではなく共有インフラであるべきだと主張した。Sentinel は 2025 年 8 月にオープンソース化され、オリジナルの PII Classifier はその翌年 11 月に続いた。音声安全分類器は ROOST の取り組みよりも早く、2024 年に初めてリリースされ、2026 年 6 月に第 3 バージョンへとアップグレードされた。

Roblox は、この取り組みは双方向に機能すると述べている。2026 年 8 月 7 日までの 12 ヶ月間で検出した子ども危険事例の約 70% が Sentinel の早期検出によるもので、バージョン 2 では他の ROOST メンバーからの評価・スコアリングに関するフィードバックが組み込まれている。この貢献は、欧州でプラットフォームのモデレーション慣行が規制当局の関心を集めている中で行われ、Roblox は EU の最も厳しいプラットフォーム規則に近づいている。3 つのモデルとベンチマークはすべて、現在 Hugging Face と GitHub で Apache 2.0 ライセンスの下で入手可能である。

イーサン・ロックハートは、Gaming.netのAI生成アナリストです。ゲームエンジンの進歩、ツールのリリース、ミドルウェアの発表、技術的なエコシステムの変化について、名前付きの開発について報道しています。

イーサンは、SDKの更新、エンジンのライセンス変更、開発者の採用傾向、ツールの統合などの具体的なニュースを報道し、これらの出来事が開発者とエンドユーザーにどのように影響するかについて詳細に説明しています。

イーサン・ロックハートによって執筆された記事は、AIによって生成され、Gaming.netの編集チームによってレビューされています。編集チームは、ゲーム開発技術の特定性、技術的正確性、専門的な報道を確保するために、検証可能な情報源に基づいて記事をレビューしています。