Jeux

Roblox rend open source trois modèles de sécurité pour la communauté de modèles ROOST

Ajouter Gaming.net à vos sources préférées sur Google

Roblox a contribué des versions mises à jour de trois modèles de confiance et de sécurité open source à la communauté de modèles ROOST, ainsi qu’un nouveau jeu de données d’évaluation que d’autres plateformes peuvent utiliser pour comparer leurs propres classificateurs, a annoncé l’entreprise le 19 août 2026.

Cette diffusion couvre la version 2.0 du Classificateur PII de Roblox, qui détecte les tentatives de partage ou de sollicitation d’informations personnelles dans le chat ; la version 2 de Roblox Sentinel, son système d’alerte précoce contre les mises en danger d’enfants ; et la version 3 de son classificateur de sécurité vocale en temps réel. Les trois versions sont déjà déployées en production sur Roblox. ROOST, abréviation de Robust Open Online Safety Tools, est l’organisme à but non lucratif dont Roblox est devenu membre fondateur début 2025 aux côtés de Google, OpenAI et d’autres ; sa communauté de modèles distribue des modèles de sécurité ouverts et inspectables que toute organisation peut déployer.

L’amélioration phare concerne le Classificateur PII. Alors que la version 1.0 évaluait les messages isolément, la version 2.0 lit chaque message cible dans le contexte de la conversation multi‑utilisateurs qui l’entoure, afin de détecter les tentatives de contournement obscurcies qui n’ont de sens que dans le contexte, comme un joueur épelant une invitation à un serveur hors plateforme sur deux tours. Les données d’entraînement synthétiques ont étendu la prise en charge linguistique de 17 à 189 langues, et le score F1 du modèle sur l’évaluation interne de Roblox est passé de 63,41 à 90,52. Le modèle repose sur l’architecture XLM‑RoBERTa‑Large avec environ 560 millions de paramètres et est distribué sous licence Apache 2.0, avec des sorties sigmoïdes sur trois catégories : demande de PII, fourniture de PII et redirection des utilisateurs hors plateforme.

Un benchmark centré sur l’évasion

En parallèle du modèle, Roblox a publié le Roblox PII Safety for Chat Benchmark, un jeu de données uniquement d’évaluation contenant 39 202 conversations synthétiques entièrement en anglais, réparties en 24 518 exemples sûrs et 14 684 exemples dangereux. La fiche du jeu de données indique qu’aucune donnée de chat d’utilisateur Roblox n’est incluse ; chaque conversation a été générée pour reproduire les techniques d’évasion observées dans les chats en ligne, notamment l’orthographe phonétique, les homoglyphes, l’espacement des lettres, le texte inversé, le langage codé et la répartition d’informations sur plusieurs tours de conversation.

La conception du benchmark cible une lacune des évaluations PII existantes, dont la plupart testent l’extraction d’entités nommées : trouver l’adresse e‑mail, identifier le numéro de téléphone. Le risque dans les chats en ligne apparaît souvent avant qu’un identifiant exploitable ne soit présent, et les chaînes ressemblant à des identifiants dans les jeux sont fréquemment bénignes : ID de chanson, totaux d’XP, codes de serveur, adresses de jeu de rôle. Les faux négatifs du jeu de données partagent délibérément des signaux de surface avec de véritables violations, de sorte qu’un modèle qui se déclenche uniquement sur des mots‑clés ou des motifs numériques échoue. Seul l’orateur cible est classé, ce qui signifie qu’un modèle qui signale toute la conversation dès qu’un participant mentionne un PII échoue également à la tâche d’attribution.

Sur ce nouveau benchmark, Roblox indique que son classificateur v2 obtient un F1 de 0,8882 contre 0,6469 pour sa propre v1.0 et 0,6624 pour Qwen3Guard‑Gen‑8B, le meilleur modèle suivant, avec Llama Guard 4 12B de Meta à 0,5456 et le filtre de confidentialité d’OpenAI à 0,5816. Ces chiffres sont les résultats rapportés par Roblox sur son propre benchmark, et la fiche du jeu de données précise que la distribution synthétique ne représente pas le trafic de production.

Sentinel 2.0 réduit les balayages de réglage d’une heure à trois minutes

Roblox Sentinel, qui signale les premiers signaux de mise en danger d’enfants avant que les messages ne deviennent explicites, passe à la version 2 avec une chaîne de réglage repensée. Le nombre de fonctions de combinaison, les agrégateurs qui transforment de nombreux scores d’observation en un score de risque unique, passe de deux à six, et les observations sont désormais encodées une fois par balayage plutôt que recomptées pour chaque configuration. Dans l’exemple de Roblox, un balayage à travers 324 configurations s’est achevé en moins de trois minutes, contre près d’une heure auparavant, et le ROC‑AUC est passé de 0,894 avec les paramètres par défaut à 0,996 avec la meilleure configuration identifiée par le balayage.

Les notes de version documentent des changements de rupture plus restreints en même temps que les nouvelles fonctionnalités. Python 3.10 devient la version minimale, les arguments après le premier sont uniquement nommés dans les appels API principaux, et plusieurs colonnes de sortie de recherche en grille ont été renommées après qu’une colonne de taille d’index ait silencieusement écrasé une colonne d’évaluation dans la version 1.0. La version 2 conserve également le corpus avec des index sauvegardés, de sorte que les explications de scores nomment le texte correspondant après un rechargement plutôt qu’un numéro de ligne, et elle fournit des Dockerfiles pour les déploiements GPU et CPU uniquement.

Le classificateur de sécurité vocale, que Roblox indique avoir été téléchargé plus de 72 000 fois depuis son ouverture en 2024, modère désormais le chat vocal dans 30 langues et huit catégories de violation grâce à une détection de langue intégrée. La fiche du modèle rapporte un rappel de 61 % à un taux de faux positifs strict de 1 % sur les 30 langues, grâce à des données d’entraînement étiquetées automatiquement puis raffinées par annotation humaine. Bien que le modèle sous‑jacent soit passé de 94,6 M à 320 M de paramètres, la distillation du modèle le maintient suffisamment rapide pour une détection en temps réel. La fiche publie les chiffres de rappel et de précision par langue et indique que le classificateur attend une entrée WAV mono 16 kHz en segments allant jusqu’à 15 secondes, avec un maximum de 30 secondes.

La sortie en chiffres

  • 17 → 189: prise en charge linguistique du Classificateur PII, version 1.0 à 2.0
  • 63.41 → 90.52: score F1 du Classificateur PII sur l’évaluation interne de Roblox
  • 39 202: conversations synthétiques dans le nouveau benchmark (24 518 sûres, 14 684 dangereuses)
  • 2 → 6: fonctions de combinaison de scores dans Sentinel version 2
  • 0.894 → 0.996: ROC‑AUC de Sentinel, paramètres par défaut versus meilleure configuration balayée
  • 30: langues couvertes par le classificateur de sécurité vocale v3, à 61 % de rappel et 1 % de faux positifs
  • 94.6M → 320M: nombre de paramètres du classificateur vocal, compensé par la distillation
  • 72 000+: téléchargements du classificateur de sécurité vocale depuis sa diffusion open source en 2024

Comment l’initiative de sécurité open source de Roblox en est arrivée là

Roblox a publié régulièrement des modèles de sécurité en production en open source — Sentinel en août 2025 et le Classificateur PII original en novembre — et cette diffusion ajoute des versions mises à jour des deux ainsi que son classificateur de sécurité vocale à la communauté de modèles ROOST. Roblox a annoncé son adhésion fondatrice à l’initiative en février 2025, arguant alors que les outils de sécurité devraient être une infrastructure partagée plutôt qu’un avantage concurrentiel. Sentinel a été rendu open source en août 2025, et le Classificateur PII original l’a suivi en novembre. Le classificateur de sécurité vocale précède l’arrangement ROOST, publié pour la première fois en 2024 et mis à jour vers sa troisième version en juin 2026.

Roblox indique que l’incitation fonctionne dans les deux sens : sur les 12 mois se terminant le 7 août 2026, près de 70 % des cas de mise en danger d’enfants détectés provenaient de la détection précoce de Sentinel, et la version 2 intègre les retours d’autres membres de ROOST sur l’évaluation et le scoring. La contribution arrive alors que les pratiques de modération de la plateforme font l’objet d’une attention réglementaire croissante en Europe, où Roblox se rapproche des règles de plateforme les plus strictes de l’UE. Les trois modèles et le benchmark sont désormais disponibles sur Hugging Face et GitHub sous licence Apache 2.0.

Ethan Lockhart est un analyste généré par IA chez Gaming.net, couvrant les développements nommés dans les avancées des moteurs de jeu, les sorties d’outils, les annonces de middleware et les changements de l’écosystème technique.

Ethan rend compte d’actualités spécifiques — mises à jour du SDK, changements de licences de moteur, tendances d’adoption par les développeurs et intégrations d’outils — et détaille comment ces événements affectent les développeurs et les utilisateurs finaux.

Les articles rédigés par Ethan Lockhart sont générés par IA et examinés par l’équipe éditoriale de Gaming.net afin d’assurer la spécificité, la précision technique et une couverture professionnelle des technologies de développement de jeux, liées à des sources vérifiables.