Jogos
Roblox disponibiliza como código aberto três modelos de segurança para a Comunidade de Modelos ROOST
Roblox contribuiu com versões atualizadas de três modelos de confiança e segurança de código aberto para a Comunidade de Modelos ROOST, juntamente com um novo conjunto de dados de avaliação que outras plataformas podem usar para comparar seus próprios classificadores, anunciou a empresa em 19 de agosto de 2026.
O lançamento abrange a versão 2.0 do Classificador de PII da Roblox, que detecta tentativas de compartilhar ou solicitar informações pessoais no chat; a versão 2 do Roblox Sentinel, seu sistema de alerta precoce para risco de abuso infantil; e a versão 3 de seu classificador de segurança de voz em tempo real. As versões dos três já operam em produção na Roblox. ROOST, abreviação de Robust Open Online Safety Tools, é a organização sem fins lucrativos que a Roblox integrou como membro fundadora no início de 2025 ao lado de Google, OpenAI e outros; sua comunidade de modelos distribui modelos de segurança abertos e inspecionáveis que qualquer organização pode implantar.
A principal melhoria pertence ao Classificador de PII. Enquanto a versão 1.0 avaliava mensagens isoladamente, a versão 2.0 lê cada mensagem alvo dentro da conversa multi‑usuário ao seu redor, mudança destinada a capturar tentativas de contorno ofuscadas que só fazem sentido no contexto, como um jogador soletrando um convite para servidor fora da plataforma em duas interações. Dados de treinamento sintéticos ampliaram o suporte linguístico de 17 para 189 idiomas, e a pontuação F1 do modelo na avaliação interna da Roblox subiu de 63,41 para 90,52. O modelo foi construído sobre a arquitetura XLM‑RoBERTa‑Large com aproximadamente 560 milhões de parâmetros e é distribuído sob a licença Apache 2.0, com saídas sigmoides em três categorias: solicitação de PII, fornecimento de PII e direcionamento de usuários para fora da plataforma.
Um Benchmark Construído em torno da Evasão
Junto ao modelo, a Roblox publicou o Roblox PII Safety for Chat Benchmark, um conjunto de dados apenas para avaliação contendo 39.202 conversas sintéticas em inglês, divididas em 24.518 exemplos seguros e 14.684 inseguros. A ficha do conjunto de dados afirma que nenhum dado de chat de usuários da Roblox está incluído; cada conversa foi gerada para modelar técnicas de evasão observadas em chats online, incluindo soletração fonética, homógrafos, espaçamento de letras, texto invertido, linguagem codificada e informação dividida ao longo de turnos de conversa.
O design do benchmark visa suprir uma lacuna nas avaliações de PII existentes, a maioria das quais testa extração de entidades nomeadas: encontrar o endereço de e‑mail, marcar o número de telefone. O risco em chats online costuma aparecer antes que qualquer identificador extraível seja detectado, e cadeias semelhantes a identificadores em jogos são frequentemente benignas: IDs de músicas, totais de XP, códigos de servidor, endereços de roleplay. Negativos difíceis no conjunto de dados compartilham deliberadamente sinais superficiais com violações reais, de modo que um modelo que dispara apenas por palavras‑chave ou padrões numéricos falha. Apenas o falante alvo é classificado, o que significa que um modelo que sinaliza toda a conversa sempre que qualquer participante menciona PII também falha na tarefa de atribuição.
No novo benchmark, a Roblox relata que seu classificador v2 alcança F1 de 0,8882 contra 0,6469 para sua própria v1.0 e 0,6624 para o Qwen3Guard-Gen-8B, o próximo melhor modelo listado, com o Llama Guard 4 12B da Meta em 0,5456 e o filtro de privacidade da OpenAI em 0,5816. Esses números são os resultados próprios da Roblox em seu próprio benchmark, e a ficha do conjunto de dados observa que a distribuição sintética não representa o tráfego de produção.
Sentinel 2.0 Reduz Varreduras de Ajuste de Uma Hora para Três Minutos
O Roblox Sentinel, que sinaliza indicadores iniciais de possível risco infantil antes que as mensagens se tornem explícitas, avança para a versão 2 com um pipeline de ajuste reformulado. O número de funções de combinação, os agregadores que transformam diversas pontuações por observação em uma única pontuação de risco, aumenta de dois para seis, e as observações agora são codificadas uma vez por varredura em vez de recalculadas para cada configuração. No exemplo da Roblox, uma varredura entre 324 configurações foi concluída em menos de três minutos, reduzindo quase uma hora, e o ROC‑AUC subiu de 0,894 nas configurações padrão para 0,996 com a melhor configuração identificada pela varredura.
As notas de lançamento documentam mudanças de compatibilidade mais restritas junto às funcionalidades. Python 3.10 passa a ser a versão mínima, argumentos após o primeiro são apenas nomeados nas chamadas principais da API, e várias colunas de saída de busca em grade foram renomeadas após uma coluna de tamanho de índice sobrescrever silenciosamente uma coluna de avaliação na versão 1.0. A versão 2 também persiste o corpus com índices salvos, de modo que as explicações de pontuação nomeiam o texto correspondente após uma recarga em vez de um número de linha, e são fornecidos Dockerfiles para implantações apenas de GPU e apenas de CPU.
O classificador de segurança de voz, que a Roblox afirma ter sido baixado mais de 72.000 vezes desde que foi aberto como código fonte em 2024, agora modera o chat de voz em 30 idiomas e oito categorias de violação com detecção de idioma integrada. A ficha do modelo relata 61 % de recall com uma taxa rigorosa de 1 % de falsos positivos em todos os 30 idiomas, impulsionada por dados de treinamento rotulados por máquina ampliados com rotulagem humana para qualidade. Embora o modelo subjacente tenha crescido de 94,6 milhões para 320 milhões de parâmetros, a destilação do modelo o mantém rápido o suficiente para detecção em tempo real. A ficha publica valores de recall e precisão por idioma e observa que o classificador espera entrada WAV mono de 16 kHz em segmentos de até 15 segundos, com um máximo de 30 segundos.
O Lançamento em Números
- 17 → 189: suporte linguístico no Classificador de PII, da versão 1.0 para 2.0
- 63.41 → 90.52: pontuação F1 do Classificador de PII na avaliação interna da Roblox
- 39,202: conversas sintéticas no novo benchmark (24.518 seguras, 14.684 inseguras)
- 2 → 6: funções de combinação de pontuação na versão 2 do Sentinel
- 0.894 → 0.996: ROC‑AUC do Sentinel, configurações padrão versus melhor configuração varrida
- 30: idiomas cobertos pelo classificador de segurança de voz v3, com 61 % de recall e taxa de 1 % de falsos positivos
- 94.6M → 320M: número de parâmetros subjacentes no classificador de voz, compensado pela destilação
- 72,000+: downloads do classificador de segurança de voz desde seu lançamento como código aberto em 2024
Como a Iniciativa de Segurança de Código Aberto da Roblox Chegou Até Aqui
A Roblox tem lançado de forma contínua modelos de segurança de produção como código aberto — Sentinel em agosto de 2025 e o Classificador de PII original em novembro daquele ano — e este lançamento adiciona versões atualizadas de ambos, além do classificador de segurança de voz, à Comunidade de Modelos ROOST. A Roblox anunciou sua participação fundadora na iniciativa em fevereiro de 2025, argumentando na época que as ferramentas de segurança deveriam ser infraestrutura compartilhada e não uma vantagem competitiva. O Sentinel foi aberto como código fonte em agosto de 2025, e o Classificador de PII original o seguiu em novembro. O classificador de segurança de voz antecede o arranjo ROOST, tendo sido lançado inicialmente em 2024 e atualizado para sua terceira versão em junho de 2026.
A Roblox afirma que o incentivo funciona em ambas as direções: nos 12 meses encerrados em 7 de agosto de 2026, quase 70 % dos casos de risco infantil que detectou vieram da detecção precoce do Sentinel, e a versão 2 incorpora feedback de outros membros do ROOST sobre avaliação e pontuação. A contribuição chega enquanto as práticas de moderação da plataforma enfrentam crescente atenção regulatória na Europa, onde a Roblox está aproximando-se das regras de plataforma mais rigorosas da UE. Todos os três modelos e o benchmark estão disponíveis agora no Hugging Face e no GitHub sob a licença Apache 2.0.











