Juegos

Roblox abre el código fuente de tres modelos de seguridad para la comunidad de modelos ROOST

Añade Gaming.net a tus fuentes preferidas en Google

Roblox ha contribuido con versiones actualizadas de tres modelos de confianza y seguridad de código abierto a la Comunidad de Modelos ROOST, junto con un nuevo conjunto de datos de evaluación que otras plataformas pueden usar para comparar sus propios clasificadores, anunció la compañía el 19 de agosto de 2026.

El lanzamiento incluye la versión 2.0 del Clasificador PII de Roblox, que detecta intentos de compartir o solicitar información personal en el chat; la versión 2 de Roblox Sentinel, su sistema de alerta temprana para el riesgo de daño infantil; y la versión 3 de su clasificador de seguridad de voz en tiempo real. Las versiones de los tres ya se ejecutan en producción en Roblox. ROOST, abreviatura de Robust Open Online Safety Tools, es la organización sin fines de lucro a la que Roblox se unió como miembro fundador a principios de 2025 junto a Google, OpenAI y otros; su comunidad de modelos distribuye modelos de seguridad abiertos e inspeccionables que cualquier organización puede implementar.

La mejora principal corresponde al Clasificador PII. Mientras que la versión 1.0 evaluaba los mensajes de forma aislada, la versión 2.0 lee cada mensaje objetivo dentro de su conversación multusuario circundante, un cambio destinado a detectar intentos de elusión ofuscados que solo tienen sentido en contexto, como un jugador que escribe una invitación a un servidor fuera de la plataforma en dos turnos. Los datos sintéticos de entrenamiento ampliaron el soporte de idiomas de 17 a 189, y la puntuación F1 del modelo en la evaluación interna de Roblox aumentó de 63,41 a 90,52. El modelo está construido sobre la arquitectura XLM-RoBERTa-Large con aproximadamente 560 millones de parámetros y se distribuye bajo la licencia Apache 2.0, con salidas sigmoides en tres categorías: solicitar PII, proporcionar PII y dirigir a los usuarios fuera de la plataforma.

Una referencia construida alrededor de la evasión

Junto con el modelo, Roblox publicó el Roblox PII Safety for Chat Benchmark, un conjunto de datos solo de evaluación de 39 202 conversaciones sintéticas en inglés, dividido en 24 518 ejemplos seguros y 14 684 inseguros. La ficha del conjunto de datos indica que no se incluye ningún chat de usuarios de Roblox; cada conversación se generó para modelar técnicas de evasión observadas en chats en línea, incluyendo ortografía fonética, homógrafos, espaciado de letras, texto invertido, lenguaje codificado e información dividida a lo largo de los turnos de conversación.

El diseño del benchmark aborda una brecha en las evaluaciones de PII existentes, la mayoría de las cuales prueban la extracción de entidades nombradas: encontrar la dirección de correo electrónico, etiquetar el número de teléfono. El riesgo en chats en línea a menudo aparece antes de que exista cualquier identificador extraíble, y las cadenas similares a identificadores en los juegos suelen ser benignas: ID de canciones, totales de XP, códigos de servidor, direcciones de rol. Los falsos negativos duros en el conjunto de datos comparten deliberadamente señales superficiales con violaciones reales, por lo que un modelo que se activa por palabras clave o patrones numéricos falla. Solo se clasifica al hablante objetivo, lo que significa que un modelo que marca toda una conversación cuando cualquier participante menciona PII también falla en la tarea de atribución.

En el nuevo benchmark, Roblox informa que su clasificador v2 alcanza un F1 de 0,8882 frente a 0,6469 para su propio v1.0 y 0,6624 para Qwen3Guard-Gen-8B, el siguiente mejor modelo listado, con Llama Guard 4 12B de Meta en 0,5456 y el filtro de privacidad de OpenAI en 0,5816. esas cifras son los resultados propios de Roblox en su propio benchmark, y la ficha del conjunto de datos señala que la distribución sintética no representa el tráfico de producción.

Sentinel 2.0 reduce los barridos de afinación de una hora a tres minutos

Roblox Sentinel, que marca señales tempranas de posible daño infantil antes de que los mensajes se vuelvan explícitos, pasa a la versión 2 con una canalización de afinación revisada. El número de funciones de combinación, los agregadores que convierten muchas puntuaciones por observación en una única puntuación de riesgo, aumenta de dos a seis, y las observaciones ahora se codifican una vez por barrido en lugar de recalcularse para cada configuración. En el ejemplo de Roblox, un barrido a través de 324 configuraciones terminó en menos de tres minutos, frente a casi una hora, y el ROC-AUC subió de 0,894 en la configuración predeterminada a 0,996 con la mejor configuración identificada por el barrido.

Las notas de la versión documentan cambios incompatibles más estrechos junto a las funcionalidades. Python 3.10 es ahora la versión mínima, los argumentos después del primero son solo por palabra clave en las llamadas principales de la API, y varias columnas de salida de búsqueda en cuadrícula fueron renombradas después de que una columna de tamaño de índice sobrescribiera silenciosamente una columna de evaluación en la versión 1.0. La versión 2 también conserva el corpus con índices guardados, de modo que las explicaciones de puntuación nombran el texto coincidente después de una recarga en lugar de un número de fila, y se incluyen Dockerfiles para implementaciones solo GPU y solo CPU.

El clasificador de seguridad de voz, que Roblox afirma ha sido descargado más de 72 000 veces desde que se abrió por primera vez en 2024, ahora modera el chat de voz en 30 idiomas y ocho categorías de infracción con detección de idioma incorporada. La ficha del modelo informa un recall del 61 % con una tasa estricta de falsos positivos del 1 % en los 30 idiomas, impulsado por datos de entrenamiento etiquetados por máquina ampliados con etiquetado humano para garantizar calidad. Aunque el modelo subyacente creció de 94,6 millones a 320 millones de parámetros, la destilación del modelo lo mantiene lo suficientemente rápido para la detección en tiempo real. La ficha publica cifras de recall y precisión por idioma y señala que el clasificador espera una entrada WAV mono de 16 kHz en segmentos de hasta 15 segundos, con un máximo de 30 segundos.

El lanzamiento en cifras

  • 17 → 189: soporte de idiomas en el Clasificador PII, versión 1.0 a 2.0
  • 63.41 → 90.52: puntuación F1 del Clasificador PII en la evaluación interna de Roblox
  • 39,202: conversaciones sintéticas en el nuevo benchmark (24 518 seguras, 14 684 inseguras)
  • 2 → 6: funciones de combinación de puntuaciones en Sentinel versión 2
  • 0.894 → 0.996: ROC-AUC de Sentinel, configuración predeterminada frente a la mejor configuración barrida
  • 30: idiomas cubiertos por el clasificador de seguridad de voz v3, con un recall del 61 % y una tasa de falsos positivos del 1 %
  • 94.6M → 320M: número de parámetros subyacentes en el clasificador de voz, compensado por destilación
  • 72,000+: descargas del clasificador de seguridad de voz desde su lanzamiento de código abierto en 2024

Cómo llegó la iniciativa de seguridad de código abierto de Roblox

Roblox ha estado lanzando de forma constante modelos de seguridad de producción como código abierto — Sentinel en agosto de 2025 y el Clasificador PII original en noviembre de ese año — y este lanzamiento añade versiones actualizadas de ambos más su clasificador de seguridad de voz a la Comunidad de Modelos ROOST. Roblox anunció su membresía fundadora en la iniciativa en febrero de 2025, argumentando entonces que las herramientas de seguridad deberían ser una infraestructura compartida y no una ventaja competitiva. Sentinel se abrió en agosto de 2025, y el Clasificador PII original lo siguió en noviembre. El clasificador de seguridad de voz precede al acuerdo ROOST, lanzado por primera vez en 2024 y actualizado a su tercera versión en junio de 2026.

Roblox afirma que el incentivo funciona en ambas direcciones: a 12 meses del 7 de agosto de 2026, casi el 70 % de los casos de daño infantil que detectó provinieron de la detección temprana de Sentinel, y la versión 2 incorpora comentarios de otros miembros de ROOST sobre evaluación y puntuación. La contribución llega mientras las prácticas de moderación de la plataforma enfrentan una creciente atención regulatoria en Europa, donde Roblox está acercándose a las normas de plataforma más estrictas de la UE. Los tres modelos y el benchmark están disponibles ahora en Hugging Face y GitHub bajo la licencia Apache 2.0.

Ethan Lockhart es un analista generado por IA en Gaming.net, que cubre desarrollos con nombre en avances de motores de juego, lanzamientos de herramientas, anuncios de middleware y cambios en el ecosistema técnico.

Ethan informa sobre noticias específicas — actualizaciones de SDK, cambios en la licencia de motores, tendencias de adopción de desarrolladores y integraciones de herramientas — y detalla cómo estos eventos impactan a los desarrolladores y a los usuarios finales.

Los artículos escritos por Ethan Lockhart son generados por IA y revisados por el equipo editorial de Gaming.net para garantizar la especificidad, la precisión técnica y la cobertura profesional de las tecnologías de desarrollo de juegos vinculadas a fuentes verificables.