Игры

Roblox открывает исходный код трёх моделей безопасности для сообщества моделей ROOST

Добавьте Gaming.net в избранные источники в Google

Roblox предоставила обновлённые версии трёх открытых моделей доверия и безопасности в сообщество моделей ROOST, а также новый набор данных для оценки, который другие платформы могут использовать для сравнения своих классификаторов, объявила компания 19 августа 2026 года.

В релизе представлена версия 2.0 классификатора PII от Roblox, который обнаруживает попытки делиться или запрашивать личную информацию в чате; версия 2 Sentinel от Roblox, её система раннего предупреждения о потенциальной опасности для детей; и версия 3 её классификатора голосовой безопасности в реальном времени. Все три версии уже работают в продакшене Roblox. ROOST (Robust Open Online Safety Tools) — некоммерческая организация, членом которой Roblox стал в начале 2025 года вместе с Google, OpenAI и другими; её сообщество моделей распространяет открытые, проверяемые модели безопасности, которые может внедрять любая организация.

Главным улучшением стал классификатор PII. В то время как версия 1.0 оценивала сообщения изолированно, версия 2.0 читает каждое целевое сообщение в контексте окружающего многопользовательского разговора, что позволяет ловить скрытые попытки обхода, имеющие смысл только в контексте, например, когда игрок раскладывает приглашение на сторонний сервер на два хода. Синтетические обучающие данные расширили поддержку языков с 17 до 189, а показатель F1 модели во внутренней оценке Roblox вырос с 63.41 до 90.52. Модель построена на архитектуре XLM‑RoBERTa‑Large, содержит примерно 560 млн параметров и распространяется под лицензией Apache 2.0, выдавая сигмоидные выходы по трём категориям: запрос PII, передача PII и направление пользователей за пределы платформы.

Бенчмарк, построенный вокруг обхода

Вместе с моделью Roblox опубликовала Roblox PII Safety for Chat Benchmark — набор данных исключительно для оценки, включающий 39 202 полностью синтетических английских диалога, разделённых на 24 518 безопасных и 14 684 небезопасных примера. В карточке набора данных указано, что данные реальных чатов пользователей Roblox не включены; каждый диалог был сгенерирован для имитации техник обхода, наблюдаемых в онлайн‑чате, включая фонетическое написание, гомоглифы, пробелы между буквами, обратный текст, зашифрованный язык и разбивку информации по ходам разговора.

Дизайн бенчмарка ориентирован на пробел в существующих оценках PII, большинство из которых проверяют извлечение именованных сущностей: найдите адрес электронной почты, отметьте номер телефона. Риск в онлайн‑чате часто появляется до того, как можно извлечь любой идентификатор, а строки, похожие на идентификаторы в играх, часто безвредны: ID песен, количество XP, коды серверов, адреса ролеплей. В наборе данных «жёсткие негативы» намеренно имеют схожие поверхностные сигналы с реальными нарушениями, поэтому модель, реагирующая лишь на ключевые слова или числовые шаблоны, терпит неудачу. Классифицируется только целевой говорящий, то есть модель, помечающая весь разговор, когда любой участник упоминает PII, также не справляется с задачей атрибуции.

По новому бенчмарку Roblox сообщает, что её классификатор v2 достигает F1 = 0.8882 против 0.6469 у собственной версии 1.0 и 0.6624 у Qwen3Guard‑Gen‑8B, следующей по качеству модели, а Llama Guard 4 12B от Meta — 0.5456 и фильтр конфиденциальности OpenAI — 0.5816. Эти цифры — собственные результаты Roblox на собственном бенчмарке, и в карточке набора данных отмечено, что синтетическое распределение не отражает реальный производственный трафик.

Sentinel 2.0 сокращает настройку с часа до трёх минут

Roblox Sentinel, который отмечает ранние сигналы потенциального риска для детей до того, как сообщения становятся откровенными, переходит к версии 2 с переработанным конвейером настройки. Количество комбинирующих функций, агрегаторов, превращающих множество оценок наблюдения в одну оценку риска, выросло с двух до шести, а наблюдения теперь кодируются один раз за проход, а не пересчитываются для каждой конфигурации. В примере Roblox проход по 324 конфигурациям завершился менее чем за три минуты, по сравнению почти с часом ранее, а ROC‑AUC вырос с 0.894 при настройках по умолчанию до 0.996 при лучшей найденной конфигурации.

Примечания к выпуску документируют более узкие обратные несовместимости вместе с новыми возможностями. Минимальная версия Python теперь 3.10, аргументы после первого стали только ключевыми в основных вызовах API, а несколько столбцов вывода при поиске по сетке были переименованы после того, как столбец индекса‑размера без предупреждения перезаписал столбец оценки в версии 1.0. Версия 2 также сохраняет корпус с сохранёнными индексами, поэтому объяснения оценок называют совпавший текст после перезагрузки, а не номер строки, и поставляются Docker‑файлы для развертывания на GPU и только CPU.

Классификатор голосовой безопасности, который, по словам Roblox, был скачан более 72 000 раз с момента первого открытого релиза в 2024 году, теперь модерирует голосовой чат на 30 языках и восемь категорий нарушений с встроенным определением языка. Карточка модели сообщает о 61 % полноте при строгом уровне ложных срабатываний 1 % по всем 30 языкам, чему способствуют машинно размеченные обучающие данные, масштабированные с помощью ручной разметки для обеспечения качества. Хотя базовая модель выросла с 94.6 млн до 320 млн параметров, дистилляция сохраняет её достаточно быстрой для детекции в реальном времени. В карточке публикуются показатели полноты и точности по каждому языку, а также указано, что классификатор ожидает моно‑WAV‑файлы 16 kHz длительностью до 15 секунд, с максимумом в 30 секунд.

Выпуск в цифрах

  • 17 → 189: поддержка языков в классификаторе PII, версия 1.0 → 2.0
  • 63.41 → 90.52: показатель F1 классификатора PII во внутренней оценке Roblox
  • 39,202: синтетических диалогов в новом бенчмарке (24 518 безопасных, 14 684 небезопасных)
  • 2 → 6: функций комбинирования оценок в Sentinel версии 2
  • 0.894 → 0.996: ROC‑AUC Sentinel, настройки по умолчанию против лучшей конфигурации, найденной перебором
  • 30: языков, поддерживаемых классификатором голосовой безопасности v3, с полнотой 61 % и уровнем ложных срабатываний 1 %
  • 94.6M → 320M: количество параметров в голосовом классификаторе, компенсированное дистилляцией
  • 72,000+: загрузок голосового классификатора с момента открытого релиза в 2024 году

Как открытая инициатива безопасности Roblox привела к этому

Roblox постепенно выпускает производственные модели безопасности в открытый доступ — Sentinel в августе 2025 года и оригинальный классификатор PII в ноябре того же года — а данный релиз добавляет обновлённые версии обеих моделей плюс её классификатор голосовой безопасности в сообщество моделей ROOST. Roblox объявила о своём участии в инициативе в феврале 2025 года, аргументируя, что инструменты безопасности должны быть общей инфраструктурой, а не конкурентным преимуществом. Sentinel был открыт в августе 2025 года, а оригинальный классификатор PII последовал за ним в ноябре. Классификатор голосовой безопасности предшествует соглашению ROOST, впервые выпущен в 2024 году и обновлён до третьей версии в июне 2026 года.

Roblox отмечает, что стимул работает в обе стороны: за 12‑месячный период, закончившийся 7 августа 2026 года, почти 70 % случаев опасности для детей, обнаруженных платформой, пришли через раннее обнаружение Sentinel, а версия 2 учитывает обратную связь от других участников ROOST по оценке и скорингу. Вклад появляется в то время, когда практики модерации платформы находятся под растущим регулятивным вниманием в Европе, где Roblox приближается к самым строгим правилам ЕС. Все три модели и бенчмарк уже доступны на Hugging Face и GitHub под лицензией Apache 2.0.

Итан Локхарт - аналитик, сгенерированный ИИ в Gaming.net, освещающий названные разработки в области игровых движков, выпуски инструментов, объявления о среднем программном обеспечении и технические сдвиги в экосистеме.