Ігри

Roblox випускає з відкритим кодом три моделі безпеки для спільноти моделей ROOST

Додайте Gaming.net до бажаних джерел у Google

Roblox внесла оновлені версії трьох моделей відкритої довіри та безпеки до спільноти моделей ROOST, а також новий набір даних для оцінки, який інші платформи можуть використовувати для порівняння своїх класифікаторів, повідомила компанія 19 серпня 2026 року.

У випуск входить версія 2.0 класифікатора PII від Roblox, який виявляє спроби ділитися або запитувати особисту інформацію в чаті; версія 2 Roblox Sentinel, його система раннього попередження про небезпеку для дітей; та версія 3 його класифікатора голосової безпеки в режимі реального часу. Версії всіх трьох вже працюють у продакшн‑середовищі Roblox. ROOST, скорочення від Robust Open Online Safety Tools, є некомерційною організацією, до якої Roblox приєднався як засновник на початку 2025 року разом з Google, OpenAI та іншими; її спільнота моделей розповсюджує відкриті, перевіряємі моделі безпеки, які може впроваджувати будь‑яка організація.

Основне покращення належить класифікатору PII. У версії 1.0 повідомлення оцінювалися окремо, тоді як версія 2.0 читає кожне цільове повідомлення в контексті його багатокористувацької розмови, що дозволяє виявляти приховані спроби обходу, які мають сенс лише в контексті, наприклад, коли гравець розкладає запрошення на сервер поза платформою на два ходи. Синтетичні дані для навчання розширили підтримку мов з 17 до 189, а F1‑бал модель отримала у внутрішньому оцінюванні Roblox з 63,41 до 90,52. Модель побудована на архітектурі XLM‑RoBERTa‑Large приблизно з 560 мільйонами параметрів і поширюється під ліцензією Apache 2.0, з сигмоїдальними виходами за трьома категоріями: запит особистих даних, надання особистих даних та перенаправлення користувачів поза платформою.

Бенчмарк, побудований навколо ухилення

Разом з моделлю Roblox опублікувала Roblox PII Safety for Chat Benchmark, набір даних лише для оцінки, що містить 39 202 повністю синтетичних англійських розмов, розділених на 24 518 безпечних і 14 684 небезпечних прикладів. У описі набору даних зазначено, що жодних чат‑даних користувачів Roblox не використано; кожна розмова була згенерована для моделювання технік ухилення, які спостерігаються в онлайн‑чатах, включаючи фонетичне написання, гомогліфи, розділення букв, перевернутий текст, кодування мови та розподіл інформації між ходами розмови.

Дизайн бенчмарку спрямований на заповнення прогалини в існуючих оцінках PII, більшість з яких тестує видобуток іменованих сутностей: знайти електронну адресу, позначити номер телефону. Ризик у онлайн‑чаті часто з’являється до того, як можна виділити ідентифікатор, а рядки, схожі на ідентифікатори в іграх, часто є безпечними: ідентифікатори пісень, рівень досвіду, коди серверів, ролеплей‑адреси. У наборі даних навмисно включено «жорсткі негативи», які діляться поверхневими ознаками з реальними порушеннями, тому модель, яка реагує лише на ключові слова або числові шаблони, провалюється. Класифікується лише цільовий співрозмовник, що означає, що модель, яка позначає всю розмову, коли будь‑хто згадує PII, також не виконує завдання атрибуції.

За новим бенчмарком Roblox повідомляє, що його v2‑классифікатор досяг F1 = 0,8882 у порівнянні з 0,6469 у власній v1.0 та 0,6624 у Qwen3Guard-Gen-8B, наступній кращій моделі, а Llama Guard 4 12B від Meta — 0,5456 та фільтр конфіденційності OpenAI — 0,5816. Ці цифри — власні результати Roblox на його власному бенчмарку, і в описі набору даних зазначено, що синтетичний розподіл не відображає трафік у продакшн‑середовищі.

Sentinel 2.0 скорочує налаштування з години до трьох хвилин

Roblox Sentinel, який виявляє ранні сигнали потенційної небезпеки для дітей до того, як повідомлення стають явними, переходить до версії 2 з переробленим конвеєром налаштування. Кількість комбінуючих функцій, агрегаторів, які перетворюють багато оцінок спостережень у єдиний ризиковий бал, зросла з двох до шести, а спостереження тепер кодуються один раз за проходження, а не переобчислюються для кожної конфігурації. У прикладі Roblox проходження через 324 конфігурації завершилося менш ніж за три хвилини, порівняно майже з годиною, а ROC‑AUC піднявся з 0,894 у налаштуваннях за замовчуванням до 0,996 у найкращій конфігурації, виявленій під час проходження.

Примітки до випуску документують більш вузькі несумісні зміни поряд з новими функціями. Тепер мінімальною версією є Python 3.10, аргументи після першого стали лише ключовими у основних викликах API, і кілька стовпців виводу пошуку за сіткою були перейменовані після того, як стовпець розміру індексу тихо перезаписав стовпець оцінки у версії 1.0. Версія 2 також зберігає корпус із збереженими індексами, тому пояснення оцінок називають відповідний текст після перезавантаження, а не номер рядка, і постачається Docker‑файли для розгортання на GPU та лише CPU.

Класифікатор голосової безпеки, який, за словами Roblox, був завантажений понад 72 000 разів з моменту першого відкриття у 2024 році, тепер модерує голосовий чат у 30 мовах та восьми категоріях порушень із вбудованим визначенням мови. У картці моделі зазначено 61 % відзиву при строгій 1 % частоті хибнопозитивних результатів у всіх 30 мовах, завдяки машинному маркуванню навчальних даних, масштабованих за допомогою людської верифікації для забезпечення якості. Хоча базова модель збільшилася з 94,6 мільйона до 320 мільйонів параметрів, дистиляція моделі зберігає її достатньо швидкою для виявлення в режимі реального часу. Картка публікує показники відзиву та точності за кожною мовою та зазначає, що класифікатор очікує моно‑WAV‑вхід 16 kHz у сегментах до 15 секунд, з максимумом у 30 секунд.

Випуск у цифрах

  • 17 → 189: підтримка мов у класифікаторі PII, версія 1.0 до 2.0
  • 63.41 → 90.52: F1‑бал класифікатора PII у внутрішньому оцінюванні Roblox
  • 39,202: синтетичних розмов у новому бенчмарку (24 518 безпечних, 14 684 небезпечних)
  • 2 → 6: функцій комбінування оцінок у Sentinel версії 2
  • 0.894 → 0.996: ROC‑AUC Sentinel, налаштування за замовчуванням проти найкращої конфігурації, знайденої під час проходження
  • 30: мов, підтримуваних класифікатором голосової безпеки v3, з 61 % відзиву та 1 % частотою хибнопозитивних результатів
  • 94.6M → 320M: кількість параметрів у базовій моделі голосового класифікатора, скоригована дистиляцією
  • 72,000+: завантажень класифікатора голосової безпеки з моменту його відкритого випуску у 2024 році

Як ініціатива відкритих інструментів безпеки Roblox привела до цього

Roblox поступово випускає виробничі моделі безпеки з відкритим кодом — Sentinel у серпні 2025 року та оригінальний класифікатор PII у листопаді того ж року — і цей випуск додає оновлені версії обох, а також його класифікатор голосової безпеки, до спільноти моделей ROOST. Roblox оголосив про своє засновницьке членство в цій ініціативі у лютому 2025 року, стверджуючи, що інструменти безпеки мають бути спільною інфраструктурою, а не конкурентною перевагою. Sentinel був відкритим у серпні 2025 року, а оригінальний класифікатор PII — у листопаді. Класифікатор голосової безпеки передує угоді ROOST, вперше випущений у 2024 році та оновлений до третьої версії у червні 2026 року.

Roblox зазначає, що стимул працює в обох напрямках: за даними за 12‑місячний період, що закінчився 7 серпня 2026 року, майже 70 % випадків небезпеки для дітей, які вона виявила, походили з раннього виявлення Sentinel, а версія 2 включає відгуки інших учасників ROOST щодо оцінки та скорингу. Цей внесок з’явився, коли практики модерації платформи піддаються зростаючій регуляторній увазі в Європі, де Roblox наближається до найжорсткіших правил платформи ЄС. Усі три моделі та бенчмарк вже доступні на Hugging Face та GitHub під ліцензією Apache 2.0.

Етан Локгарт є аналітиком, створеним штучним інтелектом у Gaming.net, який висвітлює відомі розробки у сфері вдосконалення ігрових двигунів, випуски інструментів, оголошення про програмне забезпечення та технічні зміни в екосистемі.