게임
Roblox, ROOST 모델 커뮤니티를 위해 세 가지 안전 모델을 오픈소스 공개
Roblox는 2026년 8월 19일에 ROOST 모델 커뮤니티에 세 가지 오픈소스 신뢰 및 안전 모델의 업데이트된 버전을 제공했으며, 다른 플랫폼이 자체 분류기를 벤치마크하는 데 사용할 수 있는 새로운 평가 데이터셋도 함께 공개했습니다.
이번 릴리스는 채팅에서 개인 정보를 공유하거나 요청하려는 시도를 감지하는 Roblox의 PII 분류기 2.0 버전, 아동 위험을 조기에 경고하는 Roblox Sentinel 2 버전, 그리고 실시간 음성 안전 분류기 3 버전을 포함합니다. 세 모델의 모든 버전은 이미 Roblox에서 프로덕션 환경에서 운영 중입니다. ROOST는 Robust Open Online Safety Tools의 약자로, Roblox가 2025년 초 Google, OpenAI 등과 함께 창립 멤버로 가입한 비영리 단체이며, 그 모델 커뮤니티는 모든 조직이 배포할 수 있는 공개 및 검증 가능한 안전 모델을 제공합니다.
주요 개선점은 PII Classifier에 있습니다. 1.0 버전이 개별 메시지를 별도로 평가했다면, 2.0 버전은 대상 메시지를 주변 다중 사용자 대화 맥락 안에서 읽어들여, 문맥에서만 의미를 갖는 은폐된 우회 시도를 포착하도록 설계되었습니다. 예를 들어 플레이어가 두 차례에 걸쳐 플랫폼 외 서버 초대를 철자하는 경우 등이 해당됩니다. 합성 학습 데이터를 통해 지원 언어가 17개에서 189개로 확대되었으며, Roblox 내부 평가에서 모델의 F1 점수는 63.41에서 90.52로 상승했습니다. 이 모델은 약 5억 6천만 개 파라미터를 가진 XLM‑RoBERTa‑Large 아키텍처 기반이며, Apache 2.0 라이선스로 제공되고, 세 가지 카테고리: PII 요청, PII 제공, 플랫폼 외로 유도에 대한 시그모이드 출력값을 가집니다.
우회 방지를 중심으로 설계된 벤치마크
모델과 함께 Roblox는 Roblox PII Safety for Chat Benchmark를 공개했습니다. 이는 평가 전용 데이터셋으로, 39,202개의 완전 합성 영어 대화로 구성되며, 24,518개는 안전, 14,684개는 위험 사례로 구분됩니다. 데이터셋 설명에는 Roblox 사용자 채팅 데이터가 포함되지 않았으며, 모든 대화는 온라인 채팅에서 관찰되는 우회 기법을 모델링하기 위해 생성되었습니다. 여기에는 음성 철자, 동형문자, 글자 간격, 역문자, 암호화 언어, 대화 차례에 걸친 정보 분할 등이 포함됩니다.
이 벤치마크는 기존 PII 평가의 공백을 메우기 위해 설계되었습니다. 기존 평가 대부분은 명명된 엔터티 추출(예: 이메일 주소 찾기, 전화번호 태깅)을 테스트합니다. 그러나 온라인 채팅 위험은 추출 가능한 식별자가 나타나기 전에 발생하는 경우가 많으며, 게임 내 식별자와 유사한 문자열은 종종 무해합니다(예: 곡 ID, 경험치 총합, 서버 코드, 역할극 주소). 데이터셋의 하드 네거티브는 실제 위반과 표면 신호를 일부러 공유하도록 구성되어 있어, 키워드나 숫자 패턴에만 반응하는 모델은 실패합니다. 또한 오직 대상 화자만 분류되므로, 어떤 참가자가 PII를 언급하더라도 전체 대화를 플래그하는 모델은 귀속 작업에서도 실패합니다.
새로운 벤치마크에서 Roblox는 v2 분류기가 0.8882의 F1 점수를 기록했으며, 자체 v1.0은 0.6469, 다음으로 좋은 모델인 Qwen3Guard-Gen-8B는 0.6624, Meta의 Llama Guard 4 12B는 0.5456, OpenAI의 프라이버시 필터는 0.5816을 기록했다고 보고했습니다. 이 수치는 모두 Roblox가 자체 벤치마크에서 보고한 결과이며, 데이터셋 설명에는 합성 데이터 분포가 실제 프로덕션 트래픽을 대변하지는 않는다고 명시되어 있습니다.
Sentinel 2.0, 튜닝 스윕 시간을 1시간에서 3분으로 단축
Roblox Sentinel은 메시지가 명시적으로 되기 전에 잠재적인 아동 위험 신호를 조기에 표시하며, 재구성된 튜닝 파이프라인을 갖춘 버전 2로 전환되었습니다. 관측 점수를 다수 결합해 단일 위험 점수로 만드는 결합 함수(aggregator)의 수가 2개에서 6개로 증가했으며, 관측값은 이제 각 구성마다 재계산하는 대신 스윕당 한 번만 인코딩됩니다. Roblox의 예시에서는 324개의 구성에 대한 스윕이 1시간에 가까웠던 것이 3분 미만으로 단축되었고, ROC‑AUC는 기본 설정에서 0.894에서 스윕이 찾은 최적 구성에서는 0.996으로 상승했습니다.
릴리스 노트에서는 기능과 함께 보다 제한적인 호환성 변경 사항을 문서화했습니다. 이제 Python 3.10이 최소 버전이며, 주요 API 호출에서 첫 번째 인수 이후는 키워드 전용 인수입니다. 또한 여러 그리드 검색 출력 열이 이름이 변경되었는데, 이는 1.0 버전에서 인덱스‑크기 열이 평가 열을 조용히 덮어쓴 결과입니다. 버전 2는 저장된 인덱스로 코퍼스를 지속하므로, 점수 설명이 행 번호가 아니라 재로드 후 매칭된 텍스트 이름을 사용합니다. 또한 GPU와 CPU 전용 배포를 위한 Dockerfile도 제공됩니다.
voice safety classifier는 Roblox에 따르면 2024년에 처음 오픈소스화된 이후 72,000회 이상 다운로드되었으며, 이제 내장된 언어 감지를 통해 30개 언어와 8가지 위반 카테고리에 걸쳐 음성 채팅을 모니터링합니다. 모델 카드에는 30개 언어 모두에서 1%의 엄격한 false‑positive 비율 하에 61%의 재현율이 보고되어 있으며, 이는 품질을 위해 인간 라벨링을 추가한 기계 라벨링 학습 데이터에 의해 촉진되었습니다. 기본 모델은 9,460만 파라미터에서 3억 2천만 파라미터로 증가했지만, 모델 증류 덕분에 실시간 감지에 충분히 빠릅니다. 카드에는 언어별 재현율 및 정밀도 수치가 공개되어 있으며, 분류기는 15초 이하 세그먼트의 16 kHz 모노 WAV 입력을 기대하고 최대 30초까지 지원한다고 명시합니다.
숫자로 보는 릴리스
- 17 → 189: PII Classifier의 언어 지원 수, 버전 1.0에서 2.0으로
- 63.41 → 90.52: Roblox 내부 평가에서의 PII Classifier F1 점수
- 39,202: 새로운 벤치마크에 포함된 합성 대화 수 (안전 24,518, 위험 14,684)
- 2 → 6: Sentinel 버전 2에서의 점수 결합 함수 수
- 0.894 → 0.996: Sentinel ROC‑AUC, 기본 설정 대비 최적 스윕 구성
- 30: voice safety classifier v3가 지원하는 언어 수, 61% 재현율 및 1% false‑positive 비율
- 94.6M → 320M: voice classifier의 기본 파라미터 수, 증류를 통해 보완
- 72,000+: 2024년 오픈소스 공개 이후 voice safety classifier 다운로드 수
Roblox의 오픈소스 안전 추진이 여기까지 온 과정
Roblox는 생산 환경 안전 모델을 지속적으로 오픈소스로 공개해 왔습니다—2025년 8월에 Sentinel을, 그 해 11월에 최초 PII Classifier를—이번 릴리스에서는 두 모델과 음성 안전 분류기의 업데이트된 버전을 ROOST 모델 커뮤니티에 추가했습니다. Roblox는 2025년 2월에 이 이니셔티브의 창립 멤버십을 발표하면서, 안전 도구는 경쟁 우위가 아니라 공유 인프라가 되어야 한다고 주장했습니다. Sentinel은 2025년 8월에 오픈소스화되었고, 원래 PII Classifier는 그 해 11월에 이어졌습니다. 음성 안전 분류기는 ROOST 체제보다 먼저이며, 2024년에 처음 공개된 뒤 2026년 6월에 세 번째 버전으로 업그레이드되었습니다.
Roblox는 인센티브가 양방향으로 작동한다고 말합니다: 2026년 8월 7일에 종료된 12개월 동안 감지된 아동 위험 사례 중 거의 70%가 Sentinel의 조기 탐지를 통해 발견되었으며, 버전 2는 평가 및 점수에 대한 다른 ROOST 멤버들의 피드백을 반영했습니다. 이 기여는 플랫폼의 모더레이션 관행이 유럽에서 규제 감시가 강화되는 시점에 이루어졌으며, Roblox는 EU의 가장 엄격한 플랫폼 규칙에 점점 더 가까워지고 있습니다. 세 모델과 벤치마크는 모두 현재 Hugging Face와 GitHub에서 Apache 2.0 라이선스로 제공됩니다.











