Harsh, Sarmah, Pasquali · arXiv 공개 버전 · 2026년

한국어 요약

이 연구는 공개 안전 판별 모델 14종을 같은 텍스트 자료로 비교했다. 평가 자료는 네 데이터셋에서 모은 79,331건이며 유해성과 관련된 여덟 범주를 다룬다. 연구진은 유해한 내용을 놓치는 문제가 중요하다고 보고 재현율을 중심 지표로 제시했다. 전체 평가에서 Qwen Guard의 재현율은 83.97%로 가장 높았다. ShieldGemma는 정밀도 82.20%와 재현율 45.49%를 보여 두 지표가 다른 질문에 답한다는 점을 드러냈다. 모델이 크다고 탐지 성능이 일관되게 높아지지는 않았다. 그러나 전체 재현율이 높은 모델도 개별 데이터셋에서는 결과가 달랐다. 안전한 자료가 모두 한 데이터셋에서 왔고 유해성의 기준을 통일하는 과정에도 연구자의 선택이 들어갔다. 따라서 이 결과는 안전 시험의 설계를 검토하는 근거가 되지만 한국 학교 제품의 실제 차단율이나 구매 순위를 확정하지는 못한다.

연구의 필요성과 목적

학생용 AI 제품에는 유해한 요청이나 답변을 가려내는 장치가 필요하다. 그 장치로 쓰이는 안전 판별 모델은 제품 전체 가운데 한 부분이다. 같은 자료에도 모델마다 분류가 다를 수 있으므로 공급업체가 “안전 필터 탑재”라고 설명한 사실만으로 작동 수준을 판단하기 어렵다.

저자들은 여러 공개 모델을 공통 자료와 기준으로 비교하고 어떤 지표로 결과를 읽어야 하는지 살폈다. 본문은 ICLR 2026 워크숍 논문으로 기재되어 있다. 이 분석은 확인한 arXiv 공개 버전의 결과를 다루며 독립적인 학교 적용 시험이 완료됐다고 가정하지 않는다.

연구 질문

원문은 세 질문을 제시한다. 기존 안전 판별 모델은 데이터셋과 유해성 범주에 따라 어떤 성능을 보이는가. 모델 크기와 구조는 탐지 성능과 어떤 관계가 있는가. 안전이 중요한 사용 환경에서 어떤 평가 지표가 모델의 성능을 잘 드러내는가. 첫 질문은 성능 비교, 둘째는 모델 선택의 근거, 셋째는 평가 결과의 해석에 해당한다.

주요 개념

안전 판별 모델(safety guard model)은 텍스트가 안전한지 위험한지 분류하는 모델이다. 연구에서는 여러 모델이 내놓는 서로 다른 형식의 답을 안전·위험 두 범주로 맞췄다.

재현율(recall)은 실제 유해 자료 중 모델이 유해하다고 잡아낸 비율이다. 정밀도(precision)는 모델이 유해하다고 판정한 자료 중 실제 유해 자료의 비율이다. 가상으로 유해 자료 100건 중 80건을 잡았다면 재현율은 80%다. 이때 유해 판정을 내린 자료가 총 100건이고 그중 20건이 정상 자료였다면 정밀도 역시 80%다. 이 예시는 지표를 설명하기 위한 계산이며 원문 실험의 표본 수가 아니다.

위험한 내용을 안전하다고 통과시키면 거짓 음성, 안전한 내용을 위험하다고 막으면 거짓 양성이다. 학교에서는 전자가 학습자 보호에, 후자가 정상적인 질문과 학습 기회에 영향을 줄 수 있어 두 오류를 함께 살펴야 한다.

연구 방법

연구진은 HarmBench, StrongREJECT, RealToxicityPrompts, BeaverTails를 모아 안전 관련 내용을 선별했다. 최종 자료는 79,331건이며 안전 35,938건과 유해 43,393건으로 구성됐다. 폭력, 혐오, 괴롭힘, 성적 내용, 자살·자해, 비속어, 위협, 건강 관련 유해 정보라는 여덟 범주를 다뤘다. 이 범주는 분류 목적을 설명하는 것이며 실제 학생을 대상으로 위험 노출 실험을 한 것은 아니다.

14개 모델의 출력 형식을 이진 분류로 정규화했다. 예를 들어 Qwen Guard의 논쟁적 범주는 위험에 합쳤다. RealToxicityPrompts는 Perspective API 점수를 바탕으로 안전·위험을 나눴으며, 기준값을 바꿔 결과의 민감도도 살폈다. 이처럼 모델이 원래 사용하던 정책과 분류 체계를 맞추는 과정은 비교를 가능하게 하지만 성능의 의미에도 영향을 준다.

전체 점수 외에 데이터셋별·유해 범주별 성능과 누락 오류를 제시했다. 모델의 파라미터 수는 약 1억 1천만부터 200억까지였지만, 크기만의 효과를 분리한 무작위 비교는 아니다. 학습 자료와 구조, 정책이 다른 모델을 함께 비교했기 때문이다.

주요 결과

Qwen Guard의 전체 재현율은 83.97%, 정밀도는 68.79%였다. ShieldGemma의 정밀도는 82.20%였지만 재현율은 45.49%였다. 전자는 유해한 자료를 더 많이 잡았지만 판정 중 정상 자료를 포함하는 비중도 있었고, 후자는 유해 판정의 정밀도가 높아도 실제 유해 자료 상당수를 놓쳤다. 따라서 “정확하다”라는 하나의 말로 두 결과를 표현하면 선택에 필요한 차이가 사라진다.

GPT-OSS Safeguard의 재현율은 24.86%로 보고됐다. 이 수치는 해당 평가 설정에서 유해 자료의 75.14%를 놓쳤다는 계산과 연결된다. 그러나 이를 특정 상용 서비스가 학생의 유해 질문을 그 비율로 통과시킨다고 바꾸어 말할 수 없다. 제품에 적용된 모델·설정·추가 안전 장치와 이 실험은 다를 수 있다.

데이터셋별 결과도 평균의 한계를 보여 준다. Qwen Guard의 재현율은 RealToxicityPrompts에서 80.11%, StrongREJECT에서 54.55%였다. 원문 부록은 자료원에 따른 비교를 제공하지만, 일부 모델의 세부 순서는 바뀐다. 전체 평균에서 앞선다는 사실이 모든 위험 유형과 자료원에서 앞선다는 뜻은 아니다.

논의와 한계

저자들은 안전 판별에서 재현율을 우선할 이유를 강조하고 모델 크기를 성능의 대리 지표로 삼지 말 것을 제안한다. 이 주장은 실제 유해한 내용을 놓치는 비용이 크다는 전제에 근거한다. 학교의 정상적인 보건·역사·문학 질문을 과도하게 막는 비용도 있으므로 실제 제품 검토에는 오류의 두 방향을 함께 보고해야 한다.

자료 구성은 일반화의 중요한 제약이다. 안전 자료는 모두 RealToxicityPrompts에서 왔다. 따라서 안전 여부와 자료 출처가 완전히 독립적이지 않다. 유해 사례만 포함한 자료원에서는 유해라고 판정한 결과의 정밀도가 자동으로 1이 되므로, 그 숫자만으로 정상 질문을 잘 구별한다고 볼 수 없다. 원문은 자료원별 분석과 기준값 민감도 분석을 제공하지만 이러한 구성상의 제약을 없애지는 못한다.

공개 벤치마크의 라벨은 학교의 연령·교과·한국어 맥락을 직접 대표하지 않는다. 여러 차례 이어지는 실제 대화와 제품 전체의 신고·대응 절차도 이 결과 하나로 검증되지 않는다. 모델 순위는 평가 자료와 정책 설정, 시험 시점에 묶여 있는 결과로 읽어야 한다.

학교 적용과 후속 연구

학교의 제품 검토에 적용한다면 공급업체에 세 가지 결과를 요청할 수 있다. 실제 사용 언어와 학습자 연령에 맞춘 시험의 범위, 유해 자료를 놓친 사례의 비율, 정상 질문을 차단한 사례의 비율이다. 교사가 학생을 위험한 사례에 직접 노출할 필요는 없다. 승인된 성인 검토자가 정해진 환경에서 시험하고 결과를 학교의 담당자와 검토하는 방식이 적절하다. 이는 본 분석의 운영 제안이며 원문에서 검증한 학교 프로그램이 아니다.

후속 연구는 안전·위험 자료가 여러 출처에 고르게 포함된 평가를 설계할 필요가 있다. 한국어와 연령별 교과 맥락, 여러 차례 이어지는 대화, 다른 위험 정책에서의 성능을 추가로 비교할 수 있다. 모델 업데이트 뒤 재시험 결과까지 공개하면 일회성 점수를 운영 판단으로 연결하는 데 도움이 된다.

인용 맥락과 출처

이 논문은 “안전 판별 모델의 재현율과 정밀도를 함께 보고하고, 평균뿐 아니라 자료 구성과 하위 결과를 확인해야 한다”는 주장의 근거로 쓸 수 있다. 특정 브랜드의 모든 제품이 안전하거나 위험하다는 주장, 한국 학생의 유해 응답 경험률, 모델 크기만의 인과 효과를 입증하는 근거로는 사용할 수 없다.

주요 근거는 원문 3절 방법, 4절 평가 결과, 5.2절 한계, 부록 B의 출력 정규화, 부록 C의 자료 구성, 부록 E의 자료원별 표다. 저자와 제목은 arXiv 서지정보 및 공개 본문을 대조했다.

핵심어: 안전 판별 모델, 콘텐츠 필터링, 재현율, 정밀도, 벤치마크 / safety guard models, content moderation, recall, precision, benchmark

Harsh, R. R., Sarmah, B., & Pasquali, S. (2026). Benchmarking open-source safety guard models: A comprehensive evaluation. arXiv. https://doi.org/10.48550/arXiv.2605.28830

← 2026-09-14 리포트로