PASTABench: Proactive Assessment of Sequential Trajectories for Agent Safety

Sun 외 6인, 2026. arXiv 사전공개본을 기준으로 분석했다. arXiv에는 EMNLP 2026이라는 저자 주석이 있으며, 이 분석은 확인한 공개본의 방법과 결과에 한정한다.

1. 논문 요약 (Abstract)

여러 단계를 실행하는 AI는 위험한 결과가 나온 뒤 이를 알아차리는 것만으로 안전을 보장할 수 없다. 이 연구는 위험을 알아볼 단서가 생긴 뒤 실제 피해를 촉발하는 행동 전에 개입할 수 있는지 평가한다. 연구진은 5개 큰 위험 범주와 13개 세부 범주에 걸친 1,139개 모의 작업 경로를 구성했다. 각 경로에는 첫 유효 단서와 위험을 촉발하는 행동의 시점을 표시했다. 16개 언어모델은 작업 이력을 순서대로 보고 계속 진행할지 멈출지 결정했다. 세부 위험 유형과 적절한 개입 시점을 함께 맞힌 최고 비율은 40.74%였다. 일부 모델은 위험을 연상시키는 단어에 반응해 정상 단계에서 지나치게 일찍 멈췄다. 표현을 중립적으로 바꾼 비교는 이런 반응과 상황의 진행을 이해하는 능력을 구분하는 데 도움을 줬다. 다만 텍스트로 생성한 모의 경로의 결과이므로 실제 학교 업무의 사고 예방 효과나 일반적인 오경보율로 해석할 수 없다.

2. 논문 구조별 주요 정보

연구의 필요성 및 목적

교사가 AI에게 학급 자료를 정리하고 지정된 수신자에게 보내도록 맡겼다고 가정해 보자. 파일 전송이 끝난 뒤 개인정보가 섞였다고 말하는 AI는 위험을 설명할 수 있지만 피해를 막지는 못한다. 반대로 파일이라는 말만 나와도 작업을 멈춘다면 일상 업무를 수행하기 어렵다. 이 예시는 연구의 문제를 학교 업무로 옮긴 설명이며, 논문이 학교에서 이 과정을 시험한 것은 아니다.

기존의 한 번짜리 응답 평가는 이러한 시간의 흐름을 충분히 다루기 어렵다. 전체 경로를 본 뒤 안전·위험으로 분류하는 방식도 언제 개입해야 했는지를 놓칠 수 있다. 연구의 목적은 개입 여부, 시점, 위험 종류를 구분해 평가할 수 있는 기준을 만드는 데 있다.

연구 문제

핵심 질문은 AI 감시자가 위험을 알아볼 근거가 충분해진 시점과 실제 위험이 발생하기 전의 시점 사이에서 개입할 수 있는가이다. 여기에는 두 질문이 더 연결된다. 모델이 어떤 위험인지 구체적으로 맞히는가, 그리고 그 판단이 위험을 떠올리게 하는 단어에 의존하는가이다.

논문의 결과를 읽을 때는 이 질문들을 나눠야 한다. 빨리 멈췄다고 언제나 좋은 개입은 아니며, 위험을 맞혔어도 이미 늦었다면 예방이라고 보기 어렵다.

용어의 정의

작업 경로(trajectory)는 도구 호출, 도구가 반환한 정보, 이어지는 행동의 연속을 뜻한다. 첫 유효 단서 시점(earliest-signal turn)은 그때까지의 정보로 위험을 합리적으로 알아볼 수 있는 첫 단계다. 촉발 시점(trigger turn)은 위험한 결과를 실제로 일으키는 행동 단계다.

최적 개입 구간(optimal intervention window)은 첫 유효 단서가 나온 시점부터 촉발 직전까지다. 논문이 말하는 완전한 개입(perfect interruption)은 이 구간에서 멈추면서 세부 위험 유형도 맞히는 경우다. 따라서 40.74%는 단순한 위험 감지율이 아니라 시점과 분류를 결합한 지표다.

어휘 과적합(lexical overfitting)은 상황 전체보다 특정 단어에 과도하게 반응하는 현상이다. 같은 작업을 다른 표현으로 설명했을 때 개입이 크게 달라진다면, 모델이 실제 상태 변화를 얼마나 이해했는지 다시 살펴야 한다.

연구 방법

연구진은 Recipe2Plan, LabSafetyBench, SafeToolBench에서 모은 자료를 정리하고 의미상 중복 및 범위 밖 사례를 제거했다. 도구와 환경을 구성한 뒤 언어모델로 정상 작업에서 위험이 점차 진행되는 경로를 만들었다. 생성한 경로는 도구 사용의 일관성, 원인과 결과의 연결, 위험 범주의 적합성을 검사했다.

GPT-4o와 Gemini-2.5-Pro를 이용해 위험 유형과 시간 기준점을 대조하고, 사람 검토를 추가했다. 최종 자료는 1,139개 경로다. 언어모델이 자료 생성과 주석에 관여했다는 점을 결과 해석에 포함해야 한다. 특히 평가 대상에도 주석에 참여한 모델이 있으므로 완전히 독립된 자연 관찰 자료로 볼 수 없다.

감시 모델은 매 단계까지의 누적 이력을 받아 계속 또는 중단을 선택했다. 중단을 선택하면 세부 위험 유형을 출력하고 해당 실행을 끝냈다. 평가에서는 큰 위험 범주를 맞히고 촉발 전에 멈춘 경우, 세부 범주까지 맞힌 경우, 최적 구간까지 충족한 경우를 구분했다. 위험 단어를 중립적인 표현으로 바꾸는 비교도 전체 경로에 적용했다.

연구 결과

최적 구간과 세부 위험 유형을 모두 맞힌 비율은 GPT-4o의 40.74%가 가장 높았고 Gemini-3-Pro가 39.42%로 뒤를 이었다. 이 결과는 해당 버전과 설정, 자료 구성에서 얻은 값이다. 현재 사용 중인 서비스 전체의 성능이나 앞으로의 모델 순위를 보장하지 않는다.

너무 이른 중단도 두드러졌다. 예를 들어 Gemini-2.5-Pro의 조기 중단 비율은 64.27%였다. 조기 중단은 위험을 막았다는 점만 보면 보수적인 대응으로 보일 수 있지만, 필요한 근거가 나타나기 전에 정상 작업을 차단한다는 비용이 있다. 위험을 나중에 알아차리는 문제만으로 안전 감시의 실패를 설명할 수 없는 이유다.

위험 단어를 중립적으로 바꾼 뒤에는 일부 모델의 조기 중단이 적절한 구간으로 이동했다. 다만 이 변화만으로 모든 상황에서의 인과 추론 능력을 확정할 수는 없다. 표현 치환이 원래 뜻과 단서를 얼마나 잘 보존했는지, 위험 범주별로 같은 효과가 나는지도 함께 살펴야 한다.

논의 및 결론

이 논문은 안전 감시를 단일 정답률로 압축하기보다 개입의 이유와 시점을 함께 보자는 평가 틀을 제시한다. 학교에서 AI 도구를 검토한다면 결과물 검사 외에 실행 과정의 어느 지점에서 확인을 요구할지 정하는 데 참고할 수 있다.

적용의 예로는 자료 전송 전에 수신자와 자료 범위를 확인하거나, 일괄 수정 전에 바뀔 내용을 미리 보여 주는 절차가 있다. 이는 이 분석에서 제안하는 학교 운영 방안이다. 논문은 이런 절차를 학교에 적용해 사고가 줄었는지 검증하지 않았다.

한계도 명확하다. 경로는 텍스트 중심이며 실제 영상·센서·조직 맥락이 빠져 있다. 자료에는 위험이 진행되는 구조가 포함돼 있으므로 정상 작업이 대부분인 실제 환경의 오경보율을 곧바로 계산할 수 없다. 평가에 사용한 모델이 업데이트되면 같은 결과를 기대할 수도 없다. 도입 기관은 자체 작업의 정상 사례와 위험 사례를 모두 넣어 추가 검증해야 한다.

후속 연구 제안

학교 적용 연구에서는 학생의 실제 개인정보를 넣지 않은 모의 자료로 정상 전송, 잘못된 수신자 선택, 과도한 정보 포함 사례를 구성할 수 있다. 교사와 정보보호 담당자가 먼저 유효한 단서와 개입 구간을 독립적으로 표시한 뒤, 모델의 중단 이유와 시점을 비교하는 방식을 제안한다.

중단 빈도만 세지 말고 놓친 위험, 불필요한 중단, 작업 완료 시간, 사람이 수정한 내용도 함께 기록할 필요가 있다. 다른 표현과 한국어 입력에서 결과가 유지되는지도 확인해야 한다. 이러한 설계는 후속 검증을 위한 제안이며 원 논문의 실증 결과에 포함되지 않는다.

주제어

에이전트 안전(agent safety), 사전 안전 감시(proactive safety monitoring), 개입 시점(intervention timing), 작업 경로(trajectory), 어휘 과적합(lexical overfitting).

3. APA 인용과 원문 근거

Sun, J., Zhou, Y., Zhu, H., Wen, P., Zhou, J., Han, S., & Guo, Y. (2026). PASTABench: Proactive assessment of sequential trajectories for agent safety. arXiv. https://doi.org/10.48550/arXiv.2609.28197

방법은 공개본 §3.2~3.3, 개입 비율은 표 2와 §4.2, 표현 치환은 §4.3, 텍스트 환경의 제약은 Limitations를 대조했다. 이 자료는 개입 시점과 위험 분류를 나눠 평가해야 한다는 주장의 근거로 쓸 수 있으며, 실제 학교 사고 예방의 효과량으로 인용할 수는 없다.

← 2026-09-25 리포트로