Debajyoti Mazumder, Mamta, Abhirama Subramanyam Penamakuri, 2026. arXiv 사전공개 논문이며 동료심사 전이다. 검토 기준일: 2026년 9월 27일.

1. 논문 요약 (Abstract)

학생이 영상이나 팟캐스트의 주장을 AI에게 확인하게 되면서 음성 사실검증의 신뢰성이 새로운 문제가 된다. 이 연구는 글에서 확인한 검증 능력이 같은 내용을 말로 들었을 때도 유지되는지 살폈다. 연구진은 유명인 전기 자료에서 연도·장소·관계에 관한 주장 3,879개를 구성한 VeriSpeak를 만들었다. 같은 화자의 합성 음성을 사용하고 글·음성 입력, 근거 검색, 추론 유도를 나누어 비교했다. 여러 음성언어모형은 같은 계열의 문자 기반 조건보다 낮은 사실검증 성적을 보였다. 검색 자료를 추가하는 것만으로는 원래 주장과 근거를 혼동하는 오류가 충분히 해결되지 않았다. Audio-Flamingo-next-think의 사실유형별 평균 정확도는 음성만 제시한 66.4%에서 검색·추론 결합 시 86.1%로 높아졌다. 그래도 문자 기반 검색 조건의 92.4%보다 6.3%포인트 낮았다. 이 결과는 주장·전사문·검색 근거·판정의 연결을 따로 점검할 필요를 보여 주지만, 단일 합성 화자와 고정 자료집의 시험을 실제 한국어 교실이나 뉴스 영상의 성능으로 일반화할 수는 없다.

2. 연구의 필요성 및 목적 (Background and objective)

발화를 알아듣는 일과 발화가 사실인지 판단하는 일은 다르다. 전사문이 정확해도 잘못된 자료를 검색할 수 있고, 올바른 자료를 검색해도 그 자료에 적힌 문장을 원래 주장으로 혼동할 수 있다. 예를 들어 음성의 연도가 틀렸는데 검색한 전기에 올바른 연도가 나왔다면, AI는 두 연도가 다르다는 점을 근거로 원래 주장을 거짓으로 판단해야 한다.

연구의 목적은 이런 단계를 통제된 조건에서 분리하는 것이다. 평가 대상은 학생의 학습성과가 아니라 음성 입력을 받는 AI의 사실검증 행동이다. 글을 처리하는 기반 모형의 지식이 음성 입력에서도 그대로 작동하는지, 검색과 추론이 어느 단계에 도움이 되는지 비교한다.

3. 연구 문제 (Research questions)

원문은 글에서 음성으로의 성능 전이, 차이가 생기는 위치, 검색의 효과, 추론 유도의 효과, 추론 특화 모형의 개선을 일련의 연구 문제로 다룬다. 핵심 비교는 세 가지다. 같은 주장을 글과 음성으로 바꿨을 때 성능이 어떻게 달라지는가. 검색한 근거를 제공하면 음성 검증이 개선되는가. 판단 과정을 유도하는 지시와 그에 맞춰 훈련된 모형이 근거 활용의 실패를 줄이는가.

이때 글 전용 모형과 음성모형을 비교하는 것만으로는 원인을 모두 분리할 수 없다. 음성모형 자체에 글을 넣는 조건도 필요하다. 연구는 이 조건을 추가해 모형의 다중양식 적응에서 생긴 차이와 입력을 소리로 바꿨을 때의 추가 차이를 나누었다.

4. 용어의 정의 (Key concepts)

음성언어모형(Large Audio Language Model, LALM)은 음성을 입력받아 언어 과제를 수행하는 AI다. 자동음성인식(Automatic Speech Recognition, ASR)은 소리를 문자로 옮기는 기능이며 사실검증과 동일하지 않다. 검색증강(Retrieval-Augmented Generation, RAG)은 외부 자료를 찾아 모델의 입력에 더하는 방식이다.

원자적 주장(atomic claim)은 한 번에 하나의 사실을 판단할 수 있도록 만든 짧은 문장이다. 추론 유도(chain-of-thought prompting)는 결론만 내는 대신 판단을 단계적으로 진행하도록 지시하는 조건을 가리킨다. 추론 특화 모형(thinking-tuned model)은 이런 처리에 맞게 별도로 조정된 모형이며, 지시문 하나만 바꾼 조건과 구분한다.

본문의 평균 정확도는 연도·장소·관계 유형별 정확도를 평균한 지표다. 세 유형의 문항 수가 다르므로 모든 문항을 합친 정답 수를 3,879로 나눈 값과 같은 것으로 읽지 않는다. 66.4%에서 86.1%로의 차이는 19.7%포인트이며, 상대적으로 19.7% 증가했다고 표현하지 않는다.

5. 연구 방법 (Method)

자료는 공개 인물 정보를 담은 KVQA 지식베이스에서 구성했다. 인물 659명, 60개 국가가 포함된다. 연구진은 전기에서 대명사가 없는 단일 주장을 추출하고 연도·장소·관계를 바꿔 틀린 대응 문장을 만들었다. 연도는 일정 범위에서 이동시키고, 장소나 인물은 같은 종류의 다른 값으로 바꾸는 방식이다. 결과 자료는 연도 1,451개, 장소 2,226개, 관계 202개로 총 3,879개다.

음성은 Coqui TTS의 단일 화자로 합성했다. 화자의 정체성이 정답을 추측하는 단서가 되지 않게 하려는 설계다. 검색에는 wav2vec 2.0으로 얻은 자동 전사문을 사용했다. 완벽한 원문을 검색 질의로 쓰는 것과 달리 전사 오류가 뒤 단계에 미치는 영향도 포함한다. 다만 실제 자연 발화 전체의 복잡성을 재현한 것은 아니다.

주요 비교 조건은 문자 전용 모형에 글을 제시한 경우, 음성모형에 글을 제시한 경우, 음성만 제시한 경우, 음성과 추론 유도, 음성과 전사 기반 검색, 음성과 전사 기반 검색·추론 결합이다. Qwen 계열, Audio-Flamingo, Phi 계열 등을 시험했다. 검색기 종류를 바꾸거나 음성 자체로 검색하는 조건도 살폈다.

정답 여부 외에 오류의 유형과 출력 형식을 검토했다. 요구한 답변 필드에 판정이 없으면 오답으로 처리한다. 따라서 낮은 점수에는 사실판단 실패와 답변 형식 준수 실패가 섞일 수 있다. 논문 부록은 같은 답만 반복하는 행동과 판정 추출 가능성을 별도로 다룬다.

6. 연구 결과 (Results)

첫 결과는 글의 성능이 음성으로 그대로 옮겨지지 않았다는 점이다. 예를 들어 Qwen-7B의 문자 기반 조건은 평균 75.3%였지만 대응하는 음성 조건의 Qwen-Audio-Chat은 50.4%, Qwen2-Audio-7B는 49.2%였다. 이는 각각 24.9%포인트, 26.1%포인트 차이다. 다만 서로 다른 인터페이스와 모형을 비교한 값이므로 이 전체 차이를 전사 오류 하나로 설명할 수는 없다.

둘째, 검색이 자동으로 올바른 판단을 보장하지 않았다. 검색한 문서가 참이라고 판단한 뒤, 그 문서와 내용이 다른 원래 음성 주장까지 참으로 처리하는 사례가 나타났다. 검증 대상은 처음 들은 주장이고 검색 결과는 그것을 확인하는 자료라는 관계가 유지되어야 한다.

셋째, 추론 지시와 추론 특화 훈련의 효과가 같지 않았다. 표 5에서 Audio-Flamingo-3는 음성만 제시했을 때 58.5%, 추론 유도만 추가했을 때 57.0%, 검색만 추가했을 때 60.0%, 둘을 결합했을 때 65.5%였다. 단순히 자세히 생각하라고 지시하면 모든 음성모형이 나아진다는 결론은 성립하지 않는다.

Audio-Flamingo-next-think는 같은 순서로 66.4%, 71.8%, 81.4%, 86.1%였다. 검색·추론 결합은 음성만 제시한 조건보다 19.7%포인트 높았다. 그러나 문자와 검색을 결합한 비교 조건은 92.4%였다. 가장 좋은 음성 결과도 문자 기반 검색 조건보다 6.3%포인트 낮으므로, 검색 없는 문자 기준만 골라 음성이 일반적으로 더 우수하다고 말해서는 안 된다.

7. 논의 및 현장 적용 (Discussion and application)

이 연구의 교육적 의미는 AI가 참·거짓을 대신 정하게 하는 데 있지 않다. 음성 정보를 검토하는 과정을 학생이 드러내게 만드는 데 참고할 수 있다. 먼저 짧은 발화에서 검증할 주장 하나를 적고, 사람과 AI의 전사문을 대조한다. 이어 출처에서 해당 사실을 찾고, 발화와 출처가 일치하거나 어긋나는 부분을 설명하게 한다. 마지막에는 AI의 결론과 학생 자신의 판단이 다른 이유를 확인할 수 있다.

수업에서 사용할 자료는 학생의 사적 대화 대신 교사가 준비한 공개·허용 자료로 제한할 수 있다. 평가 기준은 주장 추출의 정확성, 출처의 적합성, 불일치한 부분을 찾은 근거, 판단의 한계 설명으로 나눌 수 있다. 이 수업 절차는 본 분석이 제안하는 적용안이며 논문에서 학생을 대상으로 효과를 시험한 프로그램은 아니다.

교사는 전사 오류와 사실 오류를 따로 기록할 필요가 있다. 숫자나 고유명사를 잘못 받아쓴 경우에는 먼저 전사부터 고친다. 출처가 오래되었거나 서로 다르면 어느 시점의 주장인지 확인한다. 자료가 부족한데 이분법적 정답을 강요하면 학생도 도구도 불확실성을 숨길 수 있으므로, 수업 평가에는 판단을 보류한 이유를 설명하는 선택도 둘 수 있다.

8. 한계와 후속 연구 (Limitations and future research)

자료는 유명인 전기의 연도·장소·관계에 집중한다. 과학적 인과, 복잡한 수치, 여러 근거를 잇는 주장으로 바로 확대할 수 없다. 한 화자가 만든 합성 음성은 자연스러운 말의 끊김, 소음, 방언과 여러 언어를 충분히 반영하지 않는다. 검색 대상도 고정된 자료집이므로 실제 웹의 상충하거나 바뀌는 정보를 다룬 검증과 다르다.

후속 연구에서는 한국어 자연 발화와 다양한 화자, 교과별 주장을 포함한 평가가 필요하다. 동일 주장에 대해 사람이 검토한 전사문과 자동 전사문을 번갈아 사용하면 전사와 판단의 영향을 더 분명히 분리할 수 있다. 검색 자료의 정확성·최신성을 바꾸는 비교도 가능하다. 이때 성능과 함께 출처 추적, 판단 보류, 처리 시간과 비용을 기록해야 한다.

학생에게 적용하는 연구라면 AI의 정답률과 학생의 학습을 별도로 측정해야 한다. 도구를 사용한 과제의 질, 이후 도구 없이 수행한 검증 과제, 잘못된 AI 판정을 수정한 근거를 나누어 볼 수 있다. 원문은 이런 학습효과를 검증하지 않았으며, 이번 분석도 이를 효과가 확정된 수업으로 제시하지 않는다.

9. 주제어 (Keywords)

음성 사실검증(speech fact verification), 음성언어모형(large audio language model), 검색증강(retrieval-augmented generation), 자동음성인식(automatic speech recognition), 주장·근거 대조(claim–evidence comparison), 미디어 리터러시(media literacy).

10. APA 인용 및 근거 안내 (APA and source notes)

Mazumder, D., Mamta, & Penamakuri, A. S. (2026). To trust or not to trust: Retrieval-augmented fact checking in speech [Preprint]. arXiv.

arXiv v1의 저자명·공개일·전문을 확인하고 Semantic Scholar의 연도·공개일·외부 식별자를 대조했다. Semantic Scholar는 두 번째 저자를 Mamta Mamta로 표시하지만 원문과 arXiv가 사용하는 단일 이름 Mamta를 우선했다. 주요 근거 위치는 3절의 자료 구성, 4절의 비교 조건과 지표, 5절과 표 5의 결과, 6절의 추가 분석, 결론 뒤의 한계와 부록 B의 출력 형식 분석이다. 인용 시 동료심사 전 연구임을 밝히고 86.1%를 일반적인 음성 AI나 한국어 뉴스의 정확도로 표현하지 않는다.

← 2026-09-27 리포트로