Wiktor Werner의 「AI’s Personas and Historical Knowledge: How Models Transform Textbook Questions into Narratives」 상세 분석
Sensus Historiae, 62(1), 61–78 · 2026년 · 분석 기준일 2026년 10월 2일
초록 요약
이 연구는 같은 역사 교과서 질문에 답하더라도 AI의 역할과 자료 제공 방식에 따라 서술이 어떻게 달라지는지 살폈다. 연구자는 폴란드어 교과서에서 질문 5개를 골라 네 가지 AI 사용 조건에 제시했다. 기본 대화형 AI, 연구자 역할을 부여한 AI, 교과서에 근거해 답하는 검색 기반 도구, 같은 자료를 활용하는 에이전트가 비교 대상이다. 분석은 사실과 출처, 수사와 가치 판단, 형식적 가독성, 논리와 인과 설명을 함께 다뤘다. 기본 조건은 비교적 압축된 답을 제시했고, 연구자 역할은 판단 기준과 해석을 더 드러냈다. 교과서 기반 답변에서는 자료에 충실한 듯한 문체와 함께 연도가 뒤바뀐 오류도 관찰됐다. 어휘와 문장 길이의 차이는 학생의 실제 이해도나 학습효과를 직접 보여 주지 않는다. 네 조건은 모델·설정 등 여러 요소가 함께 달라 도구의 순수한 성능 차이를 추정하는 실험으로 보기 어렵다. 역사 수업에는 AI의 문장 완성도와 별도로 사실·해석·가치 판단을 구분해 출처를 확인하는 활동을 설계하는 데 참고할 수 있다.
연구의 필요성과 목적
역사 질문에는 사실을 재현하는 과제와 사건의 의미를 판단하는 과제가 섞여 있다. “언제 일어났는가”에는 날짜가 중요하지만, 누군가를 위대하다고 부를 수 있는지를 묻는 질문에는 평가 기준이 필요하다. 같은 답변 안에서도 확인 가능한 사실과 해석, 가치 판단이 서로 다른 역할을 한다. AI가 이들을 자연스럽게 연결하면 독자는 그 연결 자체를 근거로 받아들이기 쉽다.
이 논문은 AI의 답변을 정답률 하나로 평가하기보다 하나의 역사 서술로 읽는다. 어떤 사실을 고르는지, 누구의 관점을 중심에 놓는지, 원인과 결과를 어떻게 연결하는지, 확신을 어떤 문체로 표현하는지를 함께 살핀다. 특히 역할 설정과 검색 자료 제공이 서술의 권위와 사실 정확성에 미치는 영향을 구별하려 한다.
교사가 참고할 지점은 AI가 교과서를 읽었는지 여부만으로 답변의 신뢰성을 결정하기 어렵다는 것이다. 자료를 인용하는 답변에서도 연도나 인과 관계는 틀릴 수 있다. 반대로 짧고 단순한 답변이라고 해서 반드시 사실성이 낮은 것도 아니다. 연구는 이 차이를 구체적인 텍스트 비교로 보여 준다.
연구 질문
논문이 다루는 질문은 세 가지로 정리할 수 있다. 첫째, 같은 교과서 질문을 AI의 역할과 사용 조건을 달리해 제시하면 어떤 사실과 설명 방식이 선택되는가. 둘째, 자료를 검색해 답하도록 했을 때 출처를 활용하는 방식과 역사적 정확성은 어떻게 연결되는가. 셋째, 읽기 쉬워 보이는 문체와 논리적 설명, 사실의 정확성은 서로 일치하는가.
이 질문들은 학생의 점수가 얼마나 올랐는지를 묻지 않는다. 분석 대상은 AI가 생성한 서술이며, 결과를 교수법의 효과 크기나 학생의 역사 이해도 변화로 바꾸어 해석해서는 안 된다.
주요 개념
페르소나(persona)는 AI가 어떤 역할의 화자로 답하도록 지시하는 설정이다. 연구자처럼 답하라는 요청은 설명의 형식과 판단 기준을 바꿀 수 있다. 다만 실제 역사학자의 검토나 전문성 검증이 추가되는 것은 아니다.
검색 증강 생성(retrieval-augmented generation, RAG)은 제공된 자료를 찾아 그 내용을 바탕으로 답을 생성하는 방식이다. 이 연구에서는 교과서를 공유 자료로 활용한 조건이 해당한다. 자료에 접근할 수 있다는 사실과 그 자료를 오류 없이 해석·재현한다는 주장은 구별해야 한다.
출처에 근거한 서술(source anchoring)은 답변의 주장을 자료에 연결하는 일이다. 사실성(substantive accuracy)은 사건·인물·연도·개념 등이 정확한지를 뜻한다. 출처를 제시했더라도 인용한 내용을 잘못 옮기면 사실성은 확보되지 않는다.
평가적 입장(evaluative stance)은 사건이나 인물을 어떤 기준으로 좋거나 나쁘다고 판단하는지를 가리킨다. “위대하다” 또는 “최고의 가치다”와 같은 표현은 기준과 관점을 드러내야 검토할 수 있다. 역사 서술의 규범적 판단을 사건에 대한 경험적 설명과 섞지 않는 것이 중요하다.
가독성(readability) 지표는 단어와 문장 구조에서 읽기 난도를 추정한다. 이 논문은 폴란드어 원문에서 어휘 다양성과 문장 길이 등을 살핀다. 지표가 높거나 낮다는 사실만으로 특정 학년 학생이 실제로 더 잘 이해했다고 결론 내릴 수는 없다.
연구 방법
자료와 비교 조건
질문은 5~8학년용 교과서 「Europa. Nasza historia」에서 골랐다. 주제는 알렉산드로스를 위대하다고 평가하는 기준, 장원·농노제 아래 농민과 귀족의 이해관계, 민족을 최고 가치로 보는 관점, 스탈린의 계획경제, 브렉시트였다. 사실을 나열하는 문제뿐 아니라 관점과 가치 판단, 인과 설명이 필요한 질문을 포함했다.
기본 ChatGPT 조건은 별도의 연구자 역할 없이 답했다. 연구자 역할 조건은 분석적 화자의 역할을 부여했다. NotebookLM 조건은 공유 교과서를 검색 자료로 사용했다. 에이전트 조건은 같은 지식 자료를 활용하도록 구성했다. 질문 5개와 조건 4개의 조합이 분석의 기본 단위다.
자료 생성은 논문에 제시된 2026년 2월 15일의 실행을 기준으로 한다. 그러나 모델 버전, 생성 온도, 각 서비스의 내부 프롬프트와 검색 설정이 모두 통제·공개된 것은 아니다. 따라서 결과는 당시의 구체적인 사용 조건을 비교한 것으로 읽어야 한다. 페르소나나 검색 기능 하나만의 인과 효과를 분리한 설계는 아니다.
분석의 네 축
내용 분석에서는 사실·개념·연대와 출처의 연결을 살폈다. 수사 분석에서는 확신의 표현, 가치 판단, 누구의 관점을 중심에 놓는지를 검토했다. 형식 분석에서는 문장 길이와 어휘 다양성, 가독성 관련 지표를 사용했다. 논리 분석에서는 주장과 근거의 연결, 인과 설명과 비교의 일관성을 살폈다.
단순 어휘 다양성 지표인 TTR은 글의 길이에 영향을 받는다. 논문은 MTLD 등 다른 지표도 함께 사용하지만, 어느 지표도 학생 독해 실험을 대신하지 않는다. 분석 대상은 폴란드어 원문이며, 이 수치를 한국어 번역문이나 국내 학년별 읽기 수준에 그대로 적용하기 어렵다.
주요 결과와 근거
역할은 설명의 방식과 판단 기준을 바꾸었다
기본 대화형 AI의 답은 비교적 압축되고 일반적인 설명에 가까웠다. 연구자 역할을 부여한 답은 평가 기준을 명시하거나 규범적 주장과 경험적 주장을 구분하려는 경향을 보였다. 다만 분석적 문체가 길어지는 과정에서 원래 교과서 질문의 수준이나 과제 형식에서 벗어나는 경우도 있었다.
에이전트 조건의 답은 교사가 설명하듯 구조화된 모습을 보였지만, 정형화된 설명 방식도 나타났다. 이는 구조가 잘 보인다는 장점과 특정 형식이 반복된다는 특성을 함께 보여 준다. 구조적인 답이 역사적 판단을 더 정확하게 했다는 뜻은 아니다.
이 결과를 수업에 적용할 때는 “역사학자처럼 써라”는 역할 지시 뒤에 무엇이 실제로 달라졌는지 확인할 수 있다. 평가 기준이 추가됐는지, 출처가 명확해졌는지, 단지 설명만 길어졌는지를 구분해야 한다. 역할 부여 자체가 사실 검증을 대신하지 않는다.
자료를 검색하는 조건에서도 연도 오류가 있었다
NotebookLM의 답은 교과서의 내용을 풍부하게 끌어오고 권위 있는 설명처럼 읽히는 경우가 있었다. 그러나 스탈린의 계획경제를 다룬 대목에서 1927이 1792로 뒤바뀐 사례가 관찰됐다. 논문은 주변의 설명 흐름이 그럴듯한데도 핵심 연대가 무너질 수 있다는 점을 분석한다.
이 사례의 의미는 검색 기반 AI가 언제나 다른 도구보다 부정확하다는 것이 아니다. 질문과 출력의 수가 적어 도구별 오류율을 추정할 수 없기 때문이다. 확인할 수 있는 것은 출처를 활용한 문체와 사실의 정확성이 자동으로 일치하지 않았다는 점이다. 교과서를 제공한 뒤에도 날짜와 사건의 관계를 확인할 이유가 남는다.
교과서의 관점도 함께 전달될 수 있었다
자료에 충실한 답변은 교과서의 관점이나 규범적 표현도 옮길 수 있다. 역사 자료에 근거한다는 말이 모든 관점에서 중립적이라는 뜻은 아니다. 인물이나 제도의 평가를 다룰 때는 어떤 기준이 선택됐는지, 다른 집단의 이해관계가 빠졌는지 검토할 수 있어야 한다.
가령 농민과 귀족의 관계를 묻는 질문에서는 어느 집단의 비용과 이익을 중심으로 설명하는지가 중요하다. 민족이나 정치적 선택을 다룬 질문에서는 사실에 관한 주장과 바람직함에 관한 판단이 섞일 수 있다. AI의 서술을 읽는 활동은 이 구분을 드러낼 때 역사적 사고를 검토하는 과제가 된다.
형식의 차이는 학습효과의 차이가 아니다
논문은 문장 길이와 어휘 다양성, 가독성 지표에서 조건별 차이를 보고한다. 이러한 지표는 답변의 형식을 비교하는 데 도움이 된다. 그러나 실제 학생에게 읽게 한 뒤 이해도나 기억, 사료 해석 능력을 측정하지 않았으므로 어떤 답이 수업에서 더 효과적이라고 판단할 수는 없다.
설명이 길어지면 판단 기준을 충분히 제시할 수도 있고 불필요한 부담이 늘어날 수도 있다. 이 연구에서는 그 교육적 결과를 직접 비교하지 않았다. 교사는 대상 학년과 과제 목적을 고려해 자료를 조정하고 학생의 설명을 별도로 확인해야 한다.
논의와 현장 적용
교사: 검토할 단위를 먼저 정한다
AI 답변 전체에 “맞다” 또는 “틀리다”를 붙이기 전에 검토 단위를 나눌 수 있다. 사건·인물·연도는 원문과 직접 대조한다. 인과 설명은 답변이 연결한 원인과 결과를 표시하고 이를 뒷받침하는 자료가 있는지 확인한다. 가치 판단은 어떤 기준과 관점이 쓰였는지 문장 옆에 적는다.
이는 논문에서 효과를 검증한 수업 절차가 아니라 분석 결과를 바탕으로 한 적용 제안이다. 처음에는 짧은 답변 하나와 교과서의 관련 문단을 사용하면 검토할 범위가 분명해진다. 자료를 찾지 못한 주장은 검증이 끝난 주장과 구별해 두고, 교사가 추가 자료를 제공할 수 있다.
학생: 수정한 이유를 설명한다
학생에게는 AI의 원래 문장, 확인한 출처의 관련 부분, 자신의 수정 문장, 수정 이유를 함께 남기게 할 수 있다. 연도를 고쳤다면 대조한 근거를, 가치 판단을 고쳤다면 바꾼 기준을 설명하도록 한다. 단순히 표현을 자연스럽게 바꾼 것과 역사적 근거를 바로잡은 것을 구별하기 위해서다.
활동 후에는 AI 문장을 보지 않고 해당 사건이나 판단을 자기 말로 설명하게 할 수 있다. 이는 학생이 무엇을 이해했는지 확인하기 위한 별도 점검이다. 논문은 이 점검 방식의 효과를 측정하지 않았으므로 수업 적용 후 학생의 실제 반응과 수행을 확인해야 한다.
연수 담당자: 도구 순위보다 검토 사례를 공유한다
교사 연수에서는 같은 질문의 답변 두 개를 놓고 사실·출처·해석·문체를 각각 비교하는 사례를 만들 수 있다. 어떤 도구가 더 좋았는지 투표하는 것으로 끝내기보다 판단의 근거가 무엇이었는지 기록하는 편이 연구의 문제의식에 가깝다. 실행 날짜와 역할 지시, 제공 자료를 남겨야 다른 교사도 결과의 조건을 이해할 수 있다.
민감한 역사 쟁점에서는 교과서 한 권의 서술만으로 관점 검토를 마쳤다고 보기 어렵다. 서로 다른 해석을 다루려면 수업 목적에 맞는 추가 사료와 설명이 필요하다. 이는 출처가 있다는 사실과 충분한 근거를 갖췄다는 판단을 구별하는 문제다.
한계와 후속 연구
분석은 질문 5개와 네 사용 조건에 기반하므로 역사 질문 전체를 대표하지 않는다. 폴란드어 교과서와 당시 서비스 설정의 특성도 결과에 포함된다. 여러 조건에서 모델·역할·검색 자료·시스템 구성이 함께 달라 각 요소의 독립적인 효과를 추정하기 어렵다.
학생을 대상으로 한 실험이 없고, 질적 판단의 재현성을 충분히 확인할 독립 평가 정보도 제한된다. 가독성 지표가 학생의 실제 이해도를 대신할 수 없다는 점까지 고려하면 이 논문은 교수법의 성과 입증보다 검토 관점과 사례를 제공하는 연구로 읽는 것이 적절하다.
후속 연구에서는 질문과 시대·주제를 늘리고, 같은 모델에서 역할이나 자료 조건을 하나씩 바꾸며, 여러 독립 평가자의 사실·논리 판단을 비교할 수 있다. 학생 대상 연구라면 출처 대조 활동 전후의 오류 발견, 수정 이유 설명, 독립적인 역사 서술을 함께 측정할 필요가 있다. 이 방향들은 이번 분석에서 도출한 후속 연구 제안이다.
근거와 인용 범위
설계와 질문·조건의 설명은 원문 방법 부분에, 연도 치환 사례와 문체의 차이는 결과·논의 부분에 근거한다. 어휘·가독성 지표는 원문의 형식 분석과 표를 확인했다. 위의 수업 활동과 연수 운영안은 연구진이 효과를 검증한 처방이 아니라 이 리포트의 적용 제안이다.
이 논문은 “자료 검색이나 전문가 역할 설정 뒤에도 역사적 사실을 별도로 확인해야 한다”는 주장의 사례 근거로 인용할 수 있다. 특정 도구가 항상 더 틀린다거나 AI가 학생의 역사 이해도를 떨어뜨린다는 주장의 근거로 사용해서는 안 된다.
키워드
역사교육, 생성형 AI, 페르소나, 검색 증강 생성, 사실 검증, 역사 서술, 가치 판단, 가독성
APA 참고문헌과 원문
Werner, W. (2026). AI’s personas and historical knowledge: How models transform textbook questions into narratives. Sensus Historiae, 62(1), 61–78. https://doi.org/10.14746/sh.2026.62.1.004
- 원문: https://presstoarch.amu.edu.pl/index.php/sh/article/view/54933
- DOI: https://doi.org/10.14746/sh.2026.62.1.004
출판사 제공 18쪽 전문과 서지정보를 대조했다. 위 내용은 원문의 결과, 해석의 한계, 리포트의 적용 제안을 구분해 재구성했다.