분석 기준일: 2026년 9월 30일 · 일일 리포트 추천 논문 E03

원제: Between cognitive offloading and critical autonomy: a systematic review of the epistemic implications of generative AI in higher education

저자: Iván Claudio Suazo Galdames, Meylin Santiesteban Velázquez, Mahia Saracostti, Alain Manuel Chaple Gil

발행: Frontiers in Education, 11, Article 1878665 · 2026년 9월 3일 · 체계적 문헌고찰

논문 요약 (Abstract)

생성형 AI가 설명과 글쓰기를 돕는 대학 수업에서는 학생이 어떤 판단을 직접 했는지 확인하기 어려워질 수 있다. 이 연구는 AI 활용과 지식의 검증, 인지적 위임, 비판적 자율성의 관계를 경험연구에서 살폈다. 연구진은 2026년 5월 2일까지 여러 학술 데이터베이스를 검색하고 선별을 거쳐 대학 맥락의 연구 26편을 포함했다. 포함 연구는 질적 연구와 혼합방법 연구가 많았으며, 연구설계와 측정이 달라 메타분석 대신 서술적·주제별 종합을 수행했다. 설명을 비교하고 출처를 확인하도록 설계한 AI 활용은 성찰과 개념의 명료화가 나타나는 양상과 연결됐다. 편의를 위해 출력물을 받아들이는 활용은 출처 확인의 감소와 피상적 처리, 과의존이 보고되는 양상과 연결됐다. 저자들은 이를 바탕으로 지식의 검증, 수업 지원, 사람과 기술의 역할 조정, 시민적 책임을 함께 살피는 HEEP-HE 개념 틀을 제안했다. 그러나 자기보고와 횡단자료가 많은 연구들을 종합한 결과이므로 장기 인과효과나 이 개념 틀의 효과를 입증한 것은 아니다. 교사는 사용 횟수나 결과물의 완성도만 보지 않고 학생이 근거를 대조하고 선택을 설명한 과정을 확인하는 데 이 문헌고찰을 활용할 수 있다.

구조별 분석 (Structured analysis)

연구의 필요성 및 목적

학생은 AI의 도움으로 더 완성도 높은 글을 제출할 수 있다. 그렇다고 학생이 주장에 맞는 증거를 고르고 반론을 검토했다고 바로 판단할 수는 없다. 결과물의 수준과 학생이 수행한 사고를 구분하려면, AI가 맡은 일과 학생이 유지한 판단을 함께 보아야 한다.

이 논문은 생성형 AI의 이득과 위험을 각각 나열하는 데서 나아가, 어떤 활용에서 검토와 성찰이 나타났는지를 묻는다. 범위는 고등교육에서 보고된 경험연구다. 초중등 수업이나 장기간의 사고 능력 변화 전체를 평가한 연구로 읽어서는 안 된다.

연구 문제

원문의 목적과 분석 흐름을 교사의 질문으로 풀면 세 가지다. AI를 쓰는 학생은 정보의 신뢰성과 저자성을 어떻게 판단하는가. 어떤 수업 조건에서 AI가 사고의 보조가 되고, 어떤 조건에서 판단의 위임으로 이어지는가. 여러 연구의 결과를 연결해 교육기관이 살필 공통 기준을 제시할 수 있는가. 이는 원문 연구 질문의 축자 번역이 아니라 분석 범위를 이해하기 위한 재구성이다.

용어의 정의

  • 인지적 위임·외부화 (cognitive offloading): 기억·설명·계획 같은 인지 작업의 일부를 도구에 맡기는 일이다. 위임 자체가 학습 손실을 뜻하지 않으며 무엇을 맡겼는지가 중요하다.
  • 비판적 자율성 (critical autonomy): 주장의 근거를 검토하고, 채택하거나 거절한 이유를 자기 판단으로 설명하는 능력이다.
  • 인식적 행위주체성 (epistemic agency): 지식을 받아들이는 데 그치지 않고 증거를 평가하며 최종 주장에 책임을 지는 참여를 뜻한다.
  • 조정된 위임 (calibrated delegation): 초안 생성이나 표현 수정은 도움을 받더라도 최종 해석과 근거 확인은 사람이 맡도록 역할을 조절하는 일이다.
  • HEEP-HE: Hybrid Epistemic Engagement Practices in AI-Mediated Higher Education의 약칭이다. AI가 매개하는 대학 학습에서 지식의 생산과 검증을 함께 살피려는 잠정적 개념 틀이다.

연구 방법

검색은 Scopus, Web of Science와 EBSCOhost를 통해 접근한 7개 데이터베이스에서 이루어졌다. 최종 검색일은 2026년 5월 2일이다. 7,215개 기록에서 중복 3,122개를 제거해 4,093개가 남았다. 연구진은 Rayyan에서 사전에 정한 기준을 적용한 자동 적격성 평가로 3,962개를 제외했고, 정보가 모호한 기록은 사람의 검토로 넘겼다고 설명한다.

사람의 제목·초록 심사에 들어간 기록은 131개였다. 이 중 101개를 제외하고 30개 전문을 구했으며, 구하지 못한 1개를 뺀 29개를 심사했다. 전문 심사에서 3개를 제외해 최종 26편을 포함했다. 두 검토자가 독립적으로 심사하고 불일치를 조정했으며, 논문이 보고한 검토자 간 일치도는 Cohen의 카파 0.85다. 이 값은 보고된 사람의 심사 일치도를 나타내며 자동 제외 단계의 누락률을 검증하는 값은 아니다.

  • 질적 연구 11편: 사용 경험과 맥락을 설명하지만 모집단의 평균 효과를 추정하지 않는다.
  • 혼합방법 연구 7편: 수치와 경험을 함께 읽되 각각의 표집과 측정을 확인해야 한다.
  • 분석적 횡단연구 4편: 같은 시점의 관계로 인과의 방향을 확정하기 어렵다.
  • 준실험 2편: 비교집단과 사전 차이의 통제를 확인해야 한다.
  • 무작위 대조실험 2편: 포함되어 있다는 사실만으로 26편 전체가 실험적 근거가 되지는 않는다.

연구진은 설계에 맞는 질 평가를 거쳐 자료를 정리하고, 서술적 지도화와 주제별 종합, 개념 틀에 대한 대응 작업을 수행했다. 연구마다 사고·학습·AI 사용을 측정하는 방식이 달라 하나의 평균 효과로 합치는 메타분석은 하지 않았다. 따라서 특정 수치의 학습 향상률을 이 논문에서 끌어낼 수 없다.

연구 결과

첫째, AI의 설명을 비교하고 출처를 대조하게 하는 활동에서는 성찰, 개념의 명료화, 반복적인 추론과 자기조절학습에 관련된 양상이 보고됐다. 결과물을 빨리 얻는 데 치우친 활동에서는 검토를 덜 하고 AI의 표현을 그대로 받아들이는 양상이 나타났다. 연구진은 이 차이를 AI 사용의 단일한 효과로 단정하지 않고 수업 조건과 사용 방식에 따라 달라지는 관계로 해석했다.

둘째, 기술을 능숙하게 조작하는 것과 AI가 제시한 지식을 판단하는 것은 구별됐다. 질문을 잘 입력하는 능력만으로 출처의 적절성, 잘못된 인용, 과도한 확신을 검토할 수 있다고 보기는 어렵다. 문헌고찰은 결과의 그럴듯함과 근거의 확인 가능성을 나누어 보는 AI 리터러시를 강조한다.

셋째, 저자성과 책임이 함께 문제로 나타났다. AI를 사용했는지를 공개하는 것만으로는 학생이 어떤 판단을 했는지 설명되지 않는다. 주장을 채택한 이유, 확인한 자료, 사람이 수정한 부분을 추적할 수 있어야 최종 결과에 대한 책임도 구체화할 수 있다는 해석이다.

HEEP-HE는 이러한 주제를 네 영역으로 연결한다. 지식의 검증 영역에서는 출처 대조와 주장 확인을, 수업 영역에서는 설명·비교·성찰을 요구하는 과제 설계를 다룬다. 사람과 기술의 관계에서는 맡겨도 되는 작업과 사람이 책임질 판단을 조정한다. 시민적 영역에서는 잘못된 정보와 편향을 검토하고 공적 논의에 책임 있게 참여하는 문제로 범위를 넓힌다. 다만 마지막 영역은 포함 연구에서 직접 다룬 경험적 근거가 상대적으로 적어, 다른 영역과 같은 수준의 실증 지지를 받는다고 보면 안 된다.

논의 및 결론

이 논문에서 직접 얻을 수 있는 결론은 사용의 맥락과 검증 행동을 함께 보아야 한다는 것이다. AI 사용이 장기적으로 비판적 사고를 쇠퇴시킨다는 결론도, 일정한 지원 절차가 누구에게나 자율성을 높인다는 결론도 아니다. 저자들은 원연구의 결과, 종합팀의 해석, 교육적 권고를 구분하며 HEEP-HE를 추가 검증이 필요한 개념적 확장으로 제시한다.

교실 적용을 생각한다면, 학생에게 AI 답변 전체를 제출하게 하기보다 채택한 주장 하나와 대조한 원전, 수정한 이유를 연결해 설명하게 할 수 있다. 가령 탐구보고서의 한 문단에 대해 “AI가 제안한 설명 중 무엇을 남겼으며 어떤 자료 때문에 바꾸었는가”를 묻는 방식이다. 이후 같은 개념을 도구 없이 짧게 설명하게 하면 결과물의 완성도와 학생의 이해를 따로 관찰할 수 있다. 이 예는 문헌고찰을 바탕으로 이 분석문에서 제안한 수업 절차이며, 논문이 효과를 검증한 프로그램은 아니다.

지원량도 학생에 따라 조정할 필요가 있다. 초보 학습자에게 모든 설명을 스스로 검증하라고 요구하면 필요한 개념이나 출처 접근 방법이 없어 과제가 막힐 수 있다. 교사는 대조할 원전과 확인 질문을 먼저 제공하고, 학생이 익숙해지면 선택의 범위를 넓히는 방식을 시험할 수 있다. 대학 자료를 초중등에 적용할 때에는 읽기 수준과 교과의 증거 기준을 다시 설계해야 한다.

해석에는 세 한계가 남는다. 자기보고·횡단자료와 서로 다른 측정이 많아 변화의 원인과 지속 기간을 분리하기 어렵다. 동료심사 자료 중심의 검색과 5월 2일의 검색 마감 때문에 회색문헌이나 이후 연구가 빠질 수 있다. 또한 많은 기록이 초기 자동 적격성 평가에서 제외됐으므로 그 단계의 민감도를 별도로 검토할 필요가 있다. 마지막 지점은 실제 누락이 확인됐다는 지적이 아니라 이 분석문이 제기하는 방법상의 확인 과제다.

원문을 다시 확인할 때에는 연구 방법의 검색·선별 절, 결과 3.1의 선별 흐름, 포함 연구의 특성, 주제별 종합과 3.5의 개념 틀을 함께 읽으면 된다. 논의 4.1과 결론은 인과 해석의 범위와 HEEP-HE의 잠정적 성격을 명시한다. 인용할 때에는 “대학의 AI 활용을 검증 행동과 수업 설계의 관계로 설명한 문헌고찰”이라는 맥락이 적절하다.

후속 연구 제안

검증 활동을 요구하는 수업과 결과물만 제출하는 수업을 비교하되, AI가 없는 전이 과제와 지연 평가를 함께 측정할 필요가 있다. 그래야 도구를 쓰는 동안의 수행 향상과 학생에게 남은 능력을 구분할 수 있다. 자기보고 외에 수정 이력, 출처 대조의 정확도, 선택 이유의 질을 함께 모으면 어떤 사고가 실제로 이루어졌는지도 확인할 수 있다.

HEEP-HE의 네 영역은 먼저 관찰 가능한 행동으로 구체화해야 한다. 교과·학년·사전 지식에 따라 같은 기준이 적절한지 검토하고, 자동 선별에서 제외한 기록의 표본을 사람이 재검토하는 감사도 검색의 누락 가능성을 평가하는 데 도움이 된다. 이들은 원문의 장기·실험·학문 분야별 연구 필요성을 토대로 구체화한 후속 설계 제안이다.

주제어

생성형 인공지능 (generative AI), 고등교육 (higher education), 인지적 위임 (cognitive offloading), 비판적 자율성 (critical autonomy), 인식적 행위주체성 (epistemic agency), 출처 검증 (source verification), 체계적 문헌고찰 (systematic review)

APA 인용

Suazo Galdames, I. C., Santiesteban Velázquez, M., Saracostti, M., & Chaple Gil, A. M. (2026). Between cognitive offloading and critical autonomy: A systematic review of the epistemic implications of generative AI in higher education. *Frontiers in Education, 11*, Article 1878665. https://doi.org/10.3389/feduc.2026.1878665

본문 내 인용: Suazo Galdames et al. (2026) 또는 (Suazo Galdames et al., 2026).

← 2026-09-30 리포트로