Chiara Boolzen 외 5명 · Artificial Intelligence Review, 59(10), Article 223 · 온라인 게재 2026년 8월 25일
1. 논문 요약
생성형 AI를 사용하는 수업의 연구는 빠르게 늘었지만 도구 만족도와 실제 학습효과가 섞여 소개되기 쉽다. 이 연구는 STEM 교육에서 생성형 AI와 상호작용한 학습자의 인지적 성과를 종합하고 효과를 해석할 조건을 살폈다. 연구진은 비교집단을 갖춘 동료심사 연구 85편을 문헌고찰에 포함했으며, 이 중 49편의 59개 효과크기가 메타분석 기준을 충족했다. 일반 무선효과 모형의 평균은 Hedges g=0.839였지만 연구 간 이질성 I²는 96.32%로 높았다. 새로운 연구의 효과 범위를 가늠하는 예측구간은 −1.52~3.20으로 음수와 양수를 모두 넓게 포함했다.
출판편향을 고려한 강건 베이지안 모형의 평균은 0.076, 95% 신용구간은 −0.37~0.79로 나타났다. 학습성과가 지식인지 기능인지와 AI가 학생의 활동을 어떻게 바꾸는지가 연구 간 차이의 일부를 설명했다. 그러나 모든 포함 연구의 비뚤림 위험이 높았고 학습자의 실제 사용 과정과 평가 도구의 보고도 충분하지 않았다. 따라서 생성형 AI의 보편적 효과를 단정하기보다 비교집단의 활동, 측정한 성과, 출판편향을 함께 따져야 하며 활동 유형에 따른 차이도 확정적인 수업 처방으로 옮길 수 없다.
2. 연구의 필요성 및 목적
같은 “AI 활용 수업”이라는 이름 아래 서로 다른 활동이 들어간다. 어떤 학생은 AI가 준 답을 읽고, 다른 학생은 설명을 비교하거나 자신의 가설을 수정한다. 비교집단이 무엇을 했는지도 다르다. AI 집단이 더 많은 피드백과 상호작용 기회를 받았다면 점수 차이는 도구뿐 아니라 활동 차이에서도 생길 수 있다.
연구진은 STEM 분야의 인지적 학습성과에 초점을 맞췄다. 외부 평가로 측정한 성과를 정량 통합하고, 학습자가 겪는 어려움과 이를 지원하는 교수 개입은 근거가 충분한 범위에서 서술적으로 정리했다. 만족도나 유용성 인식을 인지적 성과의 효과크기에 섞어 넣지 않았다는 점이 중요하다.
3. 연구 문제
- 생성형 AI와의 상호작용은 STEM 인지적 학습성과를 어느 정도 높이며, 어떤 조건이 연구 간 차이를 설명하는가?
- 학습자는 AI와 상호작용하면서 어떤 어려움을 겪는가?
- 어떤 교수 개입과 지원이 이러한 상호작용을 돕는가?
첫째 질문은 메타분석과 조절변수 분석으로 다뤘다. 둘째와 셋째 질문은 보고 방식이 일정하지 않고 수량적으로 합치기 어려워 제한을 명시한 서술 분석으로 다뤘다. 따라서 세 질문에 똑같은 수준의 확실한 효과 추정치가 제시된 것은 아니다.
4. 용어의 정의
- Hedges g: 집단 간 점수 차이를 표준화하고 작은 표본의 편향을 보정한 효과크기다. 0.839를 시험 점수 83.9% 향상으로 해석하면 안 된다.
- 무선효과 모형(random-effects model): 연구마다 실제 효과가 다를 수 있다고 가정하고 평균과 연구 간 차이를 추정하는 방법이다.
- 이질성(heterogeneity): 연구들의 효과가 서로 다른 정도다. I²=96.32%는 학생의 96.32%에게 효과가 다르다는 뜻이 아니다.
- 신뢰구간(confidence interval): 사용한 통계 절차 아래 평균 효과 추정의 불확실성을 나타낸다.
- 예측구간(prediction interval): 연구 간 차이를 고려해 새로운 연구의 실제 효과가 어느 범위에 나타날지 가늠한다. 평균 효과의 신뢰구간보다 질문의 대상이 넓다.
- 출판편향(publication bias): 연구 결과의 크기나 유의성에 따라 출판될 가능성이 달라져 공개 연구의 집합이 치우칠 수 있는 현상이다.
- 강건 베이지안 메타분석(RoBMA): 효과·이질성·선택 편향 등에 관한 여러 모형을 함께 고려해 추정하는 방법이다. 결과는 모형의 가정과 이용 가능한 연구에 의존한다.
- 신용구간(credible interval): 사용한 자료와 베이지안 모형 아래 모수에 부여한 확률 범위다. 이 논문의 ±0.254는 사후 표준편차이며 95% 구간 그 자체가 아니다.
- ICAP과 ISAR: ICAP은 학습자의 인지적 참여 수준을 구별한다. ISAR는 AI 집단과 비교집단의 활동을 비교해 대체·증강·재정의 등의 관계를 코딩한다. 도구 이름만으로 활동의 수준이 정해지지는 않는다.
5. 연구 방법
검색과 선정
ERIC, PsycINFO, Web of Science 검색을 2026년 5월 7일까지 갱신하고 인용 추적을 더했다. 2017년 이후 발표된 동료심사 정량 연구 중 비교 또는 통제집단을 갖추고 학습자와 생성형 AI의 상호작용을 다룬 STEM 연구를 선별했다. 두 쌍의 평가자가 독립적으로 선별·코딩했으며 검토 계획은 AsPredicted에 사전등록했다.
적격 연구는 85편이었다. 그중 49편의 59개 효과크기가 정량 통합 기준을 충족했다. 본문은 이상치 한 개를 제외하는 분석 절차도 설명한다. 따라서 이 수치는 포함 기준을 충족한 자료 규모이며 모든 후속 모형에서 똑같은 관측치가 쓰였다고 단정하지 않는다. 메타분석 대상은 대학 수준 25편, 초·중등 23편, 수준이 명확하지 않은 1편으로 구성됐다.
효과 추정과 추가 분석
우선 무선효과 메타분석으로 평균 효과와 이질성을 추정했다. 다음으로 깔때기 그림의 비대칭과 출판편향을 검토하고 RoBMA를 적용했다. 학습성과 유형과 학습 활동 관계 등이 이질성을 설명하는지도 살폈다. 이 조절변수 분석은 개별 연구들의 특성을 비교하는 것이므로 학습자에게 활동을 무작위 배정해 얻은 인과효과와 다르다.
학습자의 어려움과 지원 개입은 정량 통합을 위한 보고가 부족했다. 이 부분은 연구에서 무엇이 보고됐고 무엇이 빠졌는지를 함께 정리하는 방식이다. 보고 빈도가 낮다고 해당 어려움이 실제로 드물다고 볼 수 없으며, 보고된 지원이 보편적으로 효과적이라는 뜻도 아니다.
6. 연구 결과
일반 평균과 출판편향 보정값
일반 무선효과 모형은 Hedges g=0.839, 95% 신뢰구간 0.53~1.15를 보고했다. 이 수치만 읽으면 전반적으로 큰 양의 효과로 받아들이기 쉽다. 그러나 I²=96.32%의 높은 이질성과 −1.52~3.20의 예측구간은 새로운 맥락에서 같은 결과를 기대하기 어렵다는 점을 보여 준다.
RoBMA의 출판편향 보정 평균은 0.076이었다. 95% 신용구간은 −0.37~0.79로, 부정적 효과와 긍정적 효과를 모두 포함했다. 이는 평균 효과의 낙관적인 해석이 출판편향에 민감하다는 결과다. 모든 AI 수업이 효과가 없다는 증거도, 모든 맥락에서 소폭의 양의 효과가 있다는 확정도 아니다.
보정 뒤에도 연구 간 이질성은 크게 남았다. 즉 출판편향만 제거하면 하나의 안정적인 평균으로 설명할 수 있는 자료가 아니었다. 개별 수업의 목표·학습자·활동·평가를 함께 살펴볼 이유가 여기에 있다.
지식과 기능, 학습 활동의 차이
학습성과를 지식과 기능으로 구별한 변수는 연구 간 이질성의 12.5%를 설명했다. ISAR로 비교한 학습 활동 관계는 13.0%를 설명했다. 두 값은 각각의 분석 결과이므로 단순히 더해 25.5%를 설명한다고 말해서는 안 된다. 남은 이질성이 크다는 사실도 함께 남는다.
출판편향 보정을 적용한 조절변수 분석에서도 지식 성과와 활동 증강·재정의 쪽이 더 유리한 양상을 보였다. 연구진은 큰 효과를 보고한 33개 연구에서 AI 집단과 비교집단의 인지 활동이 서로 비교 가능하지 않았다는 문제도 지적했다. 이런 차이는 AI 도구의 효과와 활동 설계의 효과를 분리하기 어렵게 만든다.
예를 들어 AI 집단은 대화를 통해 설명을 만들고 비교집단은 자료만 읽었다면 도구와 인지 활동이 동시에 달라진다. 이 예는 원문의 분석 논리를 설명하기 위한 상황이며, 해당 조합의 효과를 따로 검증한 수업 사례가 아니다. 지식 목표와 특정 활동 조합만 갖추면 큰 효과가 보장된다는 충분조건도 분석에서 성립하지 않았다.
어려움과 지원에 관한 근거
문헌에는 프롬프트 작성의 어려움, 일반적인 응답, 검증 부담, 인지적 부담 등이 나타났다. 그러나 32개 연구는 어려움을 보고하지 않았고, 학습자 수준과 실제 상호작용 과정의 기록도 일정하지 않았다. 어려움을 보고하지 않았다는 것과 어려움이 없었다는 것은 다르다.
따라서 지원 방안을 하나의 효과 순위로 제시할 수 없다. 프롬프트 안내나 검증 활동을 제공했다는 사실을, 그것이 어떤 학습자에게 얼마만큼 효과적이었는지와 구별해야 한다. 저자들이 제시한 통합 틀과 여섯 후속 가설도 검증을 마친 처방이 아니라 앞으로 시험할 설명이다.
7. 논의 및 결론
어떤 주장을 뒷받침하는가
이 논문은 생성형 AI의 학습효과를 평균 하나로 소개할 때 생기는 문제를 구체적으로 보여 준다. 비교집단의 인지 활동이 다르면 도구의 기여를 분리하기 어렵고, 출판편향을 보정하면 평균의 크기와 불확실성이 달라진다. 긍정적인 개별 사례를 부정하는 논문이라기보다 어떤 조건의 결과인지 확인하도록 요구하는 자료다.
연구의 한계
포함 연구의 비뚤림 위험은 모두 높게 평가됐다. 학습자 수준·AI 리터러시·메타인지, 과제 위임과 검증 행동 등 결과를 설명할 만한 변수도 충분히 측정되지 않았다. 도구의 정확한 버전과 실제 상호작용이 바뀌면 같은 활동 이름이라도 경험은 달라질 수 있다.
동료심사 문헌만 포함한 범위는 회색문헌이나 미출판 연구를 빠뜨릴 수 있다. 검색과 자동화된 선별 절차 역시 누락 가능성이 있다. STEM의 범위에도 제한이 있으므로 모든 교육 분야의 효과를 대표하지 않는다. 원문은 의학·지리와 같은 제외 범위를 명시한다.
평가 도구의 타당도와 표준화 여부가 충분히 보고되지 않았고, 학습 중 AI 사용과 평가 중 AI 지원을 일관되게 구별하기도 어려웠다. 따라서 얻어진 성과를 장기 학습이나 도움 없는 독립 수행으로 곧바로 해석할 수 없다. 조절변수의 유의하지 않은 차이 역시 두 조건이 동등하다는 증거는 아니다.
교사·연수 담당자·연구자를 위한 적용
교사는 먼저 수업 목표를 구체화할 수 있다. 개념을 설명하는 지식이 목표인지, 낯선 문제를 해결하는 기능이 목표인지 적고 AI가 대신하는 활동과 학생에게 남기는 활동을 구별한다. 이는 조절변수 결과에서 가져온 점검 관점이며 특정 교수법의 효과를 확정한 처방은 아니다.
연수 담당자는 AI 사용법 실습과 수업 설계 검토를 연결할 수 있다. 같은 학습목표에 대해 AI 조건과 기존 조건의 과제 시간, 자료, 피드백, 상호작용 수준을 나란히 적게 하면 차이를 확인하기 쉽다. 결과물의 완성도만 비교하지 않고 학생이 어떤 설명과 검증을 수행했는지도 살필 수 있다.
교육 연구자는 AI가 켜진 상태의 수행과 도움 없이 남은 학습을 분리해 측정하는 방안을 검토할 수 있다. 사전 성취도, 사용 과정, 즉시 성과와 지연 성과, 누락 자료를 보고하고 유의하지 않은 결과도 공유하면 다음 종합 연구의 해석 범위를 넓힐 수 있다. 이 문단은 논문의 한계에 근거해 본 보고서가 제안하는 연구 설계 방향이다.
8. 후속 연구 제안
- 과제·시간·피드백을 맞춘 비교를 설계해 도구와 인지 활동의 차이를 분리한다.
- AI에게 과제를 넘긴 정도, 프롬프트 수정, 출력 검증을 실제 기록으로 측정해 자기보고를 보완한다.
- 지식과 기능을 별도로 평가하고 도움 없는 수행 및 지연 평가를 추가한다.
- 사전등록과 충분한 방법 보고를 늘리고 긍정적이지 않은 결과도 공개한다.
- 활동 유형의 차이를 같은 수업 안에서 직접 시험하고, 학습자 특성에 따라 효과가 어떻게 달라지는지 확인한다. 현재의 연구 간 조절변수 분석만으로 인과적 처방을 확정하지 않는다.
9. 주제어
생성형 인공지능(generative artificial intelligence), STEM 교육(STEM education), 인지적 학습성과(cognitive learning outcomes), 메타분석(meta-analysis), 출판편향(publication bias), 학습 활동(cognitive activity), 강건 베이지안 메타분석(RoBMA).
10. 근거 위치와 인용 맥락
검색·선정·코딩은 원문 방법 절, 효과크기·이질성·편향 보정은 결과의 메타분석 절, 조절변수 해석은 학습성과 및 ISAR 분석, 적용 범위는 한계 절에 근거했다. 수치를 옮길 때는 일반 평균 0.839, 보정 평균 0.076, 예측구간과 신용구간을 각각 구별했다.
인용 맥락: 생성형 AI의 평균 학습효과를 해석할 때 출판편향과 연구 간 이질성, 비교집단의 활동 차이를 함께 확인해야 한다는 근거로 쓸 수 있다. 특정 수업에서 효과가 없거나 반드시 나타난다는 단정에는 사용할 수 없다.
11. APA 인용
Boolzen, C., Kuhn, J., Flegr, S., Rott, E.-M., Stausberg, N., & Küchemann, S. (2026). Evidence of impact and interpretational limits of generative AI in STEM education: A systematic review and meta-analysis on cognitive learning outcomes. Artificial Intelligence Review, 59(10), Article 223. https://doi.org/10.1007/s10462-026-11665-9