1. 요약
Zhang·Qiu·Wang은 영어교육의 생성형 AI 리터러시 연구를 종합했다. 분석 대상은 실증연구 27편이다. 개념 이해, 전략적 활용, 비판적·윤리적 평가를 잠정 분석틀로 사용했다. 전략적 활용의 근거가 가장 자주 나타났다. 자기보고는 인식된 역량을 설명한다. 과제 기록은 상황 속 사용을 보여 준다. 여러 영역의 역량을 주장하려면 측정과 증거가 그에 맞아야 한다. 이 종합은 특정 수업의 효과크기를 추정하지 않았다.
2. 연구 필요성과 목적
이 논문을 교사의 평가 문제로 옮겨 읽으면, AI를 쓴 학생에게서 무엇을 관찰했을 때 무엇을 안다고 말할 수 있는지가 핵심이다. 다음 세 학생을 가정해 보자. 한 학생은 자신 있게 도구를 쓰지만 출처를 설명하지 못한다. 다른 학생은 능숙한 프롬프트를 쓰지 못해도 답변의 오류를 정확히 찾는다. 또 다른 학생은 완성도 높은 글을 내지만 왜 그 내용을 채택했는지 말하지 못한다. 이는 논문에 제시된 실제 사례가 아니라 측정 문제를 살펴보기 위한 가상 사례다.
세 학생에게 결과물 점수 하나만 주면 어떤 지원이 필요한지 구별하기 어렵다. 그렇다고 사용 로그를 많이 모으면 역량을 모두 알 수 있는 것도 아니다. 기록에는 학생의 판단이 드러나지 않을 수 있고, 유창한 설명에는 실제 확인 없이 익힌 표현이 섞일 수 있다. 교사가 평가하려는 능력을 먼저 정하고, 그 능력이 드러날 장면을 마련하는 문제가 남는다.
3. 연구 질문과 주요 개념
연구는 리터러시의 개념화·측정·근거를 살폈다. 세 영역의 명칭은 개념 이해(conceptual understanding), 전략적 활용(strategic application), 비판적·윤리적 평가(critical–ethical evaluation)다. 완성된 표준이나 검증된 단일 척도가 아니라 분석을 위한 잠정적 틀이다.
이 구분을 수업 설계에 사용한다면 개념 이해에서는 답변이 그럴듯해도 틀릴 수 있는 이유를 설명하게 할 수 있다. 전략적 활용에서는 과제 목적에 맞춰 질문과 작업 순서를 조절한 이유를 볼 수 있다. 비판적·윤리적 평가에서는 근거 확인, 편향 점검, 타인의 정보와 저작물에 대한 판단이 과제에서 어떻게 드러나는지 살핀다. 이 세 예시는 본 리포트의 수업 해석이다. 논문이 검증한 평가 문항으로 제시하는 것은 아니다.
하나의 행동이 여러 영역과 관련될 수도 있다. AI의 설명이 틀렸다고 지적한 학생이 왜 틀리는지 알고 있는지, 원자료를 확인했는지, 우연히 정답을 알고 있었는지는 추가 질문으로 구별해야 한다. 행동의 이름을 정하는 것과 그 행동을 뒷받침하는 이해를 확인하는 일을 함께 설계해야 한다.
4. 방법과 확인 범위
세 데이터베이스의 문헌을 선별해 2024~2026년 3월 연구를 분석했다. 대상은 고등교육 학습자 연구 16편과 교사교육 연구 11편이다. 영어 동료심사 문헌에 한정했다. 코딩과 증거의 적합성을 검토했으며 연구의 이질성 때문에 효과를 통합하지 않았다.
따라서 이 논문을 국내 고교 수업에 적용하는 것은 새로운 맥락으로 옮기는 판단이다. 대학생에게 가능한 독립적 자료 탐색이나 긴 설명 과제가 고교생에게도 같은 부담으로 작동한다고 가정하기 어렵다. 영어 학습 상황의 결과를 과학 실험이나 역사 사료 평가에 적용할 때도 과목 고유의 지식이 개입한다. 교사는 이 분석틀을 바로 성적 산식으로 바꾸기보다 자신의 과제에서 어떤 증거가 나오는지 먼저 살펴볼 수 있다.
5. 주요 결과와 해석
영역별 근거는 전략적 활용 21편, 비판적·윤리적 평가 20편, 개념 이해 15편에서 나타났다. 영역은 중복될 수 있다. 이는 학생의 숙달률이 아니다. 직접 근거는 22편, 간접 근거는 5편이었다. 직접 근거라고 해서 모두 관찰 수행인 것도 아니다.
두 영역 이상을 직접 다룬 20편 중 18편은 연구 구성요소 사이의 연결을 보였다. 그러나 같은 연구에서 여러 영역을 다뤘다고 해서 통합된 이론을 검증한 것은 아니다. 품질 검토의 우려 수준은 낮음 4편, 일부 17편, 높음 6편이었다. 모든 연구를 동일한 강도의 근거로 취급하기 어렵다.
이 결과를 읽을 때에는 빈도와 중요도를 구별해야 한다. 연구에서 자주 측정한 영역이 학생에게 가장 중요하거나 가장 잘 발달한 영역이라는 결론은 나오지 않는다. 측정하기 쉬운 행동이 더 자주 포착됐을 가능성도 검토할 필요가 있다. 예를 들어 프롬프트 수정은 화면에 남지만, 학생이 AI의 설명을 믿지 않은 이유는 질문하지 않으면 남지 않을 수 있다. 이는 이 리포트가 제안하는 측정상의 주의점이다.
또한 서로 다른 증거가 다른 질문에 답할 수 있다. 자신감 설문은 학생이 도움을 요청할 가능성이나 학습 참여를 해석하는 데 쓸 수 있다. 과제 기록은 그때 어떤 행동을 했는지 보여 준다. 결과물은 최종 산출물의 질을 평가하게 한다. 어느 하나를 없애기보다, 각 자료를 어떤 주장에 연결할지 밝히면 해석이 구체적이 된다.
6. 교실 적용안: 한 개의 주장에 증거를 연결하기
다음은 본 리포트가 제안하는 활동이다. 학급에서 효과가 검증된 프로그램이나 표준화된 평가척도로 제시하지 않는다. 교사는 기존 쓰기 과제나 자료 해석 과제의 일부에 짧게 붙여 사용하고, 학생 반응을 보고 조정할 수 있다.
과제 시작: 확인할 판단을 좁힌다
교사는 학생이 AI의 제안을 검토해 채택 여부를 설명할 수 있는지를 확인 대상으로 삼는다. 글 전체의 품질, 프롬프트 기술, 윤리 지식을 한꺼번에 점수화하려 하지 않는다. 공통 자료를 주면 사전 지식과 자료 접근의 차이를 일부 줄일 수 있다. AI 계정 사용이 어려운 학생에게는 교사가 준비한 동일한 답변을 제공하는 방식도 가능하다.
수행 중: 제안과 판단을 함께 남긴다
학생은 AI의 제안 중 의미 있는 주장 하나를 고른다. 이어 그 주장을 확인하는 원자료의 위치를 표시하고, 원자료가 실제로 뒷받침하는 범위를 자기 말로 적는다. 마지막으로 채택·수정·거절 중 하나를 선택하고 이유를 쓴다. 문장의 외형만 고친 경우와 근거 때문에 주장을 바꾼 경우가 구별되도록 질문한다.
예를 들어 AI가 특정 교육 활동의 효과를 단정했지만 제시한 자료가 설문 상관만 보고했다면, 학생은 효과라는 표현을 관계라는 표현으로 고칠 수 있다. 반대로 근거가 충분하다면 원래 주장을 유지할 수도 있다. 수정했다는 사실 자체에 점수를 주면 학생이 필요 없는 변경을 만들 수 있으므로, 판단과 근거의 연결을 살피는 편이 적절하다.
수행 후: 짧은 전이 질문을 더한다
학생에게 같은 판단이 필요한 새 문장 하나를 제시한다. 앞서 외운 설명을 반복하는지, 다른 자료에서도 주장 범위를 조절하는지 확인한다. 이때의 성공 하나로 안정된 역량을 확정하지 않는다. 과제 난도와 익숙함이 달라질 수 있으므로 다른 날의 관찰과 함께 읽는다.
교사 기록: 관찰과 해석을 분리한다
기록에는 학생이 실제로 한 행동을 먼저 쓴다. 예를 들어 원자료의 표를 찾았지만 비교 집단이 다르다는 점을 설명하지 못했다고 적을 수 있다. 이어 다음 수업에서 비교 대상 확인을 지원하겠다는 교수 판단을 덧붙인다. 막연히 비판적 사고가 부족하다고 적는 것보다 다음 행동으로 연결하기 쉽다.
점수 기준이 필요하다면 교사들이 실제 학생 사례 몇 개를 함께 읽고 어떤 설명을 충분한 근거로 볼지 조정한다. 이 리포트는 합격 점수나 가중치를 제시하지 않는다. 새 기준을 성적에 사용하려면 수업 목표와의 적합성, 학생에게 안내한 조건, 평가자 간 판단 차이를 별도로 검토해야 한다.
7. 엇갈리는 증거를 읽는 법과 예외
자신감은 높고 과제 수행은 약한 학생에게는 자신감이 잘못됐다는 피드백보다 어떤 주장까지 확인했는지 묻는 편이 생산적일 수 있다. 수행은 좋지만 자신감이 낮은 학생에게는 성공한 판단의 근거를 구체적으로 돌려줄 수 있다. 두 경우 모두 한 번의 설문과 과제만으로 학생의 지속적인 특성을 단정하지 않는다.
설명이 짧은 학생을 곧바로 이해가 낮다고 판단하지 않는 것도 필요하다. 언어 표현, 읽기 부담, 긴장 때문에 아는 것을 충분히 쓰지 못할 수 있다. 구두 설명, 표시하기, 두 예시 비교처럼 같은 목표를 확인할 다른 경로를 마련할 수 있다. 다른 경로를 허용했을 때 평가가 쉬워졌는지보다, 원래 확인하려던 판단이 더 잘 드러났는지를 살핀다.
과제에 따라 AI를 쓰지 않는 선택도 설명할 수 있어야 한다. 확정된 실험값을 그대로 옮기는 작업이나 개인적 경험을 서술하는 장면에서 도구를 쓴 횟수가 늘었다고 역량이 높아졌다고 판단하기 어렵다. 목적에 비추어 사용할 필요가 없다고 판단한 근거도 수업의 관찰 대상이 될 수 있다.
8. 논의와 후속 연구
이 논문은 고등교육·교사교육 중심이고, 분석틀과 수집 범위의 제약이 있다. 그 결과를 모든 학년의 역량 분포로 일반화할 수 없다. 특히 자료별 근거의 적합성은 연구가 많다는 사실과 별도로 검토해야 한다.
교사 연구자가 후속 연구를 설계한다면 첫째, 역량에 관한 주장을 문장으로 먼저 적을 수 있다. 예를 들어 학생이 AI가 제시한 근거의 적절성을 평가한다는 주장과, 학생이 AI 사용에 자신감을 느낀다는 주장은 다른 측정 도구를 요구한다. 같은 설문 점수로 두 주장을 동시에 뒷받침하지 않도록 자료 수집 계획을 나눈다.
둘째, 수업 전후의 변화만으로 활동의 효과를 단정하지 않도록 비교 조건을 생각할 수 있다. 자료를 두 번 읽은 효과, 과제 익숙함, 교사의 추가 설명이 결과에 영향을 줄 수 있다. 가능하다면 비교 집단이나 다른 시점의 자료를 확보하고, 작은 학급 연구라면 그 범위와 대안 설명을 솔직하게 제시한다.
셋째, 평가자의 판단을 검토한다. 같은 학생 기록을 두 교사가 읽었을 때 어디에서 의견이 갈리는지 확인하면 문항과 기준의 모호함을 찾을 수 있다. 단순 일치율을 높이기 위해 판단을 좁히기보다 어떤 역량 주장을 증거가 뒷받침하는지를 함께 토의한다. 이후 새 과제에서도 같은 판단이 유지되는지 확인해야 도구의 활용 범위를 넓힐 수 있다.
9. 키워드와 인용 맥락
생성형 AI 리터러시(Generative AI literacy), 영어교육(English language education), 자기보고(Self-report), 수행 증거(Performance evidence), 측정과 주장 간 정합성(Claim–measure alignment).
인용할 때는 AI 리터러시의 측정 근거를 구별하는 문헌으로 활용한다. 특정 수업이 학생의 역량을 향상시켰다거나 본 리포트의 활동안이 검증됐다는 주장에는 사용하지 않는다.
10. APA와 원문
Zhang, Y., Qiu, X., & Wang, J. (2026). A systematic research synthesis of generative AI literacy in English language education. Discover Artificial Intelligence, 6, Article 1074. https://doi.org/10.1007/s44163-026-02178-z
- 원문: https://link.springer.com/article/10.1007/s44163-026-02178-z
- DOI: https://doi.org/10.1007/s44163-026-02178-z
원문 대조 범위: 초록, 연구 방법, 결과, 논의, 한계 및 서지정보. 본문의 가상 사례, 활동 절차, 평가 기록 예시, 후속 연구 제안은 이 리포트의 해석과 제안으로 구분했다.