1. 논문 요약

이 연구는 예비 수학교사가 AI와 동료의 피드백을 판단하고 수업과제를 수정하는 과정을 살폈다. 한국의 한 대학 교사교육 강좌에서 완전한 사전·사후 자료를 확보한 22명을 분석했다. 참여자는 학교 급식의 음식물 쓰레기를 줄이는 수학적 모델링 과제를 설계했다. 8명은 AI 다음 동료, 14명은 동료 다음 AI 피드백을 받았다. 연구자와 외부 평정자는 초기·최종 과제의 품질, 의견 수용 방식, 수정 깊이, 성찰 기록을 대조했다. 20명은 적어도 한 차례 피드백을 선택적으로 받아들였다. 17명은 구조를 바꾸거나 과제의 중심 문제를 재구성했지만 종합 품질 점수가 오른 사람은 5명이었다. 참여자들은 AI의 구체성과 속도, 동료의 교실 맥락과 학생 관점을 각각 장점으로 설명했다. 개인 무작위 배정이 없는 소표본 비교이므로 AI의 독립 효과나 피드백 순서의 우열을 결론 내릴 수는 없다. 이 연구의 핵심은 피드백을 활용한 과정과 최종 과제의 품질을 구분해 평가하는 데 있다.

2. 연구의 필요성 및 목적

AI는 수업안에 대해 빠르고 구체적인 의견을 줄 수 있다. 그러나 의견이 늘어나거나 수정한 흔적이 많아지는 것만으로 수업안이 좋아졌다고 판단하기는 어렵다. 수학적 모델링 과제에서는 현실 맥락, 자료, 가정, 수학적 표현, 결과 검증이 함께 맞물려야 한다.

예를 들어 자료를 추가하면 계산은 쉬워져도 학생이 스스로 가정을 세울 여지는 줄 수 있다. 검증 절차를 적어 넣어도 현실과 모델을 비교하는 활동이 아니라 정답 확인에 머물 수 있다. 저자는 피드백 수용, 수정 깊이, 완성 과제의 품질을 별도로 살펴 이런 차이를 드러내고자 했다. 연구가 다루는 결과는 해당 활동 안에서의 판단과 산출물이며, 실제 학생의 학업 성취가 아니다.

3. 연구문제

첫째, 예비교사는 AI와 동료의 의견을 어떻게 선택적으로 수용·변형·거절하는가. 둘째, 어떤 깊이의 수정이 나타나며 그 수정은 최종 과제의 품질 변화와 어떻게 연결되는가. 셋째, 참여자는 두 피드백 원천의 인지적·정서적·행동적 역할을 어떻게 설명하는가.

피드백 순서는 이 질문을 살피는 수업 맥락이다. 순서를 개별 무작위로 배정한 실험이 아니므로, AI를 먼저 쓰면 반드시 더 좋다는 인과 질문에 답하는 설계로 해석하지 않는다.

4. 주요 용어

피드백 전환(feedback translation)은 외부의 의견을 검토하고 자신의 목표에 맞춰 실제 설계 결정으로 옮기는 과정을 뜻한다. 여기서 전환은 문장을 번역한다는 뜻이 아니다.

평가적 판단(evaluative judgment)은 자신의 과제나 다른 사람의 제안이 얼마나 적절한지 기준에 따라 판단하는 능력이다. 선택적 수용(selective acceptance)은 일부 의견을 채택하면서 다른 부분은 배제하거나 조건을 붙이는 대응이다.

수정 깊이(revision depth)는 표현만 다듬었는지, 자료·가정·검증 같은 구성 요소를 바꿨는지, 중심 질문까지 재구성했는지를 구별한다. 과제 설계 품질(task-design quality)은 이러한 수정 행동과 별도로 완성된 과제가 갖춘 요소를 평가한다. 깊은 수정이 곧 높은 품질을 뜻하지 않는다는 구분이 연구 전체를 관통한다.

5. 연구방법

수업과 참여자

2026년 봄 학기 한국의 4년제 대학 수학교사 양성 강좌에서 수행했다. 15주 강좌 안의 7주 단원은 개정 교육과정, 수학적 모델링, 지속가능성 맥락의 과제 설계, AI·동료 피드백을 다뤘다. 분석에는 초기 과제, 두 차례 피드백과 수정, 최종 과제, 외부 평정을 모두 갖춘 22명이 포함됐다.

AI→동료 집단은 8명, 동료→AI 집단은 14명이었다. 기존 동료 검토 활동을 유지하도록 집단 단위로 순서를 배정했다. 집단 구성과 과제의 성숙 정도, 첫 번째 피드백의 잔여 영향을 순서 효과에서 분리할 수 없다.

피드백과 자료 수집

모든 AI 회차는 같은 강좌용 맞춤 GPT와 공통 상호작용 절차를 사용했다. 논문은 당시 이용 가능한 GPT-5 계열을 사용했다고 설명하지만, 단일 고정 세부 모델의 재현 실험으로 기술하지는 않는다. 학생의 질문에 따라 실질적인 피드백 내용은 달랐다. 동료 의견은 수업 중 활동지에 서면으로 교환했다.

AI 질문·응답의 제출본은 원래 로그와 대조했다. 연구의 주된 분석 자료는 제출 보고서이며 로그를 별도의 추가 관찰 사례로 중복 계산하지 않았다. 의견을 받아들이거나 거절한 이유, 수정 기록, 최종 성찰도 함께 분석했다. 외부 평정 전에 학생 이름과 학번을 제거했다. 이 기록 방식 자체가 학교 현장의 개인정보 처리 절차를 대신하는 것은 아니다.

측정과 분석

과제 품질은 현실 맥락, 개방성, 수량·가정·자료·제약, 모델링 요구, 검증·현실 해석, 토론·협력의 여섯 항목으로 평가했다. 각 항목은 0~2점이며 합계는 0~12점이다. 저자는 이를 잠재 능력을 등간 척도로 측정한 점수라기보다 설계 요소의 폭과 결합을 나타내는 지표로 해석했다.

수정 깊이는 변화 없음, 표면 수정, 구조 수정, 재개념화의 네 수준으로 따로 코딩했다. 저자와 외부 평정자가 22개 사례를 독립적으로 코딩한 뒤 불일치를 논의해 합의했다. 일부 토론·협력 및 검증 항목에서는 합의 전 판단 차이가 있었다. 피드백 원천 표시는 코딩에 필요해 남아 있었으므로 순서를 완전히 숨긴 평정은 아니었다.

분석은 기술통계와 사례 간 비교, 질적 해석을 중심으로 했다. 집단 크기가 작고 불균형해 순서 효과의 추론통계 검정은 하지 않았다. 평균이 비슷하다는 사실을 효과의 부재나 두 순서의 동등성 증명으로 바꾸지 않아야 한다.

6. 연구결과

수용과 수정은 널리 나타났다

22명 중 20명은 적어도 한 회차에서 선택적 수용을 보였다. 전체 44개 피드백 회차 중 32개가 선택적 수용으로 코딩됐다. 원천별로는 AI와 동료가 각각 22회 중 16회였다. 이는 참여자가 의견을 일괄 복사하기보다 판단하며 사용했음을 보여 준다.

17명은 적어도 한 번 구조 수정 또는 재개념화를 했고, 9명은 두 회차 모두 그렇게 수정했다. 다만 수정의 깊이와 최종 점수는 일치하지 않았다.

최종 과제의 점수는 5명에게서 상승했다

종합 품질 점수는 5명 상승, 10명 유지, 7명 하락이었다. 전체 평균은 6.91점에서 6.64점으로 바뀌었으며 원문이 보고한 평균 변화는 −0.27점이다. 깊은 수정을 한 17명 가운데 12명은 종합 점수가 높아지지 않았다. 반대로 점수가 오른 5명은 모두 적어도 한 번 깊은 수정을 했다. 이 자료에서 깊은 수정과 개선이 함께 나타난 사례는 있지만, 깊은 수정만으로 개선이 보장되지는 않았다.

AI→동료 집단의 평균은 7.12에서 6.88, 동료→AI 집단은 6.79에서 6.50으로 바뀌었다. 원문 변화량은 각각 −0.25, −0.29점이다. 첫 집단의 표시 평균을 직접 빼면 −0.24가 되지만, 이는 반올림된 값의 차이이므로 원문 변화량과 구분한다. 집단 비교의 유의성을 검정하지 않았으므로 이 차이에 우열을 부여하지 않는다.

세부 항목에서는 수량·자료 항목의 하락이 7명으로 가장 많았다. 어떤 부분은 보완되고 다른 부분은 약해져 종합 점수에서 상쇄될 수 있다. 저자는 이런 결합 관계를 수정 후 전체 과제의 일관성을 점검해야 하는 이유로 설명했다.

AI와 동료에 대한 경험은 서로 달랐다

검증에 초점을 둔 수정은 AI 뒤에 22회 중 11회, 동료 뒤에 8회 나타났다. 이는 수정 행동의 빈도이며 최종 검증 항목 점수의 상승 빈도가 아니다. 참여자들은 AI의 구체성·새 관점·속도를, 동료의 상호 대화·교실 현실성·학생 관점을 장점으로 언급했다. 복수 주제가 한 사람에게서 나올 수 있으므로 주제별 언급 횟수를 서로 배타적인 사람 비율로 더해서는 안 된다.

7. 논의 및 결론

이 연구는 피드백을 잘 판단했다는 설명, 실제로 바꾼 행동, 완성한 과제의 질이 서로 다른 증거임을 보여 준다. 최종 점수가 오르지 않았다고 활동 과정의 판단까지 없었다고 볼 수 없고, 판단 기록이 충실하다고 최종 과제도 좋아졌다고 볼 수 없다.

저자는 부분 수정이 전체 설계에 조화롭게 들어가지 못했을 가능성을 논의한다. 이는 관찰된 패턴을 설명하는 해석이다. 각 원인을 실험으로 분리해 입증한 결과는 아니다. 또한 두 집단 모두 AI와 동료 의견을 받았으므로 점수 하락을 AI의 부정적 효과로 돌릴 수 없다.

하나의 강좌, 하나의 음식물 쓰레기 과제, 불균형한 소표본이라는 범위를 유지해 읽어야 한다. 합의 평정과 여러 자료의 대조는 해석을 뒷받침하지만, 합의 전 일부 항목의 불일치나 순서가 추론 가능한 평정 조건까지 없애지는 않는다.

8. 현장 적용 제안

교사 연수에서는 원문이 제안한 피드백 결정 기록과 수정 후 일관성 점검을 활용할 수 있다. 먼저 초기 수업과제를 보존하고, 각 제안에 채택·변형·거절의 결정과 이유를 적는다. 그런 다음 같은 여섯 평가 영역으로 최종 과제를 다시 읽는다. 수정 전후를 평가하는 사람에게 수정 횟수나 사용 도구를 먼저 알려 주지 않는 방식도 검토할 수 있다.

음식물 쓰레기 과제라면 ‘자료를 추가했다’는 표시를 넘어 실제 학생이 그 자료로 어떤 가정을 세우고, 어떤 모델을 만들며, 무엇과 결과를 비교할지를 확인할 수 있다. 가상의 예로 일주일 잔반 무게를 제공했다면 급식 인원 변화가 해석에 영향을 주는지 토론하게 할 수 있다. 이 예시는 리포트의 적용 제안이며 연구가 시험한 별도 활동의 효과가 아니다.

연수 운영자는 피드백 판단 기록과 완성 과제 평가를 분리하고, 연구자는 이후 새 과제에도 판단이 유지되는지 추적할 수 있다. 실제 학생에게 적용하기 전에는 학년 수준과 확보 가능한 자료에 맞춰 과제를 다시 검토해야 한다.

9. 후속 연구 제안과 주제어

저자는 여러 기관과 다른 지속가능성 과제에서 패턴이 반복되는지, 판단이 이후 설계와 교실에서 지속되는지 살필 필요를 제안했다. 균형 잡힌 순서 교차 설계는 순서의 영향을 더 엄밀하게 다룰 수 있다. 수정 이력·면담·회상 자료를 결합하면 의견을 채택한 뒤 어떤 판단에서 일관성이 무너지는지 추적할 수 있다. 결정 기록표와 일관성 점검의 효과 자체도 후속 연구 대상이다.

주제어: 예비 수학교사(pre-service mathematics teachers), 피드백 전환(feedback translation), 평가적 판단(evaluative judgment), 과제 설계(task design), 동료 피드백(peer feedback), 지속가능성 교육(sustainability education).

10. 출처와 APA

Oh, S. (2026). Translating AI and peer feedback in sustainability-oriented STEM teacher education: Pre-service mathematics teachers’ uptake, revision, and modeling task-design quality. Frontiers in Psychology, 17, Article 1922989.

근거 위치: 연구 설계·절차·평정은 원문 3장, 점수 변화는 표 1·4·5, 피드백 대응은 표 2·3·6, 해석과 한계·후속 연구는 5~6장이다. 출판사 본문과 Crossref의 저자·발행일·권·논문번호를 대조했다. 분석 기준일은 2026년 10월 7일이다.

← 2026-10-07 리포트로