AI의 역사를 세 갈래로 읽는 이유
학생이 보고서 작성을 부탁하면 AI가 글을 만든다. 자료 조사까지 맡기면 검색하고 파일을 읽는다. 같은 요청이 로봇에 전달되면 카메라로 주변을 살피고 물건을 옮길 수도 있다. 겉으로는 모두 자연어로 일을 시키는 장면이지만, 그 뒤에서 필요한 기술과 자원, 실패의 결과는 다르다. 교사가 AI의 변화를 읽으려면 모델의 이름뿐 아니라 누가 만들고, 어떤 자원으로 운영하며, 무엇을 대신하게 하는지를 함께 보아야 한다.
이 리포트는 AI 혁신을 기술·기업·자본의 상호작용으로 해석한다. 논문이 새로운 방법을 제시하고, 기업이 제품으로 만들며, 자본이 계산 자원과 조직을 확보한다. 연구자와 개발자의 이동은 세 영역을 연결한다. 제품이 널리 쓰이면 새로운 수요와 실패 사례가 드러나고, 사회적 기대와 갈등, 규제가 다음 연구와 제품 설계에 영향을 준다. 이는 아래 원전과 사례를 종합한 해석이다. 특정 기업의 성공을 한 가지 원인으로 설명하는 인과 검증 모형은 아니다.
읽는 순서는 ‘AI 혁신의 역사 → 기술·기업·자본 → 인재 이동 → 제품과 서비스 → 사회적 확산 → 기대·갈등·규제 → 다음 기술 발전 → 생성형·에이전트형 AI → 피지컬 AI → 교육의 변화’다. 뒤의 변화는 앞의 단계로 다시 영향을 돌려보낸다. 학교의 평가 방식과 개인정보 요구도 교육용 AI의 설계를 바꿀 수 있다.
| 기술 | 기업 | 자본 |
|---|---|---|
| 논문·모델·평가 | 전략·조직·유통 | 투자·GPU·전력 |
| 새로운 방법을 만든다 | 사용할 제품으로 묶는다 | 실험과 운영을 뒷받침한다 |
인재 이동이 세 축을 연결한다. 이 결합에서 나온 제품과 서비스는 사회로 퍼지고, 사용 경험과 갈등은 다음 기술의 개발 조건으로 돌아온다.
생성형 AI, 에이전트형 AI, 피지컬 AI는 하나가 끝나야 다음이 시작되는 시대 구분이 아니다. 각각 콘텐츠 생성, 도구를 이용한 과업 수행, 물리적 환경에서의 행동에 초점을 둔다. 하나의 로봇이 생성형 모델을 사용하면서 에이전트처럼 계획을 세울 수도 있다. 따라서 이 흐름은 지능의 서열보다 AI가 관여하는 행동 범위의 확장으로 읽는 편이 정확하다.
조사 기준일은 2026년 9월 22일이다. 기술사의 전환점은 당시 논문으로, 산업 변화는 공식 발표와 조사보고서로 확인했다. 2026년에 발표된 통계라도 관측 대상이 2025년이면 그 연도를 따로 표시한다. 기업의 성능 주장은 독립적인 현장 검증과 구분하고, 수업안은 이 리포트의 제안으로 제시한다.
기술의 출발: 규칙을 쓰는 일에서 표현을 배우는 일로
1955년 작성된 다트머스 연구 제안서는 1956년 여름에 인공지능을 공동 연구하자고 제안했다. 언어 사용, 추상 개념, 문제 해결, 자기 개선을 연구 대상으로 삼았다. 제안자가 대학에만 속해 있지 않았다는 점도 눈에 띈다. John McCarthy와 Marvin Minsky 외에 IBM의 Nathaniel Rochester, Bell 연구소의 Claude Shannon이 참여했다. AI는 출발부터 학문과 기업 연구가 만나는 분야였다. 다만 이 제안서의 포부를 당시 이미 달성한 성과로 읽어서는 안 된다. [S01]
초기 AI를 이해하는 한 방법은 사람이 지식을 규칙으로 표현하는 접근과, 데이터에서 규칙성을 학습하는 접근을 구분하는 것이다. ‘이 조건이면 이 결론’이라는 규칙은 판단 근거를 추적하기 쉽다. 반면 예외가 늘어날 때 사람이 계속 규칙을 보완해야 한다. 학습 방식은 사례에서 관계를 찾지만, 무엇을 배웠는지와 새로운 상황에서 왜 실패하는지를 설명하는 일이 어려워질 수 있다. 두 방식의 장단점은 오늘날에도 시스템 설계의 선택지로 남아 있다.
1986년 Rumelhart, Hinton, Williams의 논문은 출력의 오차를 줄이도록 신경망의 연결 가중치를 조정하는 역전파를 설명했다. 여기서 가중치는 입력의 어느 부분에 얼마나 반응할지를 정하는 수치다. 신경망 내부의 층이 과업에 필요한 특징을 학습할 수 있다는 점이 핵심이었다. 이 논문을 모든 선행 연구를 지운 단독 발명으로 소개하기보다는, 표현 학습이 확산되는 데 기여한 대표 논문으로 읽어야 한다. [S02]
2012년 AlexNet 연구는 큰 이미지 자료와 깊은 신경망, GPU 계산을 결합했다. Krizhevsky, Sutskever, Hinton은 이미지 분류 성능과 효율적인 GPU 구현을 함께 보고했다. GPU는 여러 계산을 병렬로 처리하는 장치다. 여기서 얻을 역사적 교훈은 알고리즘만으로 성과가 나왔다는 설명이 부족하다는 것이다. 학습할 사례와 계산을 수행할 장치, 결과를 비교할 평가 체계가 함께 있어야 개선을 확인할 수 있었다. [S03]
2016년 AlphaGo 논문은 신경망과 탐색, 사람의 기보 학습과 자기 대국을 결합했다. 이 논문이 보고한 인간 상대 경기는 유럽 챔피언과의 대결이다. 같은 해의 다른 대국을 이 논문의 실험 결과로 섞지 않아야 한다. AlphaGo는 바둑이라는 명확한 규칙과 승패가 있는 환경에서 강한 성능을 보였다. 이 성취를 곧바로 교실의 복합적인 판단 능력으로 확대할 수는 없다. [S04]
논문과 모델: Transformer 이후 무엇이 달라졌나
2017년 Vaswani 등은 Transformer를 제안했다. 문장을 순서대로만 처리하는 대신, 문장 안의 요소들이 서로 어떤 관계를 갖는지 주의집중 연산으로 계산한다. 원논문은 기계번역 과제로 성능과 학습 효율을 평가했다. 오늘의 챗봇이 그 논문에 그대로 들어 있었던 것은 아니다. 이후 연구가 이 구조를 대규모 언어 학습과 여러 입력 형태로 확장하면서 응용 범위가 넓어졌다. [S05]
2020년 GPT-3 논문은 대규모 언어 모델이 소수의 예시를 입력으로 받아 여러 언어 과제를 수행하는 가능성을 보였다. 매번 과제별 모델을 다시 학습시키는 대신, 입력에 설명과 예시를 넣어 행동을 유도하는 방식이 부각됐다. 그러나 다음 문장을 잘 예측하는 능력과 사용자가 원하는 답을 안정적으로 제공하는 능력은 같지 않았다. 지시를 따르는 방식과 답의 품질을 별도로 조정할 필요가 있었다. [S06]
2022년 InstructGPT 논문은 사람의 시범 답변과 선호 평가를 활용해 언어 모델이 지시를 따르도록 훈련했다. 사람의 피드백을 이용한 강화학습은 여러 답 중 더 선호되는 답을 내도록 모델을 조정하는 방법이다. 연구는 사람의 평가에서 개선을 보였지만, 선호되는 답이 언제나 참이라는 뜻은 아니다. 그럴듯함, 유용함, 사실 정확성을 나누어 평가해야 하는 이유가 여기에 있다. [S07]
같은 해 11월 30일 공개된 ChatGPT는 대화 형태로 이러한 기술에 접근하게 했다. 출시 발표에는 연구 미리보기, 사람의 피드백, Azure의 학습 인프라가 함께 등장한다. 모델·사용 화면·운영 인프라가 한 제품 안에서 만난 사례다. 자연어 대화는 별도의 프로그래밍 없이 기술을 시험할 수 있는 입구를 만들었다. [S08]
이후의 발전을 매개변수 수 하나로만 설명해서는 안 된다. 2025년 DeepSeek-R1 연구는 강화학습을 통한 추론 능력과 작은 모델로 능력을 옮기는 증류를 다뤘다. 공개 모델의 등장과 후속 학습 방법은 누가 실험에 참여할 수 있는지도 바꾼다. 다만 특정 학습 단계의 비용, 전체 연구개발비, 서비스를 지속 운영하는 비용은 서로 다른 수치다. 이를 한 숫자로 합쳐 ‘AI 개발 비용’이라고 부르면 산업 구조를 오해하게 된다. [S09]
기업 전략: 모델 성능을 사용자의 일로 연결하기
좋은 모델을 만들었다고 곧바로 좋은 서비스가 되는 것은 아니다. 사용자가 파일을 넣고, 답을 확인하고, 오류를 고칠 수 있어야 한다. 기관은 계정과 접근 권한, 계약과 지원을 요구한다. 모델 개발사는 성능과 신뢰성을 높이고, 클라우드 기업은 계산 자원을 제공하며, 응용 기업은 특정 업무의 흐름을 설계한다. 실제 기업은 이 역할을 여러 개 겸하기도 한다.
미국 연방거래위원회(FTC)의 2025년 보고서는 Microsoft–OpenAI, Amazon–Anthropic, Google–Anthropic의 관계를 조사했다. 투자뿐 아니라 클라우드 사용 약정, 정보 접근, 제품 통합, 계약상 권리가 연결돼 있었다. 보고서의 정보 범위는 직원이 확보한 2024년 9월까지의 자료와 2025년 1월까지의 공개 정보다. 따라서 이를 2026년의 모든 계약을 보여 주는 지도로 사용해서는 안 된다. [S10]
그 뒤의 변화를 보여 주는 사례가 2025년 11월 Microsoft·NVIDIA·Anthropic의 공식 발표다. Anthropic은 Azure 계산 자원 300억 달러 구매를 약정했고, NVIDIA와 Microsoft는 각각 최대 100억 달러와 최대 50억 달러 투자를 약정했다. 이는 발표된 약정이다. 모두 이미 집행된 현금이나 확정 매출로 읽으면 안 된다. 경쟁 관계와 공급 관계가 같은 기업 사이에 동시에 존재할 수 있음을 보여 주는 사례로 읽는 것이 적절하다. [S11]
이 구조를 교육 서비스에 적용해 보면, 화면에 표시된 서비스 이름만으로 데이터 처리 경로를 알 수 없다는 점이 드러난다. 학교가 계약한 응용 서비스 뒤에 다른 회사의 모델과 클라우드가 있을 수 있다. 도입 검토에서는 ‘어느 AI인가’에 더해 어떤 업무를 수행하고, 데이터가 어디로 이동하며, 서비스 변경 때 무엇을 이전할 수 있는지 확인해야 한다. 이는 산업 구조를 학교의 선택 기준으로 옮긴 제안이다.
무료 이용자 수, 유료 이용자 수, 반복 사용, 기관 계약, 매출은 각기 다른 지표다. 무료 체험이 많다고 교육효과가 입증되는 것도 아니다. 교사는 기업의 발표를 읽을 때 성장 지표가 무엇을 세었는지 먼저 확인할 수 있다. 서비스가 빠르게 확산되는 이유와 학생이 더 잘 배우는 이유는 서로 다른 증거를 필요로 한다.
자본과 GPU: 혁신의 속도와 참여 범위를 정하는 자원
모델 학습에는 계산 장치만이 아니라 메모리, 통신망, 저장장치, 전력과 냉각이 필요하다. 훈련은 모델의 수치를 조정하는 과정이고, 추론은 훈련된 모델을 이용해 요청에 답하는 과정이다. 이용자가 늘어나면 추론 비용도 반복해서 발생한다. 투자금은 연구를 한 번 끝내는 비용과 서비스를 계속 제공하는 비용을 모두 감당해야 한다.
Stanford의 2026 AI Index는 2025년 미국의 민간 AI 투자를 2,859억 달러, 중국을 124억 달러로 집계했다. 보고서도 민간 투자 통계가 중국의 정부 주도 자금을 충분히 반영하지 못할 수 있다고 설명한다. 이는 국가별 전체 AI 지출이나 교육 예산의 비교가 아니다. 같은 보고서는 2025년 주목할 만한 프런티어 모델의 90% 이상을 산업계가 생산했다고 집계했다. 이 역시 모든 AI 연구나 모든 모델의 비율은 아니다. [S12]
2026년 8월 발표된 NVIDIA의 회계연도 2027년 2분기 실적은 2026년 7월 26일에 끝난 분기 매출을 962억 달러로 보고했다. 회계연도 이름과 실제 매출 발생 시점을 구분해야 한다. 한 기업의 매출을 전체 AI 투자액에 더하면 공급망 안에서 같은 자금 흐름을 중복 계산할 수 있다. 이 수치는 계산 인프라 공급자의 사업 규모를 보여 주는 지표로 한정해 사용한다. [S13]
전력 수요도 같은 구분이 필요하다. IEA의 2025년 보고서는 세계 데이터센터 전력 사용을 2024년 약 415TWh로 추정하고, 기본 시나리오에서 2030년 약 945TWh를 전망했다. 이는 AI만의 전력 사용량이 아니라 데이터센터 전체다. 전망은 관측된 미래가 아니며, 보급 속도와 효율 개선, 공급 제약에 따라 달라진다. [S14]
여기서 생기는 교육적 질문은 비용이 큰 기술을 무조건 쓰거나 피해야 한다는 것이 아니다. 학교가 얻으려는 학습 가치에 비해 어떤 자원을 사용하는지를 묻는 것이다. 간단한 피드백에 대규모 모델의 긴 추론이 필요한지, 같은 자료를 반복 처리하는지, 이미 검증한 결과를 다시 활용할 수 있는지 검토할 수 있다. 예산을 이용권 수로만 계산하면 교사의 검토 시간과 관리 비용을 놓친다.
인재 이동: 논문·기업·자본을 잇는 사람들
연구 성과는 논문으로 공개되지만, 실험을 조직하고 실패를 해석하는 경험은 사람과 팀에 남는다. 논문을 읽었다고 대규모 학습을 곧바로 재현할 수 없는 이유다. 인재 이동은 새로운 아이디어뿐 아니라 연구 운영 방식과 제품 경험을 옮긴다. 반대로 자원과 협업 환경이 달라지면 같은 연구자도 다른 문제를 풀게 된다.
2024년 3월 Microsoft는 DeepMind와 Inflection의 공동창업자인 Mustafa Suleyman, Inflection 공동창업자인 Karén Simonyan의 합류를 발표했다. 발표는 새 Microsoft AI 조직과 소비자용 Copilot 등 제품을 연결했다. 이 사례는 연구 경력과 창업 경험을 가진 인재의 이동이 제품 조직의 재편과 맞물릴 수 있음을 보여 준다. 발표문만으로 이후 성능 개선의 원인을 모두 그 영입에 돌릴 수는 없다. [S15]
인재 이동을 읽을 때는 이직, 팀 영입, 기술 사용권 계약, 기업 인수를 구분해야 한다. 몇 명이 합류했다는 사실이 회사 전체를 인수했다는 뜻은 아니다. 특히 기업 간 관계는 계약 시점에 따라 달라진다. 확인되지 않은 영입 금액이나 개인의 동기를 넣으면 기술사가 인물 소문으로 바뀐다.
또한 AI의 역사를 유명 연구자만으로 쓰면 데이터 수집자, 반도체 엔지니어, 시스템 운영자, 평가자, 현장 전문가가 사라진다. 교육용 AI에서는 교과 내용을 구조화하고 학생의 오개념을 설명하는 교사의 지식도 개발 자원이다. 교사가 단순한 최종 사용자를 넘어 설계와 검증에 참여해야 한다는 제안은 이 지점에서 나온다.
진로교육에서는 ‘어느 회사가 인재를 데려갔는가’ 뒤에 ‘그 팀은 어떤 능력을 필요로 했는가’를 물을 수 있다. 수학적 모델링, 소프트웨어 제작, 데이터 품질 관리, 사람의 행동 관찰, 서비스 운영은 다른 전문성을 요구한다. 한 직업의 유행을 좇기보다 협업 과정에서 자신의 판단이 필요한 지점을 찾게 하는 편이 지속적인 탐색에 도움이 된다.
제품과 서비스: 사회적 확산은 어디에서 일어나는가
논문의 결과는 정해진 과제와 평가 조건에서 얻어진다. 제품은 매일 다른 목적과 입력을 가진 사람을 상대한다. 모델이 한 번 정확히 답하는 능력에 더해, 요청을 이해하고 필요한 자료를 확보하며 실패를 드러내는 기능이 필요하다. 사용자는 보통 모델 구조보다 ‘내 일을 끝낼 수 있는가’로 서비스를 평가한다.
ChatGPT의 대화형 접근, 업무 도구에 AI를 붙이는 방식, 다른 프로그램이 모델을 호출하는 API는 기술이 사용자에게 도달하는 서로 다른 경로다. API는 프로그램끼리 정해진 방식으로 요청과 결과를 주고받는 접점이다. 같은 모델이라도 문서 편집기에 들어갈 때와 학습 튜터에 들어갈 때의 사용 경험과 책임은 다르다. 따라서 모델 평가 결과만으로 모든 응용 제품의 품질을 대신 판단할 수 없다. [S08, S10]
확산의 속도는 성능 외에도 접근성, 언어 지원, 기존 업무와의 연결, 가격, 동료의 사용 경험에 영향을 받는다. 이 리포트에서는 이를 사례를 설명하는 관점으로 사용한다. 각 요소의 효과 크기를 따로 추정한 것은 아니다. 특히 특정 서비스의 가입자 수를 사회 전체의 사용률로 바꾸거나, 특정 국가의 설문을 한국 학교의 실태로 바꾸지 않는다.
학교에서는 학생의 과제, 교사의 자료 제작, 행정 업무, 학부모의 학습 지원처럼 서로 다른 경로로 AI가 들어온다. 공통 계정 정책 하나만으로 모든 장면을 다룰 수 없다. 예를 들어 교사가 공개 자료로 수업안을 구상하는 일과 학생의 상담 기록을 외부 서비스에 넣는 일은 데이터와 책임이 다르다. 활용 단위별로 목적과 허용 범위를 정할 필요가 있다.
제품 개선에 활용되는 사용 기록도 계약과 설정에 따라 다르다. ‘쓰면 모두 학습에 들어간다’거나 ‘유료이면 아무 정보도 남지 않는다’는 식의 일괄 판단은 피해야 한다. 학교는 실제 이용 조건과 보관·삭제 정책을 확인하고, 계약 변경 시 재검토할 항목을 남길 수 있다. 이런 운영 기준은 새로운 모델이 나와도 유지할 수 있는 판단의 틀이다.
기대·갈등·규제: 확산의 결과가 기술로 되돌아오다
AI를 둘러싼 기대는 반복 작업을 줄이고 전문적 도움에 접근하기 쉽게 만든다는 데서 나온다. 갈등은 그 과정에서 누가 이익을 얻고 누가 비용을 부담하는지에서 생긴다. 제작자의 권리, 개인정보, 차별, 직무 변화, 에너지 수요는 서로 관련되지만 같은 문제는 아니다. 기술 성능이 좋아져도 이익 배분이나 책임의 질문이 저절로 해결되지는 않는다.
FTC 보고서는 클라우드와 모델 개발사의 제휴가 계산 자원과 인재 접근, 공급자 변경 비용, 민감한 사업 정보에 영향을 줄 수 있다고 지적했다. 이는 보고서가 제기한 경쟁상의 가능성과 우려다. 해당 제휴가 모두 위법하다는 확정 판결로 소개하면 안 된다. 투자와 협력이 혁신을 지원하면서 동시에 의존 관계를 만들 수 있다는 점이 쟁점이다. [S10]
EU AI Act는 AI를 사용한다는 사실만으로 동일한 의무를 부과하기보다 용도와 위험을 구분한다. 유럽연합 집행위원회의 안내는 학습 결과 평가 등 일부 교육 용도를 고위험 사례로 설명한다. 2026년 9월 22일 확인한 공식 FAQ는 AI Omnibus가 2026년 7월 27일 발효됐으며, 해당 고위험 영역의 적용 일정이 2027년 12월 2일로 조정됐다고 안내한다. 과거의 2026년 8월 적용표를 현재 일정으로 복사해서는 안 된다. 실제 적용은 법문과 개별 용도에 따라 확인해야 한다. [S16]
이 유럽 규정을 한국의 모든 교실에 그대로 적용할 수는 없다. 다만 무엇을 검토해야 하는지 묻는 비교 기준은 된다. 학생의 진로 선택이나 평가 결과에 영향을 주는 AI라면 오류를 누가 발견하고, 누가 수정하며, 학생은 어떤 설명과 이의 제기 기회를 얻는지 살펴볼 수 있다. 국내에서 실제 도입할 때는 학교·교육청 지침과 적용되는 개인정보·저작권 규정을 별도로 확인해야 한다.
규제와 사회적 요구는 연구의 제약만이 아니다. 기록을 남기는 기능, 출처를 연결하는 기능, 사람이 개입할 수 있는 단계도 개발 목표가 된다. 피드백이 기술로 되돌아온다는 것은 모든 갈등이 곧 해결된다는 뜻이 아니다. 비용과 속도, 편의와 통제 사이의 선택을 제품 안에서 드러내고 검증해야 한다는 뜻이다.
다음 기술 발전: 답변 생성에서 과업 수행으로
생성형 AI는 글·이미지·코드 등 결과물을 만든다. 에이전트형 AI는 목표를 받아 필요한 도구를 고르고, 실행 결과를 확인한 뒤 다음 행동을 정하는 체계를 가리킨다. 여기서 ‘스스로 한다’는 표현은 무제한 권한을 뜻하지 않는다. 실제 행동 범위는 연결된 도구와 허용된 접근 권한, 중단 조건에 의해 정해진다.
2022년 공개되고 ICLR 2023에 발표된 ReAct는 언어 모델의 추론 과정과 환경에 대한 행동을 번갈아 수행하는 접근을 연구했다. 답을 한 번 생성하는 데서 끝나지 않고, 외부 정보와 실행 결과를 다음 판단에 반영한다. 이는 모든 현대 에이전트의 단일 기원이라기보다, 추론과 도구 사용을 연결한 대표 연구로 볼 수 있다. 논문의 실험 성과를 모든 업무의 신뢰성으로 일반화해서는 안 된다. [S17]
Anthropic의 개발 지침은 정해진 순서대로 모델과 도구를 연결하는 워크플로와, 모델이 상황에 따라 다음 절차를 정하는 에이전트를 구분한다. 더 복잡한 체계가 항상 낫다고 보지 않으며 비용과 지연, 예측 가능성을 함께 검토하도록 권한다. 이는 개발 경험을 정리한 지침이지 학교에서의 학습효과 실험은 아니다. [S18]
가령 공개 자료를 모아 연수 초안을 만드는 과정은 검색, 출처 확인, 초안 작성, 검토로 나눌 수 있다. 여기서 자료를 읽는 권한과 메일을 발송하는 권한은 다르다. 오류가 발견되면 다시 작성할 수 있는 단계와, 외부에 이미 영향을 준 단계도 다르다. 학교가 에이전트를 도입한다면 이런 경계부터 설계하는 것이 합리적이다. 이 예시는 실제 특정 제품의 기능 보장이 아니라 운영 설계 제안이다.
신뢰성은 한 번의 성공 시연보다 반복 과제에서 살펴야 한다. 같은 요청을 다른 자료와 계정 조건에서 수행했을 때 성공하는지, 잘못된 자료를 만났을 때 멈추는지, 실패를 사람이 알아볼 수 있는지 확인한다. 과업의 일부 단계가 각각 안정적이어도 긴 작업 전체가 안정적이라는 보장은 없다. 특히 외부 문서의 문구를 작업 지시로 오인하지 않도록 자료와 권한을 분리해야 한다.
피지컬 AI: 화면 밖으로 나가는 순간 추가되는 조건
피지컬 AI는 물리적 환경을 인식하고 그 안에서 행동하는 AI를 설명하는 넓은 용어다. 사람 모습의 로봇만을 뜻하지 않으며, 로봇 연구가 언어 모델 이후에 처음 시작됐다는 뜻도 아니다. 최근 변화의 한 축은 시각·언어 모델의 능력을 로봇의 행동 제어와 연결하는 데 있다.
Google DeepMind는 2025년 Gemini Robotics에서 시각·언어·행동 모델을 소개했다. VLA는 Vision–Language–Action의 약자로, 보는 정보와 언어 지시를 로봇 행동으로 연결한다. 별도의 공간 추론 모델과 기존 제어기의 결합도 설명했다. 이는 ‘언어 모델에 팔을 붙이면 된다’는 설명보다 복합적인 구조다. [S19]
2026년 7월 30일의 Gemini Robotics 2 발표는 전신 제어, 손의 정교한 조작, 로봇 간 협업, 기기 내부에서 실행하는 모델을 제시했다. 이 자료는 해당 기업이 어떤 능력을 개발하고 공개했는지 확인하는 1차 출처다. 그러나 발표 영상과 자체 평가만으로 가정이나 학교에서 장기간 안전하게 작동한다고 결론낼 수 없다. 이 리포트는 발표 사실과 연구 방향까지만 근거로 사용한다. [S20]
디지털 환경에서는 잘못 만든 파일을 되돌릴 수 있는 경우가 있다. 물리적 환경에서는 물건의 파손이나 사람과의 충돌이 되돌리기 어려울 수 있다. 카메라가 물체를 잘 인식하는지뿐 아니라, 미끄러운 표면과 가려진 물체, 예상하지 못한 사람의 움직임에 어떻게 반응하는지 확인해야 한다. 모델 평가 외에 센서·제어·기계적 안전과 현장 운영의 검증이 필요하다는 분석이다.
교육에서는 비싼 로봇을 먼저 구입할 필요가 없다. 시뮬레이션이나 작은 센서 과제로도 목표 설정, 관찰, 행동, 결과 확인의 관계를 배울 수 있다. 예를 들어 물체 분류 과제에서 조명이 달라질 때 오분류가 어떻게 늘어나는지 기록하고, 틀렸을 때 작동을 멈추는 조건을 설계할 수 있다. 실제 장치를 쓰는 경우에는 감독과 비상 정지, 작동 범위부터 정해야 한다. 이는 아래의 수업 설계를 위한 제안이며 로봇 기업이 검증한 교육 프로그램은 아니다.
교육의 변화: 과제를 잘 끝내는 것과 배우는 것은 다르다
AI가 산출물을 빠르게 만들수록 학교는 학생이 직접 이해하고 수행할 부분을 더 분명히 해야 한다. 완성된 글이나 정답만으로는 학생의 판단 과정을 충분히 알기 어려워진다. 따라서 AI와 함께 수행하는 과제와, 도움 없이 이해를 확인하는 과제를 연결하는 설계가 필요하다. 이는 AI를 허용할지 금지할지 하나만 정하는 문제보다 구체적이다.
Bastani 등의 고교 수학 현장 실험은 약 1,000명의 학생에게 일반형 GPT 지원, 학습 보호장치를 둔 튜터, AI 없는 조건을 비교했다. AI를 쓰는 연습 단계에서는 성과가 좋아졌다. 그러나 도움을 없앤 시험에서 일반형 지원 집단은 대조군보다 성적이 상대적으로 17% 낮았다. 17%포인트 하락이 아니다. 보호장치를 둔 튜터 집단에서는 이런 부정적 효과가 크게 줄었지만, 대조군보다 유의하게 좋아졌다는 결과는 아니었다. 특정 학교·수학 과제의 실험을 모든 AI 학습에 대한 결론으로 확대할 수 없다. [S21]
Kestin 등의 연구는 다른 조건에서 가능성을 보였다. 대학 물리 수업의 학생 194명을 포함한 교차 설계 실험에서, 교수법에 맞춰 구성한 AI 튜터를 이용한 조건이 대면 능동학습 조건보다 즉시 사후평가에서 높은 성과를 보였다. AI 조건의 학습 시간 중앙값은 49분이었고, 대면 조건은 학습 시간 60분으로 간주했다. 서로 다른 두 수업 내용을 사용한 단기 결과이므로 장기 기억과 모든 교과의 우수성을 확인한 것은 아니다. [S22]
두 연구는 단순한 찬반 대결이 아니다. 학생 집단, 교과, 학습 단계, 튜터의 설계, 평가 시점이 다르다. 두 결과를 나란히 읽으면 ‘어떤 모델을 썼는가’만으로 학습효과를 설명할 수 없다는 점이 드러난다. 도움의 방식과 학생이 직접 수행하는 활동, 도움을 거둔 뒤의 평가를 함께 보아야 한다. 효과 크기를 직접 비교하거나 평균내는 것은 적절하지 않다.
UNESCO의 학생 AI 역량 체계는 인간 중심 관점, AI 윤리, 기술과 응용, 시스템 설계의 네 영역과 이해·적용·창조의 세 수준을 제시한다. 이는 특정 서비스의 사용 요령보다 넓은 교육 목표다. 다만 역량 체계는 교육과정 설계를 돕는 문서이며, 그 자체가 한 수업의 효과를 입증한 실험은 아니다. [S23]
에이전트와 피지컬 AI까지 고려하면 학생은 결과를 읽는 능력에 더해 목표와 제약을 명확히 하고, 행동을 관찰하며, 개입할 시점을 판단해야 한다. 이때 교과 지식은 줄어드는 것이 아니라 검증의 기준이 된다. 수학적 관계를 모르면 계산 결과를, 과학적 조건을 모르면 실험 설명을, 역사적 맥락을 모르면 자료의 해석을 확인하기 어렵다.
교사·학생·학부모·학교가 할 수 있는 일
다음 적용안은 앞선 근거를 바탕으로 이 리포트가 구성한 제안이다. 논문에서 동일한 방식으로 효과를 검증한 프로그램은 아니다. 학교의 교육과정과 학생의 나이, 실제 서비스의 이용 조건에 맞게 조정해야 한다.
교사는 단원에서 학생이 직접 판단해야 하는 것 하나를 먼저 정할 수 있다. 자료의 신뢰도를 가리는 일, 풀이의 조건을 설명하는 일, 대안의 장단점을 비교하는 일처럼 관찰 가능한 행동으로 표현한다. AI에게 맡길 수 있는 부분과 학생이 설명해야 할 부분을 과제 안내에 함께 쓴다. 결과물에는 초안, 수정 이유, 확인한 출처를 남기고 수업 중 짧은 구술 설명으로 이해를 확인한다.
학생에게는 AI 답변을 받은 뒤 세 가지를 기록하게 할 수 있다. 받아들인 내용과 근거, 고친 내용과 이유, 아직 확인하지 못한 내용이다. 기록이 길 필요는 없다. 자신의 선택을 설명할 수 있어야 한다. 마지막에는 AI 화면을 닫고 조건을 조금 바꾼 문제를 해결하게 한다. 이 활동은 탐지 프로그램으로 작성자를 추측하는 것보다 실제 이해를 관찰하는 데 초점을 둔다.
학부모는 숙제를 빨리 끝냈는지와 함께 도움을 받은 뒤 무엇을 혼자 할 수 있는지 살펴볼 수 있다. 아이가 설명을 어려워한다면 사용 사실을 추궁하기보다, 어느 단계에서 막혔고 어떤 힌트가 도움이 됐는지 이야기한다. 어려움을 겪는 학생에게 필요한 지원을 한꺼번에 없애기보다 힌트의 양과 과제 난도를 조절하는 편이 적절하다. 접근성 지원이 필요한 학생에게 같은 도구 사용량 기준을 일률적으로 적용하지 않는다.
학교는 서비스 선정 때 기능 목록과 이용료 외에 학생 자료의 처리, 교사의 검토 시간, 오류 수정 절차, 계정 종료 후 자료 이전을 확인할 수 있다. 작은 범위에서 시작해 학습 결과와 업무 시간을 함께 기록한다. 에이전트의 외부 발송이나 평가 기록 변경 같은 행동은 별도의 승인 지점을 둔다. 새 기능이 추가됐을 때 권한이 넓어지는지 검토하는 담당자도 정한다.
교사 연수는 아래처럼 3차시로 구성할 수 있다. 첫 시간에는 한 논문과 한 기업 발표를 비교해 무엇을 입증하고 무엇을 주장하는지 구분한다. 둘째 시간에는 AI와 함께 과제를 수행한 뒤 도움 없이 설명한다. 셋째 시간에는 같은 과제를 에이전트나 로봇에게 맡긴다고 가정하고 권한·중단·검증 조건을 설계한다. 장비가 없는 학교에서도 문서와 모의 상황으로 진행할 수 있다.
| 차시 | 학생의 활동 | 교사가 확인할 증거 |
|---|---|---|
| 기술·기업·자본 읽기 | 논문 결과와 기업 발표를 대조한다 | 사실·해석·약정의 구분 |
| 생성형 AI와 학습 | 도움을 받아 수정하고 혼자 설명한다 | 수정 이유와 독립 수행 |
| 에이전트·피지컬 AI | 도구 권한과 중단 조건을 설계한다 | 실패 사례와 개입 기준 |
진로 탐색에서는 한 직업을 통째로 사라지거나 남는 것으로 분류하지 않는다. 그 직업의 실제 과업을 자료 수집, 판단, 협의, 제작, 검증으로 나누고 어떤 부분에 AI가 관여하는지 토론한다. 이 활동은 고용 전망을 예측하는 검사가 아니다. 학생이 자신의 관심 분야에서 기술과 인간의 역할을 구체적으로 질문하도록 돕는 탐구다.
해석의 한계와 다음에 확인할 질문
이 리포트는 대표적인 전환점과 관계를 설명하는 선택적 역사다. 모든 국가와 연구 전통, 모든 모델 계열을 망라하지 않았다. 영문 원전과 공개 기업 자료의 비중이 높아 공개되지 않은 계약과 실험 실패를 충분히 반영하지 못한다. 공개 자료가 적다는 이유만으로 해당 조직의 기여가 작다고 판단하지 않는다.
산업 통계는 정의와 관측 시점을 확인해야 한다. 민간 투자, 기업 매출, 클라우드 구매 약정, 데이터센터 전력 전망은 서로 다른 수치다. 또한 모델의 벤치마크 성과, 제품의 사용성, 업무의 생산성, 학생의 학습효과는 다른 평가다. 한 지표의 상승을 나머지의 개선으로 대신 표현하지 않았다.
학교가 앞으로 확인할 질문은 구체적이어야 한다. AI를 사용한 다음 학생이 혼자 설명할 수 있는가. 교사가 절약한 시간보다 검토 시간이 더 늘지는 않았는가. 에이전트가 실패를 알리고 멈추는가. 로봇이 시연과 다른 조건에서도 안전하게 작동하는가. 이런 질문은 도입 이후에도 반복해서 살펴야 한다.
기술 변화에 맞춰 교육을 바꾼다는 것은 새 도구의 기능을 수업에 모두 넣는다는 뜻이 아니다. 학생이 어떤 판단을 배워야 하는지 정하고, 그 판단을 관찰할 과제와 증거를 설계하는 일이다. 다음 모델의 이름이 바뀌어도 이 기준으로 도입과 활용을 검토할 수 있다.