Autor 외 6인, 2026년 9월 NBER Working Paper 35720. 특허 실무자를 대상으로 한 3개월 무작위 실험이며 동료심사를 마친 학술지 논문은 아니다.
초록 재구성
이 연구는 AI가 보조하는 동안의 업무 성과와 AI를 쓰지 않는 후속 과제의 성과를 구별했다. 연구진은 11개 특허 법률회사에서 실무자 133명을 무작위로 배정하고, 처치집단에는 특허 초안 도구 InFlow를 약 3개월 제공했다. 참가자는 초기와 종료 무렵에 특허 작성 과제를 수행했으며, 마지막에는 AI를 사용하지 말라는 지시 아래 오류가 있는 특허 초안을 고쳤다. 독립 전문가의 평가에서 AI 접근권을 받은 집단의 작성 점수는 통제집단보다 초기 0.34표준편차, 종료 무렵 0.38표준편차 높았다. 작성 과제에서는 경력 7년 미만 집단의 개선 폭이 더 컸다. 마지막 수정 과제를 완료한 91명을 분석했을 때 전체 처치집단의 점수 차이는 0.32표준편차였다. 이 과제에서 경력 7년 이상 집단의 차이는 0.45표준편차였고, 7년 미만 집단은 −0.03표준편차로 평균 차이가 통계적으로 뚜렷하지 않았다. 따라서 AI와 함께 만든 결과물이 좋아졌다는 사실만으로 모든 경력 집단에 비보조 수행의 향상이 생겼다고 판단할 수 없다. 다만 사전 역량 검사 부재, 중도 이탈, AI 미사용 여부의 직접 확인 부재 때문에 개인별 학습량이나 장기 역량 변화를 확정하기는 어렵다.
연구의 필요성과 목적
AI의 도움을 받은 문서가 좋아졌을 때, 개선된 결과가 도구의 수행인지 사용자의 학습인지는 별개의 문제다. 도구를 내려놓은 뒤에도 오류를 찾아 고칠 수 있는지 측정해야 이 둘을 구별할 수 있다. 연구진은 작성과 검토가 전문 지식을 요구하고 결과물의 품질을 평가할 수 있는 특허 업무를 택했다. 목적은 AI 접근권이 당장의 작성 품질을 높이는지, 그 경험이 비보조 검토 과제에 연결되는지, 경력 수준에 따라 결과가 달라지는지를 함께 살피는 것이다.
특허 초안은 문장이 자연스럽다는 이유만으로 좋은 문서가 되지 않는다. 발명의 내용을 정확하게 기술하면서 권리 범위를 빠뜨리지 않아야 하고, 후속 법적 해석에 견딜 수 있어야 한다. 이처럼 표면적 유창성과 전문적 적합성을 구별해야 하는 업무는 AI 사용 중 성과와 사용 후 판단을 따로 평가할 필요가 크다. 연구는 그 필요를 실험 설계에 반영했지만 학교 수업의 학습효과를 직접 시험한 것은 아니다.
연구 질문
- AI 접근권은 초기와 약 3개월 뒤 특허 작성 과제의 품질을 높이는가?
- AI를 쓰지 않도록 지시한 최종 수정 과제에서도 처치집단이 더 높은 품질을 보이는가?
- 경력 7년 미만과 7년 이상 집단에서 평균과 점수 분포는 어떻게 다른가?
- 결과를 실제 업무시간 절감이나 전문성의 축적·손실로 해석할 때 어떤 제약이 있는가?
주요 용어
AI 접근권 처치(AI access treatment)는 도구에 접근할 수 있도록 무작위 배정한 조건이다. 참가자마다 실제 사용량이 달랐으므로 모든 사람이 같은 시간과 방식으로 AI를 사용했다는 뜻은 아니다. 접근권과 함께 제공된 지원을 포함한 조건의 효과로 읽어야 한다.
비보조 수행(unassisted performance)은 최종 과제에서 AI를 사용하지 말라는 지시 아래 나온 결과를 뜻한다. 연구진이 사용 여부를 직접 감시한 것은 아니므로 여기서 비보조라는 표현은 실험 지시를 가리킨다.
레드라이닝(redlining)은 이미 작성된 특허 문서의 결함을 찾아 수정하는 작업이다. 이 연구는 문제가 포함된 AI 초안을 주고 고치게 했다. 오류가 있다고 표시하는 능력과 적절한 문장으로 실제 수정하는 능력을 구별할 수 있다.
표준화 효과크기(standardized effect)는 통제집단 점수의 표준편차를 단위로 나타낸 집단 차이다. 0.45표준편차는 점수가 45% 상승했다는 뜻이 아니다. p값은 해당 분석 모형에서 영가설과 자료가 얼마나 양립하는지 판단하는 정보이며, 효과의 크기나 개인별 개선 확률을 직접 나타내지 않는다.
연구 방법
참여자와 배정
모집에 응한 실무자는 156명이었고, 무작위 배정 대상은 133명이었다. 90명은 AI 접근권을, 43명은 통제 조건을 받았다. 11개 회사가 참여했으며 한 회사가 두 번 참여해 운영 단위는 12개 코호트였다. 배정은 회사와 회사 안의 경력 수준을 고려했고, 논문의 주요 하위집단 분석은 경력 7년을 기준으로 나눴다. 이 기준은 특허 실무자의 표본을 분석하기 위한 구분이지 교사나 학생에게 적용할 역량 등급이 아니다.
코호트별 실험은 2025년 5월부터 2026년 2월 사이에 진행됐다. 참가자 한 사람의 관찰 기간은 약 3개월이다. 논문이 10일·90일 과제로 부르는 측정 시점은 운영상 목표에 해당하며 실제 평균은 각각 약 13일·102일이었다. 통제집단은 기존 법률 업무 도구를 사용하되 연구용 생성형 AI를 제공받지 않았다. 처치집단에는 Google Labs의 출시 전 특허 작성 도구 InFlow와 관련 지원이 제공됐다.
과제와 평가
초기와 종료 무렵에는 별도로 준비한 발명 자료를 바탕으로 특허 문안을 작성했다. 종료 과제는 초기 과제보다 분량과 난도가 높았다. 따라서 두 시점의 원점수를 단순 비교해 학습량으로 삼아서는 안 된다. 논문의 주요 비교는 각 시점에서 처치집단과 통제집단 사이의 차이다.
마지막 수정 과제는 결함이 있는 초안을 고치는 방식이었다. 연구진은 AI를 쓰지 말라고 명시했지만 이를 직접 감시하거나 강제하지는 못했다. 외부 평가자 6명 중 두 명이 각 결과물을 독립적으로 평가했고, 평가자는 참가자의 처치 조건을 알지 못했다. 평가 항목은 권리 집행 가능성, 정확성, 전략적 모호성, 완결성, 명료성이다. 평정자 간 상관은 과제별로 약 0.47~0.59였으므로 전문가 판단에도 차이가 있었다.
초기 작성은 105명, 종료 작성은 98명, 마지막 수정은 91명이 완료했다. 최종 수정 완료자는 처치 62명과 통제 29명이다. 표 6의 평정 단위 관측치 925개는 925명의 참가자를 뜻하지 않는다. 여러 평가자와 하위 항목의 점수가 포함돼 있으며, 주 분석은 사람별 기여를 가중하고 개인 단위로 표준오차를 조정한다.
해석에 중요한 설계 조건
연구는 접근권 배정에 따른 효과를 추정하지만, 각 결과 분석은 그 과제를 완료한 사람의 자료를 사용한다. 무작위 배정 133명 모두에게 최종 결과값이 있는 것은 아니다. 연구 참여 협의를 거쳐 사전 역량 검사를 실시하지 않았으므로 개인별 시작점에서 얼마나 성장했는지를 직접 계산할 수도 없다. 이 설계가 보여 주는 것은 주로 종료 시점의 집단 차이다.
연구 결과
AI를 사용할 수 있는 작성 과제
전문가 평정을 사용한 주 모형에서 초기 작성 품질의 처치 효과는 0.34표준편차(p=.03), 종료 작성은 0.38표준편차(p=.01)였다. 원문 표 3·4의 평정별 모형과 본문 결과를 기준으로 한 수치다. 표준화 점수의 개선이며 문서의 법적 성공률이나 수익이 그 비율만큼 증가했다는 뜻은 아니다.
경력 7년 미만 집단의 작성 효과는 초기 0.58표준편차(p=.04), 종료 0.60표준편차(p=.02)였다. 7년 이상 집단은 각각 0.22표준편차(p=.24), 0.30표준편차(p=.08)였다. 초보 경력 집단의 작성 성과가 크게 개선됐다는 해석은 가능하지만, 모든 집단·시점의 효과가 같은 수준으로 통계적으로 뚜렷한 것은 아니다.
AI를 쓰지 않도록 지시한 수정 과제
최종 수정에서 전체 평균 차이는 0.32표준편차(p=.04)였다. 경력 7년 이상 집단은 0.45표준편차(p=.02), 7년 미만 집단은 −0.03표준편차(p=.89)였다. 수치는 원문 표 6의 전문가 평정 모형에 따른다. 이 결과는 낮은 경력 집단의 비보조 수행에 평균적인 향상이 확인되지 않았다는 근거다. 모든 낮은 경력 참가자의 전문성이 약화됐다고 말할 근거는 아니다.
평균만으로는 집단 내부 차이를 놓칠 수 있다. 낮은 경력의 처치집단에서는 중하위 점수 비중이 줄고 최하위 점수 비중이 늘었으며, 중상위 점수 비중도 증가하는 양상이 보였다. 이 변화들 중 통계적으로 뚜렷한 것과 그렇지 않은 것이 섞여 있다. 따라서 양극화 가능성을 논의할 수는 있어도 누가 어떤 학습 경로를 거쳤는지까지 입증한 결과로 볼 수 없다.
전문가 검토에서는 일부 낮은 경력 참가자가 오류를 지적하고도 적절한 문장으로 고치지 못했다. 이 양상은 통제집단에서도 나타났으므로 AI가 새롭게 만든 습관이라고 단정하기 어렵다. 한 하위집단의 효과가 유의하고 다른 집단이 유의하지 않다는 사실만으로 집단 간 효과 차이가 입증되는 것도 아니다. 경력별 추정치와 불확실성을 함께 읽어야 한다.
시간과 실제 업무 성과
초기 작성에서 처치집단의 소요시간은 통제집단의 약 112분보다 약 10분 짧았고(p=.05), 종료 작성에서도 약 10분의 차이가 있었지만 통계적으로 뚜렷하지 않았다(p=.27). 실제 업무 특허에 대한 설문 결과 역시 일관된 유의성을 보이지 않았다. 따라서 이 연구를 실제 특허 처리 기간이 확실히 단축됐다는 근거로 인용하면 범위를 넘는다.
논의와 결론
이 실험의 강점은 AI와 함께 작성한 산출물만 평가하지 않고, 마지막에 도구를 사용하지 않도록 지시한 별도 검토 과제를 둔 점이다. 낮은 경력 집단의 작성 품질 향상과 최종 수정의 평균적 개선 부재가 함께 나타났다. 수행을 돕는 기능과 사용자가 다음 과제에서 스스로 판단할 수 있게 되는 과정은 같은 지표로 평가할 수 없다는 점을 보여 준다.
다만 높은 경력 참가자가 AI에서 무엇을 배웠는지, 얼마나 주의 깊게 검토했는지는 무작위로 조작한 변수가 아니다. 인터뷰는 4명으로 제한돼 있다. 기존 지식이 AI의 출력을 이해하고 흡수하는 데 도움이 됐다는 설명은 결과와 양립하지만 확정된 인과 기제는 아니다. 특정 검토 절차가 전문성을 보존한다고 입증한 연구로 소개해서는 안 된다.
중도 이탈은 최종 과제 기준 약 32%이고, 참가자 수가 작아 하위집단 추정의 불확실성이 크다. AI 사용이 의심되는 사례에 대한 민감도 분석이 주요 해석을 뒤집지는 않았지만, 금지 지시 준수를 완전히 보증하지는 못한다. 단일 직무, 약 3개월, 특정 도구를 대상으로 했다는 범위도 남는다. 장기 전문성, 다른 법률 업무, 학교 학습으로의 전이는 별도 연구가 필요하다.
연구는 Google의 지원을 받았고 저자 일부가 Google 소속이다. 외부 전문가의 맹검 평가와 사전등록은 장점이지만 이러한 이해관계와 작업논문이라는 상태를 함께 밝혀야 한다. 이 분석은 연구 결과를 부정하거나 확정하기보다, 확인된 수행 차이와 아직 측정하지 못한 학습 기제를 구분해 읽는다.
교사와 연수 설계에 적용하기
다음 제안은 특허 실험의 평가 구분을 교육에 옮긴 해석이며, 원 연구가 검증한 수업 처방은 아니다. 교사는 같은 학습목표에 대해 AI와 함께 만든 결과물의 품질과, 시간이 지난 뒤 새 문제를 도구 없이 해결하는 능력을 나눠 살필 수 있다. 예를 들어 논증 글쓰기에서는 첫 주장과 이유를 먼저 적고, AI의 제안 중 채택하거나 거절한 내용을 근거와 함께 남긴 뒤, 후속 시간에 다른 자료로 짧은 논증을 작성하게 한다.
학생에게는 결과물의 완성도 외에 수정 이유를 설명할 기회를 준다. 오류를 표시하는 데 그친 경우와 실제로 고치고 근거를 댄 경우를 구별하면, 완성된 글만 보았을 때 놓치는 학습 요구가 드러난다. 다만 첫 수행 수준과 과제 난도도 기록해야 후속 점수 차이를 AI의 효과로 오인하지 않는다. 학습 지원을 위한 소규모 점검부터 시작하고 한 번의 결과로 학생의 역량을 고정해서 평가하지 않는다.
교사 연수에서는 같은 원리를 수업안 검토에 적용할 수 있다. AI 보조 수업안의 질, 수정 이유에 대한 설명, 도구 없이 새 수업 상황을 판단하는 과제를 별도로 본다. 관리자는 문서 작성시간이 줄었다는 사실만으로 전문성이 늘었다고 보고하지 않고, 절약한 시간의 사용처와 후속 판단의 질을 함께 살핀다. 법률가의 경력 7년 구분을 교사 경력이나 학년 기준으로 복제할 이유는 없다.
후속 연구 제언
- 사전 수행 과제와 장기 후속 과제를 함께 두어 시작점, 즉각적 보조 효과, 유지·전이를 나누어 측정한다.
- 사용 로그와 가능한 범위의 과제 감독으로 실제 AI 사용량과 비보조 조건의 준수를 더 정확히 확인한다.
- 검토 이유 설명, 독립 초안 작성, 오류 수정 연습을 각각 무작위 배정해 학습을 돕는 절차를 직접 비교한다.
- 더 큰 표본과 여러 직무에서 경력별 차이를 재검증하고, 중도 이탈과 평정자 차이에 대한 분석을 사전에 정한다.
- 학교 연구에서는 과제 난도와 사전 지식을 통제하고 즉각적 점수뿐 아니라 새로운 문제에 대한 전이와 도움 요청 방식을 살핀다.
키워드와 인용 맥락
한글 키워드: 생성형 AI, 전문성, 특허 작성, 비보조 수행, 무작위 현장실험, 학습 전이.
English keywords: generative AI, expertise, patent drafting, unassisted performance, randomized field experiment, transfer of learning.
인용 맥락 메모: AI 보조 산출물의 개선과 도구 없이 수행하는 후속 과제의 개선을 따로 측정해야 한다는 주장의 근거로 쓰되, 특허 실무자·완료자 표본·경력별 불확실성을 명시한다.
출처와 APA
Autor, D., Rodchenko, T., Martin, J., Iscenko, Z., Strand, S., Pearl, D., & Ferere, M. (2026). Does AI assistance enhance or erode expertise? Evidence from a three-month field experiment in patent drafting (NBER Working Paper No. 35720). National Bureau of Economic Research.
- DOI: https://doi.org/10.3386/w35720
- 원문: https://www.nber.org/papers/w35720
- 원문: https://shapingwork.mit.edu/wp-content/uploads/2026/09/Autor-et-al-Sept-2026.pdf
근거 위치: 연구 방법은 본문 2절, 작성 효과는 표 3·4와 4.1절, 비보조 수정은 표 6·7과 4.2절, 시간·실제 업무 결과는 후속 결과 절, 해석과 한계는 논의·결론을 대조했다. 표지와 부록을 포함한 MIT 공개 저자본은 76쪽이며, 인용한 표 번호는 논문 자체의 번호다. 확인일은 2026년 9월 22일이다.