자동 생성: 2026-08-23 · 추천 논문 · 출처 신뢰도: 상 — Nirav Patel, Josiah Crossman, Eva Aggarwal, Emily Wenger, arXiv:2608.19437 (2026-08-19 제출, cs.CL).
원문(바로 열기): https://arxiv.org/abs/2608.19437

1. 📄 논문 요약 (Abstract)

정답이 명확한 과제(수학·코딩 등)에서 LLM의 성능은 수많은 벤치마크로 추적되지만, 정답이 하나가 아닌 열린 과제(open-ended task) — 즉 창의성·독창성·다양성이 품질만큼 중요한 과제 — 에서 LLM이 어떻게 변해 왔는지는 훨씬 덜 알려져 있다. LLM이 사람의 아이디어 발상과 창작을 점점 더 많이 보조하는 상황에서, 저자들은 이 열린 과제에서의 성능 추세를 파악하는 일이 중요하다고 본다. 이 논문은 3년(2023년 3월 ~ 2026년 7월)에 걸친 모델 출시 전체를 가로지르는 창의적 산출물의 예비 분석을 제시한다.

분석 대상은 두 종류의 프롬프트 세트다. 하나는 실제 사용자 질의를 모은 Infinity-Chat100(100개의 실세계 열린 프롬프트: 창작·문제해결·브레인스토밍·아이디어 발상)이고, 다른 하나는 인지심리학의 고전적 발산적 사고 검사인 대안 용도 과제(Alternate Uses Task, AUT) — 책·신발·망치 같은 흔한 사물의 색다른 용도를 떠올리게 하는 검사다. 저자들은 68개 모델(12개 주요 제공사, 폐쇄가중치 33개·공개가중치 34개)의 응답을 이 프롬프트들에 대해 수집했다.

측정 방법은 문장 임베딩 유사도다. all-MiniLM-L6-v2 문장 임베딩 모델로 각 응답을 벡터로 바꾼 뒤, 두 응답 사이의 코사인 거리(1 − 코사인 유사도)로 다양성을 정량화한다. 값이 낮을수록 서로 의미가 닮았다는 뜻이다. 공유 아키텍처·학습 데이터 같은 교란을 줄이기 위해 서로 다른 계열(cross-family) 모델 쌍의 거리를 분석했고, 27개 출시 월을 9개 구간(bin)으로 묶어 시간에 따른 추세를 보았다.

핵심 발견은 시간이 지날수록 모델 산출물의 다양성이 통계적으로 유의하게 감소한다는 것이다. 즉 여러 회사의 서로 다른 LLM이 내놓는 창의적 응답이 의미적으로 서로 닮아가고(수렴) 있다. AUT에서 구간당 기울기는 약 −0.01385(95% 신뢰구간 [−0.01695, −0.01044]), Infinity-Chat100에서는 약 −0.00167(95% 신뢰구간 [−0.00267, −0.00074])로 모두 음수였고, 1,000회 리샘플링에서 두 세트 모두 전부 음의 기울기가 나왔다. 계열 간 평균 거리는 AUT에서 약 0.50 → 0.40 아래로, Infinity-Chat100에서 약 0.34 → 0.32로 줄었다.

저자들은 이 추세가 지속된다면 LLM에 의한 획일화(homogenization)가 인간-AI 공동 창작에서 인간의 주체성(agency)을 점진적으로 약화시킬 수 있다고 경고한다. 다만 스스로 "예비 분석(preliminary analysis)"임을 강조하며, 관찰된 패턴이 일시적 발전 단계의 부산물인지 구조적 제약인지는 추가 연구가 필요하다고 밝힌다.

🔎 오늘 리포트 앵커: 'AI는 다양성을 좁힌다 — 획일화를 경계하고 교육은 마찰로 되살려라.' 이 논문은 앵커의 AI 축을 정면으로 대표한다. 서로 다른 회사의 68개 모델이 3년에 걸쳐 창의 과제에서 점점 서로 닮은 답을 내놓는다는 것을, 심리검사(AUT)와 실사용 질의(Infinity-Chat100) 두 축에서 통계적으로 보여주기 때문이다. 이는 "모델을 여러 개 쓰면 다양성이 확보된다"는 통념을 정면으로 흔든다 — 오히려 산출물 자체가 한곳으로 수렴한다. 저자들이 명명한 알고리즘 단일문화(algorithmic monoculture)는 곧 교육 현장에서 학생들이 서로 비슷한 AI 초안에서 출발할 위험을 뜻한다. 따라서 '마찰(friction)'으로 다양성을 되살리라는 앵커의 처방과 직접 맞물린다.

2. 📊 논문 구조별 주요 정보 정리

연구의 필요성 및 목적 (Purpose)

검증 가능한 정답 과제의 벤치마크는 넘쳐나지만, 창의성·독창성·다양성이 핵심인 열린 과제에서 LLM의 시간적 변화는 거의 추적되지 않았다. LLM이 인간의 발상·창작을 보조하는 비중이 커지는 만큼, 세대를 거듭하며 창의적 산출물의 다양성이 늘고 있는지 줄고 있는지를 실증적으로 진단하는 것이 목적이다.

연구 문제 (Research Questions)

용어의 정의 (Definitions)

연구 방법 (Method)

연구 결과 (Findings)

논의 및 결론 (Discussion & Conclusion)

서로 다른 계열의 모델조차 창의 과제에서 점점 닮은 답을 내놓는다는 것은 다양성이 좁아지고 있다는 신호다. 이 추세가 지속되면 LLM 주도 획일화가 인간-AI 공동 창작에서 인간의 주체성을 점진적으로 잠식할 수 있다. 저자들은 나아가 "점점 덜 창의적인 LLM"이 인간 창의성에 대한 부정적 영향(기존 연구가 지적)을 악화시킬 가능성도 우려한다. 단, 예비 분석임을 명확히 하며 인과·구조적 해석에는 신중을 요청한다.

후속 연구 제안 (Future Work)

주제어 (Keywords)

LLMs, 창의성 평가, 발산적 사고, 산출물 동질화, 의미 유사도, 알고리즘 단일문화, 시간적 분석, 열린 생성.

3. 🏫 교육 현장 시사점

1. "모델을 여러 개 쓰면 다양해진다"는 가정을 재검토: 서로 다른 회사의 LLM도 창의 과제에서 서로 닮은 답으로 수렴한다. 여러 챗봇을 돌려 쓴다고 학생 산출물의 다양성이 저절로 보장되지 않는다.

2. 'AI 초안 → 인간 발산' 순서 설계: AI가 먼저 발산(브레인스토밍)을 맡으면 반 전체가 비슷한 출발점에 서기 쉽다. AI를 초안·정리·비평 도구로 뒤에 두고, 아이디어 발산은 학생이 먼저 하도록 순서를 뒤집는다.

3. 학생 고유의 목소리·경험을 채점 준거로 명시: 글쓰기·예술 수행평가 루브릭에 '개인적 관점·구체적 경험·비관습적 발상'을 별도 배점으로 넣어, 매끄럽지만 획일적인 AI투 답안이 자동으로 높은 점수를 받지 않게 한다.

4. 의도적 '마찰' 삽입: 제약 조건 바꾸기, 낯선 관점으로 다시 쓰기, 손으로 초안 쓰기, 동료와 교차 비평 등 발산을 강제하는 과제 장치로 수렴을 되돌린다(오늘 리포트 앵커의 '마찰' 처방과 연결).

5. AUT 같은 발산적 사고 활동을 수업에 직접 활용: 흔한 사물의 색다른 용도 떠올리기 같은 짧은 발산 훈련은 AI 없이도 학생의 독창성을 키우고, AI 산출물과 대비해 '무엇이 진짜 새로운가'를 체감하게 한다.

6. AI 리터러시로 '단일문화' 개념 가르치기: 여러 모델이 왜 닮은 답을 내는지(공유 데이터·유사 정렬 기법)를 다루어, 학생이 AI 출력을 무비판적으로 '유일한 정답'으로 받아들이지 않도록 한다.

4. ⚠️ 한계와 유의점

5. 📎 인용

Patel, N., Crossman, J., Aggarwal, E., & Wenger, E. (2026). *Are LLMs becoming similarly creative? Evidence from three years of models* (arXiv:2608.19437) [Preprint]. arXiv. https://arxiv.org/abs/2608.19437

근거 1줄: 3년·68개 모델의 창의 과제 응답이 계열을 넘어 통계적으로 유의하게 수렴한다는 실증은 "여러 AI를 써도 산출물은 획일화될 수 있다"는 주장의 1차 근거로 쓸 수 있다.
← 2026-08-23 리포트로