자동 생성: 2026-08-23 · 추천 논문 · 출처 신뢰도: 상 — Nirav Patel, Josiah Crossman, Eva Aggarwal, Emily Wenger, arXiv:2608.19437 (2026-08-19 제출, cs.CL).
원문(바로 열기): https://arxiv.org/abs/2608.19437
1. 📄 논문 요약 (Abstract)
정답이 명확한 과제(수학·코딩 등)에서 LLM의 성능은 수많은 벤치마크로 추적되지만, 정답이 하나가 아닌 열린 과제(open-ended task) — 즉 창의성·독창성·다양성이 품질만큼 중요한 과제 — 에서 LLM이 어떻게 변해 왔는지는 훨씬 덜 알려져 있다. LLM이 사람의 아이디어 발상과 창작을 점점 더 많이 보조하는 상황에서, 저자들은 이 열린 과제에서의 성능 추세를 파악하는 일이 중요하다고 본다. 이 논문은 3년(2023년 3월 ~ 2026년 7월)에 걸친 모델 출시 전체를 가로지르는 창의적 산출물의 예비 분석을 제시한다.
분석 대상은 두 종류의 프롬프트 세트다. 하나는 실제 사용자 질의를 모은 Infinity-Chat100(100개의 실세계 열린 프롬프트: 창작·문제해결·브레인스토밍·아이디어 발상)이고, 다른 하나는 인지심리학의 고전적 발산적 사고 검사인 대안 용도 과제(Alternate Uses Task, AUT) — 책·신발·망치 같은 흔한 사물의 색다른 용도를 떠올리게 하는 검사다. 저자들은 68개 모델(12개 주요 제공사, 폐쇄가중치 33개·공개가중치 34개)의 응답을 이 프롬프트들에 대해 수집했다.
측정 방법은 문장 임베딩 유사도다. all-MiniLM-L6-v2 문장 임베딩 모델로 각 응답을 벡터로 바꾼 뒤, 두 응답 사이의 코사인 거리(1 − 코사인 유사도)로 다양성을 정량화한다. 값이 낮을수록 서로 의미가 닮았다는 뜻이다. 공유 아키텍처·학습 데이터 같은 교란을 줄이기 위해 서로 다른 계열(cross-family) 모델 쌍의 거리를 분석했고, 27개 출시 월을 9개 구간(bin)으로 묶어 시간에 따른 추세를 보았다.
핵심 발견은 시간이 지날수록 모델 산출물의 다양성이 통계적으로 유의하게 감소한다는 것이다. 즉 여러 회사의 서로 다른 LLM이 내놓는 창의적 응답이 의미적으로 서로 닮아가고(수렴) 있다. AUT에서 구간당 기울기는 약 −0.01385(95% 신뢰구간 [−0.01695, −0.01044]), Infinity-Chat100에서는 약 −0.00167(95% 신뢰구간 [−0.00267, −0.00074])로 모두 음수였고, 1,000회 리샘플링에서 두 세트 모두 전부 음의 기울기가 나왔다. 계열 간 평균 거리는 AUT에서 약 0.50 → 0.40 아래로, Infinity-Chat100에서 약 0.34 → 0.32로 줄었다.
저자들은 이 추세가 지속된다면 LLM에 의한 획일화(homogenization)가 인간-AI 공동 창작에서 인간의 주체성(agency)을 점진적으로 약화시킬 수 있다고 경고한다. 다만 스스로 "예비 분석(preliminary analysis)"임을 강조하며, 관찰된 패턴이 일시적 발전 단계의 부산물인지 구조적 제약인지는 추가 연구가 필요하다고 밝힌다.
🔎 오늘 리포트 앵커: 'AI는 다양성을 좁힌다 — 획일화를 경계하고 교육은 마찰로 되살려라.' 이 논문은 앵커의 AI 축을 정면으로 대표한다. 서로 다른 회사의 68개 모델이 3년에 걸쳐 창의 과제에서 점점 서로 닮은 답을 내놓는다는 것을, 심리검사(AUT)와 실사용 질의(Infinity-Chat100) 두 축에서 통계적으로 보여주기 때문이다. 이는 "모델을 여러 개 쓰면 다양성이 확보된다"는 통념을 정면으로 흔든다 — 오히려 산출물 자체가 한곳으로 수렴한다. 저자들이 명명한 알고리즘 단일문화(algorithmic monoculture)는 곧 교육 현장에서 학생들이 서로 비슷한 AI 초안에서 출발할 위험을 뜻한다. 따라서 '마찰(friction)'으로 다양성을 되살리라는 앵커의 처방과 직접 맞물린다.
2. 📊 논문 구조별 주요 정보 정리
연구의 필요성 및 목적 (Purpose)
검증 가능한 정답 과제의 벤치마크는 넘쳐나지만, 창의성·독창성·다양성이 핵심인 열린 과제에서 LLM의 시간적 변화는 거의 추적되지 않았다. LLM이 인간의 발상·창작을 보조하는 비중이 커지는 만큼, 세대를 거듭하며 창의적 산출물의 다양성이 늘고 있는지 줄고 있는지를 실증적으로 진단하는 것이 목적이다.
연구 문제 (Research Questions)
- LLM의 산출물은 세대를 거듭할수록 점점 더 동질화(homogeneous)되는가?
- 이 동질화는 특히 열린 창의 과제에서 두드러지는가?
- 관찰된 패턴은 일시적 발전 단계의 부산물인가, 아니면 구조적 제약을 반영하는가?
용어의 정의 (Definitions)
- 열린 과제(open-ended task): 정답이 하나로 고정되지 않아 창의성·다양성이 품질만큼 중요한 과제.
- 대안 용도 과제(AUT): 흔한 사물(책·신발·망치 등)의 색다른 용도를 떠올리는 인지심리학의 발산적 사고 검사(모델당 10개 임베딩).
- Infinity-Chat100: 실제 사용자 상호작용에서 뽑은 100개의 열린 프롬프트(모델당 100개 임베딩).
- 다양성(코사인 거리): 두 응답 임베딩의 코사인 거리 d = 1 − cos(x_i, x_j). 값이 낮을수록 서로 닮음.
- 알고리즘 단일문화(algorithmic monoculture): 서로 다른 모델의 산출물이 한 방향으로 수렴해 다양성이 좁아지는 현상.
- 계열 간(cross-family) 쌍: 서로 다른 제공사·계열 모델의 응답 쌍으로, 공유 아키텍처·데이터 교란을 줄이기 위한 비교 단위.
연구 방법 (Method)
- 모델: 68개(12개 제공사, 폐쇄가중치 33 · 공개가중치 34), 2023년 3월 ~ 2026년 7월 출시.
- 프롬프트: AUT + Infinity-Chat100 두 세트.
- 임베딩:
all-MiniLM-L6-v2문장 임베딩으로 응답을 벡터화. - 지표: 응답 쌍의 코사인 거리로 다양성 측정, 계열 간 쌍만 분석.
- 시간축: 27개 출시 월을 9개 구간(bin)으로 묶어 구간당 기울기 추정, 1,000회 리샘플링(부트스트랩)으로 기울기 부호의 안정성 검증.
연구 결과 (Findings)
- 다양성의 통계적으로 유의한 감소 — 즉 모델 간 산출물의 수렴.
- AUT 기울기: 약 −0.01385/구간 (95% CI [−0.01695, −0.01044]).
- Infinity-Chat100 기울기: 약 −0.00167/구간 (95% CI [−0.00267, −0.00074]).
- 계열 간 평균 거리: AUT 약 0.50 → 0.40 미만, Infinity-Chat100 약 0.34 → 0.32.
- 강건성: 1,000회 리샘플링에서 두 세트 모두 전부 음의 기울기.
- 감소 폭은 정형화된 심리검사(AUT)에서 실사용 질의(Infinity-Chat100)보다 더 컸다.
논의 및 결론 (Discussion & Conclusion)
서로 다른 계열의 모델조차 창의 과제에서 점점 닮은 답을 내놓는다는 것은 다양성이 좁아지고 있다는 신호다. 이 추세가 지속되면 LLM 주도 획일화가 인간-AI 공동 창작에서 인간의 주체성을 점진적으로 잠식할 수 있다. 저자들은 나아가 "점점 덜 창의적인 LLM"이 인간 창의성에 대한 부정적 영향(기존 연구가 지적)을 악화시킬 가능성도 우려한다. 단, 예비 분석임을 명확히 하며 인과·구조적 해석에는 신중을 요청한다.
후속 연구 제안 (Future Work)
- 프롬프트 수준 분해(prompt-level decomposition) 분석.
- 임베딩 외 보완 유사도 지표(Jaccard, 문장 구조 분석 등) 도입.
- 파라미터·과제 유형·모델 크기에 걸친 강건성 점검.
- 관찰된 수렴이 일시적 발전 부산물인지 구조적 제약인지 규명.
주제어 (Keywords)
LLMs, 창의성 평가, 발산적 사고, 산출물 동질화, 의미 유사도, 알고리즘 단일문화, 시간적 분석, 열린 생성.
3. 🏫 교육 현장 시사점
1. "모델을 여러 개 쓰면 다양해진다"는 가정을 재검토: 서로 다른 회사의 LLM도 창의 과제에서 서로 닮은 답으로 수렴한다. 여러 챗봇을 돌려 쓴다고 학생 산출물의 다양성이 저절로 보장되지 않는다.
2. 'AI 초안 → 인간 발산' 순서 설계: AI가 먼저 발산(브레인스토밍)을 맡으면 반 전체가 비슷한 출발점에 서기 쉽다. AI를 초안·정리·비평 도구로 뒤에 두고, 아이디어 발산은 학생이 먼저 하도록 순서를 뒤집는다.
3. 학생 고유의 목소리·경험을 채점 준거로 명시: 글쓰기·예술 수행평가 루브릭에 '개인적 관점·구체적 경험·비관습적 발상'을 별도 배점으로 넣어, 매끄럽지만 획일적인 AI투 답안이 자동으로 높은 점수를 받지 않게 한다.
4. 의도적 '마찰' 삽입: 제약 조건 바꾸기, 낯선 관점으로 다시 쓰기, 손으로 초안 쓰기, 동료와 교차 비평 등 발산을 강제하는 과제 장치로 수렴을 되돌린다(오늘 리포트 앵커의 '마찰' 처방과 연결).
5. AUT 같은 발산적 사고 활동을 수업에 직접 활용: 흔한 사물의 색다른 용도 떠올리기 같은 짧은 발산 훈련은 AI 없이도 학생의 독창성을 키우고, AI 산출물과 대비해 '무엇이 진짜 새로운가'를 체감하게 한다.
6. AI 리터러시로 '단일문화' 개념 가르치기: 여러 모델이 왜 닮은 답을 내는지(공유 데이터·유사 정렬 기법)를 다루어, 학생이 AI 출력을 무비판적으로 '유일한 정답'으로 받아들이지 않도록 한다.
4. ⚠️ 한계와 유의점
- 저자 스스로 "예비 분석"임을 명시한다. 인과·구조적 결론은 유보되어 있다.
- 증류(distillation)·공유 학습 데이터·공통 기법 등 숨은 관계를 완전히 통제하지 못한다(계열 간 쌍으로 완화했을 뿐).
- 모델·프롬프트당 응답 1개만 사용해 산출물 분포의 점추정치에 그친다(온도·재생성 다양성 미반영).
- 데이터셋 내 예상치 못한 중복(예: 영화 주토피아를 묻는 프롬프트 2개) 존재.
- 사용자의 프롬프트 전략에 따른 다양성 효과는 제외됨 — 즉 사람이 잘 유도하면 결과가 달라질 여지는 측정 밖.
- 임베딩 기반 지표는 텍스트 수준·구조 수준 지표로 보완될 필요가 있다.
- 수집 시 분류된 카테고리는 cs.CY였으나 arXiv 원문의 1차 카테고리는 cs.CL로 확인됨.
5. 📎 인용
Patel, N., Crossman, J., Aggarwal, E., & Wenger, E. (2026). *Are LLMs becoming similarly creative? Evidence from three years of models* (arXiv:2608.19437) [Preprint]. arXiv. https://arxiv.org/abs/2608.19437
근거 1줄: 3년·68개 모델의 창의 과제 응답이 계열을 넘어 통계적으로 유의하게 수렴한다는 실증은 "여러 AI를 써도 산출물은 획일화될 수 있다"는 주장의 1차 근거로 쓸 수 있다.