논문 개요
Kim 등은 2026년 10월 1일 arXiv에 ScholarCatalyst를 공개했다. 연구자 184명이 207개 연구 프로젝트에 도움이 되는 논문과 그 이유를 검토한 문헌 검색 벤치마크다. 동료평가 완료를 전제할 수 없는 사전공개 연구이며, 교실 학습 효과를 시험한 연구도 아니다.
요약
ScholarCatalyst는 주제가 비슷한 문헌보다 새로운 연구를 진전시키는 문헌을 찾아내는 능력을 평가한다. 연구진은 최근 컴퓨터과학 연구 207건의 저자 184명에게 도움이 되었거나 도움이 될 수 있는 논문과 이유를 판단하게 했다. 핵심 연구질문 207개와 하위질문 687개를 구성하고 190,896편의 문헌에서 검색하도록 설계했다. 검색 대상은 해당 프로젝트 시작 시점에 이용할 수 있었던 선행연구로 제한했다. 대표 비교에서 임베딩 검색의 Recall@20은 .48, 검색 도구를 사용하는 에이전트는 .42였다. 이 지표는 정답 문헌 중 상위 20개 결과에서 찾은 비율이며 검색 결과의 정확도와 다르다. 하위질문에서 유용하다고 판정된 논문의 43.6%는 원래 논문의 참고문헌에 없었다. 다만 연구자의 회고 판단, 후보 생성 방식, 컴퓨터과학에 집중된 표본은 해석을 제한한다. 따라서 이 벤치마크는 문헌 검색의 평가 목표를 넓히는 근거이며 특정 도구가 모든 학문 분야에서 우수하다는 결론은 아니다.
필요성·목적
연구자는 익숙한 용어가 들어 있는 논문을 많이 찾는 것만으로 연구문제를 해결하지 못한다. 다른 세부 분야의 방법을 가져오거나, 가정의 한계를 드러내는 자료를 만날 때 연구 방향이 바뀌기도 한다. 기존의 인용 목록이나 주제 유사도를 정답으로 삼으면 이러한 기여를 놓칠 수 있다.
이 연구는 논문이 프로젝트에 어떤 역할을 했는지 아는 저자의 판단을 평가 자료로 삼았다. 목표는 그럴듯한 문헌 목록을 만드는 능력과 실제 연구 진행에 유용한 선행연구를 찾아내는 능력을 구분하는 데 있다.
연구문제
첫째, 초기 연구질문만 주어졌을 때 이후 연구에 도움이 되는 선행연구를 회수할 수 있는가. 둘째, 도구를 반복 사용하는 에이전트 검색은 임베딩 검색보다 유용한 문헌을 더 잘 찾는가. 셋째, 주제 유사도와 인용 여부가 연구에 기여하는 문헌을 얼마나 잘 대변하는가. 독자의 이해를 위해 원문의 평가 과제를 질문 형태로 정리했다.
주요 용어
- 핵심 연구질문(CoreQ): 프로젝트의 중심 문제를 설명하는 검색 질문이다.
- 하위질문(SubQ): 연구에 필요한 특정 방법이나 세부 문제를 묻는 검색 질문이다.
- 임베딩 검색(embedding retrieval): 질문과 문헌을 수치 표현으로 바꾸고 가까운 문헌을 찾는 방식이다.
- 에이전트 검색(agentic search): 모델이 질문을 조정하거나 검색 도구를 반복 사용해 결과를 모으는 방식이다.
- 상위 20개 재현율(Recall@20): 정답으로 판단된 문헌 가운데 상위 20개 결과에 포함된 문헌의 비율이다.
- 학습자료 혼입(contamination): 평가 대상이나 완성된 연구가 모델 학습에 들어가 평가 성능을 높였을 가능성이다.
방법
저자의 판단과 검색 과제
연구진은 2025~2026년 컴퓨터과학·AI 분야의 논문을 중심으로 저자를 모집했다. 연구자 184명이 207개 프로젝트에 대해 후보 문헌이 실제로 기여했거나 기여할 수 있었는지와 그 이유를 평가했다. 프로젝트마다 핵심 질문 하나와 여러 하위질문을 구성해 총 894개 질문을 얻었다.
저자의 노동을 줄이기 위해 자동 시스템이 질문·후보·판정 이유의 초안을 만들고 저자가 검토·수정하는 절차를 사용했다. 후보에는 인용 논문뿐 아니라 검색으로 발견한 비인용 논문도 포함됐다. 따라서 사람이 참여한 판단이지만 후보의 범위와 제시 방식에서 자동 시스템의 영향이 완전히 사라지는 설계는 아니다.
검색 문헌과 시간 조건
검색 집합은 190,896편이다. 원래 프로젝트의 참고문헌과 추가 arXiv 문헌을 결합했고, 프로젝트가 시작될 때 알 수 있었던 자료를 찾도록 시간 제한을 적용했다. 전체 인터넷 검색의 최신 성능을 그대로 비교한 실험과는 다르다.
논문은 임베딩 검색과 이를 도구로 사용하는 에이전트를 비교했다. 주된 비교에서는 학습 시점과 연구 시점의 관계를 고려했고, 완성된 논문을 학습했을 수 있는 최신 모델 결과는 별도로 논의했다. 이 구분 없이 가장 높은 점수만 고르면 평가 조건이 다른 결과를 혼합하게 된다.
결과
반복 검색이 자동으로 더 높은 재현율을 보장하지 않았다
초록의 대표 결과는 임베딩 검색 .48, 에이전트 검색 .42의 Recall@20이다. 정답 문헌 10편이 있는 가상의 질문에서 상위 20개 결과가 그중 5편을 찾았다면 Recall@20은 .50이다. 이 예시는 지표 설명용이며 실제 표본의 평균 정답 수를 뜻하지 않는다. 같은 결과의 정밀도는 5/20=.25이므로 두 지표를 바꾸어 표현해서는 안 된다.
이 비교가 모든 에이전트 방식의 열등함을 입증하는 것은 아니다. 과제 종류와 모델, 검색 설정에 따라 결과가 달라지고, 논문 표에는 핵심질문과 하위질문을 나눈 성능도 제시돼 있다. 결과가 직접 보여 주는 범위는 이 문헌 집합과 저자 판단에 따른 비교에서 도구를 더 많이 사용한다고 회수 성능이 보장되지는 않았다는 점이다.
인용되지 않았어도 연구에 기여할 수 있는 문헌이 있었다
하위질문의 긍정 판정 문헌 중 43.6%는 원래 논문에 인용되지 않았다. 논문을 인용하지 않은 이유는 여러 가지일 수 있으므로 이를 누락이나 잘못된 연구 관행으로 해석할 근거는 없다. 결과는 참고문헌 목록이 연구에 유용한 문헌 전체와 같지 않다는 점을 보여 준다.
주제와 표현이 비슷한 문헌도 방법 선택이나 문제 해결에는 도움이 적을 수 있다. 반대로 다른 맥락의 문헌이 핵심 아이디어를 제공할 수 있다. 이 벤치마크는 유용성 판단의 이유를 함께 남겨 이러한 구분을 평가에 포함했다.
논의·결론
이 논문의 기여는 문헌 검색을 연구 과정의 관점에서 평가하려 한 데 있다. 단순히 관련 문헌이 있다는 사실에 더해 어떤 방법, 개념, 판단에 기여했는지 설명하도록 했다. 검색 도구를 평가하는 사람에게도 결과 목록의 양이나 설명의 유창함과 별개인 기준을 제시한다.
정답 자료는 완성된 연구를 돌아보는 저자의 판단에 의존한다. 결과를 알고 난 뒤 선행연구의 역할을 더 명확하게 해석했을 가능성이 있고, 다른 연구자가 같은 문헌을 똑같이 평가한다는 보장도 없다. 후보 검색과 사전 판정 방식은 평가할 수 있는 문헌의 범위를 제한한다. 따라서 정답 목록에 없다고 무가치한 문헌이라고 판단해서도 안 된다.
컴퓨터과학 중심의 최근 연구와 주요 학회 참여자 표본을 교육학·인문학의 문헌 탐색에 그대로 적용할 수는 없다. 시간 조건을 두었더라도 모델의 학습자료를 완전히 확인하기 어려운 문제도 남는다. 최신 모델의 별도 높은 점수를 오염 가능성 설명 없이 순위에 합치지 않은 이유다.
교사·연구모임의 적용안
연구모임은 문헌을 저장할 때 연구질문과 기여 역할을 함께 적어 볼 수 있다. 예를 들어 조사 도구를 설계하는 데 참고한 문헌, 결과 해석에 반례를 주는 문헌, 다른 맥락으로의 적용을 제한하는 문헌을 구별하는 방식이다. 이때 논문 원문에서 해당 근거가 있는 위치를 남기면 이후 인용 검토도 쉬워진다.
검색 도구를 비교하려면 같은 질문과 검색 시점을 사용하고, 결과 수를 맞춘 뒤 실제로 기여한 문헌을 검토해야 한다. 여러 사람이 독립적으로 판단한 차이도 기록할 수 있다. 다만 교사 연구모임에는 사전에 완전한 정답 목록이 없으므로 벤치마크와 같은 재현율을 정확히 계산했다고 주장하지 않는 것이 적절하다.
이 적용안은 논문의 평가 원리를 학교 연구 활동에 옮긴 제안이다. 학생의 탐구 성과나 교사의 연구 역량을 높이는 효과가 이 논문에서 검증된 것은 아니다.
후속연구
교육학 등 다른 분야에서 프로젝트 시작 시점부터 검색과 판단을 기록하는 전향적 자료가 필요하다. 복수 연구자의 합의와 불일치를 함께 남기고, 후보 생성 방식이 정답 목록에 주는 영향도 비교할 수 있다. 문헌을 찾았는지뿐 아니라 찾은 뒤 연구 설계가 어떻게 달라졌는지 추적하면 검색과 연구 기여의 관계를 더 직접적으로 검증할 수 있다.
주제어
학술 문헌 검색(scholarly retrieval), 연구 기여(research utility), 벤치마크(benchmark), 에이전트 검색(agentic search), 재현율(recall), 저자 판단(author judgments).
인용 맥락과 근거 추적
문헌의 주제 유사도·인용 여부와 실제 연구 기여를 구분하는 평가 설계의 근거로 인용할 수 있다. 표본과 검색 집합은 원문 §3 및 Table 1, 대표 성능은 초록과 실험 표, 비인용 비율은 하위질문 통계, 해석 범위는 한계 논의에 근거했다. 점수는 특정 시점의 평가 조건에 묶여 있으며 도구 선택의 영구적인 순위로 제시하지 않았다.
APA 및 원문
Kim, S., Lee, Y., Liu, B., Ko, D., Shao, R., Kim, S., Neubig, G., Koh, P. W., Chowdhery, A., Asai, A., Khattab, O., Choi, Y., Kim, G., & Finn, C. (2026). ScholarCatalyst: A benchmark for retrieving papers that inspire new research [Preprint]. arXiv. https://arxiv.org/abs/2610.02202