원문 제목: Candidate supply and answer selection shape the value of LLM judging in multi-agent systems
한눈에 보기
15,336개 문항으로 LLM 판정자의 신뢰도를 분석하고, 81,390개 후보 풀을 재생해 생성과 선택을 분리했다. 정답 후보가 만들어졌어도 최종 선택에서 잃는 경우가 적지 않았으며, 후보 답의 빈도와 판정자 점수를 결합한 선택기는 생성기를 바꾸지 않고 정확도를 63.82%에서 70.82~70.95%로 높였다.
연구 질문과 설계
다중 에이전트 성능에서 후보 생성과 최종 답 선택이 각각 어떤 기여와 실패를 만드는지 분리해 분석했다.
15,336개 문항으로 판정자 신뢰도를 살피고, 81,390개 후보 풀을 재생해 선택 규칙을 비교했다.
핵심 결과
정답 후보가 이미 생성됐지만 선택 단계에서 사라지는 경우가 확인됐다. 답 빈도와 LLM 판정 점수를 결합한 선택은 생성기를 바꾸지 않고 정확도를 63.82%에서 70.82~70.95%로 높였다.
교육·평가 시스템에 주는 의미
여러 답안을 생성해 채점·피드백을 만드는 시스템은 생성 성공률과 선택 성공률을 따로 기록해야 한다. 모델 추가 호출보다 선택기의 보정이 더 효율적인 경우가 있을 수 있다.
한계와 읽기 주의
사전논문이며 특정 질문·모델 구성의 결과다. 교육 채점처럼 규범적 판단이 필요한 과제에서는 빈도가 진실이나 공정성을 보장하지 않으므로 인간 검토와 과제별 검증이 필요하다.
인용 맥락 메모
다중 에이전트 평가에서 생성 품질과 선택 품질을 분리해야 한다는 주장의 실증 근거로 쓸 수 있다.
APA 7판
Ji, J., Li, S., Cheng, J., She, Z., Yu, J., & Yuan, Z. (2026). Candidate supply and answer selection shape the value of LLM judging in multi-agent systems [Preprint]. arXiv. https://arxiv.org/abs/2608.25937