1. 논문 요약
PlotGround는 실제 과학 그림에서 AI가 숫자를 얼마나 정확하게 복원하는지 평가하기 위한 연구다. 연구진은 그림과 저자 공개 원표를 연결해 표에서 정답을 계산하는 절차를 만들었다. 2025년 bioRxiv 논문 가운데 기계가 읽을 수 있는 표 보충자료를 가진 논문을 출발점으로 삼았다. 사람이 후보 문항을 모두 검토한 뒤 1,066편에서 나온 1,119문항을 평가 자료로 남겼다. 16개 다중모달 모델에 그림과 질문을 주자 최고 정확도는 허용 상대오차 ±5%에서 87.5%였다. 같은 모델도 허용오차를 ±2%로 줄이면 73.8%로 낮아졌다. 모든 모델에서 더 엄격한 기준의 정확도는 11~24%포인트 낮아졌다. 별도의 500문항 에이전트 실험에서는 본문과 그림을 제공할 때 90.0%, 본문과 원표를 제공할 때 97.4%의 정확도를 얻었다. 원표 조건의 평균 비용도 그림 조건보다 72% 낮았지만 이 수치는 해당 에이전트와 실험 설정에 묶여 있다. 생물학과 재구성 가능한 그림을 중심으로 만든 사전공개 연구이므로 모든 과학 그림이나 학생의 자료 해석 능력으로 결과를 일반화할 수 없다.
2. 연구의 필요성 및 목적
그래프는 연구 결과를 빠르게 파악하게 해 주지만 정확한 숫자를 다시 사용하는 데는 한계가 있다. 축 사이의 위치를 읽어 숫자로 바꾸는 과정에서 생긴 오차는 비율 계산이나 후속 분석에 전파될 수 있다. AI가 그래프의 추세를 설명하는 능력과 원래의 값을 정밀하게 복원하는 능력을 구분해 평가할 필요가 있다.
기존 그래프 평가에는 합성된 차트나 제한된 유형이 많이 쓰였다. 연구진은 실제 생물학 그림과 그 그림을 만든 표를 연결했다. 그 목적은 그림에서 얻은 그럴듯한 추정값을 다시 정답으로 삼는 순환을 피하고, 원자료에 근거한 비교 기준을 마련하는 데 있다.
이 연구의 결과는 교사가 논문 수치를 연수 자료로 옮기거나 연구자가 그림에서 값을 추출할 때 참고할 수 있다. 학생의 통계 이해나 수업 성취를 시험한 교육 실험은 아니다.
3. 연구문제와 주요 용어
연구는 세 질문을 다룬다. 실제 논문 그림과 원표로 신뢰할 만한 수치 문항을 만들 수 있는가. 현재 모델들은 허용 오차가 달라질 때 얼마나 정확하게 답하는가. 같은 과학적 질문에 답할 때 그림·원표·두 자료 모두를 제공하는 방식이 에이전트 성능에 어떤 차이를 만드는가.
그래프 수치화(plot digitization)는 시각적으로 그려진 위치를 수치로 복원하는 일이다. 근거 연결(grounding)은 특정 패널의 막대나 점을 원표의 행·열과 계산 절차에 연결하는 것을 뜻한다.
상대오차(relative error)는 참값에 비해 추정값이 얼마나 벗어났는지 나타낸다. 예를 들어 참값이 100이면 104는 ±5% 기준에서 정답이지만 ±2% 기준에서는 오답이다. 이 예시는 평가 기준을 설명하기 위한 것으로 논문에 실린 개별 문항은 아니다. 정확도가 90.0%에서 97.4%가 됐다는 말은 7.4%포인트 증가이며, 7.4%의 상대적 증가와 구분한다.
4. 연구방법
그림과 원표의 연결
절차는 그림·보충자료 연결, 패널별 재구성 가능성 확인, 질문·정답 생성의 세 단계다. 본문·캡션·표의 명칭을 근거로 대응 관계를 찾고, 어떤 시트와 열을 골라 필터링·집계·변환해야 값을 얻는지 기록한다.
재구성 기준은 보수적이었다. 복잡한 분야별 분석이 필요하거나, 어떤 열이 대응하는지 모호하거나, 기준이 되는 정규화 값이 불분명하면 제외했다. 질문은 패널 이름·범례·축 표시처럼 그림 안에서 볼 수 있는 식별자로 대상을 지정했다. 한 그림에서 최대 두 문항을 만들고 사람이 검토했다.
평가 자료의 범위
보충자료가 비어 있지 않은 bioRxiv 논문 37,635편 중 표 파일을 가진 논문은 10,540편이었다. 연결 단계 이후 비용을 통제하기 위한 표집과 패널 검토를 거쳤다. 최종 후보 1,205문항을 전수 검토해 1,119문항을 남겼다. 후보 통과율은 92.9%이며, 이는 질문 생성 절차의 검토 결과다. 모델이 수치를 맞힌 비율과 혼동해서는 안 된다.
그림은 생물학 분야에 집중돼 있다. 원표가 존재하고 값의 대응이 명확하며 비교적 읽기 쉬운 대상을 선호한 선정 과정은 정답의 신뢰성을 높이는 동시에 적용 범위를 제한한다.
16개 모델의 그림 판독 평가
각 모델에는 전체 그림과 특정 패널의 수치 질문을 제공했다. 이미지는 긴 변을 최대 1,600픽셀로 맞추고 원래 비율을 유지했다. 모델의 수치 답변을 원표 기반 정답과 비교해 ±5%와 ±2% 상대오차 기준의 정확도를 계산했다. 호출은 각 모델의 기본 설정을 따랐다.
이 실험은 그림만으로 값을 읽는 능력을 비교한다. 모델이 전체 논문과 원표를 찾아보는 상황과는 다르며, 여기서 얻은 순위를 특정 학교 업무의 종합 성능 순위로 해석할 수 없다.
500문항의 입력 자료 비교
별도 실험에서는 질문을 논문의 과학적 표현으로 다시 쓰고 그림·패널·축을 직접 가리키는 표현을 제거했다. 답이 본문에 그대로 적힌 문항을 제외한 뒤 500개를 무작위로 뽑았다. 같은 질문을 코딩 에이전트가 처리하되, 작업 폴더의 자료만 바꿨다.
세 조건 모두 논문 본문을 제공했다. 첫 조건에는 그림, 둘째에는 보충 원표, 셋째에는 그림과 원표를 함께 줬다. 그림이 포함된 논문 PDF는 제공하지 않아 조건이 섞이지 않도록 했다. 에이전트는 Claude Code와 Claude Sonnet 5를 사용했다. 도구 사용과 주변 맥락, 질문 표현 및 이미지 해상도가 앞선 실험과 달라 두 실험의 정확도를 직접 비교하지 않는다.
5. 연구결과
허용 오차를 줄이면 판독 성능이 낮아졌다
16개 모델 평가에서 GPT-5.6 Sol은 ±5% 기준 87.5%로 가장 높았다. ±2% 기준에서는 73.8%로 낮아졌다. 모델 전체로 보면 하락 폭은 약 11~24%포인트였다. 상대적인 순위가 대체로 유지되더라도 정확한 수치를 재사용하는 데 충분한지는 별도 판단이 필요하다.
이 결과는 모델이 대략적인 그래프를 이해하지 못한다는 주장과 다르다. 같은 답이 느슨한 기준을 통과하면서 엄격한 기준에서는 실패할 수 있다는 뜻이다. 또한 모델당 비용과 출력 토큰이 많다고 판독 정확도가 높지는 않았다. 비용 수치는 논문 평가 당시의 호출 조건에 한정된다.
오류는 축과 눈금을 수치로 바꾸는 과정에서 나타났다
연구진의 질적 오류 분석에서는 로그 축 중간값을 잘못 보간하거나, 실제 값 대신 가까운 눈금 숫자를 답하는 사례가 나타났다. 로그 축에서는 같은 시각적 간격이 같은 차이가 아니라 같은 비율을 나타낸다. 모델이 축의 종류를 알아도 그 위치를 정밀한 숫자로 변환하는 데 실패할 수 있다.
원문 사례 중 실제 값이 4.99인 막대는 마지막 눈금 4보다 더 길었지만, 16개 모델 중 8개가 4라고 답했다. 이 사례는 눈금 표기를 읽는 것과 눈금 밖의 위치를 추정하는 것이 다른 과제임을 보여 준다. 대표적인 오류 사례 분석이므로 전체 오류에서 각 유형이 차지하는 비율까지 알려 주는 것은 아니다.
원표 제공 조건은 정확도와 비용 모두 달랐다
500문항 에이전트 평가의 ±5% 기준 정확도는 본문+그림 90.0%, 본문+원표 97.4%, 본문+그림+원표 98.2%였다. 원표 조건의 개선 폭은 그림 조건 대비 7.4%포인트다. 그림과 표를 함께 주는 조건은 표만 줄 때보다 0.8%포인트 높았지만, 다른 에이전트에서도 같은 차이가 난다고 확인한 결과는 아니다.
문항당 평균 비용은 그림 조건 0.408달러, 원표 조건 0.113달러였다. 원문은 이를 약 72% 감소로 보고했다. 평균 지연 시간은 각각 139초와 51초였다. 그림 조건에서는 잘라 보기·확대·픽셀 위치 측정 같은 반복 작업이 필요했다. 원표를 주면 수치가 직접 계산 가능한 형태로 제공되므로 이런 절차를 줄일 수 있었다.
90.0%를 앞선 최고 모델의 87.5%보다 높은 일반 성능으로 읽어서는 안 된다. 질문 집합과 표현, 본문 제공 여부, 도구 사용 조건이 모두 다르다. 비교의 근거는 각 실험 안에서 일치시킨 조건에 있다.
6. 논의 및 한계
이 연구는 AI의 수치 답변을 개선하는 방법을 모델 자체의 능력뿐 아니라 입력 자료의 형태에서 찾는다. 그래프만 주고 숫자를 추정하게 하는 과제와 원표에서 값을 계산하게 하는 과제는 같은 과학적 질문에도 다른 오류를 낳을 수 있다.
원표가 있다고 자동으로 올바른 답을 얻는 것은 아니다. 변수·단위·집계 방식·정규화 기준을 정확히 연결해야 한다. 그림과 표가 서로 다른 값을 가리킨다면 어느 쪽이 맞는지 추가로 확인해야 하며, 표에 있다는 이유만으로 최종 결론을 확정할 수 없다.
표 보충자료를 공개한 생물학 논문에 집중됐고, 보수적인 필터로 모호한 패널을 제외했다. 따라서 원표가 없는 그림이나 더 복잡한 분야에서 성능이 같을 것이라고 기대할 근거는 부족하다. 또한 평가는 개별 표시값의 복원에 초점을 두었으며 전체 데이터 계열의 완전한 복원이나 통계적 해석까지 검증하지 않았다.
자동 생성 절차 뒤에 사람의 전수 검토가 있었다는 점도 중요하다. 이를 완전 자동으로 신뢰할 수 있는 정답 제작 과정으로 소개하면 검토 비용과 역할이 사라진다. 논문은 arXiv v1 사전공개본이며, 본문에는 평가 자료와 절차를 채택 후 공개할 예정이라고 적혀 있다. 이미 모든 자원이 공개됐다고 가정하지 않는다.
7. 교사·연구자를 위한 적용 제안
교사가 연수 슬라이드에 그래프 수치를 옮길 때는 우선 논문의 보충자료에서 CSV·엑셀을 찾을 수 있다. 다음으로 그래프의 축·범례를 표의 열과 연결하고, 평균인지 중앙값인지, 비율인지 원자료인지 확인한다. 계산이 필요하면 사용한 행과 변환 방식을 남긴다. 마지막으로 결과를 그림과 비교해 방향과 규모가 일치하는지 점검한다.
원표가 없는 경우에는 값을 정밀한 측정치처럼 인용하기보다 그림에서 추정한 값임을 밝히는 편이 적절하다. 정밀도가 필요한 연구 분석이라면 저자에게 원자료를 문의하거나 다른 검증 가능한 자료를 찾는 판단도 필요하다. 이 절차는 연구 결과를 바탕으로 리포트가 제안하는 활용법이며, 논문이 교사를 대상으로 효과를 검증한 연수안은 아니다.
자료 해석 수업에서는 같은 그래프를 보고 눈금으로 추정한 값과 원표의 값을 비교하는 활동을 설계할 수 있다. 다만 학생이 사용하는 자료의 난도와 통계 지식에 맞춰야 하며, 이 논문의 모델 정확도를 학생 평가 기준으로 사용하지 않는다.
8. 후속 연구와 주제어
다른 학문 분야와 복잡한 그림으로 범위를 넓히고, 개별 값에서 전체 계열 복원으로 평가 단위를 확장할 필요가 있다. 원표가 없거나 서로 충돌하는 경우를 다루는 실험도 실제 활용 범위를 더 잘 보여 줄 수 있다. 사람 검토를 줄이면서 정답의 신뢰성을 유지하는 방법 역시 논문이 남긴 과제다.
주제어: 과학 그림(scientific figures), 그래프 수치화(plot digitization), 원자료(source data), 다중모달 모델(multimodal models), 상대오차(relative error), 근거 표현(evidence representation).
9. 출처와 APA
Zhang, Y., Li, B., Duan, H., Miao, J., Wang, Y., Du, X., Li, C., Liu, S., Wu, K., & Zou, J. (2026). PlotGround: Grounding plot digitization in real scientific figures and their source data [Preprint]. arXiv.
근거 위치: 원문 3장과 표 1은 자료 생성·선정, 4.2~4.3절과 표 2는 16개 모델 평가, 4.4절은 오류 사례, 4.5절과 표 3은 500문항 자료 조건 비교를 설명한다. 결론 뒤 한계 절에서 분야·선정·검토·평가 단위의 제한을 확인했다. 저자·제출일은 arXiv 메타데이터와 대조했으며 분석 기준일은 2026년 10월 7일이다.