← 최신 논문
💻 computer science

How Far Is Document Parsing from Solved? PureDocBench: A Source-TraceableBenchmark across Clean, Degraded, and Real-World Settings

본 논문은 포화된 OmniDocBench 순위의 중대한 결함을 드러내고 문서 파싱이 모델 간 상당한 성능 격차와 수식 인식의 지속적인 병목 현상으로 인해 여전히 해결되지 않은 과제로 남아 있음을 보여주는 청결, 열화, 실제 세계 문서 이미지를 모두 포함하는 소스 추적 가능한 벤치마크인 PureDocBench를 소개한다.

원저자: Zhiheng Li, Zongyang Ma, Jiaxian Chen, Jianing Zhang, Zhaolong Su, Yutong Zhang, Zhiyin Yu, Ruiqi Liu, Xiaolei Lv, Bo Li, Jun Gao, Ziqi Zhang, Chunfeng Yuan, Bing Li, Weiming Hu

게시일 2026-05-12
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zhiheng Li, Zongyang Ma, Jiaxian Chen, Jianing Zhang, Zhaolong Su, Yutong Zhang, Zhiyin Yu, Ruiqi Liu, Xiaolei Lv, Bo Li, Jun Gao, Ziqi Zhang, Chunfeng Yuan, Bing Li, Weiming Hu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

세상에서 최고의 요리사를 판단하려 한다고 상상해 보세요. 지난 1 년 동안 모든 요리사가 OmniDocBench라는 작고 좁은 주방에서 경쟁해 왔습니다. 이 주방에는 단 1,355 개의 요리만 있으며, 심사위원 (점수 부여 시스템) 은 너무 관대해서 거의 모든 최상위 요리사가 90% 이상의 점수를 받았습니다. 마치 모든 사람이 정확히 같은 시간에 결승선을 통과하는 경주와 같아서, 누가 실제로 더 빠르고 뛰어난지 구분할 수 없습니다.

더욱이 심사위원들은 실수를 저질렀습니다. 재료를 잘못 세거나, 단계를 놓치거나, 심지어 존재하지 않는 맛을 환각처럼 지어내기도 했습니다. '레시피'(정답) 가 결함이 있었기 때문에 리더보드 순위는 신뢰할 수 없습니다. 게다가 모든 요리사가 1 년 동안 이 같은 주방에서 요리해 왔기 때문에, 요리사들이 요리를 배우기보다는 요리를 외웠을 가능성도 있습니다.

이제 이 논문에서 소개된 새롭고 방대하며 완벽하게 정돈된 주방인 PureDocBench가 등장합니다.

새로운 주방: PureDocBench

오래되고 지저분한 레시피를 사용하는 대신, PureDocBench 의 제작자들은 **디지털 설계도 (HTML/CSS)**를 사용하여 처음부터 주방을 구축했습니다.

  • 설계도: 먼저 문서의 코드를 작성했습니다.
  • 요리: 그 코드를 사용하여 문서의 이미지를 생성했습니다.
  • 정답지: 코드를 먼저 작성했기 때문에 텍스트, 표, 수식이 정확히 어떻게 보여야 하는지 완벽하게 알고 있습니다. 추측할 필요가 없습니다.

이 주방은 거대합니다. 10 가지 다른 유형의 레스토랑(학술, 법률, 의료, 금융 등) 과 66 가지 구체적인 메뉴(인보이스, 졸업장, 실험 보고서 등) 가 있습니다.

모든 요리의 세 가지 버전

요리사들이 실제로 얼마나 어려운지 테스트하기 위해, 이 주방은 모든 요리를 세 가지 다른 조건으로 제공합니다:

  1. 청결한 상태: 오븐에서 갓 나온 완벽한 신선한 접시.
  2. 디지털 열화: 나쁜 스캐너로 스캔되거나 사진이 압축되어 흐릿하거나 누렇게 변한 상태 (오래된 팩스와 유사).
  3. 실제 세계 열화: 접시를 인쇄한 후 어두운 조명에서 손이 떨리는 상태로 사진을 찍거나, 혹은 복사본을 다시 복사한 상태.

이것은 결정적으로 중요합니다. 요리사가 완벽한 요리를 플레이팅하는 데는 뛰어나지만, 지저분한 요리를 서빙하는 데는 서툴 수 있기 때문입니다.

결과: 실제로 누가 이겼는가?

연구자들은 이 새로운 주방에서 40 가지 다른 요리사(AI 모델) 를 테스트했습니다. 그들이 발견한 바는 다음과 같습니다:

1. 경주는 아직 멀었다
이전 주방에서는 최고의 요리사들이 90% 이상의 점수를 받았습니다. 하지만 PureDocBench 에서는 절대적인 최고의 요리사가 100 점 만점에 74 점만 받았습니다. 최상위와 최하위 사이에는 거대한 격차 (44 점) 가 존재합니다. 이는 문서 파싱이 아직 해결되지 않았으며, 여전히 개선의 여지가 많다는 것을 의미합니다.

2. 작은 전문가 vs 거대한 일반주의자
두 가지 유형의 요리사가 있습니다:

  • 전문가: 문서 요리만 할 줄 아는 요리사. 작고 효율적입니다.
  • 일반주의자: 무엇이든 요리할 수 있지만 문서에 특화되지 않은 거대하고 다재다능한 요리사.

이 논문은 작은 전문가(일부는 40 억 개 미만의 '뇌 세포'를 가진) 가 거대한 일반주의자(100 배 더 클 수 있음) 와 마찬가지로, 혹은 더 뛰어나다는 것을 발견했습니다. 마치 작은 전문 초밥 요리사가 거대한 뷔페 요리사를 초밥 만들기에서 이기는 것과 같습니다.

3. 수식 병목 현상
요리사가 얼마나 똑똑하든 수학 공식이 가장 어려운 부분입니다. 최고의 모델조차도 공식에서 약 **67%**만 정확히 맞춥니다. 이는 보편적인 약점입니다.

4. '지저분한 접시'의 놀라운 사실
가장 흥미로운 발견입니다.

  • 전문가 요리사들은 접시가 지저분해졌을 때 (실제 세계 열화) 무너졌습니다. 점수가 크게 떨어졌습니다.
  • 일반주의자 요리사들은 놀라울 정도로 강했습니다. 그들은 지저분하고 흐릿한 실제 세계 사진을 훨씬 잘 처리했습니다.

이는 완벽한 청결한 접시만 테스트하면 실제 세계에서 누가 성공할 것인지에 대한 잘못된 인상을 얻게 된다는 것을 의미합니다. 실제 세계의 노이즈를 추가하면 순위가 뒤바뀝니다!

결론

이 논문은 AI 를 판단하기 위해 오래되고 결함이 있는 주방 (OmniDocBench) 을 사용하는 것을 멈추고 PureDocBench를 사용해야 한다고 주장합니다. PureDocBench 는 다음과 같은 특징을 가집니다:

  • 완벽한 추적 가능한 정답지를 제공합니다 (심사위원 실수 없음).
  • 완벽한 상태뿐만 아니라 지저분한 실제 세계 조건에서 요리사를 테스트합니다.
  • AI 가 발전하고 있지만, 특히 수학 공식과 실제 세계의 지저분함을 처리하는 데는 여전히 갈 길이 멀다는 것을 보여줍니다.

연구자들은 이 새로운 주방의 문을 열어 커뮤니티가 함께 더 나은 요리사를 만들 수 있도록 설계도, 요리, 정답지를 모두 제공했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →