← 최신 논문
💻 computer science

Reading or Reasoning? Format Decoupled Reinforcement Learning for Document OCR

이 논문은 복잡한 문서 OCR에서의 높은 출력 불확실성을 해결하기 위해 엔트로피 기반 데이터 필터링과 형식별 보상을 활용하는 새로운 접근 방식인 FD-RL(Format Decoupled Reinforcement Learning)을 제안하며, 이를 통해 OmniDocBench 벤치마크에서 90.41이라는 새로운 최고 점수를 달성하였다.

원저자: Yufeng Zhong, Lei Chen, Zhixiong Zeng, Xuanle Zhao, Deyang Jiang, Liming Zheng, Jing Huang, Haibo Qiu, Peng Shi, Siqi Yang, Lin Ma

게시일 2026-01-15
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yufeng Zhong, Lei Chen, Zhixiong Zeng, Xuanle Zhao, Deyang Jiang, Liming Zheng, Jing Huang, Haibo Qiu, Peng Shi, Siqi Yang, Lin Ma

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 지저열하고 복잡한 문서를 읽는 법을 가르치고 있다고 상상해 보세요. 이 문서는 단순한 편지가 아닙니다. 일반적인 단락, 복잡한 수학 방정식, 그리고 까다로운 표가 뒤섞인 형태입니다.

오랫동안 연구자들은 읽기란 단순히 단어를 명확하게 "보는" 것이라고 생각했습니다. 그들은 로봇이 사물을 어떻게 보이는지 더 잘 기억할 수 있도록 더 많은 예시(데이터 엔지니어링)를 주입하려고 노력했습니다. 하지만 이 논문의 저자들은 한 가지 문제점을 발견했습니다: 로봇은 문서에 구조가 많아지면 매우 혼란스러워한다는 것입니다.

다음은 그들의 발견과 해결책에 대한 쉬운 요약입니다:

1. 문제점: 로봇의 "혼란 측정기"

저자들은 로봇이 단순한 텍스트를 읽을 때는 매우 자신감이 넘친다는 것을 발견했습니다. 하지만 수학 공식이나 표를 마주하면, 로봇의 "자신감 측정기"(그들은 이를 엔트로피라고 부릅니다)가 급격히 떨어집니다. 이는 마치 학생이 시 한 구절은 쉽게 암송할 수 있지만, 미적분 문제를 풀거나 스프레드시트를 정리하라는 요청을 받으면 얼어붙는 것과 같습니다.

로봇은 다음 단어를 예측하려고 노력하지만, 공식을 쓰는 방법이나 표를 배치하는 방법이 너무 다양하기 때문에 길을 잃습니다. 결국 로봇은 무작위로 추측하기 시작하며, 이는 오류로 이어집니다.

2. 해결책: "포맷 디커플링 강화 학습" (Format Decoupled Reinforcement Learning, FD-RL)

단순히 더 많은 예시를 암기하도록 강요하는 대신, 저자들은 로봇에게 구조에 대해 생각하는 법을 가르쳤습니다. 그들은 이 방법을 FD-RL이라고 부릅니다.

이것은 요리사를 훈련시키는 것과 비슷합니다:

  • 과거의 방식 (SFT): 당신은 요리사에게 백만 개의 레시피를 주며 "이것들을 외워라"라고 말합니다. 요리사는 레시피를 완벽하게 복사하는 법은 배우지만, 재료 목록이 약간만 달라져도 요리를 망칠 수 있습니다.
  • 새로운 방식 (FD-RL): 당신은 요리사에게 케이크가 왜 부풀어 오르는지, 혹은 소스가 왜 걸쭉해지는지 그 이유를 가르칩니다. 당신은 그들에게 다양한 요리 유형에 따른 구체적인 규칙을 제공합니다.

3. 수행 방법 (2단계 훈련)

1단계: "SFT" (지도 미세 조정) - 기초 학습
먼저, 저자들은 로봇에게 텍스트, 공식, 표를 전반적으로 읽는 법을 가르치기 위해 방대한 양의 문서(책, PDF, 합성 데이터)를 입력했습니다. 이것은 로봇이 ABC와 기초 문법을 배우는 과정과 같습니다.

2단계: "RL" (강화 학습) - 전문적인 코칭
여기서 마법이 일어납니다. 그들은 로봇의 혼란을 해결하기 위해 두 가지 영리한 기술을 사용했습니다:

  • 기술 A: "하드 모드" 필터 (엔트로피 기반 필터링)
    모든 문서를 학습시키는 대신, 그들은 필터를 사용하여 가장 어렵고 혼란스러운 문서(엔트로피가 높은 문서)만을 골라냈습니다.

    • 비유: 수학 선생님이 학생에게 쉬운 덧셈 문제 대신 복잡한 미적분 문제만 주는 상황을 상상해 보세요. 어려운 것에 집중함으로써, 학생은 단순히 추측하는 것이 아니라 혼란을 헤쳐 나가는 법을 배웁니다.
  • 기술 B: "전문 심판" (포맷 디커플링 보상)
    과거에는 로봇이 단 하나의 점수로 평가되었습니다: "단어를 맞게 썼는가?" 만약 로봇이 단어는 맞게 썼지만 표 구조를 잘못 배치했다면, 로봇은 여전히 낮은 점수를 받았지만 왜 틀렸는지는 알 수 없었습니다.

저자들은 채점 시스템을 바꿨습니다. 그들은 로봇에게 세 명의 서로 다른 심판을 주었습니다:
1. 텍스트 심판: 일반 단어의 철자가 맞는지 확인합니다.
2. 수학 심판: 공식이 수학적으로 타당한지 확인합니다 (기호가 약간 다르더라도).
3. 표 심판: 표의 행과 열이 제대로 정렬되었는지 확인합니다.

*비유:* 집을 짓고 있다면, 단순히 "집이 지어졌는가?"라고 묻지 않습니다. 배관공에게는 파이프를, 전기 기사에게는 전선을, 목수에게는 골조를 체크하게 합니다. 만약 골조가 비뚤어졌다면, 목수는 건축가에게 도장이 아닌 골조를 고치라는 구체적인 "나쁜 점수"를 줍니다.

4. 결과

이 방법을 통해 로봇은 복잡한 문서를 훨씬 더 잘 읽게 되었습니다.

  • 그들은 OmniDocBench(까다로운 문서 1,355 페이지 포함)라는 유명한 벤치마크에서 테스트를 진행했습니다.
  • 로봇은 90.41점을 기록하며, 모든 "엔드 투 엔드(end-to-end)" 모델(한 번에 모든 것을 처리하려는 모델들)을 제치고 승리했습니다.
  • 특히 공식과 표에서의 "혼란"을 해결하는 데 탁-월한 성능을 보였으며, 이는 구조에 대해 추론하도록 가르치는 것이 단순히 더 많은 텍스트를 암기하게 하는 것보다 효과적임을 입증했습니다.

요약

이 논문은 복잡한 문서를 읽는 것은 단순히 텍스트를 "보는" 것이 아니라, 구조를 통해 추론하는 것이라고 주장합니다. 쉬운 예시를 걸러내고 텍스트, 수학, 표에 대해 별도의 구체적인 피드백을 제공함으로써, 저자들은 로봇이 단순히 추측하는 것을 멈추고 문서의 규칙을 이해하도록 가르쳤습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →