← 최신 논문
🤖 AI

Prefix-Adaptive Block Diffusion for Efficient Document Recognition

본 논문은 고정된 블록 경계를 동적 접두사 할당과 인과적 노이즈 제거로 대체하여 정보 흐름 불일치를 해결함으로써 효율적인 문서 인식을 향상시키고, 기존 모델 대비 71.6%의 추론 처리량 증가와 우수한 정확도를 달성하는 접두사 적응형 블록 확산 모델 (PA-BDM) 을 제안한다.

원저자: Mingxu Chai, Ziyu Shen, Chenyu Liu, Kaidi Zhang, Jiazheng Zhang, Dingwei Zhu, Zhiheng Xi, Ruoyu Chen, Jun Long, Jihua Kang, Tao Gui, Qi Zhang

게시일 2026-05-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: Mingxu Chai, Ziyu Shen, Chenyu Liu, Kaidi Zhang, Jiazheng Zhang, Dingwei Zhu, Zhiheng Xi, Ruoyu Chen, Jun Long, Jihua Kang, Tao Gui, Qi Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

복잡한 손글씨 수학 공식이나 문서 이미지의 빽빽한 표를 컴퓨터가 읽을 수 있는 형식으로 전사하려고 한다고 상상해 보세요.

구식 방법 (경직된 블록 문제)
현재의 효율적인 AI 모델 (블록 확산 모델이라고 함) 을 교대 근무로 일하는 필경사 팀이라고 생각해 보세요. 그들은 페이지를 고정된 크기의 조각으로 나누는데, 예를 들어 한 번에 32 단어를 처리합니다.

  • 병목 현상: 그들은 32 단어를 모두 동시에 처리합니다 (빠르지만), 32 단어 조각 전체가 완료될 때까지는 어떤 단어의 진척도 저장하거나 "확정"할 수 없습니다.
  • 혼란: 그 조각 안에서 필경사들은 왼쪽에서 오른쪽으로, 그리고 오른쪽에서 왼쪽으로 서로의 작업을 볼 수 있습니다. 이는 도움이 되는 것처럼 보이지만, 다음 조각으로 이동할 때 혼란을 초래합니다. 다음 조각은 이전 내용 (왼쪽에서 오른쪽) 만 알지만, 이전 조각은 방향이 뒤섞인 상태였습니다. 이 불일치로 인해 수학 공식이나 표와 같은 것들의 구조를 올바르게 파악하기 어렵습니다.
  • 낭비: 조각 내부의 단어들을 처리해 나갈수록, "병렬" 작업은 추측해야 할 남은 단어가 줄어들어 느려집니다. 마치 절반의 제품이 만들어지면 더 이상 효율적이지 않게 되는 공장 조립선과 같습니다.

새로운 해결책: PA-BDM (적응형 필경사)
저자들은 접두사 적응형 블록 확산 (Prefix-Adaptive Block Diffusion, PA-BDM) 이라는 새로운 방법을 제안합니다. 간단한 비유를 통해 이것이 어떻게 게임의 규칙을 바꾸는지 살펴보겠습니다:

1. "후보 범위" 대 "고정된 상자"

32 단어 블록을 이동하기 전에 완전히 채워야 하는 경직된 상자로 취급하는 대신, PA-BDM 이를 최대 후보 범위로 취급합니다.

  • 비유: 물을 통에 채우는 상황을 상상해 보세요. 구식 방법은 "저장 탱크에 물을 붓기 전에 통을 완전히 채워야 한다"고 말합니다. PA-BDM 은 "통을 최대한 채우고, 컵 한 잔의 물이 깨끗하고 안전하다고 확신하는 즉시 저장 탱크에 부으라"고 말합니다.
  • 결과: AI 는 전체 블록이 완료될 때까지 기다리지 않습니다. "신뢰할 수 있는" 부분 (접두사) 을 잡아 즉시 저장합니다.

2. 인과적 흐름 (일방통행)

구식 방법은 블록 내에서 필경사들이 뒤로 그리고 앞으로 볼 수 있게 하여 사물의 순서를 혼란스럽게 했습니다. PA-BDM 은 책 읽기처럼 모든 사람이 오직 앞으로 (왼쪽에서 오른쪽) 만 보도록 강제합니다.

  • 비유: 구식 시스템에서는 문장 중간에 있는 필경사가 문장 끝을 훔쳐보며 중간을 추측할 수 있었습니다. 이는 캐주얼한 대화에는 작동했지만, 순서가 중요한 수학 공식과 같은 엄격한 구조에서는 실패했습니다. PA-BDM 은 AI 가 매번 올바른 순서를 학습하도록 보장하는 엄격한 "일방통행" 규칙을 시행합니다.

3. 점진적 접두사 확정 (PPC) – "신뢰도 확인"

이것은 새로운 시스템의 엔진입니다. AI 가 다음 단어 뭉치를 추측할 때마다 자신의 신뢰도를 확인합니다.

  • 작동 방식: AI 가 32 단어 블록의 처음 10 단어에 대해 99% 확신한다면, 즉시 그 10 단어를 "확정" (잠금) 합니다. 그런 다음 나머지 22 개의 추측을 폐기하고, 확정된 10 단어를 기반으로 새로운 32 개의 추측 뭉치를 시작합니다.
  • 이점: 이는 "병렬 공간"을 재설정합니다. 22 개, 그다음 10 개, 그다음 5 개로 줄어드는 목록을 처리하는 대신, AI 는 다시 그리고 다시 32 개의 완전한 단어 세트를 처리할 수 있게 됩니다. 이로 인해 속도가 높게 유지됩니다.

4. 신뢰도 게이트 구조적 손실 (CSL) – "엄격한 교사"

학습 과정에서 AI 는 실수를 수정하려고 시도하며 배웁니다. 구식 방법은 문장의 시작이 이미 불안정하더라도 AI 가 모든 실수에서 배우도록 강요했습니다.

  • 해결책: PA-BDM 은 "신뢰도 게이트"를 사용합니다. AI 가 문장 시작 부분에 대해 확신이 없다면, 교사 (학습 알고리즘) 는 문장 나머지 부분을 채점하는 것을 중단합니다. AI 가 확신하는 부분만 채점합니다.
  • 비유: 수학 시험을 채점하는 교사를 상상해 보세요. 학생이 첫 번째 단계를 틀리면, 교사는 잘못된 전제에 기반한 최종 답안을 채점하는 시간을 낭비하지 않습니다. 교사는 학생이 첫 번째 단계를 올바르게 풀 때까지 나머지 부분을 채점하지 않습니다. 이는 AI 가 "노이즈"가 있거나 나쁜 패턴을 학습하는 것을 방지합니다.

결과

이 논문은 새로운 접근법인 PA-BDM 이 엄청난 업그레이드라고 주장합니다:

  • 속도: 이전 최고의 확산 모델 (MinerU-Diffusion) 보다 71.6% 빠르며, 한 번에 한 단어씩 작성하는 표준 자기회귀 모델보다 약 8 배 빠릅니다.
  • 정확도: 토큰의 엄격한 순서를 존중하기 때문에 수학 공식, 표, 다이어그램과 같은 복잡한 구조를 인식하는 데 더 정확합니다.
  • 효율성: 이전 모델만큼 메모리를 효율적으로 사용하면서도 동일한 시간 동안 훨씬 더 많은 작업을 처리합니다.

요약하자면, PA-BDM 은 AI 가 "완벽한 블록"을 기다리게 하는 것을 중단시키고, 대신 "충분히 좋은" 진척도를 즉시 확정하게 하여 정확도를 잃지 않으면서 조립선을 최고 속도로 유지합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →