← 최신 논문
💻 computer science

DocClaw: A Unified Agentic System for Intelligent Document Processing

DocClaw는 다양한 지능형 문서 처리 작업을 에이전트와 문서 사이의 구조화된 문서 상태 및 재사용 가능한 도구를 활용한 공유된 반복적 상호작용 프로세스로 재정의함으로써, OCR, DocQA, KIE 벤치마크 전반에서 경쟁력 있는 성능을 달성하는 통합 에이전트 시스템입니다.

원저자: Siqi Xiang, Zhipeng Xu, Yufei Liu, Junhao Ji, Qing Liu, Zulong Chen, Zhibo Yang, Chunyan Miao, Shijian Lu

게시일 2026-08-20
📖 4 분 읽기☕ 가벼운 읽기

원저자: Siqi Xiang, Zhipeng Xu, Yufei Liu, Junhao Ji, Qing Liu, Zulong Chen, Zhibo Yang, Chunyan Miao, Shijian Lu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매일 우리는 연례 보고서, 의료 기록, 법적 계약서, 손으로 쓴 메모 등 세상의 지식을 담고 있는 문서들에 둘러싸여 있습니다. 컴퓨터가 이 페이지들을 이해하기 위해서는 단순히 단어를 읽는 것을 넘어, 텍스트가 어떻게 배치되어 있는지 파악하고, 차트와 표를 인식하며, 서로 다른 섹션에 흩어져 있는 정보를 하나로 엮어내야 합니다. 지능형 문서 처리(intelligent document processing)라고 알려진 이 과제는 오랫동안 별개의 작업들의 집합체로 취급되어 왔습니다. 어떤 프로그램은 페이지의 이미지를 텍스트로 변환하도록 설계된 반면, 다른 프로그램은 그 텍스트 내에서 특정 답을 찾아야 하고, 또 다른 프로그램은 날짜나 가격 같은 핵심 수치를 추출해야 합니다. 이러한 도구들은 서로 고립되어 작동하며, 한 작업에서 배운 것을 다음 작업을 돕기 위해 공유하지 못하므로, 종종 전체적인 맥락을 놓치는 경직된 단계별 방식을 강요하게 됩니다.

연구진은 이제 컴퓨터가 문서와 상호작용하는 방식을 바꾸는 'DocClaw'라는 새로운 시스템을 도입했습니다. 각 작업을 별개의 문제로 취급하는 대신, DocClaw는 문서를 읽고, 검색하고, 추론할 수 있는 하나의 지능적인 비서처럼 행동합니다. 질문이나 요청을 받았을 때, 이 시스템은 단순히 답을 추측하는 것이 아니라, 전문화된 도구 세트를 사용하여 적절한 정보를 찾고, 자신의 작업을 검토하며, 결과에 확신을 가질 때까지 이해도를 정교화하며 능동적으로 문서를 탐색합니다. 이미 발견한 내용을 지속적인 기록으로 유지함으로써, 이 시스템은 미래의 질문을 위해 그 지식을 재사용할 수 있으며, 시간이 지남에 따라 더 빠르고 정확해집니다.

이 새로운 접근 방식의 핵심은 정적인 예측에서 능동적인 상호작용으로의 전환입니다. 전통적인 방식에서 컴퓨터는 문서를 한 번 보고 출력을 생성하며, 실수를 바로잡거나 첫 시도가 불분명할 경우 더 깊이 들여다볼 방법이 없습니다. 그러나 DocClaw는 문서를 대화의 파트너로 취급합니다. 사용자가 질문을 하면, 시스템은 무엇이 요청되었는지에 따라 전략을 먼저 결정합니다. 목표가 단순히 텍스트를 읽는 것이라면 글자와 레이아웃을 인식하는 데 집중합니다. 목표가 특정 사실을 찾는 것이라면 검색을 계획합니다. 목표가 매출 수치와 같은 값을 추출하는 것이라면 발견한 내용을 교차 검증할 준비를 합니다. 이 전략은 연구진이 '문서 기술(document skills)'이라고 부르는 것에 의해 유도되는데, 이는 본질적으로 다양한 유형의 작업에 대해 시스템이 어떻게 행동해야 하는지 알려주는 지침입니다.

전략이 설정되면, 시스템은 문서의 구조화된 메모리를 구축하며 작업을 시작합니다. 시스템은 페이지를 관리 가능한 부분으로 나누고, 텍스트, 이미지, 표가 어디에 위치하는지 기록합니다. 특정 섹션을 읽거나 차트를 분석하기 위해 도구를 사용할 때, 시스템은 그 발견 사항들을 영구적인 메모리 뱅크에 저장합니다. 이것이 기존 시스템과의 결정적인 차이점입니다. 보고서의 한 부분을 읽어서 얻은 지식은 작업이 끝난 후 버려지지 않습니다. 대신, 나중에 질문이 동일한 섹션의 정보를 필요로 할 경우 시스템이 어디를 찾아야 하고 무엇을 발견했는지 이미 알 수 있도록 저장됩니다. 이를 통해 시스템은 반복적인 작업을 피하고, 더 많은 질문에 답하면서 문서에 대한 더 깊은 이해를 쌓을 수 있습니다.

시스템은 계획, 실행, 업데이트의 순환 과정으로 작동합니다. 시스템은 현재 지식 상태를 살펴보고, 다음으로 사용할 도구(예: 흐릿한 섹션을 확대하거나, 표를 더 명확하게 보기 위해 자르거나, 키워드를 검색하는 것 등)를 결정한 다음 그 동작을 실행합니다. 해당 동작의 결과는 즉시 메모리에 추가됩니다. 만약 시스템이 일관되지 않은 숫자를 발견하면, 원래 이미지와 대조하여 확인하거나 두 번째 검사를 수행하기 위해 도구를 사용할 수 있습니다. 이 과정은 시스템이 질문에 확신을 가지고 답할 수 있을 만큼 충분한 증거를 수집할 때까지 계속됩니다. 그제야 시스템은 멈추고 최종 답변을 제공하며, 특정 질문을 위한 임시 메모는 버리되 미래의 사용을 위한 영구적인 지식은 유지합니다.

이 접근 방식을 테스트하기 위해, 연구진은 DocClaw를 이미지로부터 텍스트 읽기, 긴 문서에 대한 질문 답변, 재무 수치와 같은 특정 데이터 포인트 추출이라는 세 가지 매우 다른 유형의 작업에 대해 평가했습니다. 연구진은 이 시스템을 범용 인공지능 모델 및 단일 작업을 위해 설계된 전문 도구들과 비교했습니다. 결과에 따르면 DocClaw는 전반적으로 전문화된 도구들과 대등하거나 그보다 더 우수한 성능을 보였습니다. 복잡한 텍스트, 공식, 표를 인식하는 테스트에서 이 시스템은 높은 정확도를 달면서 종종 전용 소프트웨어보다 뛰어난 성과를 냈습니다. 긴 보고서를 바탕으로 질문에 답하는 테스트에서, 시스템은 표준 모델보다 더 신뢰성 있게 정확한 정보를 찾아내고 근거 있는 답변을 제공했습니다. 마찬가지로, 핵심 정보를 추출하는 작업에서도 시각적 읽기와 텍스트 인식을 성공적으로 결합하여 오류를 줄였습니다.

시스템이 어떻게 효과적으로 작동하는지에 대한 자세한 분석은 그 이유를 밝혀주었습니다. 연구진은 스스로의 작업을 정교화하는 능력이 주요 요인임을 발견했습니다. 시스템은 읽기 어려운 텍스트를 마주했을 때, 작은 기호와 숫자를 인식하는 능력을 크게 향arly 높이기 위해 '확대(zoom)' 도구를 자주 사용했습니다. 특정 데이터 추출이 필요한 작업에서, 원본 이미지와 대조하여 발견한 내용을 재검토하는 습리의는 다른 모델들이 범하는 오류의 상당 부분을 수정했습니다. 또한, 시스템의 메모리는 효율성에 필수적이었습니다. 동일한 문서에 대한 일련의 질문을 받았을 때, 각 후속 질문에 답하는 데 걸리는 시간이 눈에 띄게 감소했습니다. 이는 시스템이 매 쿼리마다 전체 문서를 다시 스캔할 필요 없이, 이미 학습한 내용을 불러오고 필요한 새로운 정보에만 집중할 수 있었기 때문입니다.

이 연구는 문서 처리를 통합적이고 상호작적인 과정으로 다루는 것이 실제 세계의 복잡한 문서를 다루는 강력한 방법임을 입증합니다. 단일 시스템이 순간의 필요에 따라 읽기, 검색, 검증 사이를 전환할 수 있게 함으로써, DocClaw는 경직된 단일 목적 도구의 한계를 극복합니다. 이는 컴퓨터에게 자신이 본 것을 기억하고 다음 움직임을 신중하게 계획할 수 있는 능력이 주어질 때, 이전에는 달성하기 어려웠던 유연성과 정확도로 문서를 이해할 수 있음을 보여줍니다. 이 접근 방식은 단순히 작업을 자동화하는 것이 아니라, 기계가 우리 세상을 형성하는 방대한 양의 서면 정보와 교감하는 더 지능적인 방식을 만들어냅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →