← 최신 논문
💬 NLP

Evidence Attribution in Visual Document Understanding without Coordinates or Region Labels

이 논문은 좌표 기반의 경계 상자 출력을 텍스트 기반의 "인용 및 검색(quote-and-retrieve)" 인터페이스로 대체하는 것이 시각적 문서 이해에서 근거 환각을 유의미하게 줄이고 증거 회상 능력을 향상시키는 동시에, 비용이 많이 드는 영역 수준의 레이블 없이도 효과적인 학습을 가능하게 함을 입증한다.

원저자: Zhuchenyang Liu, Yao Zhang, Yu Xiao

게시일 2026-07-28
📖 4 분 읽기☕ 가벼운 읽기

원저자: Zhuchenyang Liu, Yao Zhang, Yu Xiao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 마치 탐정이 되어 미스터리를 풀고 있다고 상상해 보세요. 하지만 당신이 마주한 것은 범죄 현장이 아니라 영수증, 차트, 손글씨 메모가 뒤섞인 거대하고 지저분한 서류 더미입니다. 인공지능의 세계에서 이것들은 "시각적 문서(visual documents)"라고 불립니다. 컴퓨터가 유능한 탐정이 되기 위해서는 단순히 정답을 추측하는 것에 그쳐서는 안 됩니다. 반드시 자신이 단서를 발견한 정확한 위치를 가리킬 수 있어야 합니다. 이를 "속성 부여(attribution)"라고 부릅니다.

오랫동안, 컴퓨터가 단서를 가리키게 만드는 표준적인 방법은 텍스트 주위에 상자를 그리고 그 상자의 GPS 좌표(예: "x=50, y=100")를 제공하도록 요청하는 것이었습니다. 이것은 마치 아이에게 페이지 위의 특정 단어를 가리키라고 하면서 숫자를 외치라고 하는 것과 같습니다. 이는 매우 서투른 "아이 스파이(I Spy)" 놀이 방식입니다. 당신이 읽게 될 이 논문은 왜 이 "좌표 게임"이 그토록 처참하게 실패하고 있는지 조사합니다. 연구진은 문제가 컴퓨터가 단서를 찾는 데 너무 멍청해서가 아니라, 게임의 규칙(좌표)이 너무 혼란스럽기 때문이라고 제안합니다. 연구진은 새로운 규칙을 제안합니다. 숫자를 외치는 대신, 컴퓨터가 단서를 단어 그대로 소리 내어 읽게 하는 것입니다. 그러면 스마트한 조력자(검색 시스템)가 그 단어들이 문서의 정확히 어느 지점에 있는지 찾아냅니다.

거대한 "가리키기" 결함

연구진은 좌절스러운 관찰 결과로부터 시작했습니다. 강력한 AI 모델들에게 긴 문서에 관한 질문을 던지고 그 근거를 증명하게 했을 때, 모델들은 정답을 맞히는 데는 뛰어났지만 그 답을 어디서 찾았는지 보여주는 데는 형편없었습니다. 심지어 정답이 완벽할 때조차도, AI는 종종 엉뚱한 문단을 가리키거나 빈 페이지 한가운데에 상자를 그리는 일이 잦았습니다. 논문에서는 이를 "속성 환각(Attribution Hallucination)"이라고 부릅니다. 이는 수학 문제를 잘 풀었지만, 정답을 공책이 아닌 선생님의 책상 뒷면에 적어 놓는 학생과 같습니다.

핵적인 질문은 이것이었습니다: AI가 실제로 위치를 찾는 능력이 부족한 것인가, 아니면 단지 "좌표"라는 언어를 말하는 데 서툰 것인가?

"소리 내어 읽기" 실험

이를 테스트하기 위해 연구팀은 여섯 가지 서로 다른 AI 모델을 사용하여 대규모 실험을 진행했습니다. 문서, 질문, 모델은 모두 동일하게 유지하되, 게임의 규칙만을 바꾸었습니다.

게임 A (기존 방식): AI는 증거 주위에 상자를 그리기 위해 일련의 숫자(좌표)를 출력해야 했습니다.
게임 B (새로운 방식): AI는 문서의 정확한 텍스트를 인용함으로써 단순히 "증거를 소리 내어 읽는" 명령을 받았습니다. 그 후 별도의 컴퓨터 프로그램이 그 인용구를 가져가서 자동으로 문서의 일치하는 부분을 찾아냈습니다.

결과는 마치 마술 같았습니다. AI가 "숫자를 외치는" 대신 "소리 내어 읽기"를 허용받자, 올바른 지점을 찾는 능력이 급격히 치솟았습니다.

  • 기존 방식: AI가 올바른 증거를 찾는 비율은 8% 미만이었습니다.
  • 새로운 방식: AI가 올바른 증거를 찾는 비율은 26%에서 47% 사이였습니다.

이는 엄청난 도약입니다! "환각(잘못된 곳을 가리키는 현상)"의 비율이 거의 절반으로 줄어들었습니다. 가장 놀라운 점은 무엇일까요? 실제 답변의 품질은 크게 변하지 않았다는 것입니다. 모델들은 여전히 똑똑했습니다. 단지 좌표로 고군투쟁을 하지 않아도 될 때 훨씬 더 잘 보여줄 수 있었던 것입니다.

좌표가 문제인 이유

논문은 이 실패가 지능의 부족 때문이 아니라고 주장합니다. 그것은 "인터페이스 아티팩트(interface artifact, 인터페이스로 인한 인위적 오류)"입니다. 요리사에게 레시피를 설명하라고 요청한다고 생각해 보세요. 만약 당신이 요리사에게 오직 비밀 숫자로만 재료를 설명하도록 강요한다면, 요리는 제대로 만들더라도 재료 목록은 틀리게 적을 수도 있습니다. 하지만 그들이 그냥 "밀가루 두 컵"이라고 말하게 둔다면, 목록은 정확해질 것입니다.

연구진은 AI 모델들이 실제로 정보가 어디에 있는지 알고 있다는 것을 발견했습니다. 다만 좌표를 사용하도록 강요받을 때, 그들은 언어(예: "2페이지, 테이블 아래에")로 정보를 묘사했을 뿐입니다. "인용" 방식으로 전환함으로써, 연구진은 AI가 가진 본연의 강점인 언어를 사용할 수 있게 해주었습니다.

AI가 더 나은 탐정이 되도록 가르치기

연구진은 단순히 규칙을 바꾸는 데 그치지 않고, 모든 상자에 대해 인간이 일일이 채점할 필요 없이 AI가 이 새로운 게임을 더 잘하도록 가르치고 싶었습니다. 그들은 GRPO(Group Relative Policy Optimization)라고 불리는 특별한 훈련 방법을 만들었습니다.

AI가 질문에 답하려고 노력하면, "판사(Judge)"(또 다른 AI)가 그 답변과 증거를 살펴보는 게임을 상상해 보세요. 판사는 인간에게 증거의 위치를 알려달라고 할 필요가 없습니다. 대신 판사는 다음을 확인합니다: "답변이 맞는가? 인용된 단어들이 실제로 답변을 뒷받침하는가?" 만약 AI가 올바른 단어를 인용하면 보상을 받고, 내용을 지어내면 0점을 받습니다.

이 방법을 사용하여, 연구진은 더 작은 AI 모델(80억 파라미터 백본)이 증거를 훨씬 더 잘 찾도록 훈련했습니다.

  • 훈련 전: 모델의 "엄격한 속성 정확도(Strict Attribution Accuracy)"는 **22.4%**였습니다.
  • 훈련 후: 이 수치는 **33.8%**로 뛰어올랐습니다.

이는 우리가 수천 페이지의 문서에 일일이 상자를 그리는 값비싼 인간의 라벨링 없이도, AI를 더 신뢰할 수 있고 검증 가능하게 가르칠 수 있음을 의미하므로 매우 중요한 성과입니다.

시사점

이 논문은 AI를 더 신뢰할 수 있게 만드는 실질적인 경로를 제시합니다. 이는 "좌표 인터페이스(숫자로 상자를 그리는 것)"가 AI의 환각을 유발하는 약한 고리임을 보여줍니다. "언어 인터페이스(텍스트를 인용하고 시스템이 위치를 찾게 하는 것)"로 전환함으로써, 우리는 AI가 자신의 증거를 가리키는 능력을 획기적으로 개선할 수 있습니다.

이 연구 결과는 문제가 AI가 문서를 "보는" 능력이 아니라, 우리가 위치를 가리키라고 요구하는 방식이 고장 났다는 것을 시사합니다. AI가 인용구를 통해 말하게 하고 스마트한 시스템이 위치를 가리키게 함으로써, 우리는 훨씬 더 신뢰할 수 있는 탐정을 얻을 수 있습니다. 논문은 이것이 법률, 의료, 금융처럼 정답만큼이나 출처를 증명하는 것이 중요한 분야에서 더 나은 AI를 구축하기 위한 실행 가능하고 비용 효율적인 방법임을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →