← 최신 논문
💬 NLP

CLAIR-Fin: An Adversarial Multi-Agent Framework for Claim-Level Verification and Adaptive Debate in Cross-Modal Financial QA

이 논문은 질의를 원자적 주장으로 분해하여 엄격하고 유형 인지적인 검증과 적응형 토론을 수행함으로써 교차 모달 금융 질의응답 능력을 향상시키고, 기존 베이스라인 모델 대비 충실도를 크게 높이며 환각 현상을 줄이는 9개 에이전트 기반의 적대적 프레임워크인 CLAIR-Fin을 소개한다.

원저자: Fatema Tuj Johora Faria, Mukaffi Bin Moin, Jubayer Al Mahmud, M. F. Mridha, Md. Alam Hossain

게시일 2026-08-17
📖 3 분 읽기☕ 가벼운 읽기

원저자: Fatema Tuj Johora Faria, Mukaffi Bin Moin, Jubayer Al Mahmud, M. F. Mridha, Md. Alam Hossain

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 미스터리를 풀기 위해 노력하는 탐정이라고 상상해 보십시오. 하지만 당신의 단서들은 손글씨로 쓰인 이야기 가득한 일기, 숫자가 빽빽한 스프레드시트, 그리고 다채로운 차트로 채워진 스케치북이라는 세 가지 매우 다른 종류의 공책에 흩어져 있습니다. 인공지능의 세계에서, 이것은 컴퓨터가 복잡한 재무 보고서에 대한 질문에 답하려고 할 때 발생하는 현상입니다. 이 보고서들은 수백 페이지에 달하며 텍스트, 표, 그래프를 한데 섞어 놓은 거대한 규모입니다. 문제는, 아주 똑똑하지만 때때로 몽상에 빠지는 학생과 같은 AI 모델들이 이 모든 다양한 형식을 한꺼번에 읽어야 할 때 혼란을 겪기 쉽다는 점입니다. 그들은 표의 숫자와 본문의 이야기를 뒤섞거나, 실제로는 문서에 없는데도 진짜처럼 들리는 사실을 지어내는 "환각(hallucination)" 현상을 일으킬 수 있습니다. 금융 분야에서는 잘못된 숫자나 지어낸 이야기가 잘못된 결정으로 이어질 수 있기 때문에 이는 매우 중대한 문제입니다. 과학자들은 컴퓨터가 스스로의 작업 내용을 점검할 수 있는 더 나은 방법을 구축하기 위해 노력해 왔지만, 대부분의 방법은 모든 단서를 똑같이 신뢰하거나(예를 들어, 특정 숫자에 대해 스케치가 나쁜 단서임에도 불구하고), 혹은 너무 늦어서 실수를 바로잡을 수 없는 마지막 단계에 이르러서야 이야기가 말이 되는지 확인하곤 합니다.

여기에 등장한 것이 바로 CLAIR-Fin입니다. 이는 재무 보고서의 사실 여부를 확인하기 위해 협력하는 9명의 정예 탐정 팀처럼 설계된 새롭고 영리한 시스템입니다. CLAIR-Fin은 하나의 AI가 문서 전체를 한 번에 삼키도록 내버려 두는 대신, 모든 질문을 개별적인 퍼즐 조각과 같은 작은 단위의 "원자적 주장(atomic claims)"으로 분해합니다. 예를 들어, 질문이 "작년에 은행은 얼마를 벌었습니까?"라면, 시스템은 단순히 추측하는 대신 이를 "연도는 2025년이었다"와 "이익은 1억 3,900만 달러였다"와 같은 더 작은 주장들로 나눕니다. 그런 다음, 이 작은 주장들을 전문화된 에이전트들에게 보냅니다. 어떤 에이전트는 텍스트를 읽는 전문가이고, 어떤 에이전트는 표에서 숫자를 계산하는 전문가이며, 또 다른 에이전트는 차트를 해석하는 전문가입니다.

여기서 마법이 일어납니다. CLAIR-Fin은 모든 단서가 동일한 가치를 지니지 않는다는 것을 알고 있습니다. 이 시스템은 "비대칭적 증거 권위(Asymmetric Evidence Authority)"라는 규칙을 사용합니다. 이것은 마치 법정의 판사와 같습니다. 판사는 정확한 숫자가 필요할 때 스프레드시트의 셀이 황금 표준이지만, 왜 그런 일이 일나 발생했는지 알기 위해서는 글로 된 이야기가 최고의 증거라는 것을 알고 있습니다. 시스템은 모든 것을 똑같이 취급하는 대신, 숫자를 위해서는 스프레드시트를, 이유를 위해서는 이야기를 신뢰합니다. 만약 증거가 불확실하거나 부족하다면, 시스템은 억지로 추측하지 않고 단순히 모른다고 인정하며 답변을 거부합니다. 이는 AI가 멋대로 이야기를 지어내는 기존 방식보다 훨씬 큰 발전입니다.

만약 주장이 까다롭거나 증거가 상충한다면, 시스템은 "적응형 반박 사이클(Adaptive Rebuttal Cycle)"로 이를 넘깁니다. 이것은 한 명의 AI 변호사는 주장을 옹호하고, 다른 한 명의 AI 변호사는 그 주장의 허점을 파고드는 토론 클럽과 같습니다. 하지만 영리한 점은, 그들이 필요한 만큼만 논쟁한다는 것입니다. 주장이 쉬우면 토론을 건너뛰고, 어려우면 더 많이 논쟁합니다. 이는 시간과 에너지를 절약합니다. 최종 답변이 작성되기 전에는, 연구원들과 토론가들 사이의 인수인계 과정에서 증거가 바뀌거나 조작되지 않았는지 확인하는 보안 요원과 같은 "관리 연속성(Chain-of-Custody)" 체크가 이루어집니다. 마지막으로, "판사-감사관(Judge-Auditor)"이 최종 판결을 내리고 "환각 위험 지수(Hallucination Risk Index)"를 계산하는데, 이는 답변이 화창한 진실일지 아니면 폭풍우 치는 거짓일지에 대한 일기 예보와 같습니다.

연구진은 이 새로운 시스템을 방글라데시 은행의 실제 재무 보고서를 바탕으로 한 500개의 질문에 대해 테스트했습니다. 그 결과, CLAIR-Fin이 기존 방식보다 훨씬 더 진실을 잘 전달한다는 것을 발견했습니다. 표준 AI 시스템이 사실을 약 78%의 확률로 맞혔다면, CLAIR-Fin은 이를 거의 89%까지 끌어올렸습니다. 더욱 인상적인 것은, 증거가 질문에 답하기에 충분하지 않을 때, 시스템이 잘못된 답을 강요하는 대신 5.4%의 확률로 침묵을 선택했다는 점입니다. 이는 질문을 잘게 나누고, 적절한 작업에 적합한 증거를 신뢰하며, 필요한 경우에만 AI 에이전트들이 토론하게 함으로써, 복잡한 금융 데이터를 다룰 때 훨씬 더 신뢰할 수 있고 정직한 AI를 구축할 수 있음을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →