DiligenceProv: A Truth-Ledger Benchmark for Verifiable Financial Due-Diligence Answers from Large Language Models
이 논문은 고위험 금융 실사 분야에서 대규모 언어 모델의 검증 가능성, 증거 검색 및 정의적 정확성을 평가하고 개선하기 위해, 등록된 결함이 포함된 합성 딜 룸(synthetic deal rooms)을 사용하는 새로운 벤치마크이자 구축 방법론인 DiligenceProv를 소개한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
기업이 매각되거나 인수될 때, 그 과정은 기업의 재무적 건전성을 엄격하게 점검하는 단계인 실사(due diligence)에 의존합니다. 고문들은 감사된 재무제표와 수익 보고서부터 초안 계약서와 경영진 발표 자료에 이르기까지, '딜 룸(deal room)'이라 불리는 문서 모음을 검토하며 수주를 보냅니다. 이들의 임무는 다음과 같은 핵심적인 질문에 답하는 것입니다. 이 사업은 실제로 얼마나 벌고 있는가? 최대 고객들이 안고 있는 리스크는 무엇인가? 이러한 고도의 이해관계가 걸린 환경에서, 답변은 그 근거가 되는 증거가 뒷받합될 때만 가치를 지닙니다. 검토자는 단순히 최종 숫자뿐만 아니라, 그 숫자를 계산하는 데 사용된 구체적인 정의와 그 주장을 뒷받침하는 정확한 문서까지도 검증할 수 있어야 합니다. 만약 답변이 자신감 있어 보이지만 틀렸다면, 이는 답변이 아예 없는 것보다 투자 결정에 더 위험하게 오해를 불러일으킬 수 있습니다.
인공지능, 특히 거대 언어 모델은 이러한 복잡한 문서의 읽기와 분석 속도를 높여줄 것을 약속하며 이 분야에 진입하기 시작했습니다. 그러나 중대한 장애물이 남아 있습니다. 현재의 AI 시스템은 텍-스트를 유창하게 읽을 수는 있지만, 금융에서 요구되는 특정한 종류의 검증 능력은 부족합니다. AI는 실제로는 틀린 숫자를 그럴듯하게 제시하거나, 결론을 뒷받침하지 못하는 문서를 인용할 수 있습니다. 핵심 과제는 AI가 단어를 읽을 수 있느냐가 아니라, 인간 전문가가 수용할 수 있는 단 하나의 진실을 찾기 위해 어떻게 혼란스러운 정보의 집합을 탐색할 수 있느냐 하는 것입니다.
이를 해결하기 위해 연구자들은 'DiligenceProv'라는 새로운 테스트 환경을 구축했습니다. 이것은 이미 정산되고 합의된 깨끗하고 공개된 재료를 바탕으로 한 일반적인 테스트가 아닙니다. 대신, 연구자들은 가상의 회사를 만들고 재무제표, 부채 일정표, 경영진 발표 자료를 포함한 30개의 현실적인 문서 세트를 생성했습니다. 그들은 실제 거래에서 발견되는 유형의 혼란을 의도적으로 도입했습니다. 예를 들어, 동일한 수익 지표가 세 가지 다른 방식으로 정의되어 있거나, 현재의 것처럼 보이는 오래된 수치, 그리고 문서가 도저히 답할 수 없는 질문들을 포함시켰습니다. 목표는 AI 시스템이 숫자, 정의, 그리고 증거를 동시에 확인하며 인간 검토자가 검증할 수 있는 답변을 제공할 수 있는지 확인하는 것이었습니다.
연구자들은 단순히 문서를 현실적으로 만드는 것만으로는 가장 발전된 AI 시스템을 시험하기에 충분하지 않다는 것을 발견했습니다. 현실적이지만 완벽하게 일관된 문서 세트를 활용한 초기 테스트에서, 최상위 상용 모델은 질문이 까렴하더라도 모든 질문에 정확히 답했습니다. 문서에 실제 협상에서 존재하는 특유의 함정들이 없었기 때문에 시스템은 어려움을 겪지 않았습니다. 연구자들은 이 시스템들을 진정으로 시험하기 위해서는 난이도를 설계해야 한다는 점을 깨달았습니다. 그들은 모든 사실에 대한 마스터 기록인 '진실 원장(truth ledger)'을 만들었고, 그 후 문서들에 등록된 결함들을 포함하도록 작성했습니다. 여기에는 서로 다른 문서 간의 충돌, 정답처럼 보이지만 실제로는 틀린 현실적인 방해 요소, 그리고 정보가 누락되었음에도 명시적으로 누락되었다고 언급되지 않은 공백 등이 포함되었습니다.
AI 모델들을 이 설계된 혼란과 대조하여 테스트했을 때, 결과는 극적으로 변했습니다. 이전에 완벽한 점수를 기록했던 가장 진보된 모델들도 등록된 결함들을 탐색해야 할 때 실패하기 시작했습니다. 더욱 놀라운 점은, 중간 단계의 모델들의 경우 AI에게 30개의 문서 전체를 주는 것이 정교하게 선택된 6페이지의 문서만 주는 것보다 성능을 떨어뜨린다는 사실을 발견했다는 것입니다. AI가 전체 룸에 접근할 수 있게 되면, 추가 텍-스트에 나타난 오래된 수치나 조작된 인용구에 의해 주의가 분산되는 경우가 많았습니다. AI는 잘못된 버전의 숫자를 가져오거나 존재하지 않는 문서를 만들어내곤 했습니다. 그러나 연구자들이 가장 관련성이 높은 구절만을 제공했을 때, AI의 성능은 현저히 향고되었습니다. 이 경우, 검색(retrieval) 과정이 필터 역할을 하여 모델을 전체 문서 세트의 소음과 혼란으로부터 보호해 준 것입니다.
또한 이 연구는 AI 시스템들에게 가장 어려운 부분은 증거를 찾는 것이 아니라, 그것을 어떻게 사용하는지를 이해하는 것이라는 점을 밝혀냈습니다. 연구자들이 모델에게 정확한 문서와 올바른 숫자를 제공했음에도 불구하고, 모델들은 여전히 실수를 저질렀습니다. 모델들은 종종 재무 지표의 올바른 정의를 적용하는 데 실패하거나, 계약서의 초안 버전과 최종 버전을 구분하지 못했습니다. 오류는 정보의 부족 때문이 아니라, 거래의 규칙을 적용하는 규율의 부족 때문이었습니다. 연구자들은 이러한 실패를 '확신에 찬 오답(false fact를 확신하며 말하는 경우)'이나 '방해 요소 포착(misleading number에 매몰되는 경우)'과 같은 특정 유형으로 분류했습니다.
특히 우려스러운 발견은 AI가 자신이 모르는 것에 대해 인정하지 못한다는 점이었습니다. 현실 세계에서 만약 문서에 특정 예측치가 없다면, 정답은 정보가 누락되었다고 말하는 것입니다. 테스트에서 AI 모델들은 답변을 거부하는 경우가 거의 없었습니다. 대신, 누락된 데이터에 직면했을 때 그들은 추측하거나 외삽(extrapolate)하여, 구조화되고 전문적으로 보이는 가공의 숫자를 만들어내곤 했습니다. 이는 금융 분야에서 매우 위험한 행동입니다. 왜냐하면 확신에 찬 어조의 틀린 숫자는 명확하게 정보가 없다고 인정하는 것보다 더 해로울 수 있기 때문입니다.
연구자들은 금융 실사에서의 어려움은 단순히 텍-스트의 복잡성에 있는 것이 아니라, 증거가 어떻게 접근되고 관리되는지에 달려 있다고 결론지었습니다. 가장 강력한 AI 시스템의 경우, 모든 문서의 전체 맥락에 접근하는 것이 완벽에 가까운 점수로 이어졌으며, 이는 그들의 주요 한계가 단순히 적절한 정보의 가용성 문제임을 시사했습니다. 반면 다른 모델들에게 너무 많은 정보는 오히려 약점이 되었습니다. 이 연구는 이러한 시스템들이 신뢰를 얻기 위해서는 단순한 검색을 넘어 검증과 정의를 우선시하는 워크플로우가 필요함을 시사합니다. 이 벤치마크는 이제 다른 연구자들이 사용할 수 있도록 공개되어, 이 시스템들이 실제 자금을 다루기 전에 측정하고 개선할 수 있는 방법을 제공합니다. 이 작업은 고도의 이해관계가 걸린 금융 업무에서, 신뢰성을 확보하는 길은 AI를 더 똑똑하게 만드는 것이 아니라, 엄격한 규칙과 증거에 따라 자신의 답변을 스스로 검증할 수 있는 시스템을 구축하는 데 있음을 보여줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.