← 최신 논문
🤖 AI

MoCA-Agent: A Market-of-Claims Code Agent for Financial and Numerical Reasoning

MoCA-Agent는 질문을 전문가 검증을 위한 원자적 주장들로 분해하고, 시장에서 지지받는 증거로부터 실행 가능한 코드를 합성하며, 다양한 금융 벤치마크 전반에서 최첨단 성능을 달성하기 위해 엄격한 검증을 적용함으로써 금융 및 수치 추론 능력을 향상시키는 주장의 시장(market-of-claims) 코드 에이전트입니다.

원저자: Abdelrahman Abdallah, AbdelRahim A. Elmadany, Sameh Al Natour, Hasan Cavusoglu, Adam Jatowt, Muhammad Abdul-Mageed

게시일 2026-06-11
📖 4 분 읽기☕ 가벼운 읽기

원저자: Abdelrahman Abdallah, AbdelRahim A. Elmadany, Sameh Al Natour, Hasan Cavusoglu, Adam Jatowt, Muhammad Abdul-Mageed

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 매우 까다로운 수학 문제를 풀려고 하는데, 그 문제가 지저분한 스프레드시트를 기반으로 하고 있다고 상상해 보십시오. 만약 일반적인 AI에게 이 문제를 요청한다면, 그 AI는 틀린 숫자로 이어지는 길고 자신감 넘치는 이야기를 써 내려갈지도 모릅니다. 이는 마치 완벽한 에세이를 썼지만 마지막 단계에서 실수로 0으로 나누기를 해버린 학생과 같습니다. 에세이는 훌륭해 보이지만 정답은 틀린 상태인 것이죠.

이 논문은 이러한 "조용한 실수(silent mistakes)"를 금융 및 수치 작업에서 방지하기 위해 특별히 설계된 새로운 종류의 AI인 MoCA-Agent를 소개합니다. MoCA-Agent는 AI가 단순히 대화를 통해 답을 내도록 내버려 두는 대신, 문제를 사실에 대한 주식 시장처럼 취급합니다.

작동 방식은 다음과 같은 쉬운 비유를 통해 설명할 수 있습니다.

1. "클레임 카탈로그" (세분화하기)

MoCA-Agent는 AI에게 "문제를 해결하라"고 요청하는 대신, 질문을 **클레임(claim, 주장)**이라고 불리는 아주 작고 원자적인 조각들로 먼저 분해합니다.

  • 비유: 집을 짓는다고 상상해 보세요. 대신 "집을 지어라"라고 말하는 대신, 필요한 모든 벽돌, 들보, 못을 하나하나 목록으로 만드는 것과 같습니다.
  • 논문에서의 적용: 만약 질문이 "이익은 얼마였는가?"라면, 시스템은 "매출은 100달러이다", "비용은 20달러이다", "이익은 매출에서 비용을 뺀 것이다", "부호는 양수여야 한다"와 같은 클레임들을 나열합니다 부.

2. "트레이더들의 시장" (토론)

이것이 핵심적인 혁신입니다. 이 시스템은 단 하나의 AI에게 생각하도록 시키지 않습니다. 대신 네 명의 서로 다른 "전문 트레이더"를 고용하여 각 작은 클레임이 참인지 거짓인지에 대해 베팅하게 합니다.

  • 트레이더들:
    • 추출기(Extractor): 숫자가 원본 문서와 일치하는지 확인합니다.
    • 공식 전문가(Formula Expert): 수학적 논리가 타당한지 확인합니다.
    • 회계사(Accountant): 단위(달러, 퍼센트 등)와 부호(양수/음수)가 올바른지 확인합니다.
    • 회의론자(Skeptic): 적극적으로 오류를 찾아내고, 불확실해 보이는 클레임을 "매도(거절)"하려고 시도합니다.
  • 시장: 각 트레이더는 모든 클레임에 대해 "매수" 또는 "매도" 주문을 넣습니다. 만약 회계사와 회의론자가 모두 어떤 클레임을 "매도"(틀렸다고 판단)한다면, 그 클레임의 시장 가격은 떨어지고 해당 클레임은 거절됩니다. 만약 모두가 동의한다면 가격은 올라가고 클레임은 수용됩니다.
  • 이것이 중요한 이유: 일반적인 AI 토론에서는 세 명의 AI가 틀린 답에 동의하더라도 모두 자신감 있게 말할 수 있습니다. 하지만 여기서는 "공식 전문가"가 확신하더라도, 숫자가 맞지 않는다면 "회의론자"가 전체 흐를 차단(short-circuit)해 버릴 수 있습니다.

3. "신시사이저(Synthesizer)" (프로그램 구축)

시장이 정리되어(어떤 클레임이 수용될지 결정되면), "신시사이저" 에이전트가 파이썬 컴퓨터 프로그램을 작성합니다.

  • 규칙: 신시사이저는 시장에서 거절된 클레임은 절대 사용할 수 없습니다. 오직 "승인된 벽돌"만 사용하여 구축해야 합니다.
  • 비유: 이는 마치 안전 검사를 통과한 설계도만을 사용할 수 있는 건설 현장 소장과 같습니다. 설계도가 거절되었다면, 설령 정말 사용하고 싶더라도 사용할 수 없습니다.

4. "검증기(Verifier)" (안전 검사관)

최종 답변이 제공되기 전, "코드 인식 검증기(Code-Aware Verifier)"가 프로그램을 실행합니다.

  • 체크 사항: 이 검증기는 단순히 코드가 오류 없이 실행되는지만 보는 것이 아니라, 코드가 시장의 논리와 일치하는지 확인합니다. 코드가 실수로 부호를 뒤집었나요? 100으로 나누어야 할 때 곱하기를 했나요?
  • 수정: 검증기가 조용한 오류(예: 잘못된 부호)를 발견하면, 신시사이저가 수정할 수 있도록 구체적으로 실수를 지적하며 프로그램을 단 한 번의 수정 단계로 되돌려 보냅니다.

5. "갈등 중재자(Conflict Arbiter)" (결정권자)

때때로 시장이 혼란스러워하거나 프로그램이 약할 때가 있습니다. 이 경우, "위원회"가 시장의 답변을 표준적인 비시장형 AI 답변과 비교합니다. 만약 두 답변이 서로 다르다면, 특별한 "중재자"가 두 답변의 장점을 결합한 제3의 하이브리드 답변을 만들어냅니다.

결과: 왜 작동하는가

저자들은 이 시스템을 금융 보고서, 복잡한 표, 차트가 포함된 10가지의 어려운 벤치마크에서 테스트했습니다.

  • 결과: MoCA-Agent는 GPT-4o와 같은 매우 큰 모델이나 특화된 금융 모델을 포함한 다른 최상위 AI 모델들을 지속적으로 앞질렀습니다.
  • 비결: 단순히 더 큰 뇌를 사용해서 좋아진 것이 아닙니다. 수학을 하기 전에 모든 작은 사실에 대해 AI가 합의하도록 강제함으로써, "자신감 있지만 틀린 숫자"를 환각(hallucination)하는 것을 막아냈기 때문에 더 좋아진 것입니다.

한계점 (주의 사항)

이 논문은 이 시스템이 아직 무엇을 할 수 없는지에 대해서도 솔직하게 밝히고 있습니다.

  • 비용이 많이 듭니다: 이 시장 시스템을 실행하는 데는 단순한 AI 채팅보다 훨씬 더 많은 컴퓨터 "생각"(API 호출)이 필요하므로, 실행 비용이 약 5배 더 높습니다.
  • 영어가 필요합니다: 현재 시스템은 영어 금융 언어에 맞춰 튜닝되어 있습니다. 따라서 다른 언어나 생물학 같은 비금융 분야에서는 어려움을 겪을 수 있습니다.
  • 단일 단계 시각 기능: 입력값이 차트 이미지인 경우, 시스템은 이미지를 읽기 위해 하나의 도구를 사용합니다. 만약 그 도구가 라벨을 잘못 읽는다면, "트레이더"들이 그것에 대해 다시 베팅할 기회가 없으므로 오류가 그대로 통과될 수 있습니다.

요약하자면: MoCA-Agent는 모든 숫자에 대해 서명이 완료될 때까지 누구의 말도 믿지 않는 금융 감사 법인과 같습니다. 이는 "자유로운 형식의 대화"를 구조화되고 증거에 기반한 시장 체제로 대체하여 최종 수학 계산이 실제로 정확하도록 보장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →