← 최신 논문
💬 NLP

Citation-Enforced RAG for Fiscal Document Intelligence: Cited, Explainable Knowledge Retrieval in Tax Compliance

이 논문은 세무 준수와 같은 고위험 규제 분야에서 환각을 줄이고 설명 가능성을 높이기 위해 출처 기반 수집, 페이지 단위 출처 보존, 인용 강제 및 불확실 시 답변 거부를 특징으로 하는 인용 강제 RAG 프레임워크를 제안하고 실제 세무 문서로 그 유효성을 입증합니다.

원저자: Akhil Chandra Shanivendra

게시일 2026-03-17
📖 3 분 읽기☕ 가벼운 읽기

원저자: Akhil Chandra Shanivendra

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 **"세금 관련 문서를 분석할 때 인공지능 (AI) 이 실수하지 않고, 그 답이 어디서 왔는지 정확히 알려주는 시스템"**을 소개합니다.

일반적인 AI 가 "아는 척"하며 엉뚱한 말을 하는 것 (할루시네이션) 을 막기 위해, 세금 전문가들이 실제로 사용하는 문서만 가져와서 답을 짓고, 그 답의 근거를 반드시 표시하게 만든 기술입니다.

이 복잡한 내용을 일상적인 비유로 쉽게 설명해 드릴게요.


🏛️ 비유: "엄격한 도서관 사서와 AI"

이 시스템은 마치 엄격한 규칙을 지키는 도서관 사서와 같습니다.

1. 문제: "아는 척하는 AI" (기존 방식의 문제점)

기존의 AI 는 마치 지식을 많이 읽었지만 기억력이 나쁜 학생 같습니다.

  • 질문을 받으면, 머릿속에 있는 기억 (학습 데이터) 을 바탕으로 답을 지어냅니다.
  • 하지만 세금처럼 중요한 문제에서는 "아마도 그렇겠지?"라고 추측해서 엉뚱한 답을 할 수도 있습니다.
  • 문제점: "이 답이 책의 몇 페이지에 있는 거야?"라고 물어보면, "어디서 본 것 같은데..."라고 모호하게 대답하거나, 아예 없는 내용을 만들어냅니다. 이는 세금 신고나 감사 (Audit) 에 치명적입니다.

2. 해결책: "원본만 믿는 AI" (이 논문의 제안)

이 논문이 만든 AI 는 원본 문서 (IRS, 주정부 세금 안내서 등) 를 직접 들고 있는 사서입니다.

  • 원본 우선 (Source-First): AI 는 스스로 지식을 만들어내지 않습니다. 오직 공식 문서에서 직접 발췌한 내용만 답에 사용합니다. 마치 학생이 시험 볼 때 "교과서만 보고 답을 쓰라"고 하는 것과 같습니다.
  • 출처 표시 (Citation Enforcement): AI 가 한 말 하나하나마다 **"이건 A 문서 5 페이지에 나와요"**라고 딱딱하게 표시해야만 답을 할 수 있습니다. 출처가 없으면 입을 다물게 됩니다.
  • 모르면 모른다고 말하기 (Abstention): 만약 질문한 내용이 문서에 없거나, 문서가 너무 모호해서 확신이 없다면, AI 는 "이건 제가 알 수 없습니다"라고 정직하게 거절합니다.
    • 비유: "이건 제가 모릅니다"라고 말하는 것이, "잘못된 답을 지어내서 나중에 큰일 나는 것"보다 훨씬 낫다는 철학입니다.

🛠️ 이 시스템이 어떻게 작동하나요? (3 단계 과정)

  1. 문서 준비 (Ingestion):

    • 세금 문서 (PDF, 표, 그림이 섞인 복잡한 문서) 를 스캔해서 텍스트로 바꿉니다.
    • 이때 AI 가 내용을 요약해서 저장하는 게 아니라, 원문 그대로를 잘게 잘라내어 데이터베이스에 저장합니다. (요약본은 오해의 소지가 있기 때문입니다.)
  2. 검색과 검증 (Retrieval & Check):

    • 사용자가 질문을 하면, 시스템은 문서에서 관련 내용을 찾아옵니다.
    • 중요한 단계: 찾아낸 내용이 질문과 충분히 잘 맞는지 점수를 매깁니다. 점수가 낮으면 (문서에 답이 없으면), 아예 답을 짓지 않고 "모르겠습니다"라고 말합니다.
  3. 답변 생성 (Generation):

    • 찾은 내용을 바탕으로 답을 작성합니다.
    • 필수 규칙: "이 문장은 [문서명, 페이지] 에 근거합니다"라고 반드시 적어야만 답이 나옵니다. 만약 출처를 못 찾으면 답을 못 냅니다.

📊 결과는 어땠나요?

이 시스템을 실제 미국 연방 및 주정부 세금 문서로 테스트했습니다.

  • 거짓말 감소: AI 가 지어낸 엉뚱한 답변 (할루시네이션) 이 **1.8%**로 극도로 줄었습니다.
  • 출처 정확도: 답을 한 경우, 94.5% 의 확률로 정확한 문서와 페이지를 인용했습니다.
  • 실용성: 전문가 (세무사 등) 가 평가했을 때, 이 시스템이 찾아준 답은 매우 유용하고 신뢰할 만했다고 평했습니다. 특히 "어디서 이 정보를 찾았는지" 바로 확인해 볼 수 있어서 시간을 많이 절약해 주었습니다.

💡 핵심 메시지

이 논문은 **"AI 가 똑똑해지는 것보다, AI 가 정직하고 책임지는 것이 더 중요하다"**는 것을 보여줍니다.

  • 일반적인 AI: "무조건 답을 해줘야 해!" (실수할 위험 큼)
  • 이 논문의 AI: "확실한 근거가 없으면 답하지 않겠다. 근거가 있으면 출처를 딱 붙여주겠다." (신뢰도 높음)

세금이나 법률처럼 실수가 치명적인 분야에서는, AI 가 "아는 척"하는 것보다 **"모르면 모른다고 말하고, 알 때는 근거를 딱 보여주는 것"**이 훨씬 더 가치 있다는 것을 증명했습니다. 이는 앞으로 의료, 법률, 공공 정책 등 중요한 분야에서 AI 를 안전하게 쓸 수 있는 길을 제시합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →