← 최신 논문
💻 computer science

SourceMinds at CheckThat! 2026: NLI-Grounded Citation Auditing in a Multi-Agent Pipeline for Full Fact-Checking Article Generation

본 논문은 밀집 증거 검색, 구조화된 계획 수립, 게이트형 자기 비판, 그리고 NLI 기반 인용 감사를 통합하여 출처에 근거한 팩트 체크 기사를 생성하는 CLEF 2026 CheckThat! Lab Task 3를 위한 멀티 에이전트 파이프라인인 SourceMinds를 제시한다.

원저자: Farhan Sharukh Hasan, Anirban Saha Anik, Eric Liu, Xiaoying Song, Mohotarema Rashid, Lingzi Hong

게시일 2026-07-29
📖 6 분 읽기🧠 심층 분석

원저자: Farhan Sharukh Hasan, Anirban Saha Anik, Eric Liu, Xiaoying Song, Mohotarema Rashid, Lingzi Hong

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

탐정의 딜레마: 왜 더 나은 팩트체크 로봇이 필요한가

인터넷을 누구나 서가에서 "사실"이라고 외칠 수 있는 거대하고 혼란스러운 도서관이라고 상상해 보십시오. 때때로 이 외침은 진실이지만, 종종은 터무니없는 추측이나 절반의 진실, 혹은 노골적인 거짓말이기도 합니다. 오랫동안 컴퓨터는 이러한 외침에 대해 단순한 "참 또는 거짓" 게임을 수행하는 데 능숙했습니다. 컴퓨터는 심판처럼 행동하며 진실에는 초록색 깃발을, 거짓에는 빨간색 깃발을 들어 올렸습니다. 하지만 현실 세계에서 단순히 "거짓"이라고 말하는 것만으로는 충분하지 않습니다. 누군가 루머를 퍼뜨린다면, 우리는 단순히 심판의 휘슬 소리를 원하는 것이 아니라, 완전한 탐정 이야기를 원합니다. 우리는 그것이 거짓인지, 실제 증거는 무엇을 말하고 있는지, 그리고 정확히 신문의 어느 페이지가 그 거짓말쟁이가 틀렸음을 입증했는지 알아야 합니다. 이것이 바로 "팩트체크 기사 생성"의 과제입니다. 이는 단순히 답을 찾는 것이 아니라, 모든 출처를 인용하여 누구도 "그걸 어디서 얻었느냐?"라고 묻지 못하도록 주장과 증거 사이의 점들을 연결하는 명확하고 신뢰할 수 있는 이야기를 쓰는 것입니다.

여기에서 "SourceMinds at CheckThat! 2026"이라는 논문이 등장합니다. 저자인 노스텍사스 대학교 팀은 초고성능 컴퓨터에게 한 번에 거대한 도약으로 전체 팩트체크 기사를 쓰라고 요청하는 것이 종종 엉망인 결과를 초래한다는 점을 깨달았습니다. 컴퓨터는 내용을 지어내거나 출처 인용을 잊어버릴 수 있습니다. 그래서 그들은 이 작업을 단계별로 해결하기 위해 디지털 전문가 팀, 즉 "멀티 에이전트 파이프라인"을 구축했습니다. 한 대의 로봇이 모든 것을 한꺼번에 하려고 노력하는 대신, 그들은 단서를 찾는 로봇, 계획을 조직하는 로봇, 초안을 쓰는 로봇, 그리고 마지막으로 모든 인용을 검사하여 이야기가 제대로 유지되는지 확인하는 "감사(auditor)" 로봇이 있는 워크플로우를 만들었습니다. 그들의 목표는 단순히 더 빨리 쓰는 것이 아니라, 최종 기사의 모든 문장이 실제적이고 검증 가능한 출처에 의해 뒷받받되도록 하여 더 잘 쓰는 것이었습니다.

디지털 탐정 팀

이 논문은 매우 구체적인 문제를 해결하기 위해 설계된 SourceMinds라는 시스템을 설명합니다. 이 문제는 혼란스러운 주장, 판결(예: "거짓"), 그리고 일련의 증거 문서들을 어떻게 하면 깔끔하고 전문적인 팩트체크 기사로 바꿀 것인가 하는 것입니다. 저자들은 이 과정을 서로에게 바통을 넘겨주는 릴레이 경주처럼 나누는 것이 최선이라고 제안합니다. 여기서 각 "에이전트"(특화된 컴퓨터 프로그램)는 서로에게 바통을 전달합니다.

1단계: 증거 사냥꾼 (The Evidence Hunter)
먼저, 시스템은 적절한 단서를 찾아야 합니다. 수천 권의 책이 있는 도서관에서 특정 인용구를 찾고 있다고 상상해 보십시오. 만약 단순히 비슷해 보이는 책 몇 권을 집어 든다면, 가장 좋은 것을 놓칠 수도 있습니다. SourceMinds 팀은 단어의 철자뿐만 아니라 단어의 의미를 이해하는 사서와 같은 "밀집 검색(dense retrieval)" 에이전트를 사용합니다. 이 에이전트는 증거 문서들을 스캔하여 가장 관련성이 높은 문장들을 찾아냅니다. 하지만 여기서 멈추지 않습니다. 이들은 "리랭커(reranker)"를 사용하여 최적의 일치 항목을 재검토하고, "출처 균형 선택기(source-balanced selector)"를 사용하여 단 하나의 웹사이트에서 나온 인용구 10개만을 뽑아내는 실수를 방지합니다. 이들은 다양한 출처의 팀을 구성하여, 증거가 단 하나의 목소리에 편향되지 않도록 보장하고자 합니다.

2단계: 설계자 (The Architect - Fact Planner)
단서가 모이면, 시스템은 바로 글을 쓰지 않습니다. 그것은 마치 설계도 없이 집을 지으려는 것과 같습니다. "팩트 플래너(Fact Planner)" 에이전트는 선택된 증거를 가져와 구조화된 JSON 계획을 만듭니다. 이것은 건축가가 평면도를 그리는 것과 같습니다. 이 에이전트는 주요 논거가 무엇인지 결정하고, 뒷받침하는 점들을 나열하며, 증거가 판결과 완벽하게 일치하지 않을 경우에 대비한 "주의 사항(caveats)"을 기록합니다. 결정적으로, 만약 증거가 약하다면 플래너는 이야기를 억지로 맞추기 위해 가짜 이유를 만들어내는 대신, 증거가 부족함을 인정하도록 프로그래밍되어 있습니다.

3단계: 기자 (The Journalist - Article Writer)
설계도가 손에 들어오면, "기사 작성자(Article Writer)" 에이전트가 투입됩니다. 이 에이전트는 전문 기자처럼 행동합니다. 이 에이전트의 임무는 주장을 설명하고, 판결을 밝히며, 증거를 따라 독자를 안내하는 250~450단어 분량의 기사를 쓰는 것입니다. 여기서 규칙은 엄격합니다. 모든 사실적 문장은 (출처: URL) 형태의 "인용(citation)"을 포함해야 합니다. 이는 학생이 연구 보고서를 쓸 때 모든 주장에 각주를 달아야 하는 것과 같습니다. 작성자는 오직 증거 인덱스에 제공된 URL만을 사용하도록 지시받으며, 이를 통해 가짜 출처를 만들어내는 것을 방지합니다.

4단계: 편집자 (The Editor - Self-Critique)
기사가 인쇄되기 전, "게이트형 자기 비판(gated self-critique)" 과정을 거칩니다. 이것은 초안이 의심스러울 때만 깨어나는 스마트한 편집자입니다. 시스템은 초안을 검사합니다: 인용이 최소 3개 이상인가? 최소 2개의 서로 다른 출처를 사용했는가? 만약 초안이 "근거가 약하다(weakly grounded)"면(즉, 증거가 부족하다면), 편집자가 업무를 시작합니다. 편집자는 문장 단위로 기사를 읽습니다. 만약 어떤 문장이 주장을 펼치고 있는데 인용이 실제로 이를 뒷받당하지 않는다면, 편집자는 문장을 다시 쓰거나 더 나은 인용으로 교체합니다. 만약 초안이 이미 훌륭하다면, 편집자는 시간을 아끼기 위해 이 작업을 건너뜁니다. 이 단계는 기사가 단순히 출처를 가진 것처럼 보이는 것이 아니라, 출처가 실제로 단어를 뒷받침하는지 확인합니다.

5단계: 감사관 (The Auditor - NLI Citation Auditor)
마지막으로, "NLI 인용 감사관(NLI Citation Auditor)"이 엄격하고 자동화된 배경 조사를 수행합니다. 이 에이전트는 "자연어 추론(Natural Language Inference, NLI)"이라는 기술을 사용합니다. 이것은 컴퓨터가 "만약 이 증거가 참이라면, 이 문장이 반드시 참이 되는가?"라고 묻는 논리 테스트와 같습니다. 감사관은 세 단계를 거칩니다:

  1. 정리(The Cleanup): 원래의 증거 목록에 없는 URL을 가리키는 인용을 모두 제거합니다.
  2. 수리(The Repair): 인용이 없는 문장의 경우, 감사관은 가장 잘 맞는 증거를 찾아내고, 그 증거가 논리적으로 문장을 증명하는 경우에만 인용을 부착합니다.
  3. 가지치기(The Prune): 문장에 너무 많은 인용이 있는 경우, 감사관은 중복된 인용을 제거하고 필수적인 출처만 남깁니다.

연구 결과

연구팀은 1,158개의 주장과 주장당 평균 7.8개의 증거 문서가 포함된 공식 CLEF 2026 CheckThat! Lab 테스트 세트로 시스템을 테스트했습니다. 그들은 자신들의 멀티 에이전트 파이프라인을 표준 베이스라인 시스템과 비교했습니다.

결과는 성공과 미래를 위한 명확한 교훈이 섞여 있었습니다. SourceMinds 시스템은 베이스라인 점수인 0.272를 이긴 0.329의 평균 점수를 기록했습니다. 저자들은 작업을 전문화된 단계로 나누는 것이 정말 도움이 되었다고 제안합니다. 구체적으로:

  • 증거 커버리지(Evidence Coverage): 시스템은 0.394를 기록하며 모든 지표 중 가장 높은 점수를 받았습니다. 이는 시스템이 단순히 하나의 문서에 의존하는 대신, 관련 증거를 찾고 다양한 출처에 인용을 분산시키는 데 매우 뛰어났음을 의미합니다.
  • 인용 품질(Citation Quality): 시스템은 베이스라인(0.223 및 0.240)에 비해 **인용 정밀도(Citation Precision, 0.337)**와 **인용 재현율(Citation Recall, 0.339)**에서 크게 향상되었습니다. 이는 "작성자"와 "감사관" 에이전트가 인용이 존재할 뿐만 아니라 실제로 필요하도록 협력하는 데 효과적이었음을 시사합니다.

그러나 이 논문은 중요한 병목 현상도 강조합니다. 생성된 기사가 실제 근거(ground-truth reference)의 논리와 추론에 부합하는지를 측정하는 **함의 점수(Entailment Score)**가 0.245로 가장 낮았습니다. 실제로, 이는 그들의 시스템이 베이스라인(0.298)보다 낮은 점수를 기록한 유일한 지표였습니다.

저자들은 이 격차에 대해, 인용을 가지고 있다고 해서 이야기가 반드시 옳다는 보장은 없다는 점을 들어 설명합니다. 문장은 (출처: example.com)과 같은 완벽해 보이는 인용을 가질 수 있지만, 여전히 해당 웹사이트가 실제로 말한 내용을 잘못 전달할 수 있습니다. 시스템은 문장에 태그를 붙이는 데는 능숙했지만, 증거를 최종 판결로 연결하는 깊은 논리적 논거를 구축하는 데는 어려움을 겪었습니다. 이 논문은 "문장 단위"의 검증이 도움이 되기는 하지만, 다음의 큰 과제는 "증거와 주장의 정렬(evidence-to-claim alignment)"을 개선하는 것, 즉 개별 부분이 아닌 전체 이야기가 말이 되도록 만드는 것임을 시사합니다.

결론

SourceMinds 팀은 자신들의 멀티 에이전트 파이프라인이 팩트체크 기사를 생성하기 위한 유망하고 모듈화된 방법이라고 결론짓습니다. 이는 거대하고 특화된 로봇을 처음부터 훈련시킬 필요 없이, 특화된 에이전트들로 구성된 가벼운 팀을 사용하여 더 나은 결과를 얻을 수 있음을 증명합니다. 이 시스템은 적절한 증거를 선택하고, 인용이 잘 되어 있으며 추적이 가능한 기사를 생산하는 데 효과적입니다. 그러나 낮은 함의 점수는 팩트체킹의 "마법"이 단순히 출처를 찾는 것이 아니라, 그것들을 일관성 있고 논리적인 서사로 엮어내는 것임을 시사합니다. 저자들은 향가 연구가 "인용을 가지는 것"과 "전체 진실을 말하는 것" 사이의 간극을 메우기 위해 더 나은 추론 단계에 집중해야 한다고 제안합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →