← 최신 논문
💬 NLP

TraceBack: Multi-Agent Decomposition for Fine-Grained Table Attribution

이 논문은 구조화된 테이블 기반 질문 응답의 신뢰성을 높이기 위해 셀 수준의 상세한 근거 추적을 제공하는 다중 에이전트 프레임워크 'TraceBack'과 이를 평가하기 위한 새로운 벤치마크 'CITEBench' 및 참조 없는 평가 지표 'FairScore'를 제안합니다.

원저자: Tejas Anvekar, Junha Park, Rajat Jha, Devanshu Gupta, Poojah Ganesan, Puneeth Mathur, Vivek Gupta

게시일 2026-02-16
📖 4 분 읽기☕ 가벼운 읽기

원저자: Tejas Anvekar, Junha Park, Rajat Jha, Devanshu Gupta, Poojah Ganesan, Puneeth Mathur, Vivek Gupta

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 **"AI 가 테이블 (표) 데이터를 보고 답을 할 때, 그 답이 정확히 표의 어느 칸에서 나왔는지 증명하는 방법"**을 연구한 것입니다.

기존의 AI 는 답은 잘 내지만, "왜 이 답이 나왔는지" 그 근거를 보여주기 어렵거나, 근거가 엉뚱한 곳에 있는 경우가 많았습니다. 이 논문은 그 문제를 해결하기 위해 TRACEBACK이라는 새로운 시스템과 CITEBENCH라는 평가 기준, 그리고 FAIRSCORE라는 새로운 점수 측정법을 제안합니다.

일상적인 비유로 쉽게 설명해 드릴게요.


1. 문제 상황: "정답은 맞는데, 근거는 어디?"

가상의 상황을 상상해 보세요.
친구가 **"가장 효율이 좋은 재생에너지는 뭐야?"**라고 물었습니다.
AI 가 **"풍력 에너지야, 효율은 30~45% 였어"**라고 답했습니다.

이 답이 맞을 수도 있지만, AI 가 어떤 표의 어떤 칸을 보고 그 결론을 내렸는지 모르면 우리는 믿을 수 없습니다.

  • 혹시 AI 가 "태양광" 표를 보고 "풍력"이라고 잘못 말한 건 아닐까?
  • 혹시 "효율"이 아니라 "비용"을 보고 결론을 내린 건 아닐까?

기존의 AI 는 답만 던져주지, **"내 답의 근거가 표의 3 행 2 열에 있는 '30~45%'라는 숫자에서 왔고, 그걸 선택하기 위해 1 행의 '비용 50 이하' 조건을 먼저 확인했다"**는 과정을 보여주지 못했습니다.

2. 해결책: TRACEBACK (Traceback = 흔적을 추적하다)

이 논문은 TRACEBACK이라는 시스템을 만들었습니다. 이 시스템은 마치 수사관이나 감사관처럼 작동합니다.

  • 비유: "수사관 팀"
    TRACEBACK 은 혼자서 모든 일을 하는 게 아니라, 여러 명의 **전문가 (에이전트)**로 구성된 팀입니다.
    1. 검색관: "어떤 열 (Column) 을 봐야 할까?" (예: 비용, 효율, 확장성)
    2. 필터링관: "어떤 행 (Row) 을 제외할까?" (예: 비용이 50 만 원 이상인 건 다 제외)
    3. 분해관: "질문을 작은 조각으로 쪼갤까?" (예: "비용이 얼마인가?", "확장성은 어떤가?")
    4. 증거 수집관: "각 작은 질문에 답한 표의 **정확한 칸 (Cell)**은 어디인가?"
    5. 보고서 작성관: "모든 증거를 모아서 최종 답과 연결해라."

이 과정을 통해 AI 는 단순히 "풍력 에너지"라고 답하는 게 아니라, **"비용이 50 이하인 것 (A 칸) 과 확장성이 3 이상인 것 (B 칸) 을 먼저 확인하고, 그중에서 효율이 가장 높은 것 (C 칸) 을 골라 풍력 에너지라고 답했습니다"**라고 표의 특정 칸까지 가리키며 설명할 수 있게 됩니다.

3. 새로운 시험지: CITEBENCH

이 시스템을 잘 작동시키려면, AI 가 "정답"과 "근거 칸"을 모두 맞춘 데이터를 많이 필요로 합니다. 하지만 기존 데이터들은 근거가 너무 포괄적이거나 ("전체 행"만 표시) 오류가 많았습니다.

그래서 연구팀은 CITEBENCH라는 새로운 시험지를 만들었습니다.

  • 비유: "정밀한 채점용 답안지"
    기존 시험지는 "정답: 풍력 에너지"라고만 적혀 있다면, CITEBENCH 는 **"정답: 풍력 에너지 (근거: 표의 2 행 3 열, 2 행 4 열)"**라고 정확히 어떤 칸을 봤는지까지 사람이 직접 꼼꼼히 적어둔 데이터입니다. 이를 통해 AI 가 얼마나 정교하게 표를 읽는지 테스트할 수 있습니다.

4. 새로운 점수판: FAIRSCORE

문제는 인간이 직접 1,500 개 이상의 표를 보고 "이 칸이 맞다, 저 칸은 틀리다"라고 일일이 체크하는 건 너무 비싸고 느리다는 점입니다.

그래서 연구팀은 FAIRSCORE라는 자동 점수판을 만들었습니다.

  • 비유: "사실 확인 게임"
    이 시스템은 인간이 직접 표를 보지 않아도 됩니다. 대신 다음과 같이 작동합니다.
    1. AI 가 찾아낸 표의 칸들을 읽어서 **"사실 문장"**으로 바꿉니다. (예: "비용은 30~50 입니다")
    2. AI 가 낸 최종 답안에서도 **"사실 문장"**을 뽑아냅니다. (예: "효율이 높은 풍력 에너지는 비용이 30~50 입니다")
    3. 두 문장이 서로 **잘 맞는가?**를 AI 가 비교합니다.
      • 답안에 있는 모든 사실이 표에서 찾아낸 칸들로 설명될 수 있다면 점수 (Recall) 가 높습니다.
      • 표에서 찾아낸 칸들이 답안에 불필요한 거짓말을 포함하고 있지 않다면 점수 (Precision) 가 높습니다.

이렇게 하면 사람이 직접 표를 일일이 확인하지 않아도, AI 가 얼마나 정확하게 근거를 찾아냈는지 자동으로 점수를 매길 수 있습니다.

5. 결론: 왜 이것이 중요한가요?

  • 신뢰성: 고위험 분야 (의료, 금융 등) 에서 AI 가 "왜 이걸 추천했는지" 표의 특정 칸을 가리키며 증명해주면, 우리는 AI 를 더 믿을 수 있습니다.
  • 투명성: AI 가 중간에 어떤 생각을 했는지 (예: 먼저 비용을 필터링했다가 효율을 비교했다) 보여줍니다.
  • 효율성: FAIRSCORE 덕분에 수많은 데이터를 빠르고 저렴하게 평가할 수 있게 되었습니다.

한 줄 요약:
이 논문은 AI 가 표를 볼 때, "정답"뿐만 아니라 "정답을 찾은 정확한 표의 칸"까지 추적해서 보여주는 시스템을 개발했고, 이를 평가할 수 있는 새로운 기준과 자동 점수판도 함께 만들었습니다. 이제 AI 는 "내가 이 표의 이 칸을 봤기 때문에 이렇게 답했다"라고 변명할 수 있게 된 셈입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →