← 최신 논문
💬 NLP

ViTaB-A: Evaluating Multimodal Large Language Models on Visual Table Attribution

이 논문은 멀티모달 대규모 언어 모델이 구조화된 데이터에 대한 질문에 답할 수는 있지만, 답변의 근거가 되는 행과 열을 정확하게 지목하는 '속성 부여' 능력은 매우 부족하여 투명성과 추적성이 필요한 응용 분야에서의 신뢰성이 제한됨을 보여줍니다.

원저자: Yahia Alqurnawi, Preetom Biswas, Anmol Rao, Tejas Anvekar, Chitta Baral, Vivek Gupta

게시일 2026-02-18
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yahia Alqurnawi, Preetom Biswas, Anmol Rao, Tejas Anvekar, Chitta Baral, Vivek Gupta

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 **"AI 가 정답을 맞혔을 때, 그 답이 어디서 왔는지 정확히 알려줄 수 있을까?"**라는 아주 중요한 질문을 던집니다.

제목: ViTaB-A: AI 가 표 (Table) 데이터를 보고 답을 할 때, 그 근거를 제대로 찾을 수 있는지 시험한 연구

이 내용을 마치 친구와의 대화처럼, 쉬운 비유로 설명해 드릴게요.


🍽️ 비유: "맛있는 요리를 해주는 요리사"

생각해 보세요. 여러분이 식당에 가서 "오늘의 메뉴 중 가장 비싼 생선 요리는 뭐야?"라고 물었다고 칩시다.
AI(요리사) 가 **"아, 오늘 비싼 생선은 '참치'입니다!"**라고 정확히 대답했습니다.

하지만 여기서 멈추면 안 됩니다.
**"그걸 어떻게 알았어? 메뉴판의 어느 줄, 어느 칸을 봤어?"**라고 물어봐야 합니다.

이 논문은 바로 이 **"메뉴판의 어느 칸을 봤는지 정확히 지적해 주는 능력"**을 테스트한 것입니다.

🔍 연구의 핵심 발견 (3 가지 놀라운 사실)

연구진은 다양한 AI 모델들에게 표 (Table) 데이터를 주고 질문을 던진 뒤, **"정답을 맞췄다면, 그 근거가 되는 표의 줄 (Row) 과 열 (Column) 을 정확히 가리켰는지"**를 확인했습니다. 결과는 꽤 충격적이었습니다.

1. "정답은 맞췄는데, 근거는 엉뚱해!" (정답 vs 근거의 괴리)

  • 상황: AI 는 질문의 정답을 50~60% 정도는 맞췄습니다. 꽤 잘하는 편이죠.
  • 문제: 하지만 그 정답을 뒷받침하는 **표의 특정 줄이나 열을 가리키는 능력 (근거 찾기)**은 거의 0% 에 가까웠습니다.
  • 비유: 마치 시험에서 정답을 맞췄는데, 풀이 과정을 보니 완전히 엉뚱한 공식을 적어놓은 경우와 같습니다. 답은 맞았지만, 그 답이 왜 맞는지 설명할 수 없다면 우리는 그 답을 믿을 수 없겠죠? 특히 JSON(컴퓨터가 읽는 데이터 형식) 같은 텍스트 데이터에서는 근거 찾기가 거의 무작위 추측 수준이었습니다.

2. "사진으로 보면 잘하고, 글자로 보면 망해" (이미지 vs 텍스트)

  • 발견: 표를 **사진 (이미지)**으로 보여주면 AI 가 근거를 찾는 능력이 훨씬 나았습니다. 하지만 **텍스트 (Markdown, JSON)**로만 주면 급격히 떨어졌습니다.
  • 비유:
    • 사진: 요리사가 실제 메뉴판 사진을 보고 "저기 3 줄 2 칸에 참치가 있네!"라고 바로 찾아냅니다. (시각적 구조가 명확해서요)
    • 텍스트: 요리사가 메뉴판 내용을 글자로만 나열된 문서를 보고 "참치가 3 줄 2 칸에 있나?"라고 헤매는 꼴입니다. 글자만 나열되어 있으면 '줄'과 '열'의 구조를 파악하기가 매우 어렵기 때문입니다.

3. "줄 (Row) 은 찾는데, 열 (Column) 은 못 찾는다"

  • 발견: AI 는 표에서 **가로 줄 (예: '참치'라는 항목)**을 찾는 것은 비교적 잘하지만, **세로 열 (예: '가격'이라는 카테고리)**을 찾는 데는 매우 서툴렀습니다.
  • 비유: 요리사가 "저기 참치가 있네!" (줄 찾기) 는 잘하지만, "그게 가격이네?" (열 찾기) 는 헷갈려 하는 것입니다. AI 는 구체적인 '사물'은 잘 인식하지만, 그 사물이 속한 '범주'나 '속성'을 파악하는 데는 아직 약합니다.

⚠️ 가장 무서운 점: "자신감 과잉"

연구진은 AI 가 "내가 90% 확신해!"라고 말할 때, 그 확신이 사실과 일치하는지도 봤습니다.

  • 결과: AI 가 근거를 엉뚱하게 찾았을 때도, 자신감은 여전히 높았습니다.
  • 비유: 요리사가 "이게 참치 맞아요, 100% 확실해요!"라고 자신 있게 말하지만, 실제로는 메뉴판의 다른 칸을 가리키고 있는 상황입니다. AI 가 자신 있게 말할 때, 그 말이 진짜 근거에 기반한 건지 알 수 없다는 뜻입니다.

💡 결론: 왜 이 연구가 중요할까요?

이 논문은 **"AI 가 정답을 잘 맞춘다고 해서, 그 답을 믿고 따라도 된다는 뜻은 아니다"**라고 경고합니다.

  • 은행, 병원, 법률 같은 분야에서는 "왜 그 결정을 내렸는지"를 정확히 추적 (Traceability) 할 수 있어야 합니다.
  • 지금의 AI 는 정답은 잘 내지만, 그 근거를 제대로 제시하지 못합니다.
  • 따라서 우리는 AI 가 "정답"을 줄 때, "어디서 그 답을 찾았는지"를 검증할 수 있는 새로운 기준이 필요하다는 것을 이 연구는 보여줍니다.

한 줄 요약:

"AI 가 정답을 맞췄다고 해서 안심하지 마세요. 그 답이 어디서 왔는지 (근거) 정확히 가리키지 못한다면, 그 답은 믿을 수 없는 '행운의 정답'일 뿐입니다."

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →