← 최신 논문
💬 NLP

The Mighty ToRR: A Benchmark for Table Reasoning and Robustness

이 논문은 다양한 표 형식과 도메인에 걸친 모델의 성능과 견고성을 평가하는 새로운 벤치마크인 ToRR을 제안하고, 강력한 모델조차 표 데이터 처리에서 취약한 행동을 보이며 다양한 형식과 프롬프트를 통한 테스트가 필수적임을 규명합니다.

원저자: Shir Ashury-Tahan, Yifan Mai, Rajmohan C, Ariel Gera, Yotam Perlitz, Asaf Yehudai, Elron Bandel, Leshem Choshen, Eyal Shnarch, Percy Liang, Michal Shmueli-Scheuer

게시일 2026-02-18
📖 3 분 읽기☕ 가벼운 읽기

원저자: Shir Ashury-Tahan, Yifan Mai, Rajmohan C, Ariel Gera, Yotam Perlitz, Asaf Yehudai, Elron Bandel, Leshem Choshen, Eyal Shnarch, Percy Liang, Michal Shmueli-Scheuer

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

1. 연구의 배경: "왜 표 데이터가 문제일까?"

우리는 매일 은행 명세서, 주식 차트, 스포츠 기록표 등 수많은 '표'를 봅니다. AI 가 이걸 잘 읽어야 현실 세계에서 유용하게 쓰일 수 있습니다. 하지만 기존 연구들은 AI 가 표를 읽는 능력을 너무 단순하게만 평가했습니다.

  • 비유: 마치 자동차를 평평한 아스팔트 도로에서만 100km/h 로 달리게 해서 "이 차는 최고다!"라고 선언한 것과 같습니다. 하지만 실제 도로에는 비포장길이나 눈길도 있는데, 그걸 테스트해 보지 않은 셈이죠.

2. 새로운 기준, 'ToRR' (The Mighty ToRR)

연구팀은 이 문제를 해결하기 위해 **'ToRR'**이라는 새로운 시험지를 만들었습니다.

  • ToRR 이란? "표 추론 (Table Reasoning) 과 견고성 (Robustness)"을 측정하는 기준입니다.
  • 시험 내용: 10 개의 다양한 데이터셋 (금융, 과학, 위키백과 등) 을 사용했습니다.
  • 핵심 아이디어: 같은 질문을 해도 표를 보여주는 형식을 바꿔서 봅니다.
    • HTML 형식, CSV 형식, JSON 형식, 마크다운 형식 등 7 가지로 바꿔서 물어봅니다.
    • 행 (Row) 의 순서를 뒤섞거나, 열 (Column) 을 바꾸는 등 약간의 변화를 줍니다.

3. 충격적인 결과: "AI 는 표 앞에서 매우 약하다"

연구 결과는 놀라웠습니다. 최신 AI 모델들조차 표 데이터를 다룰 때 매우 취약한 (Brittle) 모습을 보였습니다.

  • 상황: 같은 표에 같은 질문을 했을 때, 표가 Markdown으로 되어 있으면 정답을 맞췄는데, CSV로 바뀌거나 행 순서가 조금만 바뀌어도 엉뚱한 답을 내놓거나 아예 실패했습니다.
  • 비유: 어떤 학생이 검은색 글씨로 쓴 수학 문제는 풀었는데, 빨간색 글씨로 쓰거나 문제 번호 순서를 살짝 바꿨을 때 "이건 다른 문제야!"라며 당황해서 풀지 못하는 것과 같습니다.
  • 결론: AI 는 표의 '의미'를 깊이 이해하기보다, 표의 '형식'에 의존해서 답을 구하고 있었습니다.

4. 중요한 발견: "하나의 정답은 없다"

어떤 AI 모델이든, 특정 표 형식 (예: HTML) 만을 좋아해서 항상 잘 풀지는 않았습니다.

  • 비유: 어떤 학생은 A4 용지에 쓴 문제를 잘 풀고, 다른 학생은 노란색 메모지에 쓴 문제를 잘 풀 수 있습니다. 하지만 어떤 학생도 모든 용지 종류에서 100 점 만점을 받는 경우는 없었습니다.
  • 교훈: AI 의 능력을 평가할 때 "이 형식으로만 테스트하면 90 점이다"라고 말하면 안 됩니다. 다양한 형식으로 테스트해야 진짜 실력을 알 수 있습니다.

5. 해결책 제안: "질문 방식을 여러 번 바꿔보세요"

연구팀은 AI 의 능력을 신뢰할 수 있게 평가하는 방법을 제안했습니다.

  • 방법: 같은 문제를 풀 때, 표의 형식을 여러 번 바꿔서 (예: 10 가지 다른 버전) 여러 번 물어보고 그 결과를 평균내는 것입니다.
  • 효과: 이렇게 하면, AI 가 우연히 한 가지 형식만 기억해서 맞춘 경우를 걸러낼 수 있습니다.
  • 비유: 학생의 실력을 볼 때, 한 번의 시험으로 평가하는 것보다 다양한 유형의 문제집을 여러 권 풀게 해서 평균 점수를 내는 것이 훨씬 공평하고 정확한 평가가 됩니다.
  • 흥미로운 사실: 테스트 문제의 수를 늘리는 것보다, 질문하는 방식 (프롬프트) 을 다양하게 바꾸는 것이 평가의 신뢰도를 높이는 데 더 효과적일 수 있었습니다.

6. 요약: 이 연구가 우리에게 주는 메시지

  1. 현재 AI 는 표를 잘 못 봅니다: 최신 AI 모델들도 표 데이터를 다룰 때 매우 불안정하고 실수를 많이 합니다.
  2. 형식에 너무 민감하다: 표가 조금만 다르게 생겼어도 AI 는 당황합니다.
  3. 평가 방식이 달라져야 한다: AI 를 평가할 때는 "한 가지 형식"으로만 테스트하지 말고, 다양한 형식과 변형을 섞어서 여러 번 테스트해야 진짜 실력을 알 수 있습니다.

한 줄 결론:

"AI 가 표를 읽는 능력을 평가하려면, 평지뿐만 아니라 비포장도로, 눈길, 진흙길 등 모든 길에서 달리게 해봐야 진짜 실력을 알 수 있습니다. 그리고 그걸 위해선 질문하는 방식을 다양하게 바꿔주는 것이 핵심입니다."

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →