TABVERSE: Benchmarking Cross-Format Table Understanding in LLMs and VLMs
이 논문은 표 표현 형식(HTML, Markdown, LaTeX, 이미지 등)이 모델 성능에 미치는 영향을 분리하여 조사하는 제어된 멀티모달 벤치마크인 TABVERSE를 소개하며, 구조화된 텍스트가 일반적으로 이미지보다 우수한 성능을 보이지만 표현 방식의 선택이 다양한 작업과 모델 전반에 걸쳐 결과에 상당한 영향을 미친다는 점을 밝히고 있다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신에게 날씨, 매출, 또는 스포츠 점수에 대한 매우 중요한 스프레드시트가 있다고 상상해 보세요. 이제 이 동일한 스프레드시트를 네 가지 다른 방식으로 컴퓨터에게 보여줄 수 있다고 상상해 봅시다.
- 사진 형태 (휴대폰으로 찍은 스크린샷처럼).
- HTML 코드 형태 (웹사이트를 만드는 데 사용되는 언어).
- LaTeX 코드 형태 (과학자들이 복잡한 문서를 작성할 때 사용하는 언어).
- 마크다운(Markdown) 형태 (채팅 앱이나 메모에서 사용되는 간단한 텍스트 형식).
**"TABVERSE"**라는 논문은 단순하지만 까다로운 질문을 던집니다: AI에게 표를 보여주는 방식이 중요할까요?
기존의 대부분의 테스트는 AI에게 서로 다른 표와 서로 다른 형식을 동시에 제공했습니다. 그것은 마치 "이 수학 문제를 풀 수 있니?"라고 물으면서, 어떤 때는 종이에 적어서 주고, 어떤 때는 화이트보드에 적어주고, 어떤 때는 귓속말로 속삭여 주는 것과 같았습니다. 그러면 당신은 AI가 수학 문제 자체가 어려워서 틀린 것인지, 아니면 화이트보드가 지저분해서 틀린 것인지 알 수 없게 됩니다.
TABVERSE는 이 문제를 해결하기 위해 단 하나의 동일한 표를 가져와서 네 가지 형식을 모두 사용하여 AI에게 동시에 보여줍니다. 이를 통해 연구자들은 어떤 형식이 AI의 사고를 돕고, 어떤 형식이 AI를 혼란스럽게 만드는지 정확히 파악할 수 있습니다.
연구 결과는 다음과 같으며, 일상적인 비유를 들어 설명합니다.
1. "읽기 vs 보기" 테스트 (질의응답)
연구자들은 AI에게 "누가 가장 많이 팔았나요?" 또는 "평균 가격은 얼마인가요?"와 같은 질문을 던졌습니다.
- 연구 결과: 일반적으로 AI는 이미지를 보는 것보다 텍스트 코드(HTML이나 마크다운 같은)를 읽는 것을 더 잘합니다.
- 비유: 당신이 전화번호부에서 특정 이름을 찾으려고 한다고 상상해 보세요.
- 텍스트 형식: 실제 전화번호부를 눈앞에 펼쳐 놓은 것과 같습니다. 글자를 훑어보며 이름을 쉽게 찾을 수 있습니다.
- 이미지 형식: 그 전화번호부를 흐릿하게 찍은 사진을 보고 있는 것과 같습니다. 단어는 보이지만, 눈이 초점을 맞추기 위해 더 많이 노력해야 하며 글자를 놓칠 수도 있습니다.
- 승자: HTML이 가장 신뢰할 수 있는 "전화번호부" 형식이었습니다. AI는 HTML 때문에 거의 혼란을 겪지 않았습니다. LaTeX는 조금 더 까다로웠는데, 마치 아주 화려하고 엄격한 글꼴로 쓰인 전화번호부 같아서 때때로 독자를 당황하게 만들었습니다.
2. "지도 읽기" 테스트 (구조적 이해)
다음으로, 연구자들은 AI에게 지도 제작자처럼 행동하라고 요청했습니다. "행(row)이 몇 개인가요?" 또는 "3행 2열에는 무엇이 있나요?"와 같은 질문을 던졌습니다.
- 연구 결과: AI는 텍스트를 완벽하게 읽을 수 있음에도 불구하고, 행을 세거나 특정 위치를 찾는 데 놀라울 정도로 서툽니다.
- 비유: AI를 지도를 든 관광객이라고 생각해보세요.
- 열(Columns): AI는 남북으로 달리는 "거리(열)"를 세는 데 능숙합니다. 수직선을 보기 쉽기 때문입니다.
- 행(Rows): AI는 동서로 달리는 "가로 길(행)"을 세다가 길을 잃습니다. "제목(Title)"이 도로가 아니라는 사실을 잊어버리거나, 첫 번째 도로가 어디서 시작되는지 헷갈려 하곤 합니다.
- 반전: 연구자들이 AI에게 이미지 대신 텍스트 목록 형태의 행 정보를 주었을 때, AI는 훨씬 더 잘 세었습니다. 하지만 그럼에도 불구하고 여전히 "열" 개념보다 "행" 개념을 다루는 데 더 어려움을 겪었습니다.
3. "따라 하기" 테스트 (재구성)
마지막으로, 연구자들은 AI에게 표의 이미지를 보여주고 이를 코드(HTML, LaTeX, 또는 마크다운)로 다시 만들어 보라고 요청했습니다.
- 연구 결과: AI는 표의 모양(상자와 선들)을 복사하는 데는 뛰어나지만, 내용을 완벽하게 복사하는 데는 서툽니다. 특히 LaTeX에서 그렇습니다.
- 비유: 아이에게 집 그림을 따라 그리라고 시킨다고 상상해 보세요.
- 위상(Topology, 모양): 아이는 집을 위해 사각형을 그리고 지붕을 위해 삼각형을 그립니다. 아이는 모양을 제대로 그렸습니다! (이것을 논문에서는 "위상"이라고 부릅니다.)
- 내용(Details): 하지만 아이는 "GARAGE"라는 단어를 틀리게 쓰거나, 문을 엉뚱한 곳에 그릴 수 있습니다.
- LaTeX 문제: AI에게 LaTeX로 표를 재구성하라고 하는 것은, 아이에게 매우 엄격하고 복잡한 규칙만을 사용하여 집을 그리라고 요구하는 것과 같습니다. 만약 아이가 규칙 중 하나라도 실수하면, 전체 그림이 망가지고 작동하지 않게 됩니다. 논문은 많은 AI 모델이 컴퓨터가 읽을 수 없는 "깨진" LaTeX 코드를 생성한다는 것을 발견했습니다. 설령 그림 자체는 괜찮아 보이더라도 말입니다.
핵심 요약
이 논문의 결론은 데이터를 AI에게 어떻게 전달하느냐가 데이터 그 자체만큼 중요하다는 것입니다.
- 단정 짓지 마세요: AI가 이미지에서 정답을 맞혔다고 해서, AI가 표를 이해한다고 가정해서는 안 됩니다.
- 형식이 중요합니다: 복잡한 수학 계산을 하거나 특정 행을 찾아야 한다면, 스크린샷을 보여주는 것보다 깨끗한 텍스트 파일(HTML 같은)을 주는 것이 보통 더 좋습니다.
- "행"의 사각지대: 가장 똑똑한 AI 모델이라 할지라도 여전히 어떤 행이 몇 번째인지 추적하는 데 어려움을 겪으며, 헤더(제목) 때문에 헷갈려 하거나 줄 수를 잘못 세기도 합니다.
요약하자면, TABVERSE는 AI를 위한 새로운 운전 면허 시험과 같습니다. 단순히 차가 달릴 수 있는지를 보는 것이 아니라, 차가 매끄러운 고속도로(HTML)에서 더 잘 달리는지, 울퉁불퉁한 흙길(LaTeX)에서 더 잘 달리는지, 아니면 도로 대신 지도를 보면서 달리는지(이미지)를 테스트하는 것입니다. 결과는 AI가 달리는 "도로"가 성능에 영향을 미친다는 것을 보여줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.