← 최신 논문
💬 NLP

Reasoning by Commented Code for Table Question Answering

이 논문은 표 질의응답(Table Question Answering)을 자연어 추론이 포함된 실행 가능한 프로그램으로 분해하여 수치적 정밀도와 해석 가능성을 향상시킴으로써, WikiTableQuestions 벤치마크에서 84.3%의 최고 수준 정확도를 달성하는 주석이 달린 단계별 코드 생성 프레임워크를 제안한다.

원저자: Seho Pyo, Jiheon Seok, Jaejin Lee

게시일 2026-02-03
📖 3 분 읽기☕ 가벼운 읽기

원저자: Seho Pyo, Jiheon Seok, Jaejin Lee

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

문제점: "선형적" 두뇌 vs. "그리드" 세상

대규모 언어 모델(LLM)을 책을 왼쪽에서 오른쪽으로 한 단어씩 읽는 매우 똑똑한 독자라고 상상해 보세요. 이 방식은 이야기나 에세이를 읽을 때는 아주 잘 작동합니다.

하지만 (스프레드시트나 재무 보고서 같은 것들)는 **그리드(격자)**와 같습니다. 표에는 행과 열이 있으며, 데이터 포인트 간의 관계는 2차원적입니다. 만약 책을 읽는 사람에게 그리드를 읽으라고 강요한다면, 그들은 종종 혼란에 빠질 것입니다. 윗줄에 있는 숫자와 아래쪽 열에 있는 카테고리 사이의 연결 고리를 놓칠 수도 있습니다.

기존의 방법들은 이 문제를 두 가지 방식으로 해결하려 했지만, 둘 다 결함이 있습니다:

  1. "마법 같은 추측" (End-to-End): 모델이 그냥 표를 보고 답을 추측하는 방식입니다. 속도는 빠르지만, 수학에 약합니다. 마치 사람에게 계산기 없이 복잡한 나눗셈을 머릿속으로 해보라고 하는 것과 같습니다. 대략적인 느낌은 맞출 수 있어도 숫자는 틀릴 수 있습니다.
  2. "한 줄 명령" (기존 코드 방식): 모델이 문제를 풀기 위해 단 한 줄의 코드를 작성합니다. 이 방식은 계산기(코드)를 사용하기 때문에 (수학에는 좋지만) 블랙박스와 같습니다. 입력값과 출력값은 볼 수 있지만, 기계가 어떻게 그 결과에 도달했는지는 알 수 없습니다. 만약 실수를 하더라도, 왜 그런 실수를 했는지 알 길이 없습니다.

해결책: "요리책" 접근법

이 논문의 저자들은 AI를 가르치는 새로운 방법을 제안합니다: 주석이 달린 레시피를 쓰는 법.

단순히 답을 추측하거나 암호 같은 한 줄 명령을 쓰는 대신, AI에게 모든 단계마다 무엇을 하고 있는지 설명하는 주석이 달린 단계별 파이썬 프로그램(컴퓨터를 위한 지침 세트)을 작성하도록 요청하는 것입니다.

이것은 요리 레시피와 같습니다:

  • 기존 방식: "수프를 만드세요." (소금을 넣었는지 설탕을 넣었는지 알 수 없습니다.)
  • 새로운 방식 (주석이 달린 코드):
    • # 계획: 리스트에서 가장 오래된 연도를 찾아야 합니다.
    • # 필터링: 먼저, "USL A-League"와 관련 없는 모든 행을 제외합니다.
    • # 집계: 이제 남은 연도들을 살펴보고 가장 큰 숫자를 선택합니다.
    • # 정답: 결과는 2004입니다.

AI가 "코드"(행동) 바로 옆에 "주석"(추론)을 쓰도록 강제함으로써, 모델은 행동하기 전에 논리적으로 생각하도록 유도됩니다. 이는 학생에게 수학 시험에서 풀이 과정을 적으라고 하는 것과 같습니다. 만약 논리에서 실수가 발생하면, 주석을 통해 그 실수가 드러나고, 코드 실행을 통해 오류를 잡아낼 수 있습니다.

AI 학습 방법

연구진은 단순히 AI에게 이렇게 하라고 말한 것이 아니라, 특별한 훈련 시스템을 구축했습니다:

  1. 선생님: 매우 똑똑한 AI를 사용하여 수천 개의 표 질문에 대해 이러한 "주석이 달린 레시피"를 생성했습니다.
  2. 안전망: 만약 AI가 작동하지 않는 레시피(코드가 충돌하거나 틀린 답을 내놓는 경우)를 작성했다면, 시스템은 이를 그냥 버리지 않았습니다. 대신 AI에게 그 실수를 보여주고, 실패한 특정 단계를 수정하여 다시 시도하도록 요청했습니다.
  3. "정답 선택기": 연구진은 "레시피" 방식이 수학에는 뛰어나지만 까다로운 언어 이해에는 약할 수 있고, "마법 같은 추측" 방식은 언어에는 능숙하지만 수학에는 약할 수 있다는 점을 깨달았습니다. 그래서 작은 "심판" AI를 만들었습니다. 질문이 들어오면, 심판 AI는 레시피 방식의 답과 마법 같은 추측 방식의 답을 비교하여 더 옳다고 판단되는 것을 선택합니다.

결과

연구진은 AI가 스포츠 통계나 재무 기록 같은 복잡하고 실제적인 표를 바탕으로 질문에 답해야 하는 인기 벤치마크인 WikiTableQuestions에서 이를 테스트했습니다.

  • 단독 성능: 상대적으로 작은 규모의 AI 모델을 사용한 이들의 "주석 달린 코드" 방식은 70.9%의 정확도를 달-성했습니다. 이는 이전의 최고 "코드 전용" 방식(67.6%)을 앞질렀습니다.
  • 팀 성능: 이들의 방식을 최고의 "마법 같은 추측" 모델(Table-R1)과 결합하고 "심판" 선택기를 사용했을 때, 정확도는 **84.3%**로 뛰어올랐습니다.

이 연구가 중요한 이유 (논문에 따르면)

이 논문은 이 접근 방식이 "생각하는 것"과 "행동하는 것" 사이의 간극을 메운다고 주장합니다.

  • 신뢰성: 수학 계산을 AI의 추측이 아닌 컴퓨터 엔진(Pandas)이 수행하기 때문에, 숫자가 정확합니다.
  • 투명성: 주석 덕분에 인간은 코드를 읽고 AI가 왜 그 답을 선택했는지 정확히 이해할 수 있습니다.
  • 강건성(Robustness): 코드가 데이터를 계산하기 전에 어떻게 정제할지 명시적으로 지시하기 때문에, 이전 방식들보다 지저분한 데이터(예: "1,234"라고 적힌 숫자나 이상한 형식의 날짜)를 훨씬 더 잘 처리합니다.

요약하자면, 이 논문은 AI에게 표에 대한 수학 문제를 풀기 전 단계별 계획과 설명을 쓰도록 강제하면, AI가 훨씬 더 똑똑해지고, 정확해지며, 신뢰하기 쉬워진다는 것을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →