SheetCompass: Hierarchical Relation Graphs for Agentic Spreadsheet Reasoning
SheetCompass는 워크시트 내부 및 시트 간의 계층적 구조 관계와 공간적 맥락을 명시적으로 모델링함으로써 기존 LLM 기반 스프레드시트 추론의 한계를 해결하고 복잡한 워크북의 더욱 효과적인 자동화를 가능하게 하는 그래프 가이드형, 메모리 구동형 에이전트 프레임워크입니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
디지털 스프레드시트의 퍼즐
당신은 아주 똑똑한 로봇에게 엉망진창인 여러 페이지짜리 스프레드시트를 읽는 법을 가르치려 한다고 상상해 보세요. 인공지능의 세계에서 이것은 마치 탐정에게 책에서 찢겨 나와 한 줄로 뒤섞인 단어 목록을 읽고 범죄를 해결하라고 요청하는 것과 비슷합니다. 스프레드시트는 단순한 데이터 목록이 아닙니다. 그것들은 시각적인 지도입니다. 행, 열, 그리고 돈, 판매 또는 재고에 관한 이야기를 들려주는 서로 다른 페이지 간의 숨겨진 연결 고리를 가지고 있습니다. 인간에게 스프레드시트를 보는 것은 도시 지도를 스캔하는 것과 같습니다. 당신은 '판매' 거리가 어떻게 '가격' 대로와 연결되는지 즉각적으로 파악합니다. 하지만 시를 쓰고 질문에 답하는 종류의 AI인 대규모 언어 모델(LLM)에게 스프레드시트는 종종 악몽과 같습니다. 우리가 이 모델들에게 스프레드시트를 입력할 때, 우리는 보통 이를 긴 텍스트 문자열로 평면화하는데, 이는 마치 3D 건물을 평평한 종이 한 장으로 만드는 것과 같습니다. 그 과정에서 우리는 데이터의 '어디에'와 '어떻게'를 잃어버리게 됩니다. 로봇은 왼쪽 상단의 숫자가 오른쪽 하단의 카테고리에 속한다는 사실이나, 서로 다른 두 개의 시트가 실제로 서로 대화하고 있다는 사실을 잊어버립니다. SheetCompass라는 제목의 이 논문은 단순하지만 매우 중요한 질문을 던집니다: 어떻게 하면 AI에게 단순히 단어 목록을 읽는 것이 아니라, 다시 지도를 보는 법을 가르칠 수 있을까?
논문의 이야기: AI를 위한 나침반 만들기
중국과학기술대학교의 연구진은 문제가 AI가 충분히 똑똑하지 않아서가 아니라, AI가 스프레드시트를 잘못된 방식으로 보고 있다는 점을 깨달았습니다. 그들은 스프레드시트를 단순한 텍스트 문서처럼 취급하는 것이 그것을 유용하게 만드는 구조 자체를 제거한다고 주장합니다. 이를 해결하기 위해 그들은 SheetCompass라는 새로운 시스템을 구축했습니다. SheetCompass를 단순히 읽기만 하는 로봇이 아니라, 맞춤 제작된 지도를 들고 함께 일하는 세 명의 전문 탐사대 팀이라고 생각해보세요.
먼저, 팀은 "평면 텍스트" 문제를 해결해야 했습니다. SheetCompass는 AI에게 혼란스러운 긴 문단을 입력하는 대신, 스프레드시트를 **계층적 그래프(hierarchical graph)**로 변로합니다. 스프레드시트를 가구로 가득 찬 어지러운 방이라고 상상해 보세요. 전통적인 방식은 방의 모든 물건을 "의자, 탁자, 램프, 의자, 탁자..."와 같이 하나의 문장으로 나열하여 설명하려고 합니다. 하지만 SheetCompass는 방의 3D 모델을 만듭니다. 전체 테이블을 위한 "테이블 노드(Table Node)"와 헤더를 위한 "컬럼 노드(Column Nodes)"를 생성한 다음, 이들을 연결하는 선을 그립니다. 심지어 서로 떨어져 있더라도 모양은 다르지만 의미는 같은(예를 들어 한 시트의 "Price"와 다른 시트의 "Cost") 컬럼들 사이에 특별한 "의미적 선(semantic lines)"을 그려 넣습니다. 이는 AI가 길을 잃지 않고 탐색할 수 있는 안정적이고 구조화된 뼈대를 만들어 줍니다.
하지만 지도만 있다고 충분한 것은 아닙니다. 탐사대원들은 지도를 사용하는 법도 알아야 합니다. SheetCompass는 이중 수준 메모리(dual-level memory) 시스템을 도입합니다. 메모리의 한 부분은 전문가의 규칙이 담긴 도서관(전문 지식, Expert Knowledge)과 같습니다. 이는 AI에게 "행을 삭제하지 말고 숨기기만 하라"거나 "피벗 테이블을 계산하는 법"과 같은 것을 가르칩니다. 다른 한 부분은 과거의 실수 기록(추론 경험, Reasoning Experience)으로, 시스템이 이전 시도의 오류를 기억하여 같은 실수를 반복하지 않도록 합니다. 이는 학생이 교과서뿐만 아니라 자신의 오답 노트를 가지고 있는 것과 같습니다.
마지막으로, 시스템은 **멀티 에이전트 팀(multi-agent team)**을 투입합니다. 한 명의 AI가 모든 것을 하려고 하는 대신, SheetCompass는 업무를 세 가지 역할로 나눕니다:
- 내비게이터 (탐험가, Navigator/Explorer): 이 에이전트는 그래프 지도를 보고 적절한 컬럼과 테이블을 찾으며, 문제를 해결하기 위해 필요한 단계의 순서를 결정합니다.
- 빌더 (프로그래머, Builder/Programmer): 이 에이전트는 계획을 받아 수학적 계산을 수행하거나 차트를 생성하기 위한 실제 코드를 작성하며, 가짜 데이터를 만들어내지 않도록 지도를 엄격히 준수합니다.
- 인스펙터 (검사관, Inspector/Reflector): 이것은 안전 요원입니다. 코드가 실행된 후, 인스펙터는 체크리스트를 바탕으로 결과를 검토합니다. 만약 계산이 이상하다면(예를 들어 거대한 가격에서 아주 작은 소수점을 빼는 경우), 인스펙터는 프로세스를 중단하고 "잠깐, 이건 말이 안 됩니다"라고 말하며 팀을 다시 수정하도록 돌려보냅니다.
연구 결과
연구진은 복잡한 여러 개의 테이블과 까다로운 지침이 포함된 어려운 데이터셋들을 대상으로 SheetCompass를 테스트했습니다. 그들은 코드를 한 번에 작성하거나 더 단순한 에이전트 루프를 사용하는 다른 인기 있는 AI 방식들과 SheetCompass를 비교했습니다. 결과는 명확했습니다: SheetCompass는 처음부터 제대로 작업을 완수하는 데 있어 현저히 뛰어났습니다.
테스트에서 강력한 AI 모델(GPT-4)을 사용했을 때, SheetCompass는 주요 벤치마크(SCB)에서 **63.2%**의 성공률을 달성하여, 그다음으로 높은 성적인 **61.1%**를 기록한 기존의 최선 방식들을 앞질렀습니다. 일련의 시도에서 모든 체크를 통과해야 하는 또 다른 어려운 테스트(SB)에서, SheetCompass는 성공률을 **18.3%**로 끌어올렸는데, 이는 이전 최고치였던 **13.5%**에서 크게 도약한 수치입니다. 더 발전된 모델(GPT-5)을 사용했을 때 격차는 더 벌어졌으며, SheetCompass는 SCB 벤치마크에서 71.3%, 어려운 SB 벤치마크에서 **22.0%**에 도달했습니다.
또한 이 논문은 기계를 분해하여 어떤 부품이 가장 중요한지 확인하는 "절제 연구(ablation studies)"를 수행했습니다. 연구진은 만약 그래프 지도를 제거하면 시스템의 성능이 급격히 떨어진다는 것을 발견했으며, 이는 지도가 가장 핵심적인 요소임을 증명합니다. 또한 인스펙터(Reflector)가 필수적이라는 것도 발견했습니다. 인스펙터가 없다면 시스템은 스스로 오류를 잡아낼 수 없기 때문에 더 많은 실수를 저지르게 됩니다.
왜 중요한가
저자들은 AI가 스프레드시트를 잘 다루게 만드는 핵심은 단순히 AI를 더 똑똑하게 만드는 것이 아니라, 데이터를 보는 더 나은 방법을 제공하는 것이라고 제안합니다. 평면 텍스트를 구조화된 그래프로 바꾸고 전문화된 에이전트 팀을 사용하여 서로의 작업을 검토하게 함으로써, SheetCompass는 인간이 자연스럽게 표를 읽는 방식과 컴퓨터가 정보를 처리하는 방식 사이의 간극을 메웁니다. 이 논문은 세상의 모든 스프레드시트 문제를 해결했다고 주장하는 것이 아니라, "구조적 인지(structural perception)"와 "협업적 추론(collaborative reasoning)"을 결합한 이 새로운 접근 방식이 강력한 방향성을 제시하고 있음을 보여줍니다. 이는 AI가 우리가 매일 사용하는 복잡한 현실 세계의 도구들을 진정으로 마스터하기 위해서는, 단순히 목록을 읽는 것이 아니라 지도를 읽기 시작해야 한다는 것을 시사합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.