기술 요약: DataSpace: 이질적 워크스페이스에서의 검증 가능한 분석을 위한 데이터 에이전트 벤치마킹
1. 문제 정의
데이터 에이전트는 조직의 데이터를 위한 자연어 인터페이스로 부상하고 있으나, 현실적인 분석 환경은 복잡한 과제를 안겨준다. 즉, 질의에 답하기 위해 필요한 증거가 단일하고 깨끗한 테이블 하나에 담겨 있는 경우는 드물다. 대신 정보는 관계형 데이터베이스, 구조화/반구조화된 파일(CSV, JSON), 긴 문서(PDF, Markdown), 그리고 멀티미디어 아티팩트(비디오)에 흩어져 있으며, 종종 교차 언어적 변형을 포함한다.
기존의 벤치마크들은 현실적인 데이터 분석의 세 가지 핵심 속성을 통합하는 데 실패하고 있다:
- 워크스페이스 범위(Workspace Scope): 기존 벤치마크들은 구조화된 쿼리(예: Spider) 또는 비구조화된 검색(예: HotpotQA)을 고립시켜 다루는 경우가 많으며, 태스크 로컬 워크스페이스 내에서 이질적인 모달리티 간의 증거를 발견하고 통합하는 작업은 포착하지 못한다.
- 출력 계약(Output Contract): 많은 벤치마크가 팩토이드(factoid) 답변, 개방형 보고서 또는 실행 가능한 파이프라인을 수용한다. 그러나 실제 세계의 분석은 직접 소비될 수 있는 완전하고 타입이 지정된 테이블 형태의 결과를 요구한다.
- 평가 의미론(Evaluation Semantics): 현재의 평가는 모델 기반 판사(judge)에 의존하거나, 동등한 표현(예: 다른 컬럼 순서, 헤더 명칭, 또는 수치 정밀도)을 결정론적으로 처리하지 못하는 경우가 많다.
본 논문은 이질적인 교차 언어 워크스페이스에 대해 완전한 테이블 출력 계약과 결정론적인 평가를 강제하는 통합된 벤치마크 없이는, 데이터 에이전트 신뢰성 향상을 정확하게 측정할 수 없다고 주장한다.
2. 방법론
2.1 DataSpace 벤치마크
DataSpace는 410개의 교차 언어 태스크와 총 15.01 GB 규모의 7,439개 아티팩트로 구성된 벤치마크이다.
- 모달리티: 워크스페이스에는 CSV, JSON, SQLite, Markdown, PDF, Video가 포함된다.
- 언어: 태스크는 질문과 워크스페이스 아티팩트가 중국어와 영어를 혼용하는 교차 언어 시나리오를 포함한다.
- 태스크 정식화: 에이전트는 자연어 질문과 태스크 로컬 워크스페이스를 받는다. 에이전트는 자율적으로 소스를 발견하고, 엔티티/스키마를 정렬하며, 다단계 계산(필터링, 조인, 집계)을 실행한 후, 요청된 완전한 테이블 결과를 CSV 파일 형태로 반환해야 한다.
- 도메인: 금융 분석(펀드, 주식), 거시 경제 데이터, 헬스케어 분석을 포함한다.
2.2 DataSpace-Builder: 구축 프레임워크
이러한 복잡한 태스크를 신뢰성 있게 구축하기 위해, 저자들은 기존의 Text-to-SQL 벤치마크(EHRSQL 및 BULL)를 이질적인 워크스페이스 태스크로 변환하는 실행 기반 프레임워크인 DataSpace-Builder를 제안한다. 이 과정은 네 단계로 이루어진다:
- 교차 언어 변환 (Cross-Language Transformation, CLT): 질문, 데이터베이스 상태, 실행 가능한 SQL의 공동 마이그레이션이다. 이는 식별자와 코드는 보존하면서 엔티티 이름과 값을 번역함으로써 참조 일관성을 보장한다. LLM 판사가 번역된 질문과 SQL 사이의 의미론적 정렬을 검증한다.
- 제약 조건 인지 관계 샘플링 (Constraint-Aware Relational Sampling): 반복적인 워크스페이스 생성을 피하기 위해, 프레임워크는 전체 스키마를 유지하면서 소스 데이터베이스에서 행을 샘플링한다. 샘pling 과정 중 관계적 무결성(예: 조인 경로 보존)을 보장하기 위해 세이프가드 세트(기본 키/외래 키, 쿼리 조건)를 사용한다.
- 모달리티 라우팅 및 아티팩트 렌더링 (Modality Routing & Artifact Rendering):
- 기본 라우팅: 스키마 속성에 따라 테이블을 렌더러(CSV, JSON, SQLite, Markdown, PDF)에 할당한다.
- 문서 렌더링: 테이블 데이터를 사용하여 LLM으로 긴 형식의 문서(Markdown/PDF)를 생성하며, 특정 셀이 텍스트에서 복구 가능하도록 "사실에 근거한(fact-grounded)" 생성을 보장한다.
- 비디오 렌더링: 테이블 데이터를 데이터 인사이트 비디오로 변환한다. 두 가지 전략이 사용된다: 조건 추상화(필터 조건을 비디오 내러티브로 이동) 및 정답-증거 렌더링(결과 셀을 비디오 장면 전반에 분산).
- 인간 검토 및 태스크 수선 (Human Review & Task Repair): 11명의 도메인 전문가 패널이 독립적인 블라인드 리뷰를 수행한다. 이들은 태스크를 직접 풀고, 골드 스탠다드(정답)를 검증하며, 평가 구성을 작성한다. 의견 불일치가 발생할 경우 질문, 워크스페이스 또는 골드 답변에 대해 근거 기반의 수선을 진행한다.
2.3 결정론적 평가기 (Deterministic Evaluator)
평가 프로토콜은 **모델 프리(model-free)**이며 **헤더 불변(header-invariant)**이다:
- 컬럼 정렬: 평가기는 헤더의 문구나 순서와 관계없이 예측된 컬럼과 참조 컬럼 간의 일대일 매핑을 찾는다.
- 정규화: 값은 의미론적 타입(텍리스트, 숫자, 날짜, 불리언)과 정밀도 규칙(예: 소수점 자리, 백분율 관례)에 따라 정규화된다.
- 행 비교: 순서가 필요한 태스크는 시퀀스로 비교하며, 그렇지 않은 경우 순서가 없는 멀티셋(multiset)으로 비교한다.
- 스코어링: 예측된 테이블이 이러한 의미론적 규칙 하에서 참조값과 완전히 일치해야만 태스크가 정답으로 인정된다.
3. 주요 기여
- 이질적 워크스페이스 벤치마크: DataSpace는 구조화된 파일, 데이터베이스, 긴 문서, 비디오를 하나의 검증 가능한 테이블 출력으로 합성해야 하는 410개의 태스크를 도입한다.
- 실행 기반 구축 프레임워크: DataSpace-Builder는 실행 가능한 Text-to-SQL 리소스를 복잡한 멀티모달 태스크로 변환하며, 샘플링 세이프가드와 전문가 검토를 통해 데이터 일관성을 보장한다.
- 의미론 인지 평가기: 컬럼 재정렬이나 포맷팅과 같은 동등한 표현은 허용하되 불완전하거나 오류가 있는 출력은 거부하는 결정론적 프로토콜을 통해, LLM 판사에 대한 의존성을 제거한다.
- 경험적 베이스라인: 본 논문은 6개의 최첨단 멀티모달 백본과 5개의 에이전트 하네스를 대상으로 성능 베이스라인을 설정하여, 현재 에이전트 역량의 구체적인 병목 구간을 식별한다.
4. 실험 결과
저자들은 6개의 멀티모달 백본(Grok 4.5, GPT-5.6 Sol, Kimi K3, MiMo-V2.5, Claude Sonnet 5, MiniMax M3)과 5개의 에이전트 하네스(자체 DataSpace-Agent 포함)를 평가했다.
- 전반적 성능: 가장 우수한 구성(Grok 4.5와 DataSpace-Agent 조합)은 **66.34%**의 정확도를 달성했다. 이는 6개의 백본 모두가 놓친 태스크가 76개인 반면, 모든 모델이 해결한 태스크는 56개뿐이라는 점에서 이 벤치마크가 미포화(unsaturated) 상태임을 나타낸다.
- 하네스 영향: 에이전트 하네스의 선택은 성능에 큰 영향을 미친다. MiMo-V2.5 백본을 고정한 상태에서, 하네스에 따라 정확도는 15.36 퍼센트 포인트까지 차이가 났다(30.98% ~ 46.34%).
- 주요 과제:
- 멀티모달 통합: 멀티모달 증거를 요구하는 태스크는 단일 모달 태스크에 비해 모든 백본에서 정확도를 1.8~14.0 포인트 감소시켰다.
- 조인(Joins): 조인 연산은 정확도를 9.7~19.8 포인트 감소시켰다.
- 효율성: GPT-5.6 Sol은 최고 성능 모델인 Grok 4.5보다 토큰은 74.2%, 액션은 50.3% 적게 사용하면서도 근접한 최고 수준의 정확도(64.63%)를 달-성했다.
- 실패 분석: Grook 4.5의 실패 사례 136건을 감사한 결과, 오류의 **52.2%**가 증거 발견이나 추출이 아닌 정답 구체화(answer materialization)(예: 올바른 내부 결과 계산 후 컬럼이나 행을 추가하거나 누락함)에서 기인했다. "제출 없음" 사례 13건 중 순수 종료 실패는 5건뿐이었으며, 대부분은 이전 단계의 지속적인 오류에서 비롯되었다.
5. 의의 및 주장
본 논문은 DataSpace가 신뢰할 수 있는 데이터 에이전트 발전을 위한 엄격한 테스트베드를 구축한다고 주장한다. 이 연구의 주요 의의는 평가 패러다임을 고립된 기술(예: SQL 생성 또는 문서 검색)에서 엔드 투 엔드 워크스페이스 해결과 엄격하고 검증 가능한 출력 계약으로 전환했다는 점에 있다.
저자들은 현재의 최첨단 모델들이 유망한 모습을 보이지만, 교차 모달리티 통합과 조인 측면에서 상당한 격차가 존재한다고 결론지었다. 이 벤치마크는 데이터를 "찾는" 능력만으로는 불충분하며, 에이전트가 요청된 출력 구조를 정확하게 **구체화(materialize)**할 수 있어야 함을 강조한다. 결과는 데이터 에이전트의 신뢰성을 높이기 위해서는 단순한 추론 능력을 넘어, 이질적인 증거 발견부터 정밀한 테이블 직렬화에 이르는 전체 파이프라인을 다루어야 함을 시사한다.
DataSpace는 KDD Cup 2026 "Complex Data Analysis를 위한 Data Agents" 경진대회의 공식 평가 벤치마크로 활용되며, 이 분야의 미래 연구를 위한 표준화되고 재현 가능한 환경을 제공한다.