← 최신 논문
💻 computer science

DataSpace: Benchmarking Data Agents for Verifiable Analytics over Heterogeneous Workspaces

이 논문은 이질적이고 다중 모달적인 워크스페이스로부터 검증 가능한 표 형식의 결과를 생성하는 데이터 에이전트의 능력을 평가하기 위해 설계된 종합적인 벤치마크이자 KDD Cup 2026 평가 프레임워크인 DataSpace를 소개하며, 이는 다중 모달 증거 통합에서의 상당한 성능 격차와 에이전트 하네스 선택이 신뢰성에 미치는 상당한 영향을 드러낸다.

원저자: Boyan Li, Zhuowen Liang, Yupeng Xie, Xiaotian Lin, Tianqi Luo, Xinyu Liu, Yizhang Zhu, Zhangyang Peng, Yuan Li, Zhengxuan Zhang, Jiayi Zhang, Nan Tang, Guoliang Li, Yuyu Luo

게시일 2026-08-05
📖 2 분 읽기☕ 가벼운 읽기

원저자: Boyan Li, Zhuowen Liang, Yupeng Xie, Xiaotian Lin, Tianqi Luo, Xinyu Liu, Yizhang Zhu, Zhangyang Peng, Yuan Li, Zhengxuan Zhang, Jiayi Zhang, Nan Tang, Guoliang Li, Yuyu Luo

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 수수께끼를 풀려는 탐정이라고 상상해 보십시오. 하지만 당신의 단서들은 여기저기 흩어져 있습니다. 어떤 단서는 컴퓨터 속 깔끔한 스프레드시트에 있고, 어떤 것은 50페이지짜리 PDF 보고서 속에 파묻혀 있으며, 다른 것들은 데이터베이스 안에 숨겨져 있고, 가장 중요한 단서는 보안 카메라의 영상일 수도 있습니다. 이것이 바로 '데이터 에이전트(data agents)'—조직의 무질서한 디지털 파일들을 뒤져 질문에 답하도록 설계된 똑똑한 컴퓨터 프로그램—가 마주하는 일상적인 현실입니다. 오랫동안 과학자들은 이 에이전트들을 전화번호부에서 이름을 찾거나 데이터베이스에 간단한 질문을 던지는 것과 같은, 깨끗하고 단일한 유형의 퍼즐로 테스트해 왔습니다. 하지만 현실 세계의 데이터는 언어, 형식, 미디어가 뒤섞인 혼돈 그 자체입니다. 연구자들이 던지는 핵심적인 질문은 이것입니다: 이 디지털 탐정들이 정말로 뒤섞인 증거 더미로부터 완전한 이야기를 구성해 낼 수 있을까요, 아니면 단서들의 모습이 서로 다를 때 길을 잃고 말까요?

이 논문은 데이터 에이전트들이 얼마나 이 무질서하고 실제적인 수수께끼를 잘 해결하는지 확인하기 위해, DataSpace라는 새롭고 매우 도전적인 테스트를 소개합니다. 연구진은 410개의 서로 다른 작업과 총 15.01GB에 달하는 7,439개의 디지털 아티팩트(파일)를 포함하는 거대한 놀이터를 구축했습니다. 그들은 단순히 무작위 파일을 던져 놓은 것이 아닙니다. 하나의 질문을 해결하기 위해 영상을 보고, PDF를 스캔하고, 데이터베이스를 쿼리하며, JSON 파일을 교차 참조해야 하는 동시에 영어와 중국어로 작성된 단서들을 모두 다뤄야 하는 '이질적인 작업 공간(heterogeneous workspace)'을 만들었습니다. 목표는 단순히 단 하나의 사실을 찾는 것이 아니라, 에이전트가 최종 성적표와 같은 완전하고 검증 가능한 표를 만들어내는 것입니다.

테스트 결과는 일종의 경종을 울립니다. 테스트에 참여한 가장 똑똑하고 진보된 AI 모델들(Grok 4.5와 GPT-5.6 같은 거물급 모델 포함)조차도 작업의 약 **66.34%**만을 올바르게 해결했습니다. 이는 그들이 퍼즐 3개 중 1개꼴로 틀렸음을 의미합니다. 연구진은 에이전트들이 서로 다른 유형의 미디어(예: 영상 단서와 스프레드시트 결합)를 결합해야 하거나, 복잡한 '조인(join)'(두 가지 서로 다른 소스의 데이터를 연결하는 작업)을 수행해야 할 때 가장 어려움을 겪는다는 것을 발견했습니다. 흥ari하게도, AI에게 도구 사용법을 알려주는 소프트웨어 프레임워크인 '하네스(harness)'의 선택은 AI의 두뇌 자체만큼이나 중요했으며, 점수에서 15.36점의 차이를 만들어냈습니다.

궁극적으로, 이 논문은 데이터 에이전트들이 발전하고는 있지만 아직 완벽과는 거리가 멀다는 것을 보여줍니다. 그들은 종종 숫자는 맞히지만 최종 표의 형식을 제대로 갖추지 못하거나, 영상 속에 숨겨진 결정적인 단서를 놓치곤 합니다. 저자들은 이러한 에이전트들이 복잡한 다중 형식 데이터 분석을 스스로 처리할 수 있을 만큼 완전히 신뢰받기까지는 아직 갈 길이 멀다고 결론지었으며, 미래의 엔지니어들이 이러한 구체적인 약점들을 보완할 수 있도록 지도 역할을 할 벤치마크를 제공했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →