Spider 2.0-AIFunc: Extending Real-World Text-to-SQL to AI-Native SQL Workflows
이 논문은 대규모 언어 모델이 스노우플레이크(Snowflake) 플랫폼에서 AI 네이티브 SQL 쿼리를 생성하는 능력을 평가하기 위해 설계된 125개의 실제 데이터베이스에 걸친 465개의 검증된 인스턴스로 구성된 새로운 벤치마크인 Spider 2.0-AIFunc를 소개하며, 상위 유료 모델들이 67-70%의 정확도를 달ach하는 반면 기존의 텍스트-투-SQL 작업에 최적화된 현재의 에이전트 프레임워크는 이 신흥 환경으로 효과적으로 전이되지 못한다는 점을 밝히고 있다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 고객 리뷰부터 판매 기록까지 모든 것을 저장할 수 있는 거대하고 첨단 기술이 집약된 도서관(클라우드 데이터베이스)을 가지고 있다고 상상해 보세요. 수년 동안 이 도서관에 대해 질문하려면 SQL이라는 매우 엄격하고 로봇 같은 언어를 사용해야 했습니다. 그것은 마치 숫나 기호의 코드로만 구성된 언어로 복잡한 식사를 주문해야 하는 레스토랑과 같았습니다.
최근 도서관 소유자들(Snowflake와 같은 기업들)은 새로운 기능인 **AI 함수(AI Functions)**를 추가했습니다. 이것은 주문 시스템에 내장된 "스마트 비서"라고 생각하면 됩니다. 이제 단순히 "모든 빨간 사과를 보여줘"라고 요청하는 대신, "이 사과들에 대한 리뷰를 읽고 사람들이 행복해하는지 아니면 화가 났는지 말해줘"라거나 "이 리뷰와 유사한 리뷰를 찾아줘"라고 요청할 수 있습니다. 이는 데이터베이스를 AI 네이티브(AI-Native) 시스템으로 탈바꿈시켜, 표준 데이터 명령과 언어 기반의 지능적인 사고를 하나의 문장 안에 혼합할 수 있게 해줍니다.
문제점: 오래된 지도는 작동하지 않는다
연구진들은 이러한 새로운 "스마트 비서"가 강력하긴 하지만, 컴퓨터의 두뇌(AI 모델)를 훈련하고 검증하는 데 사용되는 테스트들이 구식이라는 점을 발견했습니다. 기존의 테스트들은 컴퓨터가 엄격한 로봇 언어를 말할 수 있는지만을 체크했습니다. 컴퓨터가 새로운 "스격 비서"를 사용할 수 있는지는 확인하지 않았습니다. 그것은 마치 실제 세상에는 교통 체증, 보행자, 공사 구간이 있음에도 불구하고, 운전자를 오직 직선의 빈 도로에서만 테스트하는 것과 같았습니다.
해결책: Spider 2.0-AIFunc
이를 해결하기 위해 연구진은 더 혹독한 운전 시험인 Spider 2.0-AIFunc를 만들었습니다.
- 변환: 그들은 기존의 513개 "운전 테스트"(데이터에 대한 질문)를 가져와 다시 작성했습니다. 그들은 질문이 반드시 새로운 "스마트 비서"를 필요로 하도록 강제했습니다.
- 기존 질문: "모든 부정적인 리뷰를 보여줘." (사람이 먼저 리뷰를 읽어야 함).
- 새로운 질문: "AI 비서가 감정이 부정적이라고 말하는 리뷰를 모두 보여줘." (데이터베이스 내부에서 AI가 직접 읽음).
- 건설 팀: 그들은 AI 에이전트(디지털 작업자) 팀을 사용하여 이 질문들을 재작성했습니다. 이 에이전트들은 편집자이자 정비사 역할을 했습니다.
- 그들은 지침이 명확한지 확인했습니다 (예: "'부정적'이라는 것이 정확히 무엇을 의미하는가?).
- 그들은 "스마트 비서"가 업무를 수행하는 데 필요한 모든 적절한 도구(파라미터)를 갖추었는지 확인했습니다.
- 그들은 답변이 안정적인지, 그리고 AI 비서가 컨디션이 좋지 않다고 해서 답변이 바뀌지는 않는지 확인하기 위해 테스트를 반복해서 실행했습니다.
- 최종 시험: 그 결과물은 125개의 서로 다른 데이터베이스에 걸친 465개의 검증된 질문으로 구성된 벤치마크입니다. 여기에는 감정에 따라 리뷰를 분류하거나, 텍스트의 유사성을 찾거나, 단락에서 특정 세부 정보를 추출하는 것과 같은 6가지 유형의 "스마트 비서" 작업이 포함됩니다.
결과: 누가 시험을 통과했는가?
연구진은 10개의 서로 다른 AI 모델(운전자들)을 이 새로운 시험에 투입하여, 그들이 얼마나 잘 이러한 복잡한 AI 기반 쿼리를 작성할 수 있는지 테스트했습니다.
- 상위 운전자 (폐쇄형 모델): 대규모 폐쇄형 모델들(Claude Opus 및 Gemini 등)이 가장 우수한 성적을 거두었습니다. 이들은 약 **67%에서 70%**의 정답률을 보였습니다. 이들은 어떤 "스마트 비서"를 사용해야 할지, 그리고 어떻게 올바른 질문을 던져야 할지를 잘 파악했습니다.
- 오픈 소스 운전자: 가장 뛰어난 오픈 소스 모델(Kimi K2.5 등)은 약 **58%**를 기록했습니다. 준수한 성적이었지만, 실수가 더 많았습니다.
- 격차: 오픈 소스 모델들이 고전한 주요 원인은 그들이 기본적인 코드를 작성하지 못해서가 아니었습니다. 그들은 "스마트한" 부분에서 넘어졌습니다:
- 규칙 오해: 잘못된 테이블이나 컬럼을 선택함.
- 불충분한 지침: AI 비서에게 무엇을 찾아야 하는지 정확하게 알려주는 것을 잊음 (예: 분류 작업 시 가능한 모든 카테고리를 나열하지 않음).
- 논리 오류: 작업 순서를 혼동함 (예: AI에게 물어보기 전이 아니라, 물어본 후에 데이터를 필터링함).
놀라운 발견: 적을수록 좋다 (Less is More)
연구진은 또한 복잡한 "에이전트 프레임워크"(AI가 단계를 계획하도록 돕는 정교한 도구 모음)를 사용하는 것이 도움이 되는지 테스트했습니다.
- 발견: 놀랍게도, 가장 복잡한 도구 모음들이 큰 도움이 되지 않았습니다. 사실, 데이터베이스를 들여다보는 간단한 도구와 쿼리를 실행하는 도구만 있는 최소한의 설정이 정교한 프레임워크만큼, 혹은 그보다 더 나은 성능을 보였습니다.
- 비유: 이것은 숙련된 요리사에게 거대한 스위스 아미 나이프 대신 아주 작고 단순한 칼을 주는 것과 같습니다. 이 특정 종류의 요리(AI 네이티브 SQL)를 하는 데 있어, 숙련된 요리사는 추가적인 도구가 필요하지 않았습니다. 그저 칼을 어떻게 사용하는지만 알면 되었습니다. 기존 방식의 데이터 작업을 위해 설계된 복잡한 프레임워크들은 오히려 방해가 되거나 가치를 더하지 못했습니다.
요약
이 논문은 AI 모델이 현대적인 "AI 기반" 데이터베이스 기능을 사용할 수 있는지 확인하는 새로운 현실적인 테스트를 소개합니다. 연구 결과, 최고의 AI 모델들은 점점 능숙해지고 있지만, 최상위 모델들과 오픈 소스 모델들 사이에는 여 still 격차가 존재함을 발견했습니다. 성공의 핵심은 더 복잡한 계획 도구를 사용하는 것이 아니라, AI 함수의 기본 지침과 파라미터를 정확하게 전달하는 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.