← 최신 논문
🤖 AI

LLM-Based SQL Generation: Prompting, Self-Refinement, and Adaptive Weighted Majority Voting

본 논문은 Spider 및 BIRD와 같은 벤치마크에서 경쟁력 있는 실행 정확도를 달성하면서도 실제 기업 데이터베이스의 복잡성을 효과적으로 해결하고 정답 데이터에 의존하지 않는 LLM 기반 텍스트-SQL 생성을 위한 새로운 프레임워크를 제안하며, 이는 단일 에이전트 자기 정제와 앙상블 투표 (SSEV) 파이프라인과 다중 에이전트 협업 시스템 (ReCAPAgent-SQL) 을 결합한 것이다.

원저자: Yu-Jie Yang, Hung-Fu Chang, Po-An Chen

게시일 2026-05-11
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yu-Jie Yang, Hung-Fu Chang, Po-An Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

방대한 정보 도서관 (데이터베이스) 에 질문을 하고 싶다고 상상해 보세요. 하지만 사서들은 SQL 이라는 매우 엄격하고 로봇 같은 언어만 사용합니다. 당신은 자연스러운 영어로 말하죠. 이 연구의 목표는 당신의 영어 질문을 완벽한 SQL 명령어로 변환하여 도서관이 답변할 수 있도록 하는 번역기를 구축하는 것입니다.

이 논문의 저자 유지예 (Yu-Jie Yang) 와 동료들은 이러한 번역기가 종종 혼란을 겪거나 실수를 하거나 도서관의 구조를 이해하지 못하는 문제를 해결했습니다. 이를 위해 그들은 두 가지 주요 시스템을 구축했습니다. 하나는 '전문가 팀' 접근 방식이고, 다른 하나는 '전문 에이전트 팀' 접근 방식입니다.

다음은 그들이 사용한 간단한 비유를 통해 설명한 방법입니다:

1. 문제: "일률적" 번역기는 실패합니다

복잡한 법률 문서를 다른 언어로 번역하는 임무를 한 사람에게만 맡겨 보라고 상상해 보세요. 그들은 미묘한 뉘앙스를 놓치거나, 이름을 잘못 쓰거나, 잘못된 문법을 사용할 수 있습니다. 데이터베이스 세계에서는 단일 AI 모델이 SQL 코드를 추측하려 할 때 이런 일이 발생합니다. 그들은 종종 '스키마 (도서관의 지도)'에 길을 잃거나 질문을 오해합니다.

2. 첫 번째 해결책: '전문가 팀' (SSEV 파이프라인)

저자들은 SSEV(단일 에이전트 자기 정제 및 앙상블 투표) 라는 시스템을 만들었습니다. 이는 한 명의 번역가가 아니라, 테이블 주위에 앉아 있는 다섯 명의 전문가 패널로 생각하세요.

  • 초안 작성 단계 (PreSQL): 패널은 답변에 대한 초기 추측을 적어냅니다.
  • 지도 확인 단계 (스키마 링크링): 그들은 거대한 도서관 지도를 보고 있다는 것을 깨닫습니다. 전체 지도를 읽으려 하기보다는, 초기 추측을 활용하여 관련된 통로와 선반만 강조합니다. 이렇게 하면 잡음을 제거할 수 있습니다.
  • 두 번째 초안 (PostSQL): 지도가 좁혀진 상태에서 그들은 더 깔끔하고 초점이 맞춰진 두 번째 초안을 작성합니다.
  • "자기 수정" 루프: 초안에 오타가 있거나 실행해 보았을 때 작동하지 않으면, 그냥 버리지 않습니다. 대신 오류 메시지를 보고 수정한 후 다시 시도합니다. 마치 작가가 자신의 작업을 이해가 될 때까지 편집하는 것과 같습니다.
  • 투표 시스템 (WMA): 이것이 비밀 무기입니다. 단순히 한 표씩 동등하게 투표하는 대신, 가중 다수 알고리즘을 사용합니다.
    • 심사위원들이 서로 다른 신뢰 수준을 가진 게임 쇼를 상상해 보세요. '심사위원 A'가 연속으로 10 번 정답을 맞췄다면, 그들의 투표는 더 많은 가중치를 갖습니다. '심사위원 B'가 실수를 계속한다면, 그들의 투표는 더 적은 가중치를 갖습니다.
    • 시스템은 과거에 누가 정답을 맞췄는지에 따라 이러한 '신뢰 점수'를 지속적으로 업데이트합니다. 시간이 지남에 따라 시스템은 방 안의 가장 똑똑한 전문가의 의견에 주로 귀 기울이도록 학습합니다.

결과: 표준 테스트 (Spider 1.0 및 BIRD 등) 에서 이 '전문가 팀' 접근 방식은 약 **86%**의 확률로 정답을 얻었으며, 이는 혼자 일하는 어떤 단일 전문가보다 훨씬 더 나은 성과였습니다.

3. 두 번째 해결책: '전문 에이전트 팀' (ReCAPAgent-SQL)

더 어려운 문제들 (실제 기업 데이터베이스의 messy 한 상황을 모방한 새로운 Spider 2.0 데이터셋 등) 에는 단순한 패널만으로는 부족합니다. 저자들은 각 구성원이 특정 업무를 수행하는 전문 태스크포스와 같은 ReCAPAgent-SQL을 구축했습니다.

  • 플래너: 큰 질문을 작은 논리적 단계로 분해합니다 (프로젝트 매니저처럼).
  • 검색자: 팀이 특정 규칙을 모를 경우 추가 매뉴얼이나 문서를 찾아냅니다 (연구자처럼).
  • 비평가: 작업을 검토하며 "잠깐, 그 논리는 말이 안 됩니다" 또는 "단계를 놓쳤습니다"라고 말합니다.
  • 스키마 링크러: 도서관 지도를 특별히 처리하여 올바른 테이블과 열을 보고 있는지 확인합니다.
  • 자기 정제자: 코드가 작동하지 않으면 이 에이전트가 수정합니다.
  • 검증자: 최종 품질 관리 검사관으로서 "이 답변이 실제로 사용자의 문제를 해결합니까?"를 확인합니다.

이러한 에이전트들은 루프 형태로 서로 대화합니다. 그들은 계획을 세우고, 행동하며, 비판을 받고, 실수를 수정한 후, 올바르게 될 때까지 다시 시도합니다.

결과: 그들이 가장 어렵고 현실적인 질문들 (Spider 2.0-lite) 에서 이를 테스트했을 때, 정답을 **6%**만 맞췄던 기준 시스템을 **31%**까지 끌어올렸습니다. 이는 보통 아주 작은 분수로 측정되는 분야에서 엄청난 도약입니다.

4. 왜 이것이 중요한가

이 논문은 자기 수정 (자신의 실수 수정), 스마트 투표 (가장 뛰어난 전문가의 의견 경청), 그리고 **전문 에이전트 (특정 역할을 가진 팀 보유)**를 결합함으로써 이전보다 훨씬 더 복잡하고 현실적인 데이터 질문을 처리할 수 있는 시스템을 구축할 수 있다고 주장합니다.

그들은 단순히 추측한 것이 아니라, 표준 벤치마크에서 이러한 방법들을 테스트하여 다음을 증명했습니다:

  1. 가중 투표는 실제 작업에 능한 사람이 누구인지에 따라 적응하기 때문에 단순 다수 투표보다 더 잘 작동합니다.
  2. 자기 정제는 데이터베이스가 "아니요, 그 명령은 잘못되었습니다"라고 말할 때 발생하는 오류를 수정하는 데 도움이 됩니다.
  3. 멀티 에이전트 시스템은 실제 기업에서 발견되는 messy 하고 복잡한 데이터베이스에 필수적입니다.

요약하자면, 그들은 자신의 실수에서 배우고 최고의 전문가들의 의견에 귀 기울이는 더 똑똑하고 회복력 있는 번역기를 구축하여, 일반인들이 방대한 데이터베이스에 복잡한 질문을 하는 것을 훨씬 더 쉽게 만들었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →