A Cost-Aware Agentic Architecture for NL-to-SQL over Nested Enterprise Schemas, with a New Benchmark
이 논문은 중첩 구조를 가진 900개의 실행 검증된 쿼리와 새로운 Semantic Depth Score를 특징으로 하는 DevRev NL2SQL 벤치마크를 소개하며, 이 벤치마크에서 91.7%의 상당한 정답 정확도를 달ato 달성하고 Spider 2.0에서도 경쟁력을 유지하는 비용 인식 에이전트 아키텍처를 함께 선보입니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
데이터베이스라는 비밀 언어를 알 필요 없이, 컴퓨터에게 당신의 비즈니스에 관한 복잡한 질문을 던지고 평이한 영어로 정확한 답변을 받을 수 있는 세상을 상상해 보십시오. 수년 동안 연구자들은 컴퓨터가 인간의 질문을 데이터베이스 명령어로 번역하도록 가르쳐 왔으며, 이 분야를 자연어-to-SQL(natural-language-to-SQL)이라고 부릅니다. 초기 성과들은 인상적이었지만, 이는 행과 열이 있는 스프레드시트와 같은 단순하고 평면적인 데이터 리스트로 컴퓨터를 테스트하는 것에 의존했습니다. 그러나 실제 세상에서 비즈니스 데이터는 결코 그렇게 깔끔하지 않습니다. 현대의 기업 시스템은 복잡한 워크플로우를 중심으로 구축되어 있으며, 고객 지원 티켓과 같은 단일 항목은 다른 항목들의 웹과 연결되어 있고, 리스트 안에 중첩되어 있으며, 정보의 여러 층위 속에 파묻혀 있습니다. 이러한 구조들은 종면 종종 그래프 형태(graph-like)라고 설명되는데, 이는 단순한 테이블이라기보다 연결의 지도와 유사함을 의미합니다. 연구자들이 자신들의 가장 뛰어난 도구들을 이 무질서한 실제 데이터에 적용하려 했을 때, 시스템들은 깊고 얽힌 정보의 경로를 탐색하지 못해 자주 실패했습니다.
한 연구팀은 새로운 테스트 환경과 이 문제를 처리하기 위해 설계된 더 똑똑한 컴퓨터 시스템을 구축함으로써 이 구체적인 과제에 도전했습니다. 그들은 실제 비즈니스 데이터베이스를 기반으로 한 900개의 실제 질문을 포함하는 DevRev라는 벤치마크를 만들었습니다. 이전의 테스트들과 달리, 이 데이터베이스는 정보가 다른 리스트를 포함하는 리스트 안에 저장되어 있고, 맥락에 따라 연결 방식이 변하는 복잡한 방식으로 항목들이 서로 연결된 깊게 중첩된 구조로 가득 차 있습니다. 시스템이 이러한 질문들을 얼마나 잘 이해하는지 측정하기 위해, 연구진은 '시맨틱 깊이 점수(Semantic Depth Score)'라는 새로운 채점 방식을 도입했습니다. 이 점수는 단순히 질문의 길이를 세는 것이 아니라, 서로 다른 기간을 비교하거나, 기존 값으로부터 새로운 값을 계산하거나, 서로 다른 유형의 비즈니스 객체 간의 연결 고리를 따라가는 것과 같이 답을 찾기 위해 얼마나 많은 단계의 추론이 필요한지를 측정합니다.
연구진은 당시 가장 진보된 시스템들이 더 단순한 테스트에서는 좋은 성과를 냈음에도 불구하고, 이 새로운 복잡한 데이터 앞에서는 크게 고전한다는 것을 발견했습니다. 수많은 가능한 답변을 생성한 뒤 그중 최선의 것을 고르는 방식을 취하는 이 시스템들은, 중첩된 리스트를 올바르게 탐색하거나 서로 다른 유형의 비즈니스 기록을 연결하는 특정 규칙을 이해하지 못했습니다. 이들의 성공률은 새로운 벤치마크에서 약 3분의 1 수준에 머물렀으며, 이는 대부분의 질문에 대해 틀린 답을 내놓았음을 의미합니다. 연구진은 이것이 단순히 연습 부족의 문제가 아니라, 이 시스템들이 구축된 방식과 데이터가 구조화된 방식 사이의 근본적인 불일치 때문이라고 주장했습니다. 시스템들이 깊게 층을 이룬 현실에 대해 평면적이고 단순한 접근 방식을 강요하려 했다는 것입니다.
이를 해결하기 위해, 연구팀은 추측하는 자가 아닌 신중한 조사관처럼 작동하는 새로운 컴퓨터 아키텍처를 설계했습니다. 이 시스템은 수십 개의 가능한 답변을 생성하고 그중 하나가 맞기를 바라는 대신, 하나의 집중된 경로를 따릅니다. 시스템은 먼저 중앙 코디네이터에게 데이터베이스를 살펴보고 어떤 구체적인 정보가 필요한지 결정하도록 요청하며 시작합니다. 만약 테이블이나 컬럼을 찾지 못해 막히게 되면, 시스템은 단순히 추측하는 것이 아니라, 구조에 대한 더 자세한 정보를 요청하고 새로운 정보와 함께 다시 시도합니다. 이 과정은 컬럼의 이름뿐만 아니라 그 안의 데이터가 실제로 무엇을 의미하는지에 대한 설명까지 포함하는 상세한 데이터베이스 지도를 통해 안내됩니다. 또한 시스템은 자신이 저지른 모든 실수를 기록하는 실행 로그를 유지하며, 각 실패로부터 배워 동일한 실수를 반복하지 않도록 합니다. 시스템은 자신의 작업물을 데이터베이스로 보내기 전에 스스로 검토하여, 논리가 타당한지 그리고 실수로 거대하고 혼란스러운 데이터의 엉망진창을 만들고 있지는 않은지 확인합니다.
900개의 복잡한 질문에 대해 테스트했을 때, 이 새로운 시스템은 91.7%의 성공률을 달eli며 이전의 최고 성과들을 크게 뛰어넘는 엄청난 향상을 보여주었습니다. 이 시스템은 여러 단계를 따라가야 하거나, 파생된 값을 계산해야 하거나, 중첩된 데이터 리스트를 탐색해야 하는 질문들에 정확하게 답할 수 있었습니다. 연구진은 또한 이 접근 방식이 훨씬 더 효율적이라는 것을 보여주었는데, 수십 개의 잘못된 답변을 생성하고 테스트하는 데 자원을 낭비하지 않았기 때문에 실행 비용이 현저히 적게 들었습니다. 더 단순한 데이터를 다루는 별도의 대규모 테스트에서도 이 시스템은 선두 경쟁자들과 대등한 성능을 보여주었으며, 이는 복잡한 데이터를 위한 특화된 설계가 표준 데이터를 처리하는 데 있어 희생을 초래하지 않았음을 증명했습니다.
이 연구는 컴퓨터에게 질문하는 미래가 더 열심히 노력하거나 더 많은 옵션을 생성하는 데 있는 것이 아니라, 작업 중인 데이터의 구조를 이해할 수 있는 더 나은 도구를 주는 데 있다는 것을 시사합니다. 데이터베이스를 반복적으로 탐색하고, 실수로부터 배우며, 서로 다른 정보 조각들 사이의 깊은 연결을 이해할 수 있는 시스템을 구축함으로써, 연구자들은 복잡하고 중첩된 데이터를 다루는 신뢰할 수 있는 지능형 인터페이스를 향한 길을 만들어냈습니다. 이 연구는 컴퓨터가 우리의 질문을 진정으로 이해하기 위해서는, 먼저 우리의 데이터가 존재하는 복잡하고 층이 있는 세상을 이해해야 한다는 점을 강조합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.