← 최신 논문
🤖 AI

ACTS-SQL: Agentic and Critic-Oriented Tree-Structured SQL Correctness with Large Language Models

이 논문은 벤치마크 평가와 실제 산업 현장 배포 모두에서 SQL 교정 정확도를 크게 향상시키기 위해 에이전트 기반 계획, 백트래킹, 실행 기반 검증을 활용하는 학습이 필요 없는 트리 구조 프레임워크인 ACTS-SQL을 소개한다.

원저자: Xinmei Huang, Jie Song, Peng Li, Fuxin Jiang, Jing Zhang, Tieying Zhang, Jianjun Chen, Chenming Liu, Tao Yang, Maoyin Liu, Wenda Li, Hong Chen, Cuiping Li

게시일 2026-08-18
📖 5 분 읽기🧠 심층 분석

원저자: Xinmei Huang, Jie Song, Peng Li, Fuxin Jiang, Jing Zhang, Tieying Zhang, Jianjun Chen, Chenming Liu, Tao Yang, Maoyin Liu, Wenda Li, Hong Chen, Cuiping Li

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대 사회에서 방대한 양의 정보는 데이터베이스라고 불리는 디지털 창고에 저장됩니다. 이 창고에 질문을 던지기 위해 사람들은 SQL로 알려진 특정 언어를 사용하며, 이는 구조화된 데이터를 검색하기 위한 주요 인터페이스 역할을 합니다. 이 언어를 올바르게 작성하려면 복잡한 관계와 논리에 대한 깊은 이해가 필요하지만, 숙련된 인간조차 잘못된 답을 내놓는 실수를 저지르곤 합니다. 최근에는 거대 언어 모델(LLM)이라 불리는 강력한 컴퓨터 시스템이 이 쿼리를 자동으로 작성하도록 학습되어, 모든 사람이 데이터에 접근할 수 있게 하겠다는 약속을 하고 있습니다. 그러나 이러한 모델들은 종-종 사용자의 실제 질문에 제대로 답하지 못하면서도 겉보기에는 올로 보이는 쿼리를 생성하거나, 컴퓨터를 충돌시키거나 오해의 소지가 있는 결과를 반환하게 만드는 미묘한 오류를 포함하곤 합니다. 쿼리의 한 부분에서 발생하는 작은 변화가 전체 요청의 의미를 완전히 바꿀 수 있기 때문에 이러한 실수를 바로잡는 것은 매우 어렵습니다.

중국 인민대학교와 바이트댄스(ByteDance)의 연구진은 이러한 컴퓨터 시스템이 스스로의 실수를 바로잡을 수 있도록 돕는 새로운 방법을 개발했습니다. 이들의 시스템인 ACTS-SQL은 오류가 있는 쿼리를 단일한 직선 형태로 수정하려고 시나리오를 짜는 대신, 컴퓨터가 동시에 여러 가능성을 탐색할 수 있는 분기형 경로처럼 프로세스를 취급합니다. 만약 컴퓨터가 잘못된 길로 접어들면, 잘못된 가정에 갇혀 있는 대신 뒤로 물러나 다른 경로를 시도할 수 있습니다. 이 방식은 표준 벤치마크와 실제 산업 현장에서 테스트되었으며, 컴퓨터가 생성한 질문의 정확도를 크게 향 향상시켰습니다. 연구진은 시스템이 잠시 멈추고, 자신의 작업을 점검하며, 선택을 재고할 수 있도록 허용함으로써 이전 방식들이 해결할 수 없었던 문제들을 해결할 수 있음을 발견했습니다. 이는 기술을 일상적인 용도로 훨씬 더 신뢰할 수 있게 만들어 줍니다.

연구진이 다룬 핵심 문제는 현재의 컴퓨터 시스템이 흔히 오류의 루프에 갇힌다는 점입니다. 모델이 잘못된 쿼리를 생성할 때, 기존의 수정 방식은 대개 단일한 추론 경로를 따라 단계별로 수정하려고 시도합니다. 만약 모델이 특정 단어에 대한 사용자의 의도를 오해하는 것과 같은 실수를 초기에 저지른다면, 이후의 모든 수정 작업은 그 초기 오류를 바탕으로 쌓아 올리게 됩니다. 이는 미로를 항해할 때 오직 앞으로만 이동하는 것과 같습니다. 만약 처음에 잘못된 방향으로 접어든다면, 당신이 올바른 길을 가고 있다고 확신하며 계속해서 막다른 골목 깊숙이 걸어 들어가 결국 선택지가 바닥날 때까지 멈추지 못할 것입니다. 연구진은 이러한 선형적 방식이 취약한 이유는 왜냐하면 처음의 선택을 재고하기 위해 쉽게 되돌아갈 수 없기 때문임을 관찰했습니다. 일단 컴퓨터가 사용자의 요청에 대해 특정 해석을 확정하면, 결과가 틀린 것으로 드러나더라도 마음을 바꾸는 경우가 드뭅니다.

이를 해결하기 위해 연구진은 수정 과정을 트리 구조로 조직하는 시스템을 설계했습니다. 컴퓨터가 상단에서 시작하여, 도구가 새로운 결정 지점(예를 들어, '모호성 탐지(Detect Ambiguities)' 도구가 사용자의 요청에서 특정 모호한 구절을 식별할 때)을 도입할 때마다, 각기 다른 가능한 의미를 나타내는 여러 갈래의 가지로 나뉘는 의사결정 나무를 상상해 보십시오. 한 가지는 사용자가 1년 동안의 모든 매출을 보고 싶어 한다고 가정하고, 다른 가지는 특정 달의 매출을 보고 싶어 한다고 가정할 수 있습니다. 시스템은 그런 다음 각 가지를 독립적으로 테스트합니다. 만약 어떤 가지가 사용자가 의도했을 법한 결과와 일치하지 않으면, 시스템은 그 가지를 잘라내고 다시 분기점으로 돌아가 다른 경로를 시도할 수 있습니다. 이러한 백트래킹(backtrack) 능력과 대안 탐색 능력은 컴퓨터가 하나의 잘못된 생각에 갇히는 것을 방지합니다.

이 시스템은 쿼리를 수정하기 위한 계획을 세우는 중앙 "두뇌"를 사용하여 작동합니다. 이 계획은 단순한 단계의 목록이 아니라 잠재적 행동의 지도입니다. 컴퓨터는 이 지도를 탐색하는 데 도움을 주는 특수 도구들을 사용합니다. 한 가지 도구는 사용자의 질문에서 모호한 단어를 포착하고 이를 이해하는 다양한 방법들을 생성하는 데 도움을 줍니다. 또 다른 도구는 컴퓨터가 실제 데이터베이스에 쿼리의 일부를 실행하여 어떤 데이터가 돌아오는지 확인하게 해주며, 이는 아이디어가 작동하는지 확인하는 빠른 테스트 역할을 합니다. 만약 컴퓨터가 구문 오류(syntax error), 즉 쿼리의 문법적 실수를 발견하면, 전문화된 도구가 쿼리를 작은 조각으로 나누어 전체를 처음부터 다시 쓰지 않고도 정확히 어디에서 문법이 잘못되었는지 찾아냅니다.

연구진은 다양한 유형의 오류가 포함된 어려운 SQL 쿼리 예시가 담긴 BIRD-Critic이라는 벤치마크에서 시스템을 테스트했습니다. 그들은 이들의 방식과 SQL을 수정하도록 특별히 훈련된 강력한 모델 및 선형적인 단계별 방식으로 오류를 수정하려는 다른 시스템들을 포함한 여러 접근 방식과 비교했습니다. 결과는 그들의 트리 구조 방식이 훨씬 더 정확하다는 것을 보여주었습니다. 벤치마크에서 이 새로운 시스템은 이전의 최고 방식보다 성공률을 9.42 퍼센트 포인트 향상시켰습니다. 이러한 개선은 서로 다른 유형의 데이터베이스 언어 전반에 걸쳐 유효했으며, 이는 해당 방식이 특정 스타일의 쿼리 작성에 의존하지 않는 견고함을 갖추었음을 시사합니다.

시스템이 실제 세계에서 작동함을 증명하기 위해, 연구진은 바이트댄스의 로그 분석 서비스인 Torch Log Service 내 프로덕션 환경에 이를 배포했습니다. 이 환경에서 시스템은 사용자에게 전달되기 전 강력한 언어 모델이 생성한 쿼리를 수정하는 데 사용되었습니다. 결과는 놀라웠습니다. 실제로 실행에 성공한 쿼리의 정확도가 36.77%에서 53.61%로 급증했습니다. 이는 복잡하고 맞춤화된 데이터를 다루는 실제 시나리오에서, 시스템이 실패한 시도의 과반수를 성공적인 것으로 바꿀 수 있었음을 의미합니다. 연구진은 이러한 개선이 기존의 컴퓨터 모델을 새로운 데이터로 재학습시킬 필요 없이 이루어졌다는 점에 주목하며, 이 솔루션이 기존 시스템에 통합하기 쉽고 실용적이라고 언급했습니다.

또한 연구는 백트래킹의 중요성을 강조했습니다. 상세한 사례 연구에서 연구진은 선형 방식이 "월간 매출"에 대한 쿼리를 수정하는 데 실패하는 과정을 보여주었는데, 이는 사용자가 연간 매출을 의미한다고 생각하는 오류에 갇혔기 때문입니다. 선형 시스템은 쿼리를 수정하기 위해 몇 번이고 시도했음에도 불구하고 그 초기 잘못된 가정에서 벗어날 수 없었습니다. 반면, 트리 구조 시스템은 모호성을 인식하고, 연간 매출 아이디어를 시도했다가 그것이 실패하는 것을 확인한 후, 즉시 요청을 월간 데이터로 올바르게 해석하는 가지로 전환했습니다. 증거에 기반하여 방향을 전환하는 이 능력이 성공의 핵심이었습니다.

새로운 시스템이 더 효과적이기는 하지만, 여러 경로를 탐색하고 더 많은 테스트를 실행하기 때문에 실행하는 데 시간이 조금 더 걸립니다. 연구진은 쿼리를 수정하는 데 걸리는 시간을 측정하였고, 정확도의 상당한 이득을 위해 몇 분 정도의 시간이 추가되는 것은 합리적인 절충안임을 발견했습니다. 또한 그들은 이 시스템이 테스트에 사용된 모델뿐만 아니라 다양한 유형의 컴퓨터 모델과도 잘 작동한다는 것을 발견했으며, 이는 이 접근 방식이 유연하며 광범위하게 적용될 수 있음을 나타냅니다.

이 연구는 데이터베이스 쿼리 작성과 같은 복잡한 작업에 있어서 단순한 선형 방식보다 구조화된 계획 기반 방식이 우월하다는 것을 입증합니다. 컴퓨터에게 잠시 멈추고, 여러 옵션을 고려하며, 실수를 했을 때 뒤로 물러설 수 있는 능력을 부여함으로써 시스템은 훨씬 더 신뢰할 수 있게 됩니다. 이러한 발견은 인공지능의 데이터 분석 능력에 대한 미래의 발전이 모델 자체를 고립시켜 똑똑하게 만드는 것보다, 모델이 자신의 작업을 점검할 수 있는 더 나은 도구와 프로세스를 제공하는 데 달려 있을 것임을 시사합니다. 연구진은 자신들의 코드와 데이터를 공개하여 다른 이들이 이 방법을 바탕으로 컴퓨터와 인간의 데이터 간의 상호작용을 더욱 개선할 수 있도록 했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →