← 최신 논문
🤖 AI

BatchDAG: LLM-Planned Execution Graphs for Scalable Ad-Hoc Analysis Over Enterprise Data

BatchDAG는 대규모 엔터프라이즈 데이터셋에 대해 효율적이고 정확한 애드혹 분석을 가능하게 하며, 순차적 에이전트 방식에 비해 환각 현상과 비용을 크게 줄이면서, 병렬적이고 엔티티 인지적인 배치 작업을 오케스트레이션하기 위해 LLM을 활용하여 타입이 지정된 유향 비순환 그래프를 생성하는 확장 가능한 시스템입니다.

원저자: Anupreet Walia

게시일 2026-07-22
📖 5 분 읽기🧠 심층 분석

원저자: Anupreet Walia

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 책 한 권을 읽고 그 내용을 정확히 알려줄 수 있는 아주 똑똑한 로봇 친구가 있다고 상상해 보세요. 이 로봇은 이야기 하나를 요약하는 데는 탁월합니다. 하지만 만약 당신이 이 로봇에게 5만 권의 책을 읽고 "이 책들에 등장하는 모든 캐릭터가 돈에 대해 이야기한 적이 있습니까?"라는 질문에 답하라고 한다면 어떻게 될까요? 만약 당신이 로봇에게 그 모든 책을 한꺼번에 건네준다면, 너무 많은 정보 때문에 로봇의 뇌가 폭발해 버릴 것입니다. 그렇다고 로봇에게 한 권씩 읽으라고 시킨다면 완성하는 데 몇 년이 걸릴 것입니다. 이것이 바로 현대의 "대규모 언어 모델(LLM)"—많은 챗봇의 뒤에 있는 AI 두뇌—이 직면한 문제입니다. 이들은 개별 문서를 이해하는 데는 뛰어나지만, 거대하고 복잡한 데이터 집합(예: 수천 건의 비즈니스 회의록)을 한꺼번에 분석해야 할 때는 어려움을 겪습니다. 혼란에 빠지거나, 어떤 사실이 어떤 회의에 속하는지 놓치기도 하며, 완료하는 데 엄청난 시간이 걸립니다.

여기, 거대한 오케스트라의 마스터 지휘자처럼 행동하여 이 문제를 해결하도록 설계된 새로운 시스템인 BatchDAG가 있습니다. BatchDAG는 AI 로봇이 모든 것을 스스로 하게 두는 대신, AI를 오직 상세한 "레시피"나 "지도"를 작성하는 용도로만 사용합니다. 그런 다음, 생각할 줄 모르는 초고속 컴퓨터 엔진이 그 지도를 따라가며 지루하고 반복적인 수학 계산과 검색을 즉각적으로 수행하고, 꼭 필요한 경우에만 "똑똑한" AI를 호출합니다. 그 결과? 이 시스템은 수만 건의 회의에 대한 복잡한 질문에 1분도 채 안 되어 답할 수 있으며, 비용은 몇 달러가 아닌 단 몇 센트가 들고, 사실을 지어내지도 않습니다.

문제점: "하나씩 처리하기"의 함정

5만 개의 회의 녹취록이 있는 도서관에서 특정 대화를 찾는 상황을 생각해 보세요. 만약 표준 AI 에이전트(예: ReAct 봇)를 사용한다면, 이는 마치 도서관을 돌아다니며 책 한 권을 집어 들고 읽고, 내려놓고, 다음 책을 집어 드는 사람처럼 행동하는 것과 같습니다.

  • 두뇌 과부하: 만약 모든 책을 AI에게 한꺼번에 입력하려고 하면, AI는 "컨텍스트 제한(context limit)"에 부딪힙니다. 즉, 기억 용량이 가득 차서 모든 것을 담을 수 없게 됩니다.
  • 속성 손실(Attribution Loss): 만로 AI가 모든 책에서 "돈"을 검색한다면, AI는 "네, 돈이 언급되었습니다!"라고 말할 수는 있지만, 어느 회의에서 그 말이 나왔는지는 말하지 못할 수 있습니다. 사실과 출처 사이의 연결 고리를 놓치는 것입니다.
  • 시간 낭비: 이를 하나씩 처리하는 것은 고통스러울 정도로 느립니다. 만약 확인해야 할 거래가 3,000건이고 각 건당 몇 초가 걸린다면, 당신은 몇 시간을 기다려야 합니다.

해결책: "마스터 플래너"와 "조립 라인"

BatchDAG는 업무를 **플래너(Planner)**와 **워커(Worker)**라는 두 가지 뚜렷한 역할로 분리함으로써 게임의 판도를 바꿉니다.

1. 플래너 (AI 설계자)
"우리 영업팀이 모든 회의에서 좋은 질문을 던졌나요?"와 같은 질문을 던지면, AI는 아직 읽기를 시작하지 않습니다. 대신, AI는 설계도를 그리는 건축가처럼 행동합니다. AI는 **유향 비순환 그래프(Directed Acyclic Graph, DAG)**를 생성합니다.

  • 쉬운 번역: 레고 블록으로 만든 순서도라고 상상해 보세요. 각 블록은 구체적인 작업입니다: "데이터베이스 검색", "결과 필터링", "회의별 그룹화", 또는 "AI에게 분석 요청하기".
  • AI는 이 지도를 모호한 문장이 아닌, 엄격하고 구조화된 형식(JSON)으로 작성합니다. 이를 통해 컴퓨터는 혼란 없이 다음에 무엇을 해야 할지 정확히 알 수 있습니다.

2. 워커 (결정론적 엔진)
지도가 그려지면, 초고속 컴퓨터 엔진이 업무를 인계받습니다. 이 엔진은 "똑똑할" 필요가 없습니다. 그저 빠르고 순종적이기만 하면 됩니다.

  • 병렬 파동(Parallel Waves): 엔진은 작업을 하나씩 처리하는 대신, 지도를 보고 어떤 블록들을 동시에 수행할 수 있는지 확인합니다. 이들은 "파동" 형태로 실행됩니다. 경기장에서의 파도타기 응원을 상상해 보세요. A 구역의 사람들이 동시에 일어났다가, 그다음 B 구역, 그다음 C 구역이 일어나는 식입니다. 이 방식은 과정을 믿을 수 없을 정도로 빠르게 만듭니다.
  • Zero-LLM 단계: 지도상의 대부분의 블록(데이터베이스를 검색하거나 숫자를 정렬하는 등의 작업)은 AI를 전혀 필요로 하지 않습니다. 이 작업들은 일반 코드로 수행되며, 비용이 들지 않고 즉각적입니다. AI는 지도가 "이제 이 특정 그룹을 분석하기 위해 당신의 두뇌를 사용하세요"라고 명령할 때만 호출됩니다.

핵심 비결: "엔티티 인식 배치(Entity-Aware Batching)"

이것이 이 논문의 가장 큰 기술입니다. 121개의 회의가 있고, 각 회의마다 48페이지의 텍스트가 있다고 가정해 봅시다.

  • 기존 방식 (행 단위 - Row-Level): 만약 AI에게 한 번에 5페이지씩 입력한다면, 회의 A의 첫 5페이지를 보내고, 그다음 회의 A의 다음 5페이지를 보내는 식의 과정이 반복됩니다. 결국 AI에게 동일한 회의를 10번이나 보내게 되지만, 매번 아주 작고 혼란스러운 파편만을 보여주게 됩니다. 이는 낭비이며 잘못된 추측으로 이어집니다.
  • BatchDAG 방식 (엔티티 인식 - Entity-Aware): 이 시스템은 먼저 **회의 ID(Meeting ID)**별로 페이지를 그룹화합니다. 즉, "여기에 모든 페이지가 포함된 완전한 회의 5개가 있습니다"라고 말하는 것입니다. AI에게 100개의 작은 파편 대신 5개의 전체 이야기를 전달합니다.
  • 결과: 이 간단한 그룹화 덕분에 AI를 호출해야 하는 횟수가 47배 줄었습니다. 이는 탐정에게 도시 곳에 흩어진 235개의 서로 다른 방을 조사하라고 하는 대신, 5개의 집 전체를 조사하라고 보내는 것과 같습니다.

연구 결과

연구진은 5만 건 이상의 회의와 3,000건의 비즈니스 딜을 포함하는 Brevian.ai의 실제 데이터를 사용하여 이 시스템을 테스트했습니다.

  • 속도: 이 시스템은 3,000건의 딜을 60초 미만에 분석했습니다. 표준 AI 에이전트는 동일한 작업을 수행하는 데 약 100분이 걸렸을 것입니다.
  • 비용: 시스템이 모든 단계에서 비싼 AI 두뇌를 호출하는 것을 피하기 때문에 비용이 극적으로 감소했습니다. 단순한 데이터베이스 쿼리는 단 0.02였습니다.수천건의회의에대한복잡한분석조차쿼리당약0.02**였습니다. 수천 건의 회의에 대한 복잡한 분석조차 쿼리당 약 **0.24밖에 들지 않았습니다.
  • 정확도: 이 시스템은 인간 전문가가 맞춤형 워크플로우를 설계했을 때와 거의 대등한 성능을 보였으며(인간 설계 파이프라인의 3.74/5 점 대비 3.25 점), 표준 AI 에이전트보다 훨씬 뛰어났습니다.
  • 진실성: 가장 중요한 점은, BatchDAG가 답변을 입증하는 능력이 훨씬 뛰어났다는 것입니다. Batch-DAG는 **77%**의 확률로 정확한 녹취록 근거를 제시할 수 있었던 반면, 다른 방법들은 **46~60%**에 그쳤습니다. 이는 AI가 왜 그런 주장을 했는지 알아야 하는 기업들에게 매우 중요한 요소입니다.

이것이 왜 중요한가

이 논문은 거대 데이터 문제를 해결하기 위해 단순히 AI를 더 "똑똑하게" 만드는 것에 집중해서는 안 된다고 제안합니다. 대신, AI가 힘든 일을 직접 하게 두는 것을 멈춰야 합니다. 최선의 접근 방식은 AI가 작업을 **계획(Plan)**하게 하고, 빠르고 지루하며 신뢰할 수 있는 기계가 그 일을 **수행(Do)**하게 하는 것입니다.

또한, 단계 사이에 서술형 요약 대신 구조화된 데이터(엑셀의 깔끔한 행과 같은 형태)를 전달함으로써 "환각(hallucinations, 지어낸 사실)" 현상을 27% 줄였습니다. 저자들은 AI가 단계 사이에 평이한 영어로 요약할 때 세부 사항을 놓치는 경傾向이 있다는 것을 발견했습니다. 하지만 구조화된 데이터를 전달하면 사실 관계가 고정된 상태로 유지됩니다.

요약하자 ${중에, BatchDAG는 AI를 천재로 만드는 것이 아니라, 언제 전문가를 불러야 하고 언제 조립 라인에 맡겨야 하는지 정확히 아는 훌륭한 관리자로 만드는 것에 관한 것입니다. 이 시스템은 느리고, 비싸고, 오류가 발생하기 쉬운 과정을 빠르고, 저렴하며, 신뢰할 수 있는 프로세스로 탈바꿈시킵니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →