Declarative Skills for AI Agents in Knowledge-Grounded Tool-Use Workflows
본 논문은 자연어 기술 파일을 오케스트레이션에 활용하는 선언적 에이전트가 불완전한 증거라는 지배적인 병목 현상을 극복하기 위해 고품질의 검색이 제공된다는 전제하에, 지식 기반 도구 사용 워크플로에서 경직된 명령형 상태 머신보다 정확도를 높이고 오류를 줄임으로써 더 우수한 성능을 보인다고 주장한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 은행 계좌 관리를 도와줄 새로운 비서(Assistant)를 채용한다고 상상해 보세요. 당신에게는 방대한 양의 규칙서, 정책 문서, 도구 매뉴얼이 뒤섞인 지저도한 도서관(지식 베이스, Knowledge Base)이 있습니다. 당신의 목표는 비서가 올바른 규칙을 찾고 적절한 도구를 사용하여 계좌 해지나 결제 이의 제기와 같은 특정 업무를 수행하도록 하는 것입니다.
이 논문은 이 비서를 관리하는 세 가지 서로 다른 방식 중 어떤 것이 실제로 업무를 완수하는지 확인하기 위한 경주입니다.
세 가지 "관리자" (The Three "Managers")
연구진은 AI 비서를 테스트하기 위해 세 가지 관리 스타일을 실험했습니다.
1. "벌거숭이" 비서 (기본형 - Naked Assistant)
특별한 지침이 없는 비서입니다. 당신은 그저 가공되지 않은 대화 기록만을 전달하며 "알아서 해결해 봐"라고 말합니다. 이 비서는 스스로 작업 순서를 추측하고, 본인 인증 절차를 기억하며, 적절한 도구를 직접 찾아내야 합니다.
- 비유: 관광객에게 외국 도시의 지도만 쥐여준 채 "박물관을 찾아서 티켓을 사 오세요"라고 말하는 것과 같습니다.
2. "선언적" 비서 (스킬 파일 관리자 - Declarative Assistant)
이 비서는 지침에 자연어로 작성된 간단한 "스킬 파일(Skill Files)"—마치 마크다운(Markdown) 문서와 같은 요약 노트—이 첨부되어 있습니다. 이 파일들은 비서에게 엄격한 경로를 강요하지 않습니다. 대신 "계좌를 해지하기 전에, 진행 중인 분쟁(dispute)이 있는지 반드시 확인하세요"라거나 "도구 이름을 모를 때는 항상 도서관을 먼저 검색하세요"와 같이 조언합니다. 비서는 이 파일들을 읽고 그에 따라 어떻게 행동할지 스스로 결정합니다.
- 비유: 관광객에게 "운전하기 전에 교통 상황을 확인하세요", "길을 잃으면 길을 물어보세요"와 같이 강조 표시가 된 팁이 담긴 가이드북을 주는 것과 같습니다. 관광객은 여전히 직접 운전을 하지만, 더 나은 조언을 갖게 됩니다 된 것입니다.
3. "명령형" 비서 (상태 머신 관리자 - Imperative Assistant)
이 비서는 엄격하게 프로그래밍된 플로우차트(Flowchart)에 의해 구동됩니다. 관리자는 비서를 인사 → 분류(Triage) → 본인 인증 → 계획 → 실행의 특정 단계로 강제 통제합니다. 컴퓨터가 "본인 인증" 단계를 통과했음을 확인하기 전까지 비서는 "실행"(실제 뱅킹 업무) 단계로 넘어갈 수 없습니다. 컴퓨터가 신호등을 제어하고, 비서는 신호가 녹색일 때만 운전할 수 있습니다.
- 비유: 관광객을 정해진 경로가 입력된 내비게이션 시스템을 갖춘 자율주행 자동차에 태우는 것과 같습니다. 자동차는 반드시 모든 빨간불에 멈춰야 하며, GPS가 허용하지 않는 한 왼쪽으로 회전할 수 없습니다. 운전자(AI)는 경로를 벗어날 자유가 없습니다.
결정적 발견: "도서관"이 병목 구간이다 (The "Library" is the Bottleneck)
연구진은 놀라운 사실을 발견했습니다. 도서관이 엉망이라면 관리자가 아무리 훌륭해도 소용없다는 것입니다.
- "황금" 도서관 (The "Golden" Library): 연구진이 비서에게 필요한 정확한 문서들을 제공했을 때(완벽한 정보), 선언적 비서(스킬 파일을 가진 경우)가 명확한 승자였습니다. 이 방식은 실수가 적었고 업무를 더 자주 성공적으로 완수했습니다. "벌거숭이" 비서도 괜찮은 성과를 냈지만, "명령형" 비서는 오히려 성적이 더 나빴습니다. 엄격한 규칙이 너무 취약하여, AI가 단계를 잘못 분류하면 전체 시스템이 멈추거나 실패했기 때문입니다.
- "노이즈가 섞인" 도서관 (The "Noisy" Library): 연구진이 잘못된 문서를 자주 불러오는 표준 검색 도구를 사용했을 때(노이즈가 섞인 검색), 모두가 실패했습니다. 스킬 파일도 비서가 잘못된 규칙을 읽고 있다는 사실을 해결할 수 없었습니다. 플로우차트 역시 AI가 잘못된 정보에 기반해 실수를 저지르는 것을 막지 못했습니다.
핵심 요점: AI가 무질서하고 구조화되지 않은 데이터베이스에서 정보를 찾고 있다면, 어떤 영리한 관리 방식도 이를 구원할 수 없습니다. 먼저 더 나은 검색 도구가 필요합니다.
"컴플라이언스(준수)"의 신화 (The "Compliance" Myth)
연구진은 명령형 비서(엄격한 플로우차트 방식)가 "사용자의 계좌를 변경하기 전에 ID를 확인하라"와 같은 안전 규칙을 더 잘 준수하는지 확인하고자 했습니다.
- 이론: 엄격한 플로우차트는 AI가 계좌에 접근하기 전에 반드시 본인 인증을 거치도록 강제할 것입니다.
- 현실: 작동하지 않았습니다. AI는 여전히 실수를 저질렀습니다. 엉망인 정보 때문에 혼란에 빠진 AI는 가끔 본인 인증 단계를 통과했다고 "환각(Hallucination)"을 일으키거나, 엄격한 플로우차트 자체가 AI의 오류로 인해 혼선을 빚었습니다. 엄격한 규칙이 권한 없는 변경을 실제로 막아주지는 못했습니다. 오히려 엄격한 시스템은 실패한 동작을 반복해서 재시도하며 시간과 비용을 낭비하는 루프(Loop)에 빠질 가능성이 더 높았습니다.
결과 요약
- 스킬 파일은 효과가 있다 (정보가 좋을 때): AI에게 자연어로 된 "요약 노트"(선언적 방식)를 주는 것은, 특히 AI 모델 자체가 아주 똑똑하지 않을 때, 벌거숭이 AI보다 성능을 높이는 데 도움이 됩니다.
- 엄격한 코드는 취약하다: AI를 단계별 플로우차트로 강제하는 것(명령형 방식)은 AI를 더 안전하게 만들거나 규정을 잘 준수하게 만들지 못했습니다. 오히려 계획대로 되지 않을 때 시스템을 더 취약하고 오류에 취약하게 만들었습니다.
- 검색이 왕이다: 가장 큰 문제는 AI가 어떻게 관리되느냐가 아니라, AI가 올바른 정보를 찾을 수 있느냐였습니다. 검색 결과가 나쁘다면, 세상에서 가장 뛰어난 관리 방식도 소용이 없습니다.
요약하자면: AI 에이전트가 복잡한 업무를 잘 수행하게 하고 싶다면, 단순히 AI 주변에 엄격한 우리(Cage)를 만들지 마세요. 자연어 지침(스킬 파일)을 잘 제공하되, 무엇보다 중요한 것은 AI가 애초에 올바른 정보를 찾을 수 있도록 만드는 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.