HyperAgent: Planning and Acting over Tool-Schema Hypergraphs for Tool-Use LLM Agents
이 논문은 유향 도구-스키마 하이퍼그래프(directed Tool-Schema Hypergraph)를 활용하여 동적 계획 및 결핍 지향적 실행을 유도함으로써, 복잡한 도구 사용 시나리오에서 기존 베이스라인 대비 LLM 에이전트의 작업 완료율과 효율성을 향상시키는 새로운 프레임워크인 HyperAgent를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 우주선의 선장이라고 상상해 보십시오. 하지만 단순히 하나의 조이스틱으로 조종하는 것이 아니라, 각각 다른 언어를 구사하고 고유한 도구 세트를 가진 수천 대의 서로 다른 로봇 군단을 지휘해야 합니다. 이것이 바로 'AI 에이전트'의 세계입니다. AI 에이전트는 거대 언어 모델(LLM)을 기반으로 구축되어 항공권 예약, 식료품 주문, 은행 계좌 관리와 같은 실생활의 과업을 수행하도록 설계된 스마트한 컴퓨터 프로그램입니다. 이 에이전트들은 똑똑하지만 약간 정신없는 조수와 같습니다. 당신의 요청은 완벽하게 이해할 수 있지만, 그것을 어떻게 실행할지에 대해서는 종종 길을 잃곤 합니다. 그들은 필요한 재료가 없는데도 도구를 사용하려 하거나, 다음 로봇이 일을 끝내기 전에 먼저 움직여야 한다는 사실을 잊어버리기도 합니다. 과학자들이 던지는 핵심적인 질문은 이것입니다: 어떻게 하면 이 AI 조수들이 벽에 충돌하는 것을 막고, 그들이 압도당하지 않으면서 복잡한 디지털 도구의 미로를 항해할 수 있도록 도울 수 있을까?
여기에 HyperAgent가 등장합니다. 이는 AI 에이전트를 위한 초스마트 GPS 역할을 하는 새로운 방법론입니다. HyperAgent는 AI가 시행착오를 통해 길을 찾아가도록 내버려 두는 대신, 에이전트가 움직이기 전에 모든 도구가 서로 어떻게 연결되어 있는지에 대한 거대하고 상세한 지도를 구축합니다. 이것은 마치 단순히 레시피만 보는 요리사가 아니라, 어떤 재료가 있는지, 재료를 다듬기 위해 어떤 도구가 필요한지, 그리고 모든 과정이 어떤 순서로 진행되어야 하는지를 확인하기 위해 먼저 팬트리, 냉장고, 정원을 꼼sd히 살피는 것과 같습니다. 이 "지도"를 사용함으로써, HyperAgent는 AI가 정밀하게 단계를 계획하도록 도와주며, 막다른 길을 피하고 엄청난 시간과 에너지를 절약하게 해줍니다.
문제점: AI의 "추측 게임"
현재 대부분의 AI 에이전트는 자동차 엔진을 고치기 위해 무언가 작동할 때까지 부품을 무작위로 망치로 두드리는 사람처럼 작동합니다. 그들은 "이메일 보내기"나 "은행 잔고 확인하기"와 같은 도구 목록을 보고, 어떤 것을 어떤 순서로 사용할지 추측하려고 시도합니다. 문제는 이러한 도구들이 서로 의존한다는 점입니다. 먼저 "로그인"을 하지 않으면 "이메일을 보낼" 수 없고, "비밀번호"가 없다면 "로그인"을 할 수 없습니다.
기존 방식은 AI가 텍스트 설명을 읽는 것만으로 이러한 연결 고리를 파악하도록 의존합니다. 하지만 도구가 수백 개가 되면 AI는 혼란에 빠집니다. 아직 확보하지 못한 특정 입력값이 필요한 도구를 사용하려 시도할 수 있으며, 이는 실패로 이어집니다. 이는 케이크를 굽기 위해 달걀이 있는지 확인하지 않고 시작했다가, 중간에 달걀이 필요하다는 것을 깨닫고 가게로 달려갔지만 이미 가게가 문을 닫은 상황과 같습니다. 이러한 "추측 게임"은 시간을 낭비하고, 비용(컴퓨터 연산 능력)을 발생시키며, 결국 과업을 완전히 실패하게 만듭니다.
해결책: "도구 스키마 하이퍼그래프(Tool-Schema Hypergraph)"
HyperAgent의 연구진은 추측하는 것을 멈추고 지도를 그리기로 했습니다. 그들은 도구 스키마 하이퍼그래프라고 불리는 것을 만들었습니다. 이를 이해하기 위해, 모든 가닥이 도구 사이의 연결을 나타내는 거대한 3D 거미줄을 상상해 보십시오.
일반적인 지도에서는 "도구 A"에서 "도구 B"로 선을 그릴 수 있습니다. 하지만 이 새로운 "하이퍼그래프"에서의 연결은 훨씬 더 정밀합니다. 단순히 "도구 A가 도구 B를 돕는다"라고 말하는 것이 아닙니다. "도구 A는 이 특정한 재료(예: 비밀번호)를 생성하며, 이것이 바로 도구 B가 시작하는 데 필요한 것이다"라고 명시합니다. 이는 데이터의 흐름을 파이프를 통해 흐르는 물처럼 맵핑하여, 한 도구의 출력이 다음 도구에 필요한 입력과 완벽하게 일치하도록 보장합니다.
그들은 이 지도를 이메일, 쇼핑, 음악 서비스와 같은 실제 앱을 포함한 250개의 다양한 시나리오 데이터셋을 사용하여 구축했습니다. 심지어 지도에 "전제 조건"을 추가했습니다. 예를 들어 "메시지 보내기" 도구는 이미 "로그인"된 상태에서만 작동한다는 것을 아는 식입니다. 이를 통해 디지털 세계가 어떻게 작동하는지에 대한 역동적이고 살아있는 청사진을 만듭니다.
HyperAgent의 작동 방식: 3단계 댄스
이 지도가 구축되면, HyperAgent는 과업을 완수하기 위해 영리한 3단계 과정을 거칩로 다음과 같이 작동합니다:
- 정찰병 (컨텍스트 추출 - Context Extraction): 당신이 AI에게 과업(예: "룸메이트에게 최근 주문 영수증을 이메일로 보내줘")을 주면, HyperAgent는 전체의 복잡한 웹을 모두 훑지 않습니다. 대신 지도를 사용하여 해당 과업과 관련된 특정 도구와 연결만을 확대하여 추출합니다. 이는 모든 단계와 필요한 재료를 나열한 레시피 카드처럼, 작업 순서를 보여주는 "Task DAG"(복잡한 용어로 플로우차트)를 생성합니다.
- 건설업자 (결핍 지향 확장 - Deficit-Oriented Expansion): 여기서 HyperAgent는 정말 똑똑해집니다. AI가 작업을 시작할 때, 현재 자신의 "상태"—즉, 지금 가지고 있는 정보가 무엇인지—를 체크합니다. 만약 "영수증 파일"이 필요한데 아직 가지고 있지 않다면, HyperAgent는 지도를 살펴보고 그 파일을 생성하는 정확한 도구를 찾아냅니다. 이는 AI가 할 수 없는 일을 시도하지 않도록, 부족한 부분만을 위한 미니 하위 네트워크를 구축하는 과정입니다. 이는 집 전체를 한꺼번에 지으려 하기보다, 현재 벽을 쌓는 데 필요한 벽돌만을 주문하는 건설 현장과 같습니다.
- 항해사 (동적 실행 - Dynamic Execution): AI가 단계를 완료하고 새로운 정보(예: 영수증 찾기)를 수집함에 따라, 내부 상태를 업데이트합니다. 만약 문제가 발생하거나 상황이 변하면, HyperAgent는 당황하지 않습니다. 지도를 다시 확인하고, 계획을 조정하며, 새로운 경로를 찾아냅니다. 이는 교통 체증이 풀리기를 바라며 뱅뱅 도는 대신, 교통 상황을 감지하면 즉시 경로를 재탐색하는 GPS와 같습니다.
결과: 더 빠르고, 더 똑똑하며, 더 저렴하게
연구진은 단순한 작업부터 매우 복잡한 작업까지 750개의 다양한 과업이 포함된 엄격한 테스트 스위트인 AppWorld 벤치마크에서 HyperAgent를 테스트했습니다. 그들은 추측 방식(ReAct 등)이나 과거 사례를 학습한 방식 등 다른 AI 방법론들과 비교했습니다.
결과는 인상적이었습니다. HyperAgent는 단순히 더 많은 과업을 완료했을 뿐만 아니라, 훨씬 더 효율적으로 수행했습니다.
- 성공률: 표준 테스트 세트에서 HyperAgent는 **63.1%**의 성공률을 기록하며, 차순위 방법론의 **48.8%**를 앞질렀습니다. 더 어려운 "챌린지(Challenge)" 세트에서도 **35.7%**를 달성하여 기존의 **30.2%**보다 높은 성적을 냈습니다.
- 효율성: 더욱 중요한 것은 HyperAgent가 엄청난 양의 자원을 절약했다는 점입니다. 표준 방식이 과업당 140,000개의 토큰(AI가 처리하는 디지털 "단어")을 사용한 반면, HyperAgent는 46,000개만을 사용했습니다. 또한 API 호출(외부 도구 요청) 횟수도 평균 75.1회에서 48.0회로 크게 줄였습니다.
더 간단히 말해, HyperAgent는 성공 가능성이 높을 뿐만 아니라, 그 과정에서 시간과 컴퓨터 전력을 덜 낭비했습니다. 이는 다른 에이전트들이 도구를 시도하고, 실패하고, 다른 것을 시도하고, 다시 실패하며 결국 포기하는 "시행착오" 루프를 피했음을 의미합니다.
이것이 왜 중요한가
이 논문은 도구들이 서로 어떻게 의존하는지를 명시적으로 모델링하는 것이(단순히 텍스트로부터 이러한 연결을 추측하는 것에 의존하는 대신), AI 에이전트를 훨씬 더 신뢰할 수 있게 만든다는 점을 시사합니다. 연구진은 "지도"(그래프 컨텍스트)나 "건설업자"(지원 그래프)를 제거했을 때 성능이 크게 떨어진다는 것을 발견했습니다. 이는 지도의 구조가 단순히 있으면 좋은 부가 기능이 아니라 필수적이라는 것을 증명합니다.
이 연구는 시뮬레이션 환경(AppWorld 데이터셋)에서 수행되었지만, 결과는 명확한 방향을 제시합니다. AI 에이전트는 단순히 글을 잘 읽는 것을 넘어, 자신이 사용하는 도구의 구조를 더 잘 이해해야 합니다. 그들에게 지도를 제공함으로써, 우리는 그들이 어둠 속에서 방황하는 것을 막고 복잡한 디지털 세계를 자신감 있게 항해할 수 있도록 도울 수 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.