← 최신 논문
💬 NLP

MyAG: A Graph-Based Framework for Designing and Analyzing Composable LLM Agent Systems

이 논문은 유연한 설계, 계층적 구성 및 성능 분석을 가능하게 하기 위해 결합 가능한 LLM 에이전트 시스템을 컴포넌트, 워크플로 및 검색 그래프로 분해하는 오픈 소스 기반의 그래프 프레임워크인 MyAG를 소개한다.

원저자: Zhisong Zhang

게시일 2026-07-16
📖 6 분 읽기🧠 심층 분석

원저자: Zhisong Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

컴퓨터가 단순히 질문에 답하는 것을 넘어 실제로 무언가를 수행하는 세상을 상상해 보십시오. 웹을 탐색하고, 항공권을 예약하거나, 디지털 비서처럼 행동하며 복잡한 퍼즐을 풀 수도 있습니다. 이것이 바로 **AI 에이전트(AI Agents)**의 영역입니다. 이들을 단순한 챗봇이 아니라, 뇌(대규모 언어 모델)와 세상과 상호작용할 수 있는 손(도구)을 가진 작은 로봇이라고 생각하십시오. 하지만 여기서 까다로운 점은, 이러한 로봇을 만드는 과정이 매우 무질서하다는 것입니다. 어떤 도구를 줄지, 단계별로 어떻게 생각할지, 그리고 막혔을 때 무엇을 할지를 결정해야 합니다. 이는 마치 엔진, 스티어링 휠, GPS가 서로 엉겨 붙어 있어 교체하는 것이 불가능한 자동차를 만드는 것과 같습니다. 자동차의 주행 방식을 바꾸고 싶다면 엔진 전체를 다시 만들어야 할지도 모릅니다. 연구자들은 이러한 에이전트를 유연하고 효율적이며 고치기 쉽게 구축하는 방법을 찾으려 노력하고 있습니다. 왜냐하면 현재로서는 로봇이 실패했을 때 그것이 "멍청해서"인지, 아니면 단지 지침이 잘못 작성되었기 때문인지 구별하기 어렵기 때문입니다.

홍콩 시립대학교의 장즈송(Zisong Zhang)이 만든 새로운 툴킷인 MyAG가 등장했습니다. 이 논문은 MyAG를 "그래프 기반 프레임워크"라고 제시하는데, 이는 에이전트 설계를 하나의 거대하고 엉킨 덩어리가 아닌 세 가지의 분리되고 명확한 청사진으로 조직화한다는 뜻입니다. 저자들은 "누가"(구성 요소), "어떻게"(워크플로우), "만약 ~라면"(탐색 전략)을 분리함으로써 개발자들이 레고 블록처럼 부품을 조합하고 섞을 수 있다고 제안합니다. 그들은 이러한 분리가 시스템 전체를 다시 쓰는 것 없이도 다양한 전략을 테스트하는 것을 훨씬 쉽게 만든다는 것을 발견했습니다. 실험에서 그들은 이 접근 방식이 에이전트가 작업을 수행하는 능력과 그 과정에서 드는 시간 또는 비용 사이의 절충안(trade-offs)을 상세히 들여다볼 수 있게 해준다는 것을 보여주었습니다. 그들이 모든 AI 문제를 해결했다고 주장하는 것은 아니지만, 그들의 방법론이 에이전트가 어디에서 시간을 쓰고 어디에서 자원을 낭비하고 있는지 정확히 파악하는 데 도움이 된다는 것을 입증했습니다.

디지털 두뇌의 세 가지 청사진

MyAG를 이해하기 위해, 여러분이 영화 감독이라고 상상해 보십시오. 여러분에게는 세 가지 별도의 직무가 있으며, MyAG는 하나를 고치려다 다른 것을 망가뜨리지 않도록 이 직무들을 엄격히 분리할 것을 요구합니다.

1. 구성 그래프(Component Graph): 출연진과 제작진
이것은 영화에 누가 나오는지를 적은 명단입니다. AI 세계에서 이것은 에이전트(결정을 내리는 배우), 환경(웹 브라우저와 같이 그들이 활동하는 무대), 그리고 도구(그들이 사용하는 소품)입니다. MyAG에서 이것은 누가 누구와 대화할 수 있는지를 보여주는 지도 형태로 그려집니다. 예를 들어, "액션 에이전트"는 "브라우저 환경"과 연결되어 있어 웹페이지의 버튼을 클릭할 수 있습니다. 여기서 멋진 점은 동일한 배우를 다른 장면에서도 재사용할 수 있다는 것입니다. 장면이 바뀐다고 해서 새로운 배우를 만들 필요 없이, 기존 배우에게 다음에 무엇을 할지 알려주기만 하면 됩니다.

2. 워크플로우 그래프(Workflow Graph): 대본
이것은 배우들이 언제 말하고 다음에 무엇을 할지를 알려주는 대본입니다. 이야기의 흐름입니다. 에이전트가 날씨를 확인한 다음 티켓을 예약할까요? 아니면 실패하면 다시 시도하기 위해 루프를 돌까요? MyAG를 사용하면 이 대본을 순서도(flowchart)로 그릴 수 있습니다. 루프, 분기(만약 이 일이 발생하면 왼쪽으로, 저 일이 발생하면 오른쪽으로), 그리고 종료 조건을 설정할 수 있습니다. 가장 좋은 점은 무엇일까요? 동일한 출연진(구성 그래프)을 유지하면서도 대본(워크플로우 그래프)을 교체하여 다른 구조의 이야기가 더 효과적인지 확인할 수 있다는 것입니다.

3. 탐색 그래프(Search Graph): "만약 ~라면"의 리허설
이 부분이 정말 흥ًا목입니다. 때때로 로봇은 최선의 결정을 내리기 전에 여러 경로를 탐색해야 합니다. 예를 들어, 문을 열어보려다 잠겨 있다는 것을 깨닫고 창문을 시도할 수도 있습니다. 탐색 그래프는 이러한 모든 "만약 ~라면"의 시나리오를 기록합니다. 에이전트가 취한 모든 가지치기, 모든 막다른 길, 그리고 모든 성공적인 경로를 추적합니다. 이를 통해 시스템은 "최선 우선 탐색(Best-First Search, 항상 가장 유망한 경로를 선택)"이나 "롤백(Rollback, 상황이 잘못되면 이전 단계로 돌아감)"과 같은 전략을 사용할 수 있습니다. 이는 마치 감독이 전체 영화 세트를 다시 만들 필요 없이, "컷! 그 장면 다시 해봅시다. 이번에는 캐릭터가 걷는 대신 뛰게 하세요"라고 말할 수 있는 것과 같습니다.

레고 블록으로 탑 쌓기

이 논문의 핵심 아이디어 중 하나는 **계층적 구성(Hierarchical Composition)**입니다. 거대한 로봇을 만든다고 상상해 보십시오. 아주 작은 나사와 전선을 한꺼번에 설계하는 대신, 손을 만들고, 다리를 만들고, 머리를 만든 다음 마지막에 이들을 합칩니다. MyAG는 AI 에이전트로 이 작업을 할 수 있게 해줍니다. 인터넷에서 논문을 찾는 데 특화된 작은 "웹 브라우징 시스템"을 구축할 수 있습니다. 그런 다음, 그 전체 시스템을 하나의 단위로 묶어 더 큰 "연구 보조 시스템" 내부의 단일 도구처럼 다룰 수 있습니다.

논문은 이러한 "하위 시스템"들이 무상태(stateless)(계산기처럼 매번 사용될 때마다 초기화됨)이거나 상태 유지(stateful)(사용자의 선호도를 기억하는 인간 비서처럼 이전의 일을 기억함)일 수 있다고 설명합니다. 이러한 모듈식 구조 덕분에 매번 처음부터 시작하는 대신, 테스트를 마친 작은 조각들을 끼워 맞춤으로써 복잡한 에이전트를 구축할 수 있습니다.

스톱워치와 지갑: 효율성 측정

저자들은 효율성 또한 중요하게 생각합니다. 그들은 에이전트가 정답을 맞혔다고 해서 반드시 좋은 에이전트인 것은 아니라고 주장합니다. 100번의 시도 끝에 엄청난 컴퓨터 시간을 들여 답을 냈을 수도 있기 때문입니다. MyAG에는 내장된 스톱워치와 지갑이 포함되어 있습니다.

그들은 두 가지 주요 요소를 측정합니다:

  • LLM 비용 (CLC_L): "두뇌"가 드는 비용입니다. 이는 AI가 읽고 쓰는 단어(토큰) 수를 기준으로 계산됩니다. 그들은 입력과 출력 토큰에 가중치를 두는 공식을 사용하여, 사용자가 AI 모델의 가격에 따라 비용을 설정할 수 있도록 합니다.
  • 환경 비용 (CEC_E): "손"이 드는 비용입니다. 이는 웹페이지 로딩을 기다리거나 페이지를 스크롤하는 등 현실 세계에서 작업을 수행하는 데 걸리는 시간을 측정합니다.

이러한 비용을 추적함으로써, 연구자들은 **성능-효율성 절충안(performance-efficiency trade-off)**을 볼 수 있습니다. 예를 들어, 그들은 단순한 "탐욕적(Greedy)" 전략(생각나는 대로 즉시 실행하는 것)이 대안을 확인하는 데 시간을 낭비하지 않기 때문에 가장 빠르고 저렴하다는 것을 발견했습니다. 반면, "롤백(Rollback)" 전략(실수를 인정하고 다시 시도하게 함)은 시간이 조금 더 걸리고 비용이 더 들 수 있지만 종종 더 나은 결과를 가져옵니다. "Best-of-N" 전략(여러 경로를 동시에 시도하고 가장 좋은 것을 선택)은 매우 정확할 수 있지만, 매우 느리고 비용이 많이 듭니다.

실험 결과가 보여준 것

연구팀은 두 가지 실제 작업, 즉 복잡한 질문에 답하기(GAIA 벤치마크 사용)와 웹사이트 탐색(Mind2Web-Live 사용)을 통해 MyAG를 테스트했습니다. 그들은 각 전략이 어떻게 경쟁하는지 보기 위해 다양한 전략으로 테스트를 수행했습니다.

  • 속도 vs. 지능: 탐욕적(Greedy) 전략은 대안을 확인하느라 시간을 낭비하지 않기 때문에 가장 적은 시간과 토큰을 사용하는 가장 효율적인 방식이었습니다.
  • 두 번째 기회의 힘: 롤백(Rollback) 전략은 충분한 시간이 주어졌을 때 전반적으로 가장 우수한 성능을 보였습니다. 이 전략은 에이전트가 실수를 인정하고 다시 시도할 수 있게 하여, 시간과 토큰이 조금 더 들더라도 더 높은 정확도를 달아냈습니다.
  • 복잡성의 대가: Best-FirstBest-of-N과 같은 전략은 성능을 향상시킬 수 있지만, 그만큼의 대가를 치러야 했습니다. 이들은 훨씬 더 많은 컴퓨터 자원과 시간을 요구했습니다. 논문은 이러한 복잡한 방법들의 성공 여부가 어떤 경로가 최선인지 결정하는 훌륭한 "판사(judge)"를 보유하고 있는지에 크게 달려 있다고 언급합니다.

또한 그들은 시간이 어디에 쓰였는지 상세히 분석했습니다. 웹 탐색의 경우, "스크롤"은 놀라울 정도로 저렴하고 빨랐던 반면, "대기"는 페이지가 로드되기를 기다리는 등의 작업으로, 빈도는 낮았지만 가장 많은 시간을 차지하는 가장 비싼 동작임을 발견했습니다. 이러한 상세한 분석은 개발자들이 에이전트의 어느 부분을 최적화해야 하는지 알 수 있게 도와줍니다.

결 결론

MyAG는 모든 AI 문제를 해결하는 마법 지팡이가 아닙니다. 저자들은 이 도구가 수백만 명의 사용자를 위한 상업용 앱을 만들기 위한 완성된 제품이 아니라 연구용 도구로 설계되었다는 점을 분명히 하고 있습니다. 아직 보안이나 분산 네트워크와 같은 기능은 다루지 않습니다. 그러나 MyAG는 "누가", "어떻게", "만약 ~라면"을 분리하는 것이 AI 에이전트를 설계, 테스트 및 이해하는 것을 훨씬 쉽게 만든다는 것을 성공적으로 증명했습니다. 연구자들에게 에이전트를 시각화하고 측정할 수 있는 명확한 방법을 제공함으로써, MyAG는 더 똑똑하고, 빠르고, 비용 효율적인 디지털 비서를 만드는 방법을 파악하는 데 도움을 줍니다. 이 논문은 이러한 접근 방식이 AI 에이전트 시스템을 더 투명하고 관리 가능하게 만드는 데 있어 견고한 진전임을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →