← 최신 논문
📊 statistics

AgensFlow: A Coordination-Policy Substrate for Multi-Agent Systems

본 논문은 부분 관측성 하의 온라인 정책 학습 문제로 다중 에이전트 조정을 다루는 오픈 소스 프레임워크인 AgensFlow 를 소개하며, 기술, 역할, 모델, 토폴로지에 관한 결정을 동적으로 최적화함으로써 학습되고 감사 가능한 라우팅이 복잡한 워크플로우에서 정적 파이프라인보다 우수함을 입증합니다.

원저자: Nicole Koenigstein

게시일 2026-05-28
📖 4 분 읽기☕ 가벼운 읽기

원저자: Nicole Koenigstein

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

바쁜 고위험 주방의 매니저가 되어 상상해 보세요. 당신은 셰프 팀(에이전트), 다양한 재료와 도구들이 있는 식료품 저장고(스킬), 그리고 서로 다른 속도와 비용으로 요리를 하는 몇 개의 오븐(모델)을 가지고 있습니다.

과거의 방식(정적 파이프라인)에서는 모든 요리마다 경직된 레시피 카드를 작성했습니다. "수프에는 항상 셰프 A 를 사용하고, 식료품 저장고를 확인한 후 오븐 1 을 사용하세요." "샐러드에는 항상 셰프 B 를 사용하고, 식료품 저장고는 건너뛰고 오븐 2 를 사용하세요."

문제는 실제 삶이 그렇게 단순하지 않다는 것입니다. 때로는 수프 재료가 기이하거나, 오븐이 고장 나거나, 실제로 수프 냄비가 필요한 샐러드를 만들어야 할 수도 있습니다. 만약 경직된 레시피에 매달린다면, 시간과 돈을 낭비하거나 나쁜 요리를 내놓을 수 있습니다.

AgensFlow는 이 주방을 운영하는 새로운 방식입니다. 고정된 레시피 대신, 요리할 때마다 일어나는 일을 지켜보고 즉석에서 계획을 조정하는 스마트하고 학습하는 매니저입니다.

다음은 이를 단순한 개념으로 분해한 작동 원리입니다:

1. "폴드된 서명" (상황 인식)

매니저는 모든 주문의 세부 사항을 하나하나 살펴보는 것이 아닙니다 (그것은 압도적일 것입니다). 대신 주문을 "서명"으로 그룹화합니다.

  • 비유: 교통 신호등 시스템을 생각해 보세요. 매니저는 "빨간 토요타인가요, 파란 포드인가요?"라고 묻지 않습니다. 대신 "이것은 러시 아워(위험 높음, 속도 필요) 상황인가요?" 또는 "이것은 느린 화요일(위험 낮음, 신중하게 진행 가능) 인가요?"라고 묻습니다.
  • 논문에서: 이 시스템은 작업이 모호한지, 위험한지, 아니면 많은 증거가 필요한지 확인합니다. 모든 개별 주문을 외우는 대신, 해당 유형의 상황을 처리하는 최선의 방법을 학습할 수 있도록 유사한 작업들을 그룹화합니다.

2. "건너뛰기" 버튼 (토폴로지 학습)

경직된 주방에서는 어떤 요리든 그 요리에 필요하지 않더라도 그릇을 씻고, 양파를 다지고, 냄비를 저어야 할 수도 있습니다.

  • 비유: AgensFlow 는 매니저에게 "건너뛰기" 버튼을 제공합니다. 매니저가 간단한 주문 (예: 물 한 잔) 을 보면, 다지기나 정교한 플레이팅을 건너뛰는 법을 배웁니다. 주문이 복잡하다면 (예: 5 코스 만찬), 두 명의 셰프가 작업을 더블 체크하는 것과 같은 추가 단계를 추가하는 법을 배웁니다.
  • 논문에서: 이를 skip:X라고 합니다. 시스템은 특정 유형의 작업의 경우 웹 검색이나 사실 확인과 같은 비싼 단계를 완전히 건너뛸 수 있음을 학습하여 결과를 망치지 않으면서 시간과 비용을 절약합니다.

3. "학습 루프" (정책 그래프)

이 시스템은 단순히 추측하지 않습니다. 점수판을 유지합니다.

  • 비유: 매니저가 수첩을 가지고 있다고 상상해 보세요. 매 식사 후, 음식 평론가 (심판) 가 요리를 평가합니다. 매니저는 다음과 같이 기록합니다: "'러시 아워' 주문이 왔을 때, 셰프 B 를 사용하고 가니쉬를 건너뛰면 9/10 점에 비용도 적게 들었습니다. 셰프 A 를 사용하면 7/10 점이지만 비용은 더 들었습니다."
  • 논문에서: 이것이 정책 그래프입니다. 각 "서명" (상황) 에 대해 "정책" (규칙 집합) 을 학습합니다. 새로운 것을 시도하는 것 (탐색) 과 작동하는 것에 머무르는 것 (활용) 사이를 균형 있게 유지하기 위해 UCB1이라는 수학적 트릭을 사용합니다.

4. "이중 확인" (보상 감사)

AI 의 가장 큰 문제 중 하나는 "심판"이 편향될 수 있다는 것입니다. 한 평론가는 매운 음식을 좋아할지도 모르지만, 다른 평론가는 싫어할지도 모릅니다.

  • 비유: AgensFlow 는 한 명의 음식 평론가에게만 묻지 않습니다. 서로 다른 배경을 가진 세 명의 다른 평론가에게 요리를 평가하도록 요청합니다. 그들이 모두 동의하면 매니저는 점수를 신뢰합니다. 그들이 이견을 보이면, 매니저는 점수가 불안정하다는 것을 알고 이를 바탕으로 규칙을 변경하지 않습니다.
  • 논문에서: 이것이 크로스-심판 감사입니다. 논문은 단순히 한 명의 심판에만 의존하면 시스템이 실제보다 더 잘하고 있다고 착각하게 만든다는 것을 발견했습니다. 여러 명의 심판을 사용하면 성공에 대한 더 정확한 그림을 얻을 수 있습니다.

그들은 무엇을 발견했나요?

연구자들은 이 "스마트 매니저"를 두 가지 매우 다른 유형의 작업에서 테스트했습니다:

  1. 컴퓨터 시스템 충돌 수정 (분산 시스템).
  2. 보안 경고 분석 (보안 권고).

결과:

  • 어려운 일에 더 뛰어남: 학습형 매니저는 여러 출처의 정보를 결합하는 것과 같은 조정이 필요한 복잡한 작업에서 경직된 레시피보다 훨씬 더 뛰어났습니다. 이러한 어려운 작업에서 답변의 품질이 크게 향상되었습니다.
  • 간단한 일에 좋음: 매우 간단한 작업의 경우, 학습형 매니저는 경직된 레시피와 거의 비슷했습니다 (상황을 악화시키지는 않았지만, 화려할 필요도 없었습니다).
  • "웜 스타트" 트릭: 그들은 컴퓨터 충돌에 대한 기존 지식을 활용하여 보안 경고에 대한 매니저를 가르쳐 보았습니다. 그것은 작동했습니다! 매니저는 새로운 업무를 더 빠르게 학습했고, 주제가 달랐음에도 불구하고 "추측" (탐색) 에 더 적은 시간을 보냈습니다.

결론

AgensFlow 는 복잡한 AI 팀의 경우 규칙을 하드코딩해서는 안 된다는 것을 증명합니다. 대신 지켜보고, 학습하고, 적응하는 시스템을 구축해야 합니다. "누가, 언제, 무엇을 하며, 심지어 그것을 해야 할 필요가 있는지"에 대한 결정을 고정된 설정이 아니라 학습할 수 있는 기술로 취급합니다.

가장 중요한 점은 성공을 측정하는 방식에 주의해야 한다는 것입니다. 당신의 "심판"이 편향되어 있다면, 당신의 "학습"은 잘못될 것입니다. 심판 자신들을 감사함으로써 시스템은 정직하고 효과적으로 유지됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →