PANDO: Efficient Multimodal AI Agents via Online Skill Distillation
PANDO 는 구조화된 스킬 라이브러리를 유지하고 진행 상황 반영 및 캐시 인식 프롬프팅과 같은 기법을 활용하여 멀티모달 웹 에이전트가 성능을 향상시키고 토큰 소비를 줄일 수 있도록 하는 효율적인 온라인 스킬 증류 프레임워크를 소개하며, 기존 방법들에 비해 추론 비용을 현저히 낮추면서 VisualWebArena 에서 58.3% 의 성공률을 달성합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
다음은 PANDO 논문을 일상적인 언어와 비유를 사용하여 설명한 것입니다.
큰 문제: "클릭당 과금"의 함정
온라인 쇼핑을 도와줄 매우 똑똑하지만 비싼 조수를 고용했다고 상상해 보세요. 그들이 웹페이지를 볼 때마다, 무엇을 할지 생각할 때마다, 혹은 버튼을 클릭할 때마다 당신은 아주 작은 요금 (이를 '토큰'이라고 부릅니다) 을 지불해야 합니다.
현재 대부분의 AI 에이전트는 더 많은 돈을 지출함으로써 업무 능력을 향상시키려 합니다. 실패하면 다시 시도하고, 막히면 두 번째 의견을 구합니다. 같은 작업을 10 번 실행하여 가장 좋은 결과를 선택합니다. 이는 작동하지만, 이는 마트까지 택시를 타고 가려면 택시비를 내고, 지갑을 잊어버렸는지 확인하러 다시 택시를 타고 돌아가려면 두 번째 택시비를, 가격을 다시 확인하려면 세 번째 택시비를 내는 것과 같습니다. 일은 해결되지만, 비용이 엄청나게 비싸고 느립니다.
이 논문의 저자들은 질문했습니다: 매번 돈을 더 지출하는 대신, 에이전트가 더 일할수록 더 저렴하고 빨라질 수 있을까요?
해결책: PANDO (거대 아스펜 에이전트)
연구진은 PANDO라는 에이전트를 개발했습니다. 이름은 유타주의 '판도 (Pando)' 아스펜 숲에서 따왔습니다.
- 비유: 판도는 47,000 개의 개별 나무처럼 보이지만, 실제로는 지하에 있는 하나의 단일 뿌리 시스템으로 모두 연결되어 있습니다. 한 나무가 자라면 다른 나무들과 영양분을 공유합니다. 한 나무가 죽어도 뿌리 시스템은 그것을 기억하여 숲 전체를 살아있게 유지합니다.
- AI 버전: PANDO 는 공유된 '기억 뿌리'(기술 라이브러리) 를 가진 AI 에이전트입니다. 새로운 작업을 완전히 새로운 문제로 취급하는 대신, 이전 작업에서 배운 것을 기억하고 그 교훈을 새로운 문제 해결에 활용합니다.
PANDO 의 작동 방식 (4 단계 루프)
PANDO 는 단순히 추측하고 확인하지 않습니다. **계획 (Plan) → 실행 (Act) → 성찰 (Reflect) → 학습 (Learn)**이라는 주기를 따릅니다.
- 계획: "두뇌"(똑똑하지만 비싼 AI) 가 큰 작업 (예: "500 달러 이하인 가장 저렴한 기타 찾기") 을 작은 단계로 나눕니다.
- 실행: "손"(더 저렴하고 빠른 AI) 이 실제로 버튼을 클릭합니다.
- 성찰: "관리자"가 단계가 작동했는지 확인합니다. 가격 필터가 실제로 목록을 변경했나요? 그렇지 않다면 왜 그런가요?
- 학습 (마법 같은 부분): 여기서 PANDO 는 더 똑똑해집니다.
- 기술 라이브러리: 에이전트가 성공적으로 저렴한 기타를 찾으면, 레시피를 기록합니다: "저렴한 품목을 찾으려면 '가격순 정렬'을 클릭한 후 '낮은 가격에서 높은 가격'으로 선택하세요." 이를 규칙이나 루틴으로 저장합니다.
- 기술 재사용: 다음에 에이전트가 "가장 비싼" 품목을 찾아야 할 때, 열심히 생각할 필요가 없습니다. 라이브러리를 살펴보고 규칙을 확인한 후 "높은 가격에서 낮은 가격"으로 스위치를 바꾸기만 하면 됩니다.
- 강등 (정리): 규칙이 작동하지 않게 되면 (예: 웹사이트 레이아웃 변경), 에이전트는 이를 "고장 난" 것으로 표시하고 사용을 중단합니다. 이는 에이전트가 오래되고 고장 난 지시를 사용하며 루프에 갇히는 것을 방지합니다.
게임 체인저인 이유
이 논문은 PANDO 를 910 가지 웹 작업(쇼핑, 구인구직, 레딧) 에서 테스트했습니다. 결과는 다음과 같습니다.
- 성공률: PANDO 는 **58.3%**의 성공률을 보였습니다. 이는 현재 최상위 에이전트들 (약 54%) 보다 좋습니다.
- 비용: 이것이 큰 승리입니다. PANDO 는 다음으로 가장 좋은 에이전트보다 토큰 (돈) 을 58% 적게 사용했습니다.
- "공짜 점심" 효과:
- 초기: PANDO 는 규칙을 배우는 동안 다소 느립니다.
- 후기: 기술 라이브러리를 구축할수록 더 빠르고 저렴해집니다. 테스트가 끝날 무렵에는 시작했을 때보다 더 적은 단계와 비용으로 작업을 해결했습니다.
- 비유: 수학 시험을 치르는 학생을 상상해 보세요.
- 기존 에이전트: 새로운 문제를 볼 때마다 매번 공식부터 다시 유도합니다. 시간이 매우 오래 걸립니다.
- PANDO: 문제를 처음 풀 때, 공식을 해결하고 치트시트에 적어둡니다. 그 다음 99 번은 치트시트만 보면 됩니다. 시험을 더 빠르게 끝내고 더 적은 두뇌 에너지를 사용합니다.
PANDO 가 피하는 "숨겨진 비용"
이 논문은 다른 에이전트들이 비용을 두 가지 방식으로 숨긴다고 지적합니다.
- 사전 평가 발견: 일부 에이전트는 테스트가 시작되기 전에 몇 주 동안 "훈련"하거나 "도구를 발견"하는 데 시간을 보냅니다. PANDO 는 테스트 도중에 학습하므로 숨겨진 초기 비용이 없습니다.
- 롤아웃 확장: 일부 에이전트는 단순히 작업을 10 번 시도하고 승자를 선택합니다. PANDO 는 한 번만 시도하지만, 그 한 번의 시도가 의미 있도록 기억을 활용합니다.
결론
PANDO 는 AI 를 더 좋게 만들기 위해 더 많은 돈을 쏟아부을 필요가 없음을 증명합니다. 구조화된 기억(기술 라이브러리) 과 나쁜 기억을 정리하는 방법(강등) 을 제공함으로써, 에이전트는 더 일할수록 더 효율적이 됩니다.
매일 모든 것을 잊고 끊임없이 재교육을 받아야 하는 노동자와, "작업 수행 방법"을 적어둔 노트를 가지고 매일 더 빨라지는 노동자 사이의 차이와 같습니다.
핵심 교훈: PANDO 는 단순히 더 똑똑해지는 것이 아니라, 경험을 쌓을수록 실행 비용이 더 저렴해집니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.