← 최신 논문
💬 NLP

Are Online Skill and Memory Modules Always Worth Their Tokens? A Budget-Constrained Study of Web Agents

본 연구는 고정된 토큰 예산 하에 평가될 때, 바닐라 웹 에이전트가 메모리 및 스킬 모듈과 같은 온라인 증강 방식의 성공률과 대등하거나 오히려 더 높은 성능을 보이는 경우가 많음을 입증하며, 이는 이러한 모듈들의 겉보기에 드러나는 이점이 그 토큰 오버헤드를 고려할 때 빈번하게 사라진다는 점을 시사한다.

원저자: Sina Hajimiri, Masih Aminbeidokhti, Jose Dolz, Ismail Ben Ayed, Issam H. Laradji, Spandana Gella, Nicolas Gontier

게시일 2026-06-16
📖 4 분 읽기☕ 가벼운 읽기

원저자: Sina Hajimiri, Masih Aminbeidokhti, Jose Dolz, Ismail Ben Ayed, Issam H. Laradji, Spandana Gella, Nicolas Gontier

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 웹사이트에서 일련의 미스터리(태스크)를 해결하기 위해 탐정 팀을 고용한다고 상상해 보십시오. 당신에게는 그들이 "생각하는 시간"(토큰)에 쓸 수 있는 엄격한 예산이 있습니다.

이 논문은 단순하지만 놀라운 질문을 던집니다: 미리 작성된 메모, 지도, 도구들이 담긴 무거운 배낭(메모리와 기술)을 짊어진 탐정을 고용하는 것이 나을까요, 아니면 스스로 더 많이 둘러보고 생각할 수 있도록 더 많은 시간을 주는 단순한 탐정을 고용하는 것이 나을까요?

연구자들은 놀랍게도, 더 많은 시간을 가진 단순한 탐정이 화려한 배낭을 가진 탐정보다 보통 더 많은 미스터리를 해결하고 돈도 적게 쓴다는 것을 발견했습니다.

다음은 일상적인 비유를 사용한 연구 결과의 요약입니다:

1. "배낭" vs "추가 시간"

  • 증강된 에이전트 (배낭을 멘 탐정): 일부 연구자들은 "배낭"을 메고 다니는 에이전트를 구축해 왔습니다. 이 배낭에는 다음이 포함됩니다:
    • 기술(Skills): 미리 작성된 스크립트 (예: 티켓을 구매하는 방법과 같은 치트 시트).
    • 메모리(Memory): 이전 사건으로부터 얻은 노트 (예: 로그인 버튼은 보통 왼쪽에 있다는 것을 기억하는 것).
    • 워크플로우(Workflows): 특정 문제를 해결하기 위한 단계별 가이드.
    • 문제점: 에이전트가 노트를 읽거나 스크립트를 사용하기 위해 배낭을 열 때마다 비용(토큰)이 발생합니다. 또한 이는 에이전트의 정신 속에 공간을 차지하여, 실제 과업을 수행하기 위한 "생각" 부분을 더 복잡하게 만듭니다.
  • 바닐라 에이전트 (추가 시간을 가진 단순한 탐정): 연구자들은 배낭이 없는 "평범한" 에이전트를 만들었습니다. 대신, 그들에게 동일한 총 예산을 주되, 이를 사용하여 에이전트가 (방해 요소 없이) 더 많은 단계(더 오래 둘러보고, 더 많은 버튼을 클릭하고, 더 깊이 생각함)를 밟을 수 있도록 했습니다.

결과: 대부분의 경우, 추가 시간을 가진 평범한 에이전트가 배낭을 멘 에이전트보다 더 많은 태스크를 해결했습니다. "배낭"은 그것을 들고 열어보는 데 너무 많은 비용이 들어서, 정작 에이전트가 일을 끝내는 데 필요한 자원을 남기지 못하는 경우가 많았습니다.

2. "치트 시트"가 치팅이 되지 못한 이유

연구는 세 가지 인기 있는 "배낭" 방식들을 살펴보았습니다:

  • AWM (워크플로우 메모리): 한 번 해본 일을 바탕으로 "셔츠를 사는 법"에 대한 레시피를 적어두는 탐정과 같습니다.
  • ASI (기술 유도): 특정 작업을 자동화하기 위해 컴퓨터 프로그램을 작성하는 탐정과 같습니다.
  • ReasoningBank: "무엇이 잘 되었고 무엇이 잘못되었는지"를 기록하는 일지를 보관하는 탐정과 같습니다.

연구자들은 이러한 "치트 시트"가 종종 역효과를 낸다는 것을 발견했습니다.

  • "고장 난 지도" 문제: 웹은 끊임없이 변합니다. 한 버전의 웹사이트를 위해 작성된 기술은 웹사이트가 업데이트되면 즉시 깨질 수 있습니다. 실시간으로 화면을 보고 있는 평범한 에이전트는 자연스럽게 적응합니다. 하지만 스크립트를 따르는 에이전트는 옛 지침을 따르려다 충돌을 일으킵니다.
  • "잘못된 노트" 문제: 에이전트들은 때때로 실패한 시도로부터 얻은 노트를 성공한 것으로 착각하여 기록하곤 합니다. 나중에 이 잘못된 노트를 사용하려고 시도하면서 더 많은 실패를 초래합니다.
  • "복잡한 책상" 문제: 에이전트가 배낭에서 노트를 읽을 때마다, 그 전체 내용을 다시 읽어야 합니다. 이는 "생각" 과정을 더 느리고 비싸게 만들어, 실제 작업에 쓸 예산을 줄어들게 합니다.

3. "단 한 번의 실행"이라는 환상

논문은 에이전트가 일반적으로 테스트되는 방식의 주요 결함을 지적합니다.

  • 단일 실행의 함정: 흔히 연구자들은 에이전트를 한 번 실행한 뒤, "보십시오, 80%의 태스크를 해결했습니다!"라고 말합니다.
  • 현실: 연구자들은 테스트를 세 번 실시했습니다. 그 결과, 결과가 매우 다양하게 나타났습니다. 에이전트는 운 좋게 무작위 추측이 맞아떨어져 첫 번째 시도에서 태스크를 해결했을 수도 있지만, 두 번째 시도에서는 실패할 수 있습니다.
  • 교훈: 단 한 번의 테스트 실행만으로는 믿을 수 없습니다. 이는 농구 선수가 운 좋게 쏜 슛 하나가 들어갔다고 해서 그 선수의 실력을 판단하는 것과 같습니다. 그 선수가 정말 실력이 있는지 보려면 여러 경기를 지켜봐야 합니다.

4. "병렬 처리"의 이점

한 가지 더 실질적인 차이점이 있습니다:

  • 배낭 에이전트는 계주 경기와 같습니다. 태스크 2를 돕는 노트를 작성하기 위해 반드시 태스크 1을 마쳐야 합니다. 즉, 하나씩 순차적으로 진행해야 합니다.
  • 평범한 에이전트는 독립적인 작업자 팀과 같습니다. 이전 태스크로부터의 노트에 의존하지 않기 때문에, 10개의 서로 다른 태스크를 해결하기 위해 10명의 에이전트를 동시에 보낼 수 있습니다. 이는 현실 세계에서 훨씬 더 빠릅니다.

결론

논문은 "기술"이나 "메모리"가 이론적으로는 훌륭해 보이지만, 그것들이 제공하는 이점에 비해 너무 많은 비용과 복잡성을 초래하는 경우가 많다고 결론짓습니다.

고정된 예산이 있다면, 유능한 AI에게 직접 탐색하고 생각할 수 있는 더 많은 시간을 주는 것이, 미리 만들어진 도구들이 담긴 무겁고 비싼 배낭을 억지로 메게 하는 것보다 더 현명한 경우가 많습니다. "화려한" 에이전트들은 서류상으로는 좋아 보일지 모르지만, (배낭의 비용을 포함한) 비용을 계산하면 단순하고 직접적인 접근 방식이 승리합니다.

미래를 위한 핵심 교훈: AI 에이전트를 평가할 때, 우리는 단순히 얼마나 많은 태스크를 해결했는지만 봐서는 안 됩니다. 그들이 한 모든 것(메모리와 도구 포함)의 총비용을 계산해야 하며, 결과가 진짜인지 아니면 단순히 운이었는지 확인하기 위해 테스트를 여러 번 반복해야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →