Token Optimization and Context Window Management in Multi-Agent AI Workflows
이 논문은 컨텍스트 계층화 및 '관련성-대조' 컨텍스트 구성과 같은 전략이 모델 정확도를 향상시키는 동시에 지연 시간과 비용을 유의미하게 줄일 수 있음을 프로덕션 데이터와 통제된 연구를 통해 입증하며, 멀티 에이전트 AI 워크플로에서 토큰 사용량을 최적화하고 컨텍스트 창을 관리하기 위한 실무자 프레임워크를 제시한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인공지능이 급격히 발전하는 세상에서, 여러 컴퓨터 프로그램, 즉 '에이전트(agents)'가 협력하여 복잡한 문제를 해결하는 새로운 형태의 시스템이 등장했습니다. 디지털 비서 팀을 상상해 보십시오. 한 명은 정보를 수집하고, 다른 한 명은 이를 정리하며, 세 번째는 최종 보고서를 작성합니다. 이러한 팀이 기능하기 위해서는 그들의 사고를 뒷받침하는 엔진인 거대 언어 모델(LLM)에 의존해야 합니다. 하지만 이 엔진들은 단일 순간에 보유할 수 있는 '작업 기억(working memory)'의 정보량에 엄격한 제한이 있습니다. 이 제한은 단어와 문장을 구성하는 작은 단위인 '토큰(tokens)'으로 측정됩니다. 워크플로우가 너무 길어지거나 불필요한 세부 정보로 너무 혼잡해지면, 시스템은 느려지고, 실행 비용이 더 많이 들며, 중요한 사실이 소음의 바다 속에서 길을 잃어 실수를 저지르기도 합니다. 엔지니어들의 과제는 단순히 더 똑똑한 에이전트를 만드는 것이 아니라, 업무를 잘 수행하는 데 정말로 필요한 것만을 보도록 에이전트에게 효율적인 메모리 관리 방법을 가르치는 것입니다.
연구자 디비르 샤메이(Dvir Shamay)의 최근 연구는 바로 이 문제를 다루며, 이론적인 아이디어를 넘어 실제 운영 환경에서 실용적인 방법들을 테스트합니다. 이 연구는 엔지니어링 작업을 추적하는 대시보드에 초점을 맞추고 있는데, 이 시스템은 회의 녹취록, 이메일, 채팅 메시지를 지속적으로 흡수하여 중요한 작업(tasks)을 추출하고 진행 상황을 요약합니다. 연구팀은 정보를 AI에 전달하는 방식을 신중하게 재배치함으로써, 데이터를 처리하는 데 걸리는 시간과 필요한 컴퓨팅 파워를 획기적으로 줄일 수 있다는 것을 발견했습니다. 그들은 가장 효과적인 접근 방식이 모든 것을 포함하는 거대한 텍스트 블록을 AI에게 제공하는 것이 아니라, 각 단계에 필요한 특정 유형의 데이터만을 보내는 것이라는 점을 발견했습니다. 동일한 정보를 반복해서 요청하는 대신, 데이터를 한 번 가져와서 로컬에서 처리하도록 함으로써, 새로운 작업 세트를 로드하는 데 걸리는 시간을 약 3분 30초에서 10분 30초 사이에서 61초에서 116초 사이로 단축했습니다. 이러한 변화는 또한 처리 비용을 60~70% 절감하여, 더 강력한 컴퓨터보다 더 나은 조직화가 얼마나 강력한지를 증명했습니다.
아마도 이 연구에서 가장 놀라운 발견은 이러한 시스템이 학습하는 방식에 대한 일반적인 직관에 도전하는 것입니다. 엔지니어들은 최상의 결과를 얻으려면 AI에게 가장 관련성이 높고 품질이 좋은 정보만을 제공하여 나머지는 걸러내야 한다고 흔히 가정합니다. 연구진은 직장 내 커뮤니케이션 목록에서 중요한 항목을 식별하도록 AI에게 요청함으로써 이를 테스트했습니다. 그들은 고도의 관련성을 가진 항목들로만 채워진 프롬프트와, 고도의 관련성을 가진 항목에 낮지만 여전히 관련이 있는 콘텐츠를 섞은 프롬프트를 비교했습니다. 직관과는 반대로, 시스템은 고도의 관련성을 가진 항목들과 함께 '노이즈(noise)'—즉, 결정적이지는 않지만 동일한 주제에 속하는 항목들—가 섞여 있을 때 더 잘 작동했습니다. AI가 무엇이 중요하지 않은지에 대한 사례를 보았을 때, 무엇이 중요한지를 훨씬 더 잘 구별하게 된 것입니다. 테스트 결과, 중요한 항목 50%와 덜 중요한 항목 50%를 섞었을 때, 중요한 항목만을 사용했을 때보다 AI의 점수 산정 정확도가 유의미한 차이로 향상되었습니다. 이는 사람이 '따뜻함'이 진정 무엇인지 이해하기 위해 다양한 온도를 경험해야 하는 것처럼, AI도 신호와 소음 사이의 대비를 보아야 스스로의 판단력을 교정할 수 있음을 시사합니다.
연구는 또한 정보의 순서가 성능에 미치는 영향을 조사했습니다. 일부 이론은 긴 목록의 중간에 배치된 정보가 무시된다고 제안하지만, 연구진은 목록이 짧을 경우 배열보다 중요한 항목과 중요하지 않은 항목의 비율이 더 중요함을 발견했습니다. 그러나 목록이 매우 길어질 경우, 핵심 사실을 중간에 묻어두면 실제로 놓칠 수 있다는 점은 확인했습니다. 또 다른 실무적인 발견은 동일한 작업에 대한 여러 번의 시도를 어떻게 처리할 것인가에 관한 것이었습니다. 시스템이 정보를 추출하기 위해 다섯 번의 시도를 하고 나서 스마트한 AI를 사용하여 결과를 병합했을 때, 이는 다섯 번의 시도에서 발견된 모든 고유 항목의 합집합(union)을 취하는 것보다 더 나은 성능을 보이지 않았습니다. 복잡하고 지능적인 병합 단계는 최종 결과물을 개선하지 못한 채 비용과 시간만을 추가했으며, 이는 단순한 기계적 결합이 정보를 수집하는 데 있어 종종 가장 신뢰할 수 있는 방법임을 시사합니다.
이 연구 결과는 AI 시스템을 구축하는 이들에게 명확한 경로를 제시합니다. 연구는 효율성과 정확성이 단순히 더 진보된 모델을 선택하는 문제가 아니라, 정보의 흐름을 설계하는 문제임을 입증합니다. AI에 도달하기 전에 데이터를 필터링하고, 명확한 기준을 설정하기 위해 적절한 맥락을 섞으며, 결과를 결합하는 방식에서 불필요한 복잡성을 피함으로써, 팀들은 시스템을 더 빠르고, 저렴하며, 신뢰할 수 있게 만들 수 있습니다. 이 연구는 인공지능의 모든 문제를 해결했다고 주장하거나, 이 규칙들이 모든 단일 작업에 적용된다고 제안하는 것이 아닙니다. 대신, 실제 운영 환경에서 작동하는 것으로 증명된, 측정 가능하고 반복 가능한 패턴들을 제공합니다. 자동화된 업무의 미래를 구축하는 이들에게 교훈은 명확합니다. 더 나은 성능을 위한 열쇠는 종아 더 많은 것을 추가하는 것이 아니라, 당신이 가진 것을 더 정밀하게 조직하는 데 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.