← 최신 논문
🤖 AI

Agent-Omit: Adaptive Context Omission for Efficient LLM Agents

본 논문은 콜드스타트 파인튜닝과 생략 인식 강화 학습을 통해 LLM 에이전트가 중복된 사고와 관찰을 적응적으로 생략하도록 함으로써 효율성을 향상시키는 통합 학습 프레임워크인 에이전트-오밋을 소개하며, 이는 여러 벤치마크에서 뛰어난 효과성-효율성 트레이드오프를 달성합니다.

원저자: Yansong Ning, Jun Fang, Naiqiang Tan, Hao Liu

게시일 2026-05-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yansong Ning, Jun Fang, Naiqiang Tan, Hao Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

다음은 "Agent-Omit: 효율적인 LLM 에이전트를 위한 적응형 컨텍스트 생략"이라는 논문을 간단한 언어와 창의적인 비유로 설명한 것입니다.

문제: "과도한 설명가" 에이전트

인터넷에서 특정 사실을 찾아달라고 매우 똑똑하지만 약간 집착하는 성격의 연구 조교를 고용했다고 상상해 보세요.

  • 좋은 소식: 그들은 천재입니다. 답을 찾아냅니다.
  • 나쁜 소식: 그 답에 도달하기 위해, 그들이 취하는 단 한 걸음마다 50 페이지 분량의 일기장을 작성합니다. "파란 버튼을 클릭할지 고민 중이야"라고 적고 버튼을 클릭합니다. 그다음 "화면의 텍스트를 읽고 있어"라고 적고 읽습니다. 이전 단계에서 명백했던 버튼을 클릭하는 것조차, 그들에겐 전체 단락을 작성해야 할 일이 됩니다.

이것은 바로 현재의 AI 에이전트들이 하는 일입니다. 그들은 많은 "생각"(추론) 과 "관찰"(행동 결과 읽기) 을 생성합니다. 이는 그들이 어려운 문제를 해결하는 데 도움이 되지만, 엄청난 양의 "디지털 잡음"을 만들어냅니다. 이 잡음은 다음과 같은 문제를 일으킵니다:

  1. 많은 비용이 듭니다(AI 회사들이 단어/토큰 단위로 요금을 청구하기 때문입니다).
  2. 모든 것을 느리게 만듭니다.
  3. AI 를 혼란스럽게 만듭니다. 대화 기록이 너무 길어져서 시작 부분을 잊어버리기 때문입니다.

통찰: 모든 생각이 평등하게 창조된 것은 아님

이 논문의 연구자들은 단순한 질문을 던졌습니다. "정말로 그 50 페이지 일기장의 모든 페이지를 읽어야 할까요?"

그들은 AI 의 여정을 분석하여 이러한 생각과 관찰의 중요성이 언제 발생하는지에 따라 달라진다는 사실을 발견했습니다.

  • 시작: AI 는 경로를 계획하기 위해 열심히 생각해야 합니다. (높은 가치)
  • 중간: AI 는 단순히 버튼을 클릭하거나 간단한 검색 결과를 읽을 뿐입니다. 종종 이 경우 일기장을 작성할 필요가 없으며, 단순히 행동을 수행하면 됩니다. (낮은 가치)
  • 끝: AI 는 발견 사항을 요약해야 합니다. 최종 결과는 필요하지만, 3 시간 전의 검색 결과를 다시 읽을 필요는 없습니다. (오래된 데이터에 대한 낮은 가치)

비유: 요리 레시피를 따르고 있다고 상상해 보세요. 시작할 때는 지시를 신중하게 읽어야 합니다 (계획). 하지만 10 분째 냄비를 저을 때는 저어주는 방법에 대해 소설을 쓸 필요가 없습니다. 그냥 저으면 됩니다. 저어주는 것에 대해 계속 글을 쓴다면, 요리를 끝내기 전에 종이가 다 떨어질 것입니다.

해결책: Agent-Omit

이 팀은 Agent-Omit이라는 새로운 학습 프레임워크를 구축했습니다. 이는 AI 에게 새로운 초능력을 가르치는 것과 같습니다: 무엇을 건너뛸지 아는 기술.

AI 에게 모든 것을 적도록 강요하는 대신, Agent-Omit 은 "내가 무엇을 하고 있는지 알기 때문에 이것을 적을 필요가 없어"라고 말하거나 "그 오래된 메모를 다시 읽을 필요가 없어"라고 말하도록 가르칩니다.

그들은 두 단계로 이를 수행했습니다.

1 단계: "콜드 스타트"(기본 가르치기)

먼저, 그들은 특별한 연습 문제 세트를 만들었습니다. 그들은 AI 에게 다음과 같은 예들을 수동으로 보여주었습니다:

  • "여기에는 당신이 너무 많이 생각한 경우가 있습니다. 다음에는 그 생각을 건너뛰세요."
  • "여기에는 도움이 되지 않는 오래된 관찰을 읽은 경우가 있습니다. 다음에는 그것을 읽는 것을 건너뛰세요."

그들은 AI 가 단계를 건너뛰고 싶을 때 사용할 구체적인 "수동 신호"(특별 코드) 를 가르쳤습니다. 마치 학생에게 때로는 "정답을 알고 있습니다"라는 응답이 유효하며, 모든 수학 문제마다 풀이 과정을 보여줄 필요가 없다는 것을 가르치는 것과 같습니다.

2 단계: "보상 시스템"(강화 학습)

다음으로, 그들은 AI 가 웹사이트 탐색이나 과학 퍼즐 해결과 같은 게임을 하도록 하고 특별한 보상 시스템을 제공했습니다:

  • 정답을 맞췄을 때의 보상.
  • 더 적은 단어를 사용했을 때의 추가 보상.

만약 AI 가 게으름을 피워 필요한 단계를 건너뛰려고 시도하면 나쁜 점수를 받았습니다. 하지만 불필요한 단계를 올바르게 식별하고 이를 건너뛰어 시간과 돈을 절약했다면 엄청난 보너스를 받았습니다. 시간이 지남에 따라 AI 는 작업을 수행하지만 그에 대해 덜 쓰는 "현명한 미니멀리스트"가 되는 법을 배웠습니다.

결과: "골디락스" 에이전트

연구자들은 이 새로운 AI(Agent-Omit) 를 일곱 가지 다른 최상위 AI 에이전트와 비교하여 테스트했습니다.

  • 성능: 그것은 DeepSeek-R1 이나 o3 와 같은 "초지능" 거인들과 마찬가지로 문제를 해결했습니다.
  • 효율성: 도달하기 위해 사용한 단어 (토큰) 수가 현저히 적었습니다.
  • 절충: 그것은 완벽한 균형을 찾았습니다. 실패할 정도로 게으르지 않았고, 돈을 낭비할 정도로 수다스럽지도 않았습니다.

비유: 같은 목적지로 가려는 두 명의 운전자를 상상해 보세요.

  • 운전사 A(구형 AI): 모든 회전, 모든 신호등, 그리고 그들이 보는 모든 구름을 설명하며 전체 거리를 운전합니다. 그들은 도착하지만, 많은 연료를 소모하고 시간이 오래 걸립니다.
  • 운전사 B(Agent-Omit): 전체 거리를 운전하지만, 복잡한 결정을 내려야 하거나 지도를 확인해야 할 때만 말을 합니다. 그들은 똑같이 빠르게 도착하지만, 훨씬 적은 연료를 사용합니다.

왜 이것이 중요한가 (논문에 따르면)

이 논문은 AI 에게 불필요한 컨텍스트를 "생략"(건너뛰기) 하도록 가르침으로써 이러한 에이전트를 다음과 같이 만들 수 있다고 주장합니다:

  1. 운영 비용이 저렴해집니다.
  2. 더 빨라집니다.
  3. 똑똑함은 그대로 유지됩니다.

그들은 올바른 것들만 건너뛴다면, 이러한 건너뛰기가 AI 의 올바르게 생각하는 능력을 해치지 않는다는 것을 수학적으로 증명했습니다. 그들은 AI 가 작업 중간에 있는 "지루한" 부분에서 정확히 3~4 회 분량의 불필요한 수다를 자연스럽게 건너뛰는 법을 배웠음을 보여주었습니다.

간단히 말해, Agent-Omit은 AI 에이전트들이 과도하게 설명하는 것을 멈추고 지능을 잃지 않으면서 시간과 돈을 절약하도록 가르치는 학습 방법입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →