← 최신 논문
💬 NLP

Self-Compacting Language Model Agents

이 논문은 모델 호출형 압축 도구와 경량 루브릭을 결합하여 에이전트 트레이스의 적응형 및 문맥 인식 요약을 가능하게 함으로써, 고정 간격 방식에 비해 수학 및 검색 벤치마크 성능을 향상시키는 동시에 토큰 비용을 크게 절감하는 학습 불필요 스캐폴딩 프레임워크인 SelfCompact를 소개한다.

원저자: Tianjian Li, Jingyu Zhang, William Jurayj, Xi Wang, Chuanyang Jin, Mehrdad Farajtabar, Eric Nalisnick, Daniel Khashabi

게시일 2026-06-23
📖 4 분 읽기☕ 가벼운 읽기

원저자: Tianjian Li, Jingyu Zhang, William Jurayj, Xi Wang, Chuanyang Jin, Mehrdad Farajtabar, Eric Nalisnick, Daniel Khashabi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 매우 어려운 퍼즐, 예를 들어 복잡한 수학 문제나 심도 있는 웹 검색을 풀려고 노력하고 있다고 상상해 보세요. 당신에게는 아주 유능한 조수(AI)가 있고, 그 조수는 이 문제를 해결하기 위해 노력하고 있습니다. 하지만 여기 함정이 있습니다. 이 조수는 단기 기억력이 매우 짧습니다. 한 번에 머릿속에 담을 수 있는 정보의 양이 제한되어 있습니다.

조수가 작업을 수행하면서 자신의 생각을 적고, 단서를 찾고, 메모를 남깁니다. 결국 이 "연습장(scratchpad)"이 너무 가득 차서 넘쳐흐르게 됩니다. 이때 조수는 새로운 메모를 위한 공간을 만들기 위해 오래된 메모를 버려야 합니다.

문제점: "부패하는" 연습장
이 현상을 **"컨텍스트 부패(Context Rot)"**라고 부릅니다.

조수가 이야기를 쓰고 있다고 가정해 봅시다. 만약 조수가 편집 없이 계속 글만 쓴다면, 이야기의 시작 부분이 기억 속에서 너무 멀리 밀려나 주인공의 이름조차 잊어버리게 될 것입니다. 혹은 더 심각하게는, 한 시간 전에 가졌던 막다른 길에 대한 아이디어에 너무 몰두한 나머지, 5분 전에 찾아냈던 결정적인 단서를 잊어버릴 수도 있습니다.

현재의 시스템들은 이를 해결하기 위해 **경직된 타이머(rigid timer)**를 사용합니다. 그들은 이렇게 말합니다. "매 10,000단어를 쓸 때마다 멈춰서 지금까지 쓴 내용을 요약하세요."

  • 결함: 이것은 마치 요리사가 단지 10분 동안 요리를 했다는 이유만으로 양파를 썰던 도중에 멈추라고 명령하는 것과 같습니다. 요리사는 완벽한 레시피의 단계를 수행 중일 수 있으며, 지금 요약을 강요하는 것은 방금 썬 반쪽짜리 양파와 방금 넣은 특정 향신료를 버리게 만드는 격입니다. 그들은 흐름을 놓치고 추측하며 시작해야 합니다.

해결책: SELFCOMPACT (자기 편집형 조수)
저자들은 SELFCOMPACT라는 새로운 시스템을 제안합니다. 타이머 대신, 그들은 조수에게 두 가지 새로운 도구를 제공합니다.

  1. "요약하기" 버튼: 조수는 스스로 자신의 메모를 요약할 수 있습니다.
  2. "루브릭(Rubric, 평가 기준/규칙)" (규칙집): 이것은 조수가 버튼을 누르기 전에 읽어야 하는 간단한 체크리스트입니다.

이 규칙집은 조수가 요약을 허용받기 전에 세 가지 질문을 던집니다:

  • 방금 특정 단계를 마쳤는가? (예: "이 하위 질문에 대한 답을 찾았다.")
  • 루프(반복)에 빠졌는가? (예: "똑같은 검색을 계속 반복하고 있다.")
  • 오래된 메모를 버려도 안전한가? (예: "이 부분에 필요한 모든 사실을 확보했다.")

비유: 탐정의 사건 파일
AI를 미스터리를 풀고 있는 탐정이라고 생각해 보세요.

  • 기존 방식 (고정 타이머): 매 시간마다 엄격한 감독관이 들어와서 말합니다. "멈추세요! 사건 파일을 요약하세요." 탐정은 두 단서를 연결하려는 찰나일 수 있습니다. 감독관은 요약을 강요하고, 탐정은 실수로 완성되지 않은 연결 고리를 버리게 됩니다. 탐정은 혼란에 빠져 추측을 시작합니다.
  • 새로운 방식 (SELFCOMPACT): 탐정에게는 규칙집이 있습니다. 그들은 특정 단서(예: "집사가 범인이다")를 성공적으로 해결했거나, 자신이 막다른 골목에 갇혔다는 것을 깨달았을 때만 요약을 합니다.
    • 만약 방금 단서를 해결했다면, 다음과 같이 요약합니다: "좋아, 집사가 범인이다. 이제 범행 동기를 찾아야 한다." 그들은 집사의 알리바이에 대한 지저치 않은 메모들을 버립니다. 이제 그것들은 확고한 사실이 되었기 때문입니다.
    • 만약 아직 범인이 누구인지 알아내는 중이라면, 규칙집은 이렇게 말합니다: "아직 요약하지 마세요! 당신은 아직 생각 중입니다."

이 논문이 발견한 점
연구진은 어려운 수학 문제와 복잡한 웹 검색을 사용하여 이 시스템을 7개의 서로 다른 AI 모델에 테스트했습니다.

  • 더 나은 결과: "규칙집"을 사용하는 AI(SELFCOMPACT)는 "타이머"를 사용하는 AI나 요약을 전혀 하지 않는 AI보다 더 많은 정답을 맞혔습니다. 수학 문제의 경우, 점수가 최대 18점까지 향상되었습니다.
  • 더 저렴함: AI가 정말 필요할 때만 요약을 하기 때문에, 필요하지 않은 상황에서 요약하느라 시간과 비용을 낭비하지 않습니다. 아무것도 하지 않았을 때와 비교하여 비용을 30%에서 70%까지 절감했습니다.
  • 학습 불필요: 가장 놀라운 점은 AI에게 이 방법을 가르칠 필요가 없었다는 것입니다. 그들은 단지 도구와 규칙집을 제공했을 뿐이며, AI는 스스로 이를 사용하는 법을 터득했습니다.

핵심 요약
이 논문은 AI 모델이 자신이 언제 "막혔는지" 또는 언제 "단계를 마쳤는지"를 파악하는 데 상당히 능숙하지만, 이를 깨닫기 위해서는 약간의 자극(규칙집)이 필요하다는 것을 보여줍니다. AI에게 스케줄에 따라 강제로 메모를 정리하게 하는 대신, 스스로 메모를 정리할 시점을 결정하게 함으로써 우리는 더 똑똑하고, 저렴하며, 신뢰할 수 있는 결과를 얻을 수 있습니다.

이 논문이 주장하지 않는 것

  • 이 방식이 의료 진단이나 임상적 용도로 작동한다고 주장하지 않습니다.
  • 이 방식이 모든 AI 문제를 영원히 해결할 것이라고 주장하지 않습니다.
  • AI가 인간적인 의미에서 "의식"이나 "자각"을 가지고 있다고 주장하는 것이 아닙니다. 그저 제공된 규칙을 매우 잘 따를 뿐입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →