← 최신 논문
🤖 AI

Why Retrying Fails: Context Contamination in LLM Agent Pipelines

본 논문은 실패한 LLM 에이전트 시도가 오류율을 증가시켜 후속 재시도를 어떻게 오염시키는지를 정량화하기 위해 컨텍스트 오염 재시작 모델 (CCRM) 을 도입하고, 성공 확률 및 최적 파이프라인 깊이에 대한 이론적 상한을 유도하여 실제 SWE-bench 데이터를 통해 실증적으로 검증한다.

원저자: Zhanfu Yang

게시일 2026-05-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Zhanfu Yang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

다음은 "왜 재시도가 실패하는가: LLM 에이전트 파이프라인에서의 컨텍스트 오염"이라는 논문을 쉬운 언어와 일상적인 비유를 사용하여 설명한 것입니다.

핵심 문제: "나쁜 기억" 효과

복잡한 퍼즐을 풀거나, 예를 들어 고장 난 코드 조각을 수리하려고 한다고 상상해 보세요. AI 어시스턴트에게 도움을 요청합니다.

  • 시도 1: AI 가 수리하려 하지만 실수를 합니다.
  • 시도 2: AI 에게 "그건 작동하지 않았으니 다시 시도해 봐"라고 말합니다.

완벽한 세상에서는 AI 가 실수를 잊고 처음부터 다시 시작할 것입니다. 하지만 현실에서는 AI 가 실수를 기억합니다. 실패한 시도는 여전히 그 "대화 기록"(컨텍스트 윈도우) 안에 남아 있습니다. AI 가 자신의 이전 실수를 보게 되므로 혼란을 겪거나 루프에 갇히게 되어, 첫 번째 시도보다 두 번째 시도에서 실패할 가능성이 더 높아집니다.

저자들은 이를 **"컨텍스트 오염"**이라고 부릅니다. 이는 진흙 투성이 바닥을 닦으려 하지만, 닦을 때마다 조금 더 많은 진흙을 남겨 다음 닦기 작업을 더 어렵게 만드는 것과 같습니다.

해결책: 새로운 수학 모델 (CCRM)

연구자들은 이러한 현상이 정확히 어떻게 일어나고 어떻게 해결할 수 있는지 설명하기 위해 **컨텍스트 오염 재시작 모델 (Context-Contaminated Restart Model, CCRM)**이라는 새로운 수학 모델을 개발했습니다. 그들은 AI 의 재시도 과정을 특정 규칙이 있는 게임처럼 취급합니다.

  1. 파이프라인: AI 는 한 번에 코드를 "수리"하는 것이 아니라, 작업을 작은 단계들의 사슬 (파이프라인) 로 나눕니다. 어떤 단계 하나라도 실패하면 전체 시도가 실패합니다.
  2. 오염:
    • 시도 1 (깨끗함): AI 는 실패할 표준 확률을 가집니다 (예를 들어 10% 라고 가정해 봅시다).
    • 시도 2 이상 (오염됨): 시도 1 이 실패하면 AI 는 이제 "오염된" 상태가 됩니다. 이전 실수의 짐을 안고 있기 때문에 실패할 확률이 급격히 상승합니다 (아마도 30% 이상).

다섯 가지 주요 발견

이 논문은 이 "나쁜 기억" 효과에 대해 다섯 가지 주요 사실을 증명합니다.

1. 성공을 위한 정확한 공식
연구자들은 AI 가 특정 횟수 내에서 마침내 성공할 확률을 예측하는 정밀한 수학 공식을 찾아냈습니다.

  • 비유: 주사위를 굴려 "6"이 나올 때까지 몇 번이나 굴려야 하는지 정확히 아는 것과 같지만, 실패할 때마다 주사위가 조금씩 당신에게 불리하게 "조작된"(무게가 실린) 상태가 된다는 것을 알고 있는 것과 같습니다.

2. "연쇄" 오버헤드
오염 때문에, AI 가 깨끗한 기억을 가졌을 때보다 성공하기 위해 훨씬 더 많은 시도가 필요합니다.

  • 비유: 사다리를 오르는 상황을 생각해 보세요. 깨끗한 재시작은 한 발짝 아래로 내려와 처음부터 다시 시작하는 것과 같습니다. 하지만 오염된 재시작은 같은 사다리를 오르려 하지만, 미끄러질 때마다 발판이 미끄러워지고 잡기가 더 어려워지는 것과 같습니다. 결국 필요한 것보다 훨씬 더 많이 미끄러지게 됩니다.

3. 작업 크기의 최적점
논문은 이렇게 질문합니다: "우리가 '시도' (컴퓨팅 파워) 의 제한된 예산을 가지고 있다면, 작업을 몇 단계로 나누어야 할까요?"

  • 발견: 완벽한 중간 지점이 존재합니다. 작업이 너무 길면 (단계가 너무 많으면), 한 번의 실수가 전체를 망칩니다. 너무 짧으면 재시작을 너무 자주 하여 시간을 낭비합니다. 수학은 성공을 극대화하기 위한 작업의 정확한 "최적점" 길이를 알려줍니다.

4. 이론적 한계
저자들은 전략이 얼마나 똑똑하든, 이 오염으로 인해 설정된 한계를 극복할 수 없음을 증명했습니다. 메모리를 지우지 않는 한, 그들의 모델이 예측하는 것보다 적은 시도 횟수로 성공할 수는 없습니다.

5. "초기화"의 힘
가장 실용적인 발견은 다음과 같습니다: AI 가 다시 시도하기 전에 AI 의 메모리를 지우면 훨씬 더 잘 작동합니다.

  • 비유: 교통 체증에 갇혔을 때, 같은 체증을 다시 통과하려 해도 도움이 되지 않습니다. 하지만 다른 경로를 택하면 (컨텍스트를 지우면) 교통 체증을 완전히 피할 수 있습니다. 수학은 재시도 전에 컨텍스트를 지우는 것이 항상 최선의 선택임을 보여줍니다.

현실 세계 증명: "SWE-bench" 테스트

연구자들은 AI 가 소프트웨어 버그를 수정하는 벤치마크인 SWE-bench의 실제 데이터를 사용하여 이론을 테스트했습니다.

  • 구 방식 (IID 모델): 이전 이론들은 AI 가 한 번 실패하면 다음 번에도 첫 번째 시도와 동일한 확률로 실패할 것이라고 가정했습니다 (공정한 동전 던지기처럼).
  • 현실: 이전 이론들은 지나치게 낙관적이었습니다. 그들은 AI 가 세 번의 시도 후 약 **98.6%**의 성공률을 보일 것이라고 예측했습니다. 하지만 실제로는 **81.2%**만 성공했습니다.
  • 신 방식 (CCRM): 새로운 모델은 거의 완벽한 정확도로 (오류 0.1% 미만) 성공률을 예측했습니다.

결론

AI 가 작업을 실패하고 "다시 시도해 보라"고 요청할 때, AI 는 자신의 이전 실수에 시달려 종종 다시 실패합니다.

  • 맹목적으로 재시도하지 마십시오.
  • 컨텍스트를 지우십시오. 이 논문은 재시도 전에 AI 의 메모리를 초기화하는 것이 컴퓨팅 파워를 절약하고 더 나은 결과를 얻는 데 가장 효과적인 단일 방법임을 증명합니다.

저자들은 또한 AI 가 초기 실수를 적게 하도록 훈련할 수 있다면, "오염 연쇄"가 시작되지 않도록 막을 수 있으므로 그 이점이 매우 크다고 지적합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →