← 최신 논문
💬 NLP

From Plan to Action: How Well Do Agents Follow the Plan?

이 논문은 SWE-agent 를 대상으로 한 대규모 분석을 통해, 명시적인 계획이 수행 성공에 필수적이지만 부실하거나 과도하게 세분화된 계획은 오히려 성능을 저하시키며, 모델이 내재된 워크플로우에 의존하기보다 주어진 계획을 유연하게 따르도록 학습시키는 연구의 필요성을 강조합니다.

원저자: Shuyang Liu, Saman Dehghan, Jatin Ganhotra, Martin Hirzel, Reyhaneh Jabbarvand

게시일 2026-04-15
📖 3 분 읽기☕ 가벼운 읽기

원저자: Shuyang Liu, Saman Dehghan, Jatin Ganhotra, Martin Hirzel, Reyhaneh Jabbarvand

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 **"AI 에이전트 (지능형 프로그램) 가 우리에게 준 '작업 지시서 (플랜)'를 얼마나 잘 따르는가?"**를 조사한 연구입니다.

마치 새로운 요리 레시피를 들고 있는 **요리사 (AI)**를 상상해 보세요. 연구자들은 이 요리사가 레시피대로 순서대로 재료를 다듬고, 볶고, 맛을 보는지, 아니면 제멋대로 요리하는지, 혹은 레시피를 아예 무시하고 기억나는 대로 요리하는지 분석했습니다.

이 연구의 핵심 내용을 쉬운 비유로 설명해 드리겠습니다.


1. 연구의 배경: "레시피를 줬는데, 요리사는 왜 제멋대로 할까?"

소프트웨어 버그를 고치는 AI 에이전트들에게 보통은 **"1. 버그 찾기 → 2. 버그 재현하기 → 3. 수정하기 → 4. 검증하기"**라는 명확한 단계 (플랜) 를 알려줍니다.
하지만 연구진은 의문이 들었습니다.

"AI 가 정말 이 레시피를 따르면서 문제를 해결하는 걸까? 아니면 레시피를 무시하고 훈련 때 배운 나쁜 습관대로 하거나, 시험 문제의 정답을 외워서 (데이터 오염) 문제를 푸는 걸까?"

2. 실험 방법: 17,000 개의 요리 기록을 분석

연구진은 4 가지 다른 AI 모델 (GPT-5, DeepSeek 등) 에게 16,991 개의 소프트웨어 버그 수정 작업을 시켰습니다. 이때 조건을 바꿔가며 실험했습니다.

  • 조건 1: 완벽한 레시피를 줌.
  • 조건 2: 레시피를 아예 안 줌.
  • 조건 3: 레시피에서 '재현'이나 '검증' 같은 중요한 단계를 뺌.
  • 조건 4: 레시피 순서를 뒤섞음 (예: 검증 없이 먼저 수정).
  • 조건 5: 중간중간 "레시피 기억나? 다시 봐!"라고 상기시킴.

3. 주요 발견 사항 (재미있는 비유들)

🍳 비유 1: 레시피를 안 줬을 때 (No Plan)

  • 현상: 레시피를 주지 않아도 AI 는 훈련받던 기억을 바탕으로 대략적인 순서 (찾기 → 고치기) 를 따릅니다.
  • 결과: 하지만 성공률은 떨어집니다. 레시피가 없으면 요리사가 "아, 이거 뭐지?" 하며 헤매거나, 너무 빨리 결론을 내서 실패하는 경우가 많았습니다.
  • 교훈: 레시피는 AI 가 길을 잃지 않게 하는 나침반 역할을 합니다.

🍳 비유 2: 나쁜 레시피는 아예 없는 것보다 나쁘다 (Bad Plan)

  • 현상: 레시피에서 중요한 단계 (예: '버그 재현') 를 빼거나, 순서를 엉망으로 섞어주면 AI 는 더 혼란스러워합니다.
  • 결과: 성공률이 '레시피 없음' 상태보다 더 낮아졌습니다.
  • 이유: AI 는 "아, 레시피에 이 단계가 없네? 그럼 안 해도 되겠구나"라고 생각하거나, 엉뚱한 순서로 진행하다가 실패합니다. 잘못된 지도는 아예 지도가 없는 것보다 더 위험할 수 있습니다.

🍳 비유 3: 레시피에 '추가 재료'를 넣으면? (Augmentation)

  • 현상: "수정하기 전에 레시피를 요약해라" 같은 새로운 단계를 추가했습니다.
  • 결과: AI 가 그 단계를 자연스럽게 할 수 있으면 괜찮지만, AI 가 그걸 필요로 하지 않는데 억지로 넣으면 오히려 성능이 떨어집니다.
  • 비유: 요리사가 "양념을 먼저 넣고 볶아"라고 배웠는데, 레시피에 "먼저 접시를 닦아"라는 단계를 추가하면, 요리사는 혼란을 겪고 요리가 망가집니다. AI 도 자신의 사고방식과 맞지 않는 지시를 받으면 오히려 엉망이 됩니다.

🍳 비유 4: 중간중간 "레시피 확인!" (Periodic Reminders)

  • 현상: 작업이 길어지면 AI 는 처음에 준 레시피를 잊어버리고 (기억 상실), 엉뚱한 길로 빠집니다.
  • 해결: 작업 중간중간 **"아직도 레시피대로 하고 있니?"**라고 상기시켜 주면, AI 는 다시 제자리로 돌아와 성공률이 높아졌습니다.
  • 비유: 긴 여행에서 길 안내를 잊어버린 운전자에게 중간중간 "다음 목적지는 여기야"라고 알려주면 길을 잃지 않습니다.

4. 결론: 무엇을 배웠을까?

  1. AI 는 레시피를 완벽하게 따르지 않습니다. AI 는 자신의 훈련된 습관 (내부 전략) 을 더 중요하게 생각합니다.
  2. 단순히 레시피를 적어주는 것만으로는 부족합니다. AI 가 레시피를 무시하거나, 레시피가 AI 의 습관과 충돌하면 실패합니다.
  3. 미래의 방향: 앞으로는 AI 에게 "이 일을 이렇게 해"라고 구체적인 레시피를 주입하는 것보다, **"어떤 상황에서도 주어진 계획을 잘 따라야 한다"는 사고방식 (학습)**을 가르치는 것이 더 중요합니다. 즉, 레시피를 외우게 하는 게 아니라, 레시피를 읽는 법을 가르쳐야 합니다.

요약

이 논문은 **"AI 에게 지시서를 주는 것만으로는 부족하며, AI 가 그 지시서를 어떻게 해석하고 따르는지 분석해야 진정한 성능 향상을 이룰 수 있다"**는 사실을 밝혀냈습니다. 마치 훌륭한 요리사가 되기 위해 레시피를 외우는 것보다, 레시피를 이해하고 상황에 맞게 유연하게 적용하는 법을 배우는 것이 중요하다는 것과 같습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →