← 최신 논문
💬 NLP

Improved Generalized Planning with LLMs through Strategy Refinement and Reflection

이 논문은 전략을 의사코드로 생성하고 자동 디버깅 및 반성 단계를 도입하여 PDDL 일반화 계획의 정확성을 크게 향상시킨 LLM 기반 접근법을 제안합니다.

원저자: Katharina Stein, Nils Hodel, Daniel Fišer, Jörg Hoffmann, Michael Katz, Alexander Koller

게시일 2026-03-23
📖 3 분 읽기☕ 가벼운 읽기

원저자: Katharina Stein, Nils Hodel, Daniel Fišer, Jörg Hoffmann, Michael Katz, Alexander Koller

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 **"대규모 언어 모델 (LLM, 예: 챗지피티) 이 복잡한 문제 해결 능력을 어떻게 더 잘 발휘할 수 있게 했는지"**에 대한 연구입니다.

기존의 방식은 LLM 에게 "이 문제를 해결해줘"라고 하면, 매번 처음부터 끝까지 해결책을 찾아내게 했습니다. 하지만 이 방법은 문제가 커지거나 복잡해지면 LLM 이 혼란에 빠지거나, 매번 다시 계산해야 해서 비효율적이었습니다.

이 논문은 **"한 번만 잘 만든 '지침서 (전략)'를 쓰면, 어떤 크기의 문제든 해결할 수 있는 프로그램"**을 만드는 방법을 제안합니다. 이를 위해 세 가지 핵심적인 '요리 비법'을 추가했습니다.


🍳 비유: "요리 레시피 만들기 프로젝트"

이 연구의 핵심을 요리사 (LLM) 가 새로운 요리를 개발하는 과정에 비유해 설명해 드리겠습니다.

1. 문제: "요리사가 레시피를 잘못 이해하면?"

기존 연구 (Silver et al.) 는 요리사에게 "이 재료를 가지고 요리를 해줘"라고만 했습니다. 요리사는 머릿속으로 "아, 그럼 이렇게 하면 되겠네"라고 생각한 뒤 (전략), 바로 요리를 시작했습니다.

  • 문제점: 만약 요리사가 "소금 대신 설탕을 넣어야겠다"라고 전략을 잘못 세웠다면, 그 결과물은 맛이 없는 요리가 될 수밖에 없습니다. 그리고 요리가 다 된 뒤에 "맛이 없네요"라고 지적해도, 이미 요리는 망가진 상태입니다.

2. 이 논문의 해결책: "3 단계 개선법"

이 연구는 요리사가 실제 요리를 하기 전에, 가상 시뮬레이션을 통해 레시피를 완벽하게 다듬는 과정을 추가했습니다.

① 단계 1: '가상 레시피 (의사 코드)' 작성 및 검증

  • 무엇인가요? 요리사가 바로 요리를 시작하는 게 아니라, 먼저 **"어떻게 할지"를 글로 된 가상 레시피 (의사 코드)**로 적어봅니다.
  • 왜 좋나요? "소금 대신 설탕을 넣는다"는 실수가 실제 요리를 하기 전에 발견됩니다.
  • 비유: 요리사가 "우선 고기를 굽고, 그다음 채소를 넣고..."라고 적어놓은 초안 레시피를 먼저 검토하는 것입니다.

② 단계 2: '실수 반성 (Reflection)' 단계

  • 무엇인가요? 가상 레시피를 바탕으로 시뮬레이션 (테스트) 을 해봤는데, "고기가 타버렸다"는 결과가 나왔습니다. 이때 요리사에게 **"왜 타버렸을까? 어디가 잘못되었을까?"**라고 물어봅니다.
  • 왜 좋나요? 단순히 "다시 해봐"라고 말하는 게 아니라, **"아, 불을 너무 세게 했구나"**라고 원인을 파악하게 합니다.
  • 비유: 요리사가 실패한 요리를 보고 "왜 실패했을까?"라고 스스로에게 질문하며, "아, 고기를 굽는 시간이 2 배로 길었구나"라고 깨닫고 레시피를 수정하는 과정입니다.

③ 단계 3: '여러 가지 버전' 만들어서 고르기

  • 무엇인가요? 한 가지 레시피만 믿지 않고, 같은 레시피를 바탕으로 3~5 가지 다른 버전을 만들어봅니다. (예: "고기를 먼저 굽는 버전", "채소를 먼저 굽는 버전" 등)
  • 왜 좋나요? 여러 시도를 해보면, 가장 맛있는 요리 (가장 잘 작동하는 프로그램) 를 골라낼 확률이 높아집니다.
  • 비유: 같은 재료로 요리사 3 명이 서로 다른 레시피를 만들어보고, 심사위원이 가장 맛있는 것을 고르는 방식입니다.

🚀 이 방법이 가져온 결과

이론만 설명하면 어렵지만, 실제로 실험해 보니 놀라운 결과가 나왔습니다.

  • 성능 향상: 기존 방식보다 약 20~23% 더 많은 문제를 성공적으로 해결했습니다. (평균 82% 성공률 달성!)
  • 범용성: 한 번 만든 '완벽한 레시피 (프로그램)'는 문제 크기가 커져도 (예: 10 개의 물건을 나르는 것에서 1,000 개로 늘어도) 그대로 작동했습니다.
  • 비용 절감: 매번 문제를 풀 때마다 LLM 에게 돈을 지불할 필요가 없어졌습니다. 한 번만 '레시피'를 만들고 나면, 그 레시피를 무한정 사용할 수 있기 때문입니다.

💡 요약

이 논문은 **"LLM 이 문제를 풀 때, 바로 답을 내기보다 먼저 '생각의 과정 (전략)'을 글로 적어보고, 실수를 반성하며 고치고, 여러 번 시도해 보는 과정"**을 도입함으로써, AI 가 훨씬 더 똑똑하고 효율적으로 일할 수 있게 만들었습니다.

마치 훌륭한 요리사가 레시피를 완벽하게 다듬은 뒤, 어떤 손님이 와도 맛있는 요리를 만들어내는 것과 같습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →