← 최신 논문
💻 computer science

Knowing What to Solve Before How: Preplan Empowered LLM Mathematical Reasoning

본 논문은 추론 오버헤드를 추가하지 않으면서 여러 벤치마크에서 LLM 의 수학적 추론 성능을 크게 향상시키는 명확한 '사전 계획' 단계를 문제 유형과 도구를 계획 전에 명확히 하기 위해 도입한 새로운 프레임워크인 PPC(Preplan-Plan-CoT) 를 제안합니다.

원저자: Shaojie Wang, Liang Zhang

게시일 2026-05-29
📖 3 분 읽기☕ 가벼운 읽기

원저자: Shaojie Wang, Liang Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 까다로운 수학 문제, 마치 복잡한 퍼즐을 푸는 상황을 상상해 보세요. 과거에 대규모 언어 모델 (LLM) 은 이러한 문제들을 해결하기 위해 바로 작업에 착수했습니다. "좋아, 단계별로 계산해서 답을 찾아보자." 이것이 바로 사고의 연쇄 (Chain-of-Thought) 입니다.

하지만 문제가 더 어려워질수록, 이러한 "바로 작업 시작하기" 접근법은 모델이 길을 잃거나, 잘못된 방향으로 나아가거나, 퍼즐에 맞지 않는 방법들에 시간을 낭비하게 하는 결과를 초래했습니다.

이를 해결하기 위해 연구자들은 새로운 방법을 시도했습니다: 계획 후 해결 (Plan-then-Solve). 그들은 모델에게 "중지! 먼저 계획을 세운 다음 작업을 수행하라"고 지시했습니다. 이는 도움이 되었지만, 해당 논문은 여전히 빠진 조각이 있다고 주장합니다. 모델은 수학을 어떻게 풀지 계획하고 있었지만, 정작 문제가 무엇을 요구하는지 진정으로 이해하기 위해 잠시 멈추는 시간을 갖지 못했습니다.

다음은 이 논문의 해결책을 간단히 설명한 것입니다:

빠진 단계: "사전 계획 (Preplan)"

저자들은 사전 계획 (Preplan) 이라는 새로운 단계를 도입했습니다. 이를 경기가 시작되기 전에 운동선수와 대화하는 코치로 생각해보세요.

  • 옛 방식 (질문 → 계획 → 해결): 운동선수가 총소리를 듣고 즉시 달리기 시작하며, "빨리 달려서 왼쪽으로 꺾은 뒤 질주하자"라고 생각합니다. 그들은 빠르게 달릴 수 있지만, 잘못된 방향으로 달린다면 속도는 중요하지 않습니다.
  • 새로운 방식 (질문 → 사전 계획 → 계획 → 해결): 운동선수가 달리는 것을 생각하기 전에, 코치는 말합니다. "잠깐. 트랙을 봐. 가파른 언덕이 있는 원형 트랙이야. 바람이 우리를 향해 불고 있어. 우리는 출발 때 질주하는 것이 아니라 언덕을 위해 에너지를 아껴야 해."

이 "사전 계획"은 실제 달리기 (계산) 를 하지 않습니다. 단지 지형 (문제 유형) 을 분석하고, 올바른 기어 (도구/개념) 를 선택하며, 함정 (위험 요소) 을 찾아냅니다.

사전 계획 작성의 문제점

저자들은 모델에게 단순히 이 "사전 계획"을 작성하도록 요청했을 때, 모델이 종종 속임수를 썼다는 사실을 발견했습니다.

  1. 누출 (Leakage): 모델은 트랙을 분석하는 대신, 우연히 경기 단계들을 묘사하기 시작했습니다 ("먼저 10 미터를 달릴 것이다..."). 분석을 건너뛰고 바로 계획으로 넘어갔습니다.
  2. 스포일러 (Spoiler): 모델은 트랙을 분석했지만, 분석 내용 속에 수학 문제를 비밀리에 해결했습니다 ("언덕 높이가 50 미터이므로 시간을 계산할 것이다..."). 너무 일찍 작업을 수행함으로써 놀라움을 깨뜨렸습니다.

이를 해결하기 위해 팀은 엄격한 필터 (휘슬을 든 심판과 같은) 를 구축했습니다. 만약 "사전 계획"에 실제 수학이나 단계별 지시가 포함되어 있다면, 심판은 휘슬을 불고 답을 폐기하며 모델에게 다시 시도하게 했습니다. 이로써 사전 계획이 문제를 해결하는 것이 아니라, 오직 문제를 이해하는 것에만 집중하도록 보장했습니다.

"충실한" 보상 시스템

모델이 좋은 사전 계획을 작성하는 법을 배운 후, 연구자들은 모델이 실제로 그 계획에 순종하도록 해야 했습니다. 때때로 모델은 훌륭한 학습 계획을 작성하지만, 그것을 무시하고 다른 것을 공부하는 학생과 같았습니다.

이를 막기 위해 그들은 특별한 보상 시스템 (비디오 게임 점수 시스템과 같은) 을 만들었습니다:

  • 점수: 모델은 정답을 맞출 때 점수를 받습니다.
  • 충성도 보너스: 모델이 취하는 단계 (계획) 가 사전 계획에서 제시된 조언을 실제로 따를 때만 추가 점수를 받습니다.
  • 벌점: 모델이 필터를 속이는 것처럼 보이는 수학적 사전 계획을 작성하면 점수를 잃습니다.

이것은 모델이 사전 계획을 실제 지도처럼 대하도록 강제합니다. 지도가 "북쪽으로 가라"고 말하면, 모델은 "남쪽으로 가자"고 결정하고 운을 시험해 볼 수 없습니다.

결과

연구자들은 이 새로운 방법 (PPC 라고 함) 을 네 가지 다른 AI 모델과 다섯 가지 어려운 수학 경기에 테스트했습니다.

  • 향상된 정확도: 새로운 방법은 특히 가장 어려운 문제들에서 이전의 어떤 방법보다 더 자주 정답을 얻었습니다.
  • 더 빠른 사고: 놀랍게도, 모델이 추가적인 "사전 계획" 섹션을 작성해야 했음에도 불구하고, 문제를 해결하는 데 사용된 전체 단어 수는 오히려 줄었습니다. 그 이유는 원형으로 뛰거나 잘못된 방법을 시도하는 시간을 낭비하지 않았기 때문입니다. 처음부터 어디로 가야 할지 정확히 알았기 때문입니다.

요약

이 논문은 어려운 문제를 해결하려면 "어떻게"에 바로 뛰어들지 말아야 한다고 주장합니다. 먼저 "무엇"을 이해하기 위해 잠시 멈추어야 합니다. AI 가 계획을 세우기 전에 문제를 멈추고, 문제 유형을 분석하며, 함정을 식별하도록 강제함으로써, AI 는 훨씬 더 똑똑하고 효율적인 문제 해결사가 됩니다. 이는 허둥지둥 달리는 주자와 전략적인 항해자 사이의 차이와 같습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →