← 최신 논문
🤖 machine learning

Breaking the Capability Ceiling of LLM Post-Training by Reintroducing Markov States

이 논문은 LLM 후속 학습에서 '역사 (history) 를 상태 (state) 로 간주'하는 기존 접근법의 한계를 지적하고, 명시적인 마르코프 상태를 도입함으로써 샘플 복잡도를 줄이고 복잡한 논리 퍼즐 등에서의 성능 한계를 돌파할 수 있음을 이론적·실증적으로 증명합니다.

원저자: Yurun Yuan, Tengyang Xie

게시일 2026-03-23
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yurun Yuan, Tengyang Xie

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🎒 1. 문제: "무거운 가방"을 들고 가는 AI

지금까지 AI 를 더 똑똑하게 만들기 위해 사용하는 방법 (강화 학습) 은 마치 매번 과거의 모든 기억을 가방에 넣고 다니는 사람과 같습니다.

  • 기존 방식 (Action-Sequence): AI 가 문제를 풀 때, "내가 1 분 전에 무엇을 했는지, 2 분 전에 무엇을 했는지, 3 분 전에 무엇을 했는지..." 모든 과거의 행동 기록을 입력으로 받습니다.
  • 문제점: 이 가방은 시간이 지날수록 너무 무거워집니다. AI 는 "지금 내가 어디에 있는지 (현재 상황)"를 파악하는 대신, "과거에 무엇을 했는지"를 기억하는 데 에너지를 다 써버립니다.
  • 결과: AI 는 과거의 패턴을 조금 더 잘 반복할 뿐, **진짜 새로운 아이디어를 찾아내거나 복잡한 문제를 해결하는 데 한계 (Capability Ceiling)**에 부딪힙니다. 마치 무거운 가방을 멘 채로 달리기 경주를 하는 것과 같아서, 아무리 훈련해도 속도가 나지 않습니다.

🔑 2. 해법: "현재 상황"만 기억하는 마법

이 논문은 **"과거의 모든 기록은 버리고, 지금 이 순간의 상태 (Markov State) 만 기억하라"**고 제안합니다.

  • 새로운 방식 (Markov State): AI 는 "내가 과거에 무엇을 했는지"가 아니라, **"지금 이 순간의 보드판 상태는 어떻게 생겼는지?"**만 봅니다.
  • 비유: 체스나 바둑을 칠 때, "내가 100 수 전에 말을 어디에 뒀는지"를 다 기억할 필요가 없습니다. 중요한 건 **"지금 보드판에 말이 어떻게 놓여 있는지"**입니다. 이 '현재의 모습'이 모든 정보를 담고 있기 때문입니다.
  • 효과: AI 는 불필요한 과거의 잡음 (노이즈) 을 버리고, 현재 상황에 집중하게 됩니다. 가방이 가벼워지니, AI 는 훨씬 더 빠르게 배우고, 더 복잡한 미로를 헤쳐 나갈 수 있게 됩니다.

🧩 3. 실험: 퍼즐을 푸는 두 명의 학생

연구자들은 이 아이디어를 검증하기 위해 수두 (Sudoku), 소코반 (Sokoban), 푸토시키 (Futoshiki) 같은 논리 퍼즐 게임을 만들었습니다.

  • 학생 A (기존 방식): 과거의 모든 행동을 기억하며 문제를 풉니다.
    • 결과: 간단한 문제는 풀지만, 문제가 조금만 복잡해지거나 길어지면 완전히 멈춰버립니다. (성공률 0% 에 수렴)
  • 학생 B (새로운 방식 - Markov): 현재 보드판 상태만 보고 문제를 풉니다.
    • 결과: 학생 A 가 포기한 어려운 문제도 훌륭하게 해결합니다. 특히 훈련 때 보지 못했던 더 어려운 문제 (OOD) 에도 잘 적응합니다.

📉 4. 왜 이렇게 효과가 좋은가요? (데이터 효율성)

이 방식은 배우는 데 필요한 데이터 양도 훨씬 적게 만듭니다.

  • 기존 방식: 모든 가능한 과거의 행동 조합을 다 경험해봐야 하므로, 데이터가 지수함수적으로 (엄청나게) 많이 필요합니다. (예: 10 단계 퍼즐을 풀려면 100 만 번 이상 시도해야 함)
  • 새로운 방식: 현재 상태만 보면 되므로, 데이터 양이 선형적으로 (적게) 증가합니다. (예: 10 단계 퍼즐을 풀면 10 번 정도만 시도해도 됨)
  • 비유: 미로에서 길을 찾을 때, "내가 어디를 잘못 갔는지"를 다 기록하며 헤매는 것보다, **"지금 내가 서 있는 위치"**를 보고 다음 길을 찾는 것이 훨씬 빠르고 효율적입니다.

💡 5. 결론: AI 의 미래를 여는 열쇠

이 논문은 AI 가 진정한 "지능"을 갖추기 위해서는 과거의 기록에 매몰되지 않고, 현재 상황을 명확하게 파악하는 능력이 필요하다고 말합니다.

  • 코드 작성: 과거의 수정 기록이 아니라, 현재 코드와 로그를 보고 다음 행동을 결정합니다.
  • 수학 증명: 과거의 추론 과정이 아니라, 현재 증명된 정리들을 바탕으로 다음 단계를 밟습니다.

한 줄 요약:

"AI 가 더 똑똑해지려면, 과거의 무거운 가방을 내려놓고 '지금 이 순간'에 집중하는 법을 배워야 합니다."

이 연구는 AI 가 단순한 패턴 반복을 넘어, 진짜로 새로운 것을 발견하고 복잡한 문제를 해결하는 **진정한 인공지능 (AGI)**으로 발전하는 데 중요한 이정표가 될 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →