Planning with Transformers: Chain of Computation and Structured Context Windows
이 논문은 트랜스포머 기반 언어 모델을 구조화된 컨텍스트 윈도우(Structured Context Window, SCW)와 함께 반복적인 루프로 통합하여 이론적 튜링 완전성과 경험적 계획 수행 능력 사이의 간극을 메움으로써, 소규모 모델이 특화된 컨텍스트 관리 및 산술 지원을 통해 BlocksWorld나 Tower of Hanoi와 같은 복잡한 계획 과제에서 완벽에 가까운 성공을 달성할 수 있게 하는 Chain of Computation (COC) 프레임워크를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 조금은 건망증이 있는 천재 로봇에게 복잡한 퍼즐을 푸는 법을 가르치려 한다고 상상해 보세요. 당신은 로봇에게 아주 똑똑한 두뇌(거대 언어 모델, 즉 LLM)를 주고 그냥 "알아서 해결해 봐"라고 말하면 성공할 것이라고 생각할지도 모릅니다. 하지만 인공지면의 세계에서 이러한 모델들은 놀라운 패턴 매칭 능력을 갖추고 있지만, 때로는 긴 다단계 여정을 계획하라는 요청을 받으면 어려움을 겪곤 합니다. 이들은 이야기를 쓰거나 대화를 나누는 데는 뛰어나지만, 블록을 옮기거나 하노이의 탑과 같은 엄격한 논리 퍼즐을 다룰 때는 규칙이나 방금 수행한 단계를 잊어버리며 길을 잃기 일쑤입니다. 이는 매우 중요한 문제입니다. 왜냐하면 우리가 AI가 창고를 정리하거나 로봇을 조종하는 것과 같은 현실 세계의 작업을 돕기를 원한다면, AI가 어처구니없는 실수를 하지 않고 앞을 내다보며 계획할 수 있어야 하기 때문입니다. 연구자들이 던져온 핵심적인 질문은 이것입니다: AI가 실제로 계획을 세우기에 너무 멍청한 것인가, 아니면 단지 적절하지 않은 도구를 사용하고 있는 것인가?
이 논문은 AI가 반드시 멍청한 것이 아니라, 한 번에 너무 많은 일을 하려고 노력하고 있을 뿐이라고 제안합니다. 저자인 에산 푸투히(Ehsan Futuhi)와 네이선 R. 스터티번트(Nathan R. Sturtevant)는 "계산의 사슬(Chain of Computation, COC)"이라는 새로운 사고방식을 제안합니다. AI에게 전체 해결책을 한 번에 거대한 숨을 몰아쉬듯 써 내려가라고 요구하는 대신(이는 마치 사람에게 책 한 권을 한 번에 통째로 암기하라고 하는 것과 같습니다), 그들은 AI를 '구조적 컨텍스트 윈도우(Structured Context Window, SCW)'라는 특별한 "메모장"이 있는 루프 안에 넣었습니다. 이것은 마치 로봇에게 붙여진 포스트잇 메모지와 같습니다. 전체 계획을 기억하려고 애쓰는 대신, 로봇은 메모장의 지시 사항 하나를 보고, 그 작은 단계 하나를 수행한 다음, 다음 지시 사항을 메모장에 쓰고, 그다음 지시 사항이 어디에 있는지 가리킵니다. 이것은 로봇이 리더인 동시에 팔로워가 되어 끊임없이 자신의 지도를 업데이트하는 "따라하기" 게임과 같습니다.
연구자들은 이 아이디어를 세 가지 고전 퍼즐인 하노이의 탑(원판을 막대 사이로 옮기기), 블록스 월드(블록 쌓기), 팬케이크 퍼즐(팬케이크를 뒤집어 정렬하기)에 대해 테스트했습니다. 그들은 AI에게 이 "메모장" 시스템을 제공했을 때, 처음부터 학습된 비교적 작은 규모의 AI 모델조차도 놀라운 정확도로 퍼즐을 해결할 수 있다는 것을 발견했습니다. 블록과 팬케이크 퍼즐에서는 99.89% 이상의 성공률을 보였습니다. 마법의 비결은 AI가 전체 역사를 기억할 필요가 없었다는 점입니다. 그저 현재의 지시 사항을 읽고, 다음 단계를 결정하기 위해 계산을 수행한 다음, 다음에 어디를 볼지 적기만 하면 되었습니다.
하지만 이 논문은 특정한 약점도 발견했습니다. 퍼즐이 매우 커질 때(예를 들어 많은 원판이 있는 하노이의 탑의 경우), AI는 계획을 잊어버려서가 아니라 다른 이유로 실수를 하기 시작했습니다. 알고 보니 AI는 단순한 수학 계산에서 발목이 잡혔습니다. 로봇이 다음 단계를 결정하기 위해 "원판 7번 빼기 1"을 계산해야 할 때, 특히 본 적 없는 특정 숫자를 접하게 되면 숫자를 틀리곤 했습니다. 저자들은 만약 AI를 도와 수학을 대신 해주거나, 복잡한 수학이 필요 없는 특별한 "스택(stack)" 시스템을 사용한다면, AI가 가장 어려운 버전의 하노이의 탑(원판 20개까지)도 완벽하게 해결할 수 있다는 것을 보여주었습니다. 이는 AI의 계획하는 두뇌는 사실 꽤 강력하지만, 잠재력을 최대한 발휘하기 위해서는 산술과 메모리 관리에 약간의 도움이 필요하다는 것을 시사합니다.
큰 그림: 왜 AI는 계획 세우기에 어려움을 겪는가
이 논문이 왜 중요한지 이해하려면, 먼저 이 이야기의 두 주인공인 **거대 언어 모델(LLM)**과 **계획(Planning)**을 이해해야 합니다.
LLM은 에세이를 쓰거나 코드를 작성하는 것과 같이 당신이 들어봤을 법한 초지능형 AI 두뇌입니다. 이들은 방대한 양의 텍스트로 학습되어 문장에서 다음에 올 단어를 예측하는 법을 배웁니다. 엄청나게 많은 글을 읽었기 때문에 패턴을 인식하는 데 매우 뛰어납니다. 만약 당신이 용에 관한 이야기를 써달라고 하면, 그들은 수천 개의 용 이야기를 보았기 때문에 해낼 수 있습니다. 그러나 "계획"은 다릅니다. 계획은 미로를 풀거나 여행을 계획하는 것과 같습니다. 몇 단계 앞을 생각해야 하고, 내가 무엇을 했는지 기억해야 하며, 규칙을 어기지 않도록 확인해야 합니다.
오랫동안 과학자들은 LLM이 대화는 잘하지만 계획에는 형편없다는 것을 발견했습니다. 만약 당신이 LLM에게 블록 더미를 떨어뜨리지 않고 한 곳에서 다른 곳으로 옮기라고 요청하면, 규칙을 어기거나 단계를 누락한 계획을 내놓는 경우가 많습니다. 이는 AI가 현실 세계에서 유용하게 쓰이길 원하는 우리에게 매우 답답한 일입니다. 왜냐하면 현실에서는 일들이 올바른 순서대로 수행되어야 하기 때문입니다.
LLM이 사실 "튜링 완전(Turing-complete)"하다는 이론이 있습니다. 이는 컴퓨터가 할 수 있는 모든 계산, 즉 복잡한 계획 세우기까지 포함하여 수행할 수 있어야 한다는 멋진 수학적 표현입니다. 하지만 실제로는 실패하는 것처럼 보입니다. 이 논문이 다루는 큰 질문은 이것입니다: 왜 그럴까요? AI의 두뇌가 근본적으로 계획을 세우기에 망가진 것일까요, 아니면 단지 잘못된 방식으로 과업을 수행하도록 요청받고 있는 것일까요?
문제점: "원샷(One-Shot)"의 함정
당신이 루빅스 큐브를 맞추려 한다고 상상해 보세요. 만약 누군가 당신에게 중간에 멈춰서 생각하지 말고, 단 한 문장으로 전체 해결 과정(20~30개의 움직임 시퀀스)을 적으라고 요구한다면, 당신은 틀릴 수도 있습니다. 중간 단계를 잊어버리거나 색상을 섞어버릴 수도 있습니다.
이것이 우리가 표준적인 LLM에게 계획을 세우라고 요청할 때 발생하는 현상입니다. 우리는 보통 "이 퍼즐을 풀어봐"라는 프롬프트를 주고, AI는 한 번에 전체 움직임 목록을 생성하려고 시도합니다. 논문은 이를 "단일 패스, 전체 컨텍스트(Single-Pass, Full Context)"라고 부릅니다. 문제는 퍼즐이 커질수록 움직임의 목록도 길어진다는 것입니다. AI는 그 모든 움직임을 자신의 "머릿속"(컨텍스트 윈도우)에 동시에 담아두어야 합니다. 목록이 늘어남에 따라 AI는 길을 잃기 시작합니다. 이는 친구와 대화를 나누면서 동시에 장보기 목록, 전화번호, 그리고 수학 문제까지 한꺼번에 기억하려고 애쓰는 것과 같습니다. 결국 AI는 혼란에 빠지고, 초기에 실수를 저지르며, 전체 계획이 무너집니다.
저자들은 AI가 계획을 못 하는 것이 아니라, 거대하고 정리되지 않은 지시 사항 목록을 머릿속에 담아두는 데 서툰 것이라고 주장합니다.
해결책: "계산의 사슬 (Chain of Computation, COC)"
이를 해결하기 위해 저자들은 **계산의 사슬(COC)**이라는 새로운 시스템을 구축했습니다. AI에게 한 번에 전체 계획을 쓰라고 하는 대신, 그들을 루프(loop) 안에 넣었습니다.
AI가 공장에서 일하는 로봇이라고 상상해 보세요. 로봇에게 공장 전체의 거대한 설계도를 주는 대신, **구조적 컨텍스트 윈도우(SCW)**를 제공합니다. SCW를 옛날 컴퓨터에서 사용하던 긴 종이 테이프나 아주 긴 포스트잇 메모지라고 생각하세요.
다음은 이 새로운 시스템을 사용하는 로봇의 작동 방식입니다:
- 읽기: 로봇은 테이프의 맨 첫 번째 지시 사항을 읽습니다.
- 생각하기: 그 하나의 지시 사항을 바탕으로 다음에 무엇을 할지 결정합니다.
- 쓰기: 테이프의 끝에 새로운 지시 사항을 적습니다.
- 가리키기: "이것 바로 다음의 지시 사항을 보시오"라고 말하는 '포인터'(화살표 같은 것)를 적습니다.
- 반복: 로봇은 새로운 지시 사항으로 눈을 옮겨 다시 과정을 반복합니다.
로봇은 전체 계획을 기억할 필요가 없습니다. 오직 현재의 지시 사항에만 집중하고 다음 단계가 무엇인지 결정하기만 하면 됩니다. 이는 로봇이 끊임없이 자신을 위한 지도를 업데이트하는 "따라하기" 게임과 같습니다.
논문은 포인터라는 특별한 도구를 소개합니다. 이 포인터는 로봇에게 다음에 어느 부분의 테이프를 봐야 할지 정확히 알려줍니다. 이것은 매우 중요한데, 왜냐하면 AI의 "주의력(attention)"이 방대한 텍스트의 바다에 빠지는 대신, 작고 관리 가능한 정보에 집중할 수 있게 해주기 때문입니다.
실험: 로봇 테스트하기
저자들은 이 새로운 로봇이 계획을 더 잘 세울 수 있는지 확인하기 위해 세 가지 유명한 퍼즐로 테스트를 진행했습니다.
1. 블록스 월드 (BlocksWorld)
이 퍼즐은 여러 블록이 테이블 위에 쌓여 있고, 이를 특정 모양으로 재배치하는 것입니다. 당신은 스택의 맨 위 블록만 움직일 수 있습니다.
- 결과: 로봇은 이 작업에 매우 뛰어났습니다. 퍼즐이 매우 복잡해졌을 때(블록 40개)도 로봇은 100%의 성공률로 완벽하게 해결했습니다. 로봇은 "모두 해체한 다음 다시 쌓는다"는 전략을 배웠으며, 한 번도 본 적 없는 새로운 블록 배치에도 이를 적용할 수 있었습니다.
2. 팬케이크 퍼즐 (Pancake Puzzle)
이 퍼즐은 다양한 크기의 팬케이크가 쌓여 있는 형태입니다. 당신은 크기순으로 정렬하기 위해 스택의 윗부분만을 뒤집을 수 있습니다.
- 결과: 블록스 월드와 마찬가지로 로봇은 놀라운 성과를 보였습니다. 40개의 팬케이크가 있는 경우에도 거의 모든 퍼즐을 해결했습니다. 유일한 "실패"는 팬케이크가 이미 정렬되었을 때도 굳이 뒤집으려고 시도한 경우였지만, 뒤집었다가 다시 돌려놓는 것이 최종 결과에 해를 끼치지 않았으므로 결국 목표에 도달했습니다. 이는 로봇이 퍼즐의 핵심 논리를 학습했음을 보여주었습니다.
3. 하노이의 탑 (Tower of Hanoi, TOH)
이것은 가장 어려운 퍼즐입니다. 세 개의 막대가 있고 다양한 크기의 원판이 쌓여 있습니다. 전체 스택을 한 막대에서 다른 막대로 옮겨야 하지만, 큰 원판 위에 작은 원판을 올릴 수는 없습니다. 필요한 이동 횟수는 기하급수적으로 늘어납 (매우 빠르게 증가합니다).
- 결과: 여기서 로봇은 잘했지만 완벽하지는 않았습니다. 원판이 적을 때(최대 15개)는 약 92%의 퍼즐을 해결했습니다. 하지만 퍼즐이 어려워질수록 실수를 하기 시작했습니다.
미스터리: 로봇은 왜 실패했는가?
저자들은 단순히 "성공했다"에서 멈추지 않았습니다. 그들은 왜 가장 어려운 퍼즐에서 실패했는지 알고 싶었습니다. 그들은 하노이의 탑에서 로봇이 저지른 실수를 면밀히 조사했습니다.
그들은 로봇이 계획을 이해하지 못해서 실패한 것이 아님을 발견했습니다. 로봇은 어떤 원판을 어디로 옮겨야 하는지 정확히 알고 있었습니다. 문제는 바로 수학이었습니다.
계획을 추적하기 위해 로봇은 "원판이 7개 있다면, 먼저 상위 6개를 옮겨야 한다"와 같은 간단한 산술을 해야 했습니다. "7 빼기 1"을 계산하여 "6"을 얻어야 했습니다. 논문은 로봇이 본 적 없는 숫자(매우 큰 원판 번호 등)를 접했을 때 수학 계산을 틀린다는 것을 발견했습니다. 로봇은 "7 빼기 1"을 "5"나 "8"로 계산할 수 있었고, 그러면 전체 계획이 궤도를 벗어나게 됩니다.
이것은 엄청난 발견이었습니다. 이는 로봇의 "계획하는 두뇌"는 사실 완벽하게 작동하고 있었다는 것을 의미합니다. 실패는 논리의 문제가 아니라 계산기의 문제였습니다.
해결책: 수학과 메모리 돕기
이를 증명하기 위해 저자들은 두 가지 다른 해결책을 시도했습니다.
해결책 1: 기호 수학 (Symbolic Math)
그들은 로봇에게 스스로 수학을 하지 말라고 명령했습니다. 대신 "기호적" 지시 사항을 주었습니다. 예를 들어, "원판 6번을 옮겨라"라고 하는 대신, 로로봇은 "원판 (n-1)을 옮겨라"라고 말합니다. 그러면 별도의 간단한 컴퓨터 프로그램(산술 모듈)이 실제 수학을 수행하고 로봇에게 실제 숫자를 알려줍니다.
- 결과: 이렇게 했을 때 로봇의 성공률이 올라갔습니다. 로봇은 숫자를 틀릴 걱정을 할 필요가 없었기에 퍼즐을 완벽하게 해결할 수 있었습니다. 이는 계획 부분이 정상이었으며, 수학이 병목 구간이었음을 입증했습니다.
해결책 2: 스택 (PDA)
저자들은 하노이의 탑의 경우, 로봇이 테이프를 돌아다니며 다른 지시 사항을 찾을 필요조차 없다는 것을 깨달았습니다. 로봇은 단지 스택의 맨 위를 보고 새로운 지시 사항을 맨 위에 추가하기만 하면 됩니다. 이것은 컴퓨터 과학에서 말하는 "스택(Stack)"이 작동하는 방식(Last-In, First-Out)과 정확히 일치합니다.
그들은 로봇의 임무를 **결정적 푸시다운 오토마타(Deterministic Pushdown Automaton, PDA)**처럼 재구성했습니다. 이는 스택만을 사용하는 기계라는 뜻의 전문 용어입니다.
- 결과: 이 새로운 설정에서 로봇은 20개의 원판(100만 번 이상의 이동이 필요한 수준)까지도 **100%**의 성공률로 하노이의 탑을 해결했습니다. 로봇은 다음 지시 사항을 찾기 위해 복잡한 수학을 할 필요가 없었습니다. 스택이 자동으로 이를 처리해주었기 때문입니다.
이것이 의미하는 바
이 논문은 거대 언어 모델이 본질적으로 계획 세우기에 서툰 것이 아니라는 점을 시사합니다. 문제는 우리가 AI에게 너무 많은 것을 한꺼번에 요구했다는 것입니다. 전체 계획을 기억하고, 수학을 하고, 다음 단계를 결정하는 일을 거대한 텍스트의 벽을 바라보며 동시에 수행하도록 한 것입니다.
작업을 작은 반복 단계로 나누고, AI에게 "메모장"(SCW)이라는 도구를 제공함으로써, AI는 매우 효과적으로 계획을 세울 수 있습니다. 이 논문은 처음부터 학습된 작은 규모의 AI 모델이라도 적절한 도구만 주어진다면 복잡한 계획 전략을 배울 수 있다는 것을 보여줍니다.
핵심적인 교훈은 AI의 "추론" 능력은 강력하지만, "산술"과 "메모리 관리"에는 도움이 필요하다는 것입니다. 계획 논리와 수학을 분리하고, AI에게 단계를 관리할 수 있는 구조적인 방법을 제공한다면, AI는 이전에 너무 어렵다고 여겨졌던 문제들도 해결할 수 있습니다.
저자들은 자신들이 큰 진전을 이루었지만, 아직 배울 것이 더 많다고 결론지었습니다. 그들은 "포인터" 시스템이 AI를 어떻게 돕는지, 그리고 이 방법이 향로의 더 복잡한 현실 세계 계획 작업에 어떻게 사용될 수 있을지를 조사하고자 합니다. 하지만 현재로서는, 구조를 갖춘다면 AI가 매우 훌륭한 플래너가 될 수 있음을 보여주었습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.