Canvas-of-Thought: Grounding Reasoning via Mutable Structured States
이 논문은 기존 Chain-of-Thought(CoT) 방식의 선형적이고 수정 불가능한 한계를 극복하기 위해, HTML Canvas를 외부 추론 기질로 활용하여 원자적 CRUD 연산과 시각적 피드백 루프를 통해 상태를 직접 수정하고 정교화할 수 있는 새로운 멀티모달 추론 패러다임인 'Canvas-of-Thought(Canvas-CoT)'를 제안합니다.
기존의 AI(Chain-of-Thought 방식)가 문제를 푸는 방식은 마치 **'한 줄로 길게 이어지는 일기 쓰기'**와 같습니다.
비유: 여러분이 수학 문제를 풀 때, 연습장에 풀이 과정을 한 줄 한 줄 적어 내려간다고 상상해 보세요. 그런데 중간에 계산을 틀렸습니다! 기존 방식에서는 그 틀린 부분을 지울 수가 없습니다. 틀린 내용을 그대로 둔 채, "아까 틀렸는데 사실은 이렇습니다..."라고 구구절절 설명을 덧붙이거나, 아예 처음부터 다시 써야 합니다.
문제점: 글이 길어질수록 AI는 자기가 앞에서 무슨 말을 했는지 헷갈리기 시작합니다(환각 현상). 마치 낙서가 가득한 종이 위에서 길을 찾는 것과 같죠. 특히 도형이나 그림처럼 '공간'이 중요한 문제를 풀 때, 글로만 설명하다 보니 "삼각형의 각도가 이렇다"라고 말하면서 정작 그림은 엉뚱하게 그리는 실수를 자주 합니다.
2. 새로운 해결책: "스마트한 디지털 캔버스"
이 논문에서 제안하는 Canvas-CoT는 AI에게 단순히 글을 쓰는 종이가 아니라, **'언제든 수정 가능한 디지털 캔버스(HTML Canvas)'**를 손에 쥐여준 것입니다.
비유: 이제 AI는 일기장이 아니라, **'포토샵'이나 '파워포인트'**를 사용하는 디자이너가 됩니다.
핵심 기능 1 (CRUD - 자유로운 수정): 이제 AI는 틀린 부분이 생기면 전체를 다시 쓰는 게 아니라, 틀린 도형의 색깔만 바꾸거나(Modify), 잘못된 선을 지우고(Delete), 새로운 점을 콕 찍어 넣을 수 있습니다(Insert). 마치 레이어(Layer)를 나누어 작업하듯, 필요한 부분만 '싹둑' 잘라 고칠 수 있는 것이죠.
핵심 기능 2 (시각적 피드백 루프): AI가 캔버스에 그림을 그리면, 옆에서 **'깐깐한 검토관(Critic)'**이 실시간으로 그림을 확인합니다. "야, 너 아까는 삼각형이라고 해놓고 왜 그림은 사각형으로 그려놨어?"라고 시각적으로 지적해 줍니다. AI는 이 지적을 듣고 즉시 그림을 수정합니다.
3. 요약하자면?
이 논문의 핵심은 **"AI의 생각을 '글자'라는 1차원적인 선에서 '그림과 구조'라는 2차원적인 공간으로 옮긴 것"**입니다.
기존 방식: "A는 B다. (아, 틀렸다) 다시 말하자면 A는 C다..." (비효율적, 헷갈림)
연구팀이 이 방식을 수학 문제, 기하학 문제, 그리고 복잡한 그림 그리기(SVG 코딩) 테스트에 적용해 본 결과, 기존 방식보다 훨씬 더 정확하고, 훨씬 더 적은 양의 데이터(토큰)를 사용하면서도 똑똑하게 문제를 풀어냈습니다.
한 줄 요약: "AI에게 '말'로만 설명하게 하지 말고, '수정 가능한 그림판'을 주고 직접 그리면서 고쳐나가게 했더니 훨씬 똑똑해졌다!"는 내용입니다.
[기술 요약] Canvas-of-Thought (Canvas-CoT): 가변적 구조 상태를 통한 추론 접지(Grounding)
1. 문제 정의 (Problem Statement)
현재 멀티모달 거대언어모델(MLLM)의 추론 방식인 **Chain-of-Thought (CoT)**는 선형적이고 텍스트 중심적인 구조를 가집니다. 이로 인해 다음과 같은 세 가지 핵심적인 한계가 발생합니다.
불변적 추론 이력 (Immutable History): CoT는 텍스트를 순차적으로 생성하는 'append-only' 방식입니다. 중간에 기하학적 좌표나 논리적 오류가 발생하면, 이를 수정하기 위해 전체 문맥을 다시 생성하거나 매우 장황한 수정 텍스트를 덧붙여야 하므로 토큰 소모가 극심하고 인지 부하가 높습니다.
구조적 불일치 (Structural Mismatch): 기하학, SVG 설계와 같은 고차원 공간 작업은 다차원적이고 가변적인 특성을 갖지만, 이를 1차원적인 텍스트 시퀀스로 표현하는 데 한계가 있습니다.
시각적 비접지 (Visual Ungrounding): 모델이 텍스트로는 논리적인 것처럼 보이지만, 실제 시각적/물리적 제약(예: 겹치지 않는 물체, 정확한 각도 등)을 위반하는 '환각(Hallucination)'을 일으켜도 이를 스스로 감지하고 교정하기 어렵습니다.
2. 제안 방법론 (Methodology: Canvas-CoT)
본 논문은 추론 과정을 단순한 텍스트 나열이 아닌, HTML Canvas를 외부 추론 기질(Substrate)로 활용하는 상호작용형 프로세스로 전환하는 Canvas-CoT 프레임워크를 제안합니다.
핵심 아키텍처:
구조화된 상태 조작 (Structured State Manipulation):
추론의 결과물을 단순 텍스트가 아닌, HTML DOM 트리(예: <rect>, <circle>, <path>) 형태의 객체로 관리합니다.
CRUD 연산: 모델은 DOM의 id를 사용하여 특정 요소를 **삽입(Insert), 수정(Modify), 교체(Replace), 삭제(Delete)**할 수 있습니다. 이를 통해 전체 문맥을 다시 쓸 필요 없이 특정 오류만 '제자리에서(in-place)' 수정할 수 있습니다.
시각적-물리적 접지 (Visual-Physical Grounding):
Rendering-Critique Loop: 모델이 조작한 DOM 상태를 헤드리스 브라우저를 통해 즉시 렌더링하여 이미지로 만듭니다.
비판 에이전트(Critique Agent): 렌더링된 이미지와 원본 이미지를 비교하여 시각적 불일치(색상, 위치, 형태 오류 등)를 찾아내고, 이를 모델에게 '시각적 그래디언트(Visual Gradient)' 형태의 피드백으로 제공하여 자가 교정을 유도합니다.
재귀적 문맥 최적화 (Recurrent Context Optimization):
장황한 사고 과정(Thought Trace)은 버리고, 현재의 구조화된 상태(DOM)와 비판 피드백만을 다음 단계의 문맥으로 사용하여 토큰 효율성을 극대화합니다.
3. 주요 기여 (Key Contributions)
새로운 추론 패러다임 제시: 선형적 텍스트 서술에서 **상태 기반 시각적 모델링(Stateful Visual Modeling)**으로의 패러다임 전환을 이루었습니다.
비단조적 상태 전이 (Non-monotonic State Transition): 오류 발생 시 과거의 상태를 수정하거나 삭제할 수 있는 메커니즘을 통해 추론의 유연성을 확보했습니다.
토큰 효율성 및 정확도 향상: 불필요한 재생성을 방지하여 토큰 사용량을 줄이면서도, 시각적 피드백을 통해 추론의 정밀도를 높였습니다.
4. 실험 결과 (Results)
VCode, RBench-V, MathVista 등 고난도 멀티모달 벤치마크에서 실험한 결과, Canvas-CoT는 기존의 CoT, Tree-of-Thought(ToT), Program-of-Thought(PoT) 및 Iterative Reflection 방식보다 압도적인 성능을 보였습니다.
VCode (SVG 생성): GPT-5 기반 Canvas-CoT는 기존 방식보다 높은 정확도를 기록하며 복잡한 구조적 생성 능력을 입증했습니다.
RBench-V (물리/수학 추론): 물리적 제약과 상태 추적이 중요한 과제에서 탁월한 성능을 보였으며, 특히 수학 및 물리 서브태스크에서 큰 폭의 향상을 보였습니다.
토큰 효율성: 오류 수정 시 전체 코드를 다시 생성하는 대신 특정 요소만 수정하므로, 추론 단계가 진행될수록 토큰 소모량이 급격히 감소하는 양상을 보였습니다 (Figure 3, 4 참조).
Ablation Study: DOM Canvas만 사용하는 것보다 Rendering-Critique 루프를 결합했을 때 성능이 비약적으로 상승함을 확인하여, 시각적 피드백의 중요성을 증명했습니다.
5. 의의 (Significance)
Canvas-CoT는 MLLM이 단순히 "말을 잘하는 모델"을 넘어, **"외부 도구(Canvas)를 사용하여 자신의 생각을 시각적으로 설계하고, 실행 결과를 보고 스스로 수정할 줄 아는 에이전트"**로 진화할 수 있는 경로를 제시했습니다. 이는 특히 기하학, 설계, 데이터 시각화와 같이 높은 공간적 정밀도가 요구되는 복잡한 멀티모달 추론 분야에서 매우 중요한 기술적 도약입니다.