Do Models Read What They Write? Causal Registers in Scratchpad Reasoning
이 논문은 스크래치패드에 중간 상태를 작성하도록 훈련된 거대 언어 모델이 단순히 인간의 가독성을 위해 해당 상태를 생성하는 것이 아니라, 실제로 그 작성된 상태를 후속 추론 단계의 인과적 입력으로 활용한다는 것을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
이 논문 "모델은 자신이 쓰는 것을 읽는가?(Do Models Read What They Write?)"에 대한 설명을 쉬운 언어와 일상적인 비유를 사용하여 설명합니다.
핵심 질문: 모델은 단순히 "말하고" 있는 것인가, 아니면 실제로 "생각하고" 있는 것인가?
당신이 한 학생이 수학 시험을 치르는 것을 지켜보고 있다고 상상해 보세요. 학생은 종이(이른바 "연습장")에 풀이 과정을 적고, 마지막에 최종 답안을 적습니다.
- 우리의 기대: 우리는 학생이 실제로 그 종이를 이용해 수학 문제를 풀기를 바랍니다. 만약 당신이 그들이 적은 숫자 하나를 마법처럼 바꾼다면, 최종 답안도 바뀐 숫자에 맞춰서 변해야 합니다.
- 우리의 우려: 우리는 학생이 그저 "척"을 하고 있는 것이 아닐까 걱정합니다. 학생은 이미 머릿속으로 문제를 다 풀어놓았고, 종이는 단지 똑똑해 보이기 위해 늘어놓는 이야기일 뿐일 수도 있습니다. 만약 당신이 종이에 적힌 숫자를 바꾼다 해도, 학생의 최종 답안은 변하지 않을 것입니다. 왜냐하면 학생은 실제로 그 종이를 보고 계산한 것이 아니라, 그냥 이야기를 써 내려간 것이기 때문입니다.
이 논문은 다음과 같은 질문을 던집니다: AI 모델이 자신의 사고 과정을 글로 적을 때, 모델은 다음 단계를 알아내기 위해 실제로 그 단계들을 사용하는 것일까요, 아니면 그저 이야기를 써 내려가는 것일까요?
실험: "마법 지우개" 테스트
연구진은 이 답을 찾기 위해 AI를 위한 매우 구체적이고 단순한 게임을 만들었습니다.
게임 규칙:
작은 2x2 격자판 위에서 움직이는 로봇을 상상해 보세요.
- 로봇은 특정 지점(예: 왼쪽 상단)에서 시작합니다.
- 로봇은 이동 명령(예: "첫 번째 비트를 반전시켜라")을 받습니다.
- 로봇은 현재 자신의 위치를 적습니다.
- 로봇은 또 다른 명령을 받고, 새로운 위치를 적는 과정을 반복합니다.
까다로운 점은, 로봇에게 움직임의 순서에 따라 변하는 숨겨진 "페이즈 비트(phase bit)"(비밀 스위치 같은 것)가 있다는 것입니다. 서로 다른 두 경로가 겉보기에는 같은 위치에 도착하더라도, 내부의 비밀 스위치 설정은 다를 수 있습니다.
테스트 ( "마법 지우개"):
연구진은 AI가 게임을 수행하며 단계를 적도록 했습니다. 그 후, 연구진은 다음과 같은 "외과적" 조작을 수행했습니다.
- 적힌 텍스트는 정확히 그대로 유지했습니다. 종이에는 여전히 "나는 스위치가 ON인 상태로 A 지점에 있다"라고 적혀 있습니다.
- AI의 내부 뇌 상태를 은밀하게 변경했습니다. 종이에는 "ON"이라고 되어 있지만, AI의 기억 속에 있는 "비밀 스위치"를 "OFF"로 뒤집었습니다.
- 그다음 동작을 수행하도록 요청했습니다.
질문:
- 만약 AI가 단순히 이야기를 쓰고 있는 것이라면, AI는 내부의 변화를 무시할 것입니다. 종이에 "스위치 ON"이라고 적혀 있으니, "스위치 ON"을 기준으로 다음 단계를 계산할 것입니다.
- 만약 AI가 실제로 상태를 사용하고 있는 것이라면, AI는 내부의 변화를 느낄 것입니다. AI는 "잠깐, 내 내부 스위치는 사실 OFF인데?"라고 깨닫고, 종이에 뭐라고 적혀 있든 상관없이 "스위치 OFF"를 기준으로 다음 단계를 계산할 것입니다.
결과: 누가 테스트를 통과했는가?
연구진은 세 가지 유형의 AI 모델을 테스트했습니다:
- 사전 학습된 모델 (Pre-trained Model): 인터넷에서 학습했지만 이 특정 게임은 배우지 않은 모델.
- "최종 답안" 모델 (Final Answer Model): 이 게임을 푸는 법을 배웠지만, 단계별 과정 없이 최종 결과만 적는 모델.
- "실행 상태" 모델 (Running State Model): 진행되는 모든 단계를 매번 적도록 학습된 모델.
발견된 사실:
- "이야기꾼들" (사전 학습된 모델 & 최종 답안 모델): 연구진이 몰래 내부 스위치를 뒤집었을 때, 이 모델들은 신경 쓰지 않았습니다. 이들은 종이에 적힌 내용을 바탕으로 다음 단계를 예측했습니다. 즉, 자신의 내부 현실을 무시하고 있었습니다.
- "진짜 생각하는 모델" (실행 상태 모델): 연구진이 몰래 내부 스위치를 뒤집었을 때, 이 모델들은 예측을 변경했습니다. 이들은 종이에 적힌 텍스트를 무시하고, 새로운 내부 스위치 상태를 바탕으로 다음 단계를 계산했습니다.
"실행 상태" 모델에서, 적힌 텍스트는 단순한 보고서가 아니었습니다. 그것은 하나의 **작동하는 변수(working variable)**가 되었습니다. 모델은 실제로 수학 계산을 하기 위해 자신의 노트를 읽고 있었던 것입니다.
"왜 중요한가"에 대한 비유
컴퓨터 프로그램을 생각해 보세요.
- 부실한 감시: 프로그램이 화면에 "파일을 저장 중입니다"라고 출력하지만, 실제 백그라운드에서는 파일을 삭제하고 있는 경우입니다. 이때 화면의 텍스트를 "파일을 삭제 중입니다"로 바꾼다고 해도 프로그램은 상관하지 않습니다. 텍스트는 그저 디스플레이일 뿐이기 때문입니다.
- 훌륭한 감시: 프로그램에
file_status라는 실제 변수가 있는 경우입니다. 코드에서 이 변수를 바꾸면, 프로그램의 동작이 즉시 변하게 됩니다.
이 논문은 AI에게 중간 단계를 적도록 훈련함으로써, 그 단계들을 AI가 실제로 사용하는 '실제 변수'로 만들 수 있다는 것을 증 proves 합니다.
"인과적" 증명
연구진은 여기서 멈추지 않았습니다. AI가 단순히 추측하거나 다른 예시를 복사하는 것이 아님을 확인하기 위해 추가 테스트를 실시했습니다.
- "이동 교체" 테스트 (The "Move Swap" Test): 내부 상태를 편집한 상태에서 명령(예: "오른쪽으로 이동" 대신 "왼쪽으로 이동")을 바꾸었습니다. AI는 새로운 명령에 따라 정답을 올바르게 변경했는데, 이는 AI가 상태와 명령을 결합하여 처리하고 있음을 증명합니다.
- "복사꾼" 테스트 (The "Copycat" Test): 다른 예시의 미래 답안을 복사하도록 AI를 속이려 했습니다. AI는 복사하지 않고, 현재 상황에 근거하여 다시 계산했습니다.
결론
이 논문은 AI 안전과 감독이 제대로 작동하려면, 단순히 AI가 자신의 생각을 적기를 바라는 것만으로는 부족하다고 결론짓습니다. 우리는 특정한 방식으로 AI를 훈련시켜서, 그 적힌 생각들이 실제 계산 과정의 일부가 되도록 만들어야 합니다.
이렇게 하면, "연습장"은 단순히 일어난 일을 기록하는 "기록지"가 아니라, 우리가 실제로 개입하여 AI의 생각을 바꿀 수 있는 **"제어판"**이 됩니다.
요약하자면: 이 논문은 적절한 훈련을 통해 AI가 "자신이 쓰는 것을 읽도록" 가르칠 수 있으며, 이를 통해 모델의 추론 과정을 실제 활용 가능한 부분으로 바꿀 수 있음을 보여줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.