← 최신 논문
💬 NLP

Teaching Language Models to Think in Code

본 논문은 언어 모델의 추론을 자연어와 코드가 교차하는 방식에서 코드 자체가 주요 추론기로 작용하는 코드 중심 패러다임으로 전환하는 ThinC라는 프레임워크를 소개하며, 코드 궤적을 증류하고 감독 미세조정 후 강화학습을 적용함으로써 경쟁 수준의 수학 벤치마크에서 최첨단 성능을 달성합니다.

원저자: Hyeon Hwang, Jiwoo Lee, Jaewoo Kang

게시일 2026-05-11
📖 4 분 읽기☕ 가벼운 읽기

원저자: Hyeon Hwang, Jiwoo Lee, Jaewoo Kang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 매우 까다로운 수학 퍼즐을 풀려고 노력하고 있습니다. 이를 해결하는 두 가지 방법이 있습니다:

  1. 기존 방식 (교차 추론): 영어로 스스로에게 말하며 단계를 파악합니다. "좋아, 먼저 500 에 0.12 를 곱해야 해..." 그런 다음, 조금 불안해지므로 계산기 (코드 도구) 에게 작업을 확인해 달라고 요청합니다. 하지만 함정이 있습니다. 영어로 생각한 부분에서 실수를 했다면 (예: 500 곱하기 0.12 가 60 이 아니라 50 이라고 말한 경우), 그 잘못된 숫자를 계산기에 실수로 입력할 수 있습니다. 계산기는 당신이 시킨 대로만 수행할 뿐, 당신이 실수를 했다는 것을 알지 못합니다. 계산기는 잘못된 숫자를 기반으로 계산하므로, 결국 잘못된 답을 얻게 됩니다.
  2. 새로운 방식 (THINC): 영어로 전략을 세우는 데 아주 짧은 순간을 할애한 후 ("이 도형의 넓이를 구해야 해"), 즉시 전체 작업을 로봇 프로그래머에게 넘깁니다. 로봇은 코드를 작성하고, 실행하며, 결과를 확인한 후 그 결과에 기반해 더 많은 코드를 작성하고, 답이 나올 때까지 이 과정을 계속합니다. 당신은 머릿속이나 영어 문장으로 어떤 수학 계산도 하지 않습니다. 모든 중노동은 로봇이 수행합니다.

이 논문은 THINC(Thinking in Code, 코드로 사고하기) 를 소개합니다. 이는 AI 모델이 수학적 문제를 해결할 때, 코드를 단순히 작업을 확인하는 도구로만 사용하는 것이 아니라 코드 자체가 사고하는 주체가 되도록 하는 새로운 방식입니다.

기존 방식의 문제점

저자들은 영어 사고와 코드를 혼합한 현재의 AI 모델들 (Tool-Integrated Reasoning, 도구 통합 추론) 이 "구조적 한계"라고 부르는 세 가지 주요 결함을 가지고 있다고 말합니다:

  • 사후 검증자 (The "Post-Hoc" Verifier): AI 는 종종 전체 해결책을 영어로 먼저 작성한 후, 코드 실행을 통해 "그래, 맞네"라고 확인만 합니다. 코드는 실제로 사고를 수행하는 것이 아니라, 마지막에 찍는 승인 도장에 불과합니다.
  • 침묵하는 오류 (The "Silent Error"): AI 가 영어 사고 과정에서 수학 실수를 하면 (예: 500 의 12% 를 60 이 아닌 50 으로 계산한 경우), 그 잘못된 숫자를 코드에 복사해 넣을 수 있습니다. 코드는 그 잘못된 숫자로 계산하게 되고, AI 는 이를 깨닫지 못합니다. 코드는 명령을 따르기만 할 뿐이므로 오류는 "침묵"합니다.
  • 이중 작업 (The "Double Work"): AI 는 종종 문제를 해결하는 방법을 장황한 영어 설명으로 작성한 후, 그와 정확히 동일한 작업을 수행하는 코드를 작성합니다. 요리법을 영어로 쓴 다음, 요리법을 안다는 것을 증명하기 위해 똑같은 요리법을 프랑스어로 다시 쓰는 것과 같습니다. 이는 불필요하고 혼란스럽습니다.

THINC 의 해결책

THINC 는 게임의 규칙을 바꿉니다. AI 가 수학에 대해 말하는 대신, 코드를 통해 수학 안에서 말하도록 합니다.

  • 계획: AI 는 전략을 설정하는 한 줄의 짧은 영어 문장으로 시작합니다 (예: "답을 찾기 위해 숫자를 반복해서 돌리겠습니다").
  • 작업: 그 한 문장 이후, 모든 것이 코드 블록 내에서 이루어집니다. AI 는 코드를 한 조각 작성하고, 실행하며, 출력을 확인한 후, 그 출력에 기반해 다음 코드를 작성합니다.
  • 결과: 최종 답안은 AI 가 영어로 추측하는 것이 아니라, 컴퓨터의 계산기 (인터프리터) 에서 직접 도출됩니다.

AI 를 어떻게 가르쳤는가

연구자들은 AI 에게 단순히 이렇게 하라고 지시한 것이 아니라, 세 단계 과정을 통해 가르쳤습니다:

  1. 증류 (Distillation, 교사 역할): 매우 똑똑하고 큰 AI 모델을 가져와 이 새로운 "코드 우선" 스타일로 수학 문제를 해결하도록 요청했습니다. 이렇게 해서 12,200 개의 완벽한 "코드 우선" 해결 사례를 수집했습니다.
  2. 지도 미세 조정 (Supervised Fine-Tuning, 학생 역할): 17 억 개의 "뇌 세포"를 가진 모델과 40 억 개의 "뇌 세포"를 가진 두 개의 작은 AI 모델을 이 사례들을 모방하도록 가르쳤습니다. 이를 통해 모델들은 코드로 사고하는 습관을 익혔습니다.
  3. 강화 학습 (Reinforcement Learning, 코치 역할): 모델들에게 수천 개의 수학 문제를 풀도록 연습시켰습니다. 모델이 정답을 맞추면 "보상"을 받았고, 실패하면 다른 코드 전략을 시도하도록 학습시켰습니다. 이로 인해 모델들은 훨씬 더 똑똑하고 신뢰할 수 있게 되었습니다.

결과: 작은 모델, 큰 승리

이 논문은 이 새로운 모델들을 AIME 와 HMMT 와 같은 매우 어려운 대회 수준의 수학 경시대회에서 테스트했습니다.

  • 거인들을 꺾다: 40 억 파라미터 규모의 작은 THINC 모델은 평균 78.1% 점수를 기록했습니다. 이는 17 억 파라미터 모델보다 높고, 다른 "도구 통합" 모델들보다 높으며, 오직 영어로만 사고하는 거대한 2,350 억 파라미터 모델보다도 더 높은 점수입니다!
  • 신뢰성: 사례의 99.2% 에서 최종 답안은 컴퓨터의 코드 출력에서 직접 추출되었습니다. AI 는 추측하지 않고 계산했습니다.
  • 회복력: 코드가 실수를 하여 오류가 발생하고 멈추더라도, THINC 모델은 놀랍게도 다음 코드 블록에서 "말"로 해결책을 찾으려 하지 않고 오류를 수정하는 데 능했습니다. 영어와 코드를 혼합하는 다른 모델들은 코드 오류를 만나면 종종 무너집니다.

결론

이 논문은 AI 가 수학에 대해 "말"하는 것을 멈추고 코드로 수학을 "수행"하도록 강제함으로써, 모델들이 더 정확해지고, 터무니없는 산수 실수를 줄이며, 어려운 문제를 더 효율적으로 해결하게 된다고 주장합니다. 이는 머릿속으로 나눗셈을 하려던 인간이, 단계별로 계산기를 프로그래밍해 스스로 계산하게 하는 인간으로 바뀌는 것과 같습니다. 이 과정에서 머릿속 계산 실수는 전혀 발생하지 않습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →