← 최신 논문
🤖 machine learning

Barriers to Universal Reasoning With Transformers (And How to Overcome Them)

본 논문은 표준 체인 오브 사고 트랜스포머가 복제 및 검색의 본질적 한계로 인해 더 긴 추론 궤적으로 일반화하는 데 실패하지만, 이러한 장벽을 극복하기 위해 고유한 길잡이 토큰과 값 변경 인코딩을 갖춘 확장 가능한 어휘를 도입함으로써 길이 일반화 가능한 튜링 완전성을 달성할 수 있음을 보여준다.

원저자: Oliver Kraus, Yash Sarrof, Yuekun Yao, Alexander Koller, Michael Hahn

게시일 2026-04-29
📖 4 분 읽기☕ 가벼운 읽기

원저자: Oliver Kraus, Yash Sarrof, Yuekun Yao, Alexander Koller, Michael Hahn

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

"Barriers to Universal Reasoning With Transformers (And How to Overcome Them)"이라는 논문에 대한 설명을 쉬운 언어와 창의적인 비유를 사용하여 제시합니다.

큰 그림: 잊어버리는 '영리한 학생'

복잡한 퍼즐을 풀도록 배우는 매우 영리한 학생 ( Transformer ) 을 상상해 보세요. 이를 돕기 위해 교사들은 그들이 생각을 단계별로 적을 수 있는 '초안지 (scratchpad)'를 제공합니다. 이를 Chain-of-Thought (CoT) 라고 합니다.

이전 연구에 따르면, 이 초안지를 통해 이 학생은 이론적으로 얼마나 어렵든 모든 퍼즐을 풀 수 있었습니다. 마치 초능력을 부여받은 것과 같았습니다.

그러나 이 논문의 저자들은 큰 결함을 발견했습니다: 이 학생은 연습한 퍼즐을 푸는 데는 뛰어나지만, 퍼즐이 길어지면 완전히 실패합니다. 10 단계 퍼즐로 훈련받았다면, 논리가 동일하더라도 20 단계 퍼즐은 풀지 못합니다. 그들은 추론이 무너지는 '한계점'에 부딪힌 것처럼 보입니다.

이 논문은 묻습니다: 왜 이런 일이 일어나며, 우리는 이를 고칠 수 있을까요?


두 가지 큰 장애물

저자들은 이 학생의 뇌 (Transformer) 가 더 긴 작업으로 일반화하는 것을 방해하는 두 가지 특정 '오작동'이 있음을 발견했습니다.

1. '복사기' 오작동 (반복적인 복사)

학생이 책에서 긴 지시 목록을 초안지로 복사해야 한다고 상상해 보세요.

  • 문제: 목록이 짧으면 쉽게 복사할 수 있습니다. 하지만 목록이 길어지면 혼란에 빠집니다. 긴 페이지의 중간에서 복사해야 할 정확한 줄을 찾지 못해 위치를 잃어버립니다.
  • 논문의 주장: 표준 Transformer 는 길이가 변할 때 임의의 정보 문자열을 '복사'하는 데 어려움을 겪습니다. 그들은 텍스트 중간에서 길을 잃습니다.

2. '마지막으로 본 것' 오작동 (검색)

학생이 'X 의 값'과 같은 변수를 추적한다고 상상해 보세요.

  • 문제: 학생이 "X = 5"라고 쓴 후 나중에 "X = 7"이라고 쓰고 다시 "X = 5"라고 쓴다면, 현재의 값이 무엇인지 알아야 합니다. 긴 사고 연쇄에서 학생은 종종 가장 최근의 '5'가 무엇인지 잊어버립니다. 페이지의 새로운 것이 아니라 처음에 있던 오래된 '5'를 잡을 수 있습니다.
  • 논문의 주장: 모델은 긴 변경 이력에서 최신 업데이트를 찾는 데 어려움을 겪습니다. 1,000 페이지 분량의 일기에서 마지막에 사과를 먹은 시점을 찾으려는 것과 같습니다.

해결책: 초안지를 쓰는 새로운 방법

저자들은 이러한 오작동을 수정하기 위한 두 가지 교묘한 방법을 제안합니다. 그들은 학생의 뇌를 바꾸지 않고, 단지 초안지에 쓰이는 지시 사항의 방식을 변경합니다.

방법 #1: '이름표' (Signpost Tokens)

복사기 오작동을 해결하기 위해, 저자들은 퍼즐의 모든 항목에 고유한 ID 카드나 '이름표'를 부여할 것을 제안합니다.

  • 작동 원리: "50 번째 줄로 가라"라고 말하는 대신, "이름표 #42 가 있는 항목으로 가라"라고 지시합니다.
  • 도움 되는 이유: 목록이 길어지더라도 학생은 50 번째 줄을 찾기 위해 세지 않아도 됩니다. 특정 이름표만 찾으면 됩니다. 모든 책에 고유한 바코드가 있는 도서관과 같습니다. 필요한 책을 찾기 위해 선반 전체를 스캔할 필요가 없습니다.

방법 #2: '변경 로그' (Value-Change Encoding)

마지막으로 본 것 오작동을 해결하기 위해, 저자들은 학생이 무엇을 적는지를 변경할 것을 제안합니다.

  • 구식 방식: 학생은 매번 전체 현재 상태를 적습니다 (예: "X 는 5 입니다", 그다음 "X 는 7 입니다", 다시 "X 는 5 입니다"). 이는 많은 노이즈를 생성하고 무엇이 최신인지 알기 어렵게 만듭니다.
  • 신식 방식: 학생은 무엇이 변했는지만 적습니다.
    • "X 는 7 입니다"라고 쓰는 대신 "X 가 5 에서 7 로 변했습니다"라고 씁니다.
    • 다시 "X 는 5 입니다"라고 쓰는 대신 "X 가 7 에서 5 로 변했습니다"라고 씁니다.
  • 도움 되는 이유: 현재 값을 찾으려면 학생은 변경 사항만 세면 됩니다. "5 에서 7 로" 그리고 "7 에서 5 로"라는 변경을 보면 현재 값이 5 라는 것을 알 수 있습니다. 이는 은행 잔고를 매번 다시 쓰는 대신 거래 내역 장부를 관리하는 것과 같습니다.

결과: 이론 vs 현실

이 논문은 이러한 아이디어를 두 가지 방식으로 테스트합니다:

  1. 수학적 증명 (이론):

    • 나쁜 소식: 고정된 단어 집합 (유한 알파벳) 과 표준 작성 스타일에만 의존한다면, 학생은 특정 복잡도 이상의 퍼즐을 풀도록 배울 수 없습니다 (구체적으로, TC0라고 불리는 문제 클래스를 넘을 수 없습니다). 그들은 수학적으로 갇혀 있습니다.
    • 좋은 소식: 학생에게 고유한 이름표 (Signposts) 의 무한 공급을 사용하고 '변경 로그' 방법을 사용하도록 허용한다면, 그들은 이론적으로 얼마나 길든 모든 퍼즐을 풀 수 있습니다.
  2. 실험 (현실):

    • 저자들은 세 가지 어려운 작업에서 처음부터 작은 컴퓨터 모델을 훈련시켰습니다:
      • Parity (패리티): 숫자 문자열에 1 이 홀수 개인지 짝수 개인지 세기.
      • Boolean Evaluation (부울 평가): 복잡한 논리 퍼즐 (참/거짓) 해결.
      • S5 Permutation: 5 개 물체가 서로 바뀌는 움직임을 추적하기.
    • 결과:
      • 표준 방법으로 훈련된 모델은 퍼즐이 길어지면 실패했습니다.
      • 이름표변경 로그로 훈련된 모델은 이전에 본 적이 없는 더 긴 퍼즐을 푸는 데 훨씬 더 뛰어났습니다.
    • 그들은 또한 거대하고 사전 훈련된 AI 모델 (Llama 및 Mistral 등) 에서 이를 테스트했습니다. 재훈련 없이 단순히 답변에 이름표와 변경 로그를 사용하도록 프롬프트를 입력하는 것만으로도, 이러한 모델들은 길고 어려운 문제를 해결하는 데 훨씬 더 똑똑해졌습니다.

결론

이 논문은 Chain-of-Thought 가 마법이 아님을 결론지었습니다. AI 에게 "단계별로 생각하라"고 말하는 것만으로는 충분하지 않습니다. 만약 그 사고 방식이 긴 목록에서 길을 잃기 쉽다면 말입니다.

AI 가 장기 추론에서 진정으로 신뢰할 수 있게 만들려면, 두 가지 주요 함정을 피하는 방식으로 '생각'을 포맷해야 합니다:

  1. 아무것도 잃어버리지 않도록 모든 단계에 고유한 이름표를 부여합니다.
  2. 모델이 오래된 정보에 혼동하지 않도록 변경 사항만 기록합니다.

추론의 포맷을 수정함으로써, 우리는 AI 모델이 현재의 한계를 돌파하고 훨씬 더 어려운 문제를 해결하도록 도울 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →