← 최신 논문
💬 NLP

The Illusion of Latent Generalization: Bi-directionality and the Reversal Curse

이 논문은 양방향 학습이 역전 저주 (reversal curse) 를 완화할 수 있음을 보여주지만, 이는 사실의 방향과 무관한 통합된 잠재 표현을 학습한 것이 아니라 정방향과 역방향 정보를 별개의 엔트리로 저장하는 메커니즘에 기인한다는 점을 규명합니다.

원저자: Julian Coda-Forno, Jane X. Wang, Arslan Chaudhry

게시일 2026-04-08
📖 3 분 읽기☕ 가벼운 읽기

원저자: Julian Coda-Forno, Jane X. Wang, Arslan Chaudhry

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🎭 1. 문제: "역전 저주 (The Reversal Curse)"란 무엇인가요?

상상해 보세요. AI 에게 **"토끼 (A) 는 고양이 (B) 보다 작다"**라는 사실을 가르쳤다고 칩시다.
그런데 나중에 AI 에게 **"고양이 (B) 는 토끼 (A) 보다 크다"**라고 물어보면, AI 는 당황해서 **"모르겠다"**라고 대답하거나 엉뚱한 답을 내놓습니다.

이걸 **'역전 저주'**라고 부릅니다. AI 는 앞뒤가 바뀐 문장을 이해하지 못합니다. 마치 "A 가 B 보다 작다"는 사실을 외웠지만, "B 가 A 보다 크다"는 같은 사실을 전혀 연결하지 못하는 아이와 같습니다.

🛠️ 2. 해결책: "양방향 훈련"의 마법

연구자들은 이 문제를 해결하기 위해 AI 의 훈련 방식을 바꿨습니다.

  • 기존 방식 (NTP): 책장을 한 장씩 넘기며 앞의 글만 보고 다음 글자를 예측하는 방식. (앞으로만 읽음)
  • 새로운 방식 (MLM, NTP+Masking): 책장을 덮고 빈칸을 채우는 방식. 앞뒤 문맥을 모두 보고 빈칸을 추측하게 합니다.

결과적으로, 빈칸을 채우는 훈련 (양방향 훈련) 을 시키니 AI 는 "고양이 > 토끼"라는 질문에도 "토끼"라고 정확히 답할 수 있게 되었습니다.

🧐 3. 핵심 발견: "진짜로 이해한 걸까, 아니면 그냥 암기한 걸까?"

여기서부터가 이 논문의 진짜 핵심입니다.
AI 가 역전 질문을 잘 대답하게 되었으니, **"아! AI 가 이제 '크다/작다'라는 개념을 방향과 상관없이 하나의 통합된 지능으로 이해하게 되었구나!"**라고 생각하기 쉽습니다.

하지만 연구자들은 **"아니, 그렇지 않아"**라고 말합니다.

🏠 비유: "두 개의 다른 주소"

AI 는 사실 '통합된 개념'을 만든 게 아니라, 두 개의 서로 다른 주소에 같은 사실을 따로따로 저장했을 뿐입니다.

  • 기존 AI: "A 는 B 보다 작다"라는 메모만 있음. "B 는 A 보다 크다"는 질문을 받으면 메모를 못 찾음.
  • 새로운 AI: "A 는 B 보다 작다"라는 메모 "B 는 A 보다 크다"라는 메모를 둘 다 따로따로 외웠음.

즉, AI 가 "이 두 문장은 같은 뜻이야"라고 깊이 이해한 게 아니라, **"아, 이 질문에는 저쪽 메모를 꺼내면 되겠네"**라고 단순히 다른 메모장을 찾아낸 것에 불과하다는 것입니다.

🔍 4. 어떻게 알아냈을까? (실험의 재미)

연구자들은 AI 의 뇌 (내부 표현) 를 들여다보며 두 가지 실험을 했습니다.

  1. 거리 측정 실험: AI 의 뇌속에서 "A 는 B 보다 작다"와 "B 는 A 보다 크다"라는 정보가 얼마나 멀리 떨어져 있는지 재봤습니다.

    • 결과: 두 정보는 서로 아주 멀리 떨어져 있었습니다. 마치 "사과"와 "오렌지"처럼 서로 다른 별개의 존재로 저장되어 있었습니다. 만약 진짜로 통합된 개념이었다면 두 정보는 서로 아주 가깝게 붙어 있어야 했을 텐데 말입니다.
  2. 선형 탐침 (Linear Probe) 실험: AI 가 "A → B"에서 "B → A"로 넘어가는 규칙을 하나의 공식처럼 가지고 있는지 확인했습니다.

    • 결과: 그런 규칙은 없었습니다. AI 는 그냥 "B 가 나왔으니, B 에 해당하는 다른 메모장을 꺼내서 답을 줘야지"라고 생각했을 뿐입니다.

💡 5. 결론: "우리는 AI 를 오해하고 있었다"

이 논문의 결론은 매우 중요합니다.

"양방향 훈련 (빈칸 채우기) 은 AI 가 역전 질문을 잘 대답하게 만들지만, 그것이 AI 가 '진짜로' 개념을 통합적으로 이해하게 되었다는 뜻은 아닙니다."

AI 는 마치 두 개의 서로 다른 전화번호부를 가지고 있는 것과 같습니다.

  • 전화번호부 A: "토끼를 찾아라" → "고양이"
  • 전화번호부 B: "고양이를 찾아라" → "토끼"

우리가 AI 가 "토끼와 고양이의 관계"를 통찰력 있게 이해했다고 착각하지만, 실제로는 단순히 더 많은 전화번호를 외운 것일 뿐입니다.

🚀 6. 이 연구가 우리에게 주는 교훈

  • AI 의 '지능'은 착시일 수 있습니다: AI 가 잘하는 행동을 보며 "아, 이제 AI 는 인간처럼 생각하네"라고 생각하기 쉽지만, 실제로는 단순히 더 많은 패턴을 암기했을 뿐일 수 있습니다.
  • 미래의 과제: 진짜로 AI 가 방향과 상관없이 사실을 이해하게 하려면, 단순히 훈련 방식을 바꾸는 것만으로는 부족합니다. AI 가 "앞뒤가 바뀐 문장은 같은 뜻"이라는 것을 내부적으로 연결해주는 새로운 구조가 필요합니다.

한 줄 요약:
AI 가 역전 질문을 잘 대답하게 된 건, '진짜 이해'가 아니라 **'두 번째 메모장을 따로 외웠기 때문'**이라는 것이 이 논문의 놀라운 발견입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →