← 최신 논문
💬 NLP

Towards Mechanistically Understanding Why Memorized Knowledge Fails to Generalize in Large Language Model Finetuning

이 논문은 미세 조정된 거대 언어 모델에서 암기된 지식이 일반화에 실패하는 '알고 있음과 사용함 사이의 간극(Knowing–Using Gap)'을 조사하며, 셀프 패칭(self-patching) 개입을 통해 정렬되지 않은 내부 지식 회로가 효과적인 추론을 방해한다는 것을 밝히고 잠재적 일반화 성능의 58~75%를 회복하는 휴리스틱 전략을 제안한다.

원저자: Lu Dai, Ziyang Rao, Yili Wang, Hanqing Wang, Hao Liu, Hui Xiong

게시일 2026-07-10
📖 3 분 읽기☕ 가벼운 읽기

원저자: Lu Dai, Ziyang Rao, Yili Wang, Hanqing Wang, Hao Liu, Hui Xiong

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 방금 "시드니는 호주에 있다"라는 새로운 사실을 배운 아주 똑똑한 로봇 사서가 있다고 상상해 보세요. 당신이 "시드니는 어디에 있나요?"라고 묻자, 로봇은 완벽하게 대답합니다. 하지만 이어서 당신이 "시드니가 있는 나라의 수도는 어디인가요?"라고 묻자, 로봇은 마치 아무것도 모르는 것처럼 얼어붙어 버립니다.

이것이 바로 HKUST(GZ)와 HKUST의 연구진들이 해결하려고 노력 중인 바로 그 퍼즐입니다. 그들은 이를 **"아는 것과 사용하는 것 사이의 간극(Knowing–Using Gap)"**이라고 부릅니다. 이는 거대 언어 모델(LLM)이 새로운 정보를 분명히 암기했지만, 약간 더 복잡한 퍼즐을 풀기 위해 그 정보를 사용하는 데는 실패했을 때 발생하는 좌절스러운 순간을 의미합니다.

미스터리: 왜 로봇은 멈춰 서는가?

연구진은 이것이 로봇이 "잊어버렸거나" 논리를 파악할 만큼 너무 멍청해서 발생하는 문제가 아니라는 것을 발견했습니다. 사실 로봇은 답을 알고 있습니다. 단지 엉뚱한 방에 숨겨두었을 뿐입니다.

이를 이해하기 위해 로봇의 뇌를 거대한 다층 사무용 빌딩이라고 생각해 보세요.

  • 초반 층 (레이어 1–10): 이곳은 로비나 우편실과 같습니다. 들어오는 패키지를 저장하는 데(사실을 암기하는 데) 탁월합니다.
  • 중간 층 (레이어 10–20): 이곳은 복잡한 추론이 일어나는 "사고" 부서입니다.
  • 상층부 (레이어 20–30): 이곳은 최종 보고서가 작성되어 발송되는 곳입니다.

로봇이 새로운 사실을 배울 때, 로봇은 정보를 로비상층부에 빠르게 쏟아붓습니다. 그곳은 안전하니까요! 하지만 중간에 있는 "사고 부서"에는 그 메모가 전달되지 않습니다. 그래서 로봇이 다단계 퍼즐(예: 시드니를 호주와 연결하고, 다시 호주를 그 수도와 연결하는 과정)을 풀려고 할 때, 정보는 엉뚱한 곳에 갇혀 있게 됩니다. 이는 마치 주머니에 도서 카드를 넣어두고 식료품점 계산대에서 사용하려는 것과 같습니다.

탐정 작업: "셀프 패칭(Self-Patching)"

그들은 어떻게 정보가 사라진 것이 아니라 단지 잘못 배치된 것뿐이라는 것을 증명했을까요? 그들은 **"셀프 패칭(Self-Patching)"**이라는 영리한 기술을 고안했습니다.

두 버전의 로봇이 나란히 실행되고 있다고 상상해 보세요.

  1. 로봇 A는 어려운 질문에 답하려고 노력하지만 실패하고 있습니다.
  2. 로봇 B는 "로비"에 정답을 저장하고 있습니다.

연구진은 로봇 B 속으로 손을 뻗어 "시드니는 호주에 있다"라는 특정 기억을 집어 들고, 그것을 로봇 A의 "사고 부서"로 물리적으로 옮겼습니다.

결과는 어땠을까요? 로봇 A는 즉시 문제를 해결했습니다!

이 실험은 정보가 결여된 것이 아니라, 단지 **정렬이 어긋나 있었음(misaligned)**을 보여주었습니다. 로봇은 데이터를 가지고 있었지만, 수학적 사고를 하기 위해 필요한 뇌의 적절한 경로로 데이터가 라우팅되지 않았던 것입니다. 연구진은 이를 **"지식-회로 불일치 가설(Knowledge–Circuit Misalignment Hypothesis)"**이라고 부릅니다.

이것이 "아닌" 것들

연구진은 다른 가능성들을 배제하기 위해 매우 신중했습니다.

  • 지능의 부족이 아닙니다: 그들은 더 크고 똑똑한 모델들을 테스트했지만, 문제는 여전히 발생했습니다.
  • "프롬프팅"의 문제가 아닙니다: 그들은 로봇에게 힌트(예: "단계별로 생각하라"고 요청)를 주어 보았지만, 이는 아주 조금밖에 도움이 되지 않았습니다. 진짜 해결책은 질문을 더 잘하는 것이 아니라 메모를 옮기는 것이었습니다.
  • 로봇이 새로운 논리를 배우는 것이 아닙니다: 로봇은 추론하는 방법을 배울 필요가 없었습니다. 단지 이미 알고 있는 사실에 접근하기만 하면 되었습니다.

좋은 소식: 간단한 해결책

가장 좋은 점은 무엇일까요? 연구진은 어떤 메모가 어떤 사실에 속하는지 정확히 알 필요 없이도 이 문제를 해결할 수 있는 방법을 찾아냈다는 것입니다.

그들은 "사고 부서"(중간 레이어)가 핵심이라는 점에 주목했습니다. 그들은 다음과 같은 간단한 규칙을 만들었습니다: "만약 로비나 상층부에 저장된 사실이 있다면, 그것을 중간 층으로 옮겨라."

그들은 이 간단한 규칙을 다양한 로봇 모델과 다양한 유형의 지식(생물학부터 학술 논문까지)에 대해 테스트했습니다.

  • 이 해결책이 없을 때, 로봇은 추론 질문을 약 7%에서 18% 정도만 맞혔습니다.
  • 이 "메모 이동" 규칙을 적용하자, 정답률이 **35%에서 45%**로 올라갔습니다.

이 간단한 기술은 로봇이 완벽하게 정렬되었을 때 달성할 수 있었던 잠재적 성공의 **58%에서 75%**를 회복시켜 주었습니다. 이것이 모든 것을 해결하는 마법 지팡이는 아니지만, 문제가 해결 가능하다는 것을 입증합니다.

요약

이 논문은 AI 모델이 학습한 내용을 사용하지 못할 때, 그것은 종로가 아니라 라우팅(경로 지정) 문제인 경우가 많다는 것을 보여줍니다. 사실들은 존재하며 뇌의 잘못된 구석에 안전하게 저장되어 있을 뿐입니다. 그 사실들을 "사고" 레이어로 옮겨줌으로써, 우리는 로봇이 점들을 연결하고 퍼즐을 풀 수 있도록 도울 수 있습니다.

연구진은 이제 미래의 훈련이 단순히 모델이 사실을 더 빨리 암기하도록 만드는 데 집중하는 것이 아니라, 그 사실들을 추론을 위한 적절한 장소로 라우팅하는 법을 가르치는 데 집중해야 한다고 제안합니다. 이는 "더 많이 가르치는 것"에서 "더 잘 조직하는 것"으로의 전환입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →