← 최신 논문
🤖 machine learning

Beyond Fixed Directions: Adaptive Representation Analysis of Reasoning and Memorization in LLMs

이 논문은 거대언어모델(LLM)의 추론 및 암기 작업이 단일한 표현 방향을 통해 디코딩 가능하지만, 이 방향은 고정되어 있지 않으며 기저의 정보는 여전히 접근 가능한 상태에서도 강화 학습 과정 동안 상당한 기하학적 재구성을 겪는다는 것을 입증한다.

원저자: Shaheen Nabi

게시일 2026-08-25
📖 3 분 읽기☕ 가벼운 읽기

원저자: Shaheen Nabi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

급격히 진화하는 인공지능의 세계에서, 거대 언어 모델은 복잡한 퍼즐을 풀고 방대한 양의 정보를 회상할 수 있는 능력을 갖추게 되었습니다. 과학자들은 이 디지털 두뇌가 실제로 어떻게 작동하는지 오랫동안 궁금해해 왔습니다. 하나의 지배적인 아이디어는 논리적 추론이나 단순한 사실 회상과 같은 특정 행동이 모델 내부 메모리의 뚜렷하고 고정된 경로와 연결되어 있다고 제안합니다. 모델의 마음을 모든 생각이 흔적을 남기는 광활한 다차원 공간이라고 상상해 보십시오. 만약 이 아이디어가 사실이라면, 수학 문제를 풀기 위해 생각하는 것과 단순히 사실을 회상하는 것 사이의 차이는 특정 방향을 가리키는 단 하나의 직선으로서 관찰될 수 있어야 합니다. 이 개념은 매우 매력적이어서, 일부 연구자들은 그들이 찾아낸 경로가 일정하고 신뢰할 수 있을 것이라고 가정하며, 모델이 더 잘 생각하도록 훈련하기 위한 가이드로 이러한 고정된 선들을 사용하려고 시도했습니다.

하지만, 새로운 연구는 이러한 경로가 제자리에 머물러 있다는 가정에 의문을 제기합니다. 연구진은 모델이 엄격한 훈련을 거칠 때 이 고정된 방향의 아이디어가 유효한지 확인하기 위해, Qwen3-0.6B로 알려진 소형 언어 모델을 자세히 조사했습니다. 그들은 절반은 논리적 추론을 요구하고 나머지 절반은 사실 회상을 요구하는, 정교하게 균형 잡힌 400개의 사례를 수집했습니다. 문장의 길이 나 특정 어휘와 같은 방해 요소를 제거함으로써, 그들은 발견된 차이가 진정으로 관련된 사고 유형에 의한 것임을 보장했습니다. 그들의 첫 번째 발견은 안심할 만한 것이었습니다. 즉, 어느 한 순간에 추론과 기억 사이의 차이는 실제로 매우 명확하여, 단 하나의 선이 두 그룹을 완벽하게 분리할 수 있음을 확인했습니다. 사실, 이 단순한 선은 가능한 모든 각도에서 데이터를 살펴보는 복잡한 고차원 분석만큼이나 효과적이었습니다.

이야기는 연구진이 추론 능력을 높이기 위해 설계된 강력한 기법인 집단 상대 정책 최적화(group-relative policy optimization)를 사용하여 모델을 훈련하면서 반전을 맞이합니다. 만약 고정된 방향의 아이디어가 사실이라면, 추론과 기억을 구분하는 선이 학습하는 동안에도 같은 위치에 머물 것이라고 그들은 예상했습니다. 대신, 그들은 모델이 여전히 두 작업 사이의 차이를 완벽하게 알고 있음에도 불구하고, 그 지식의 실제 방향이 극적으로 변했다는 것을 발견했습니다. 훈련 후, 한때 "추론"을 향해 명확하게 가리켰던 선은 너무 많이 회전하여 더 이상 원래의 위치와 정렬되지 않았습니다. 평균적으로, 새로운 방향은 이전 방향과 약 45퍼센트 정도만 유사했으며, 모델의 가장 깊은 층에서는 그 변화가 더욱 두드려져 내부 표현이 절반 이상 표류했습니다.

이 발견은 모델이 무엇을 아는지와 그 지식을 어떻게 저장하는지 사이의 결정적인 구분을 드러냅니다. 정보 자체가 사라진 것은 아니었습니다. 모델은 훈련 후에도 수학 문제와 상식 퀴즈를 완벽한 정확도로 구분할 수 있었습니다. 하지만 그 구분을 표현하기 위해 사용한 기하학적 좌표는 완전히 재구성되었습니다. 이는 마치 도시의 지도가 도서관이 어디에 있는지 알려주는 데는 여전히 완벽하게 정확하지만, 지도의 나침반 방향이 회전하여 "북쪽"이 이제 "동쪽"이 있던 곳을 가리키게 된 것과 같습니다. 연구진은 훈련 전후의 모델 내부 상태를 비교하여 이 변화를 측정했으며, 이 변화가 단순한 미세 조정이 아니라 모델의 내부 지형의 실질적인 재구성이었음을 발견했습니다.

연구는 추론과 기억을 분리하는 능력은 견고하지만, 이 능력이 단 하나의 변하지 않는 방향에 의존한다는 아이디어는 틀렸다고 결론짓습니다. 정보는 지속되지만, 그것이 모델의 마음을 통과하는 구체적인 경로는 유동적이며 학습과 함께 변합니다. 이는 향후 이러한 내부 방향을 사용하여 인공지능을 안내하려는 노력에 있어, 과학자들이 단지 경로를 한 번 찾고 그것이 유효할 것이라고 가정할 수 없음을 시사합니다. 대신, 그들은 랜드마크는 그대로 유지되더라도 지도 자체가 끊임없이 다시 그려지고 있음을 받아들여야 합니다. 지식의 안정성이 그것에 접근하기 위해 사용되는 경로의 안정성을 보장하는 것은 아닙니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →