← 최신 논문
💻 computer science

When Do Concepts Become Functionally Sufficient During Language-Model Training?

이 논문은 희소한 마스크된 활성화가 레이어와 체크포인트를 가로지르는 개입을 통해 대상 정보를 보존할 수 있는지 여부를 테스트함으로써 언어 모델 학습 과정 중 언제 내부 개념이 충분해지는지를 결정하기 위한 기능적 프레임워크를 도입하며, 이를 통해 예측 분포의 변화는 미미함에도 불구하고 다운스트림 마스크가 재구성 마스크에 비해 현저히 적은 소프트 질량을 유지한다는 것을 밝혀낸다.

원저자: Raphael Bernas, Paul G. Chevalier, Fanny Jourdan, Céline Hudelot

게시일 2026-08-18
📖 3 분 읽기☕ 가벼운 읽기

원저자: Raphael Bernas, Paul G. Chevalier, Fanny Jourdan, Céline Hudelot

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

언어를 이해하는 현대의 컴퓨터는 단어를 방대한 숫자의 구름으로 변환하는 방식으로 작동합니다. 이러한 기계들이 학습함에 따라, 이들은 정보를 조직하여 예측을 수행하기 위한 수학적 경로인 내부 구조와 층(layers)을 구축합니다. 수년 동안 과학자들은 이 구름 내부를 들여다보며 컴퓨터가 실제로 무엇을 생각하고 있는지 확인하려고 노력해 왔습니다. 그들은 '예의'나 '수학'과 같은 개념을 나타낼 수 있는 특정 패턴이나 '개념'을 찾아왔습니다. 그러나 패턴을 찾는 것이 그것의 목적을 이해하는 것과 같지는 않습니다. 어떤 구조는 도구 상자에 들어있지만 한 번도 집어 들지 않는 도구처럼, 기계 내부에 존재하더라도 결정을 내리는 데 사용되지 않을 수도 있습니다. 중요한 질문은 단순히 모델 내부에 무엇이 나타나는가가 아니라, 그 내부 구조가 당면한 과제에 진정으로 유용해지는 시점이 언제인가 하는 것입니다.

한 연구팀은 학습의 시작부터 끝까지 이러한 내부 구조가 어떻게 변화하는지를 관찰함으로써 이 질문에 답하고자 했습니다. 모델의 최종 상태만을 살펴보는 대신, 그들은 학습 과정을 영화처럼 취급하여, 학습의 여러 단계에서 일시 정지하며 기계의 능력을 테스트했습니다. 그들은 모델의 뇌의 특정 층을 가져와 중요한 정보를 운반하는 것으로 보이는 작은 숫자 그룹들을 분리하려고 시도했습니다. 이를 위해 그들은 기계의 내부 활동 위에 반투명한 스크린을 얹는 것과 같은 '마스킹(masking)' 기법을 만들었습니다. 이 스크린은 특정 숫자를 흐리게 하거나 숨길 수 있지만, 다른 숫자들은 통과하게 할 수 있었습니다. 연구진은 엄격하고 단순한 질문을 던졌습니다. 만약 우리가 대부분의 활동을 숨기고 우리 스크린에 의해 선택된 숫자들만 남긴다면, 컴퓨터는 이전과 동일한 예측을 여전히 수행할 수 있는가?

연구팀은 이 아이디어를 작은 규모부터 큰 규모에 이르기까지 7개의 서로 다른 언어 모델에 걸쳐 테스트하며, 모델이 학습함에 따라 답이 어떻게 변하는지 관찰했습니다. 그들은 '유용성'을 판단하는 네 가지 서로 다른 방법을 비교했습니다. 첫째, 남은 숫자들로 원래의 데이터 구름을 단순히 재구성할 수 있는지 확인했습니다. 둘째, 단순하고 고정된 번역기가 남은 숫자들로부터 의미를 여전히 읽어낼 수 있는지 테스트했습니다. 셋째, 가장 중요하게도, 컴퓨터의 실제 행동—즉, 새로운 텍st에 대한 최종 예측—이 변하지 않고 유지되는지 확인했습니다. 마지막으로, 학습 초기 단계에서 학습된 개념이 훨씬 나중의 학습 단계에서도 여전히 인식되고 사용될 수 있는지 테스트했습니다.

결과는 이 기계들이 어떻게 학습하는지에 대한 놀라운 진실을 드러냈습니다. 연구진이 컴퓨터의 행동을 정확히 똑같이 유지하려고 시도했을 때, 그들은 매우 적은 정보만을 유지해야 한다는 것을 발견했습니다. 실제로 모델의 실제 예측을 보존하는 작업의 경우, 내부 활동의 약 6.6%만을 유지하면 되었습니다. 이는 원래의 숫자를 단순히 재구축하기 위해 70% 이상의 활동을 보존해야 했던 것에 비하면 아주 적은 비율입니다. 이는 컴퓨터가 방대한 양의 정보를 저장하고 있지만, 결정을 내릴 때 실제로 핵심적인 역할을 하는 것은 매우 작고 특정한 조각이라는 것을 시사합니다. 나머지 활동은 존재하기는 하지만, 모델의 의사 결정 과정이 주로 무시하는 방향에 있는 것으로 보입니다.

또한 이 연구는 이 '유용한' 정보의 조각이 무작위가 아님을 보여주었습니다. 연구진은 모델이 예측을 위해 의존하는 특정 숫자들이 모델이 배우고 있는 과제에 매우 민동적이라는 것을 발견했습니다. 이 숫자들은 모델의 내부 기하학적 구조가 가장 많이 휘어진 영역에 집중되어 있는데, 이는 작은 변화가 최종 답변에 가장 큰 영향을 미치는 방향임을 의미합니다. 연구진은 또한 이러한 유용한 구조가 나타나는 시점이 특정 유형의 모델에 따라 크게 달라진다는 것을 발견했습니다. 어떤 모델의 경우 유용한 정보가 학습이 진행됨에 따라 안정적이고 명확해지는 반면, 다른 모델의 경우 이 정보의 위치가 네트워크의 층을 통해 크게 이동하기도 합니다.

아마도 가장 중요한 점은, 모델이 이러한 개념을 사용하는 법을 배우는 방식이 단순한 직선 형태가 아니라는 것을 연구진이 발견했다는 것입니다. 최종 예측에 유용한 정보는 관찰하거나 측정하기 가장 쉬운 정보와는 종종 다릅로 나타납니다. 어떤 구조는 감지하고 설명하기 매우 쉽지만, 최종 결정에는 거의 아무런 기여를 하지 못할 수 있습니다. 반대로, 모델의 행동을 주도하는 아주 작은 정보의 조각은 이 특정 테스트 방법 없이는 고립시키기 어려운 복잡한 패턴 속에 숨겨져 있는 경우가 많습니다. 이 연구는 우리가 언어 모델의 성숙도를 내부 구조만을 보고 판단해서는 안 된다고 결론짓습니다. 대신, 우리는 그 구조들이 실제로 무엇을 하는지를 측정해야 합니다. 기계는 노이즈와 사용되지 않는 잠재력으로 가득 차 있을지 모르지만, 이해의 무게를 짊어지는 매우 작고 효율적인 활동의 핵심에 집중함으로써 기능을 수행하는 법을 배웁니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →