Do Language Models Consistently Encode the Current Year?
이 논문은 언어 모델이 현재 연도를 일관되지 않게 인코딩하며, 수정에 저항하는 사실 회상 메커니즘을 통해 사전 학습 기반의 '연상적' 개념을 유지하는 한편, 프롬프팅을 통해 쉽게 업데이트되는 사후 학습 기반의 '선언적' 개념을 유지함으로써, 두 시점적 개념을 동시에 수정하는 것을 방해하는 근본적인 괴리를 만들어낸다는 점을 밝히고 있다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
언어를 읽고 쓰는 현대의 컴퓨터들은 인간의 대화를 흉내 내는 데 놀라울 정도로 능숙해졌다. 이들은 뉴스를 요약하고, 이야기를 쓰고, 역사에 관한 질문에 답할 수 있다. 그러나 이 기계들에게는 고치기 어려운 사각지대가 있다. 바로 현재가 몇 시인지(또는 몇 년인지)를 진정으로 알지 못한다는 점이다. 이들은 과거에 대한 사실은 암송할 수 있지만, 그들의 내부적인 '현재'에 대한 감각은 살아있는 현재의 의식이 아니라 학습 과정에서 주입된 데이터의 혼란스러운 메아리인 경우가 많다. 이러한 혼란은 중요하다. 만약 기계가 현재 연도를 10년 전이라고 믿는다면, 최근 사건에 대한 질문에 답변하기를 거부하거나, 더 나아가 아직 일어나지 않은 미래에 대해 자신 있게 사실을 지어낼 수도 있기 때문이다. 연구자들은 디지털 지능이 시간이라는 개념을 어떻게 저장하는지 오랫동안 궁금해해 왔으며, 모델이 날짜를 알고 있다면 그 안에 돌아가는 단일하고 통일된 시계가 있을 것이라고 가정해 왔다.
한 새로운 연구는 그러한 가설에 이의를 제기하며, 언어 모델이 단일하고 일관된 시계를 보유하고 있지 않다는 사실을 밝혀냈다. 대신, 그들은 두 가지 별개이며 상충하는 연도 개념을 가지고 있다. 하나는 모델이 인터넷을 읽으며 배운 문법 자체에 깊게 새겨진 구조적이고 심층적인 개념이다. 다른 하나는 모델이 지시 사항을 따르는 법을 배울 때 습득한 단순한 사실인, 얕고 표면적인 개념이다. 연구진은 이 두 개념이 날짜에 대해서는 흔히 일치하지만, 완전히 다른 내부 메커로 구축되어 있다는 것을 발견했다. 이러한 분리는 고질적인 문제를 야기한다. 과학자들이 현재 연도를 반영하도록 모델의 지식을 업데이트하려고 할 때, 얕은 수준의 사실은 쉽게 수정할 수 있지만, 깊은 수준의 문법적 시간 감각은 꿈쩍도 하지 않는 것이다.
이 숨겨진 이중성을 밝혀내기 위해 연구진은 모델에게 현재가 몇 년도라고 생각하는지 묻는 두 가지 뚜렷한 방식을 설계했다. 첫 번째 방법은 '연상 과업(associative task)'이라 불리는데, 이는 모델에게 날짜를 직접 묻지 않는다. 대신, "1960년에는..."과 같은 문장 파편을 제시하고 다음에 올 단어가 무엇인지 묻는다. 만약 모델이 "was"와 같은 과거 시제 동사를 예측한다면, 이는 모델이 1960년을 과거로 인식하고 있음을 의미한다. 반면 "is"나 "will"과 같은 현재 또는 미래 시제를 예측한다면, 그 해가 여전히 진행 중이거나 아직 오지 않은 해라고 생각함을 시사한다. 이 방법은 모델이 초기 학습 과정에서 수십억 개의 문장을 읽으며 흡수한 기술인, 문법에 대한 직관적 이해를 활용한다. 두 번째 방법인 '선언적 과업(declarative task)'은 훨씬 더 직접적이다. 단순히 "현재 연도는 무엇입니까?"라고 묻거나 특정 연도로 시작하는 이야기를 쓰도록 유도한다. 이는 모델이 사실을 진술하는 능력, 즉 모델이 인간의 지시를 따르는 법을 배우는 후기 학습 단계에서 연마된 기술을 테스트한다.
연구팀이 다양한 모델을 대상으로 이 방법들을 테스트했을 때, 명확한 패턴이 나타났다. 두 방법 모두 모델의 학습 데이터가 중단된 시점과 놀라울 정도로 가까운 날짜를 결과로 내놓았다. 깊은 문법적 테스트의 경우, 모델들은 일관되게 자신의 학습 중단 시점으로부터 약 10개월 정도 차이 나는 연도를 추측했다. 이는 모델의 내부 시간 감각이 학습 데이터에서 마지막으로 본 날짜에 밀접하게 묶여 있음을 시사한다. 그러나 두 방법은 단순히 같은 것을 다른 방식으로 측정하는 것이 아니라, 서로 다른 것을 측정하고 있었다. 연구진은 깊은 문법적 시간 감각이 세상에 대한 사실을 회상하는 방식과 유사하게 모델 내부의 특정하고 조직된 경로에 의존한다는 것을 발견했다. 반면, 단순히 연도를 소리 내어 말하는 능력은 단일하고 일관된 경로에 의존하지 않는다. 그것은 질문이 어떻게 던져지느냐에 따라 모델의 여러 부분에 의해 촉발될 수 있는 유연하고 표면적인 행동이다.
정보가 저장되는 이러한 방식의 차이는 모델을 수정하려는 시도에 심오한 결과를 초래한다. 연구진은 대화 중에 힌트를 주는 것, 새로운 데이터로 재학습시키는 것, 그리고 모델의 내부 가중치를 외과적으로 수정하는 세 가지 일반적인 기술을 사용하여 모델의 시간 감각을 업데이트하려고 시도했다. 모델이 진술하는 얕은 수준의 선언적 연도를 업데이트하려고 했을 때, 이 방법들은 완벽하게 작동했다. 시스템 프롬프트에서 모델에게 연도가 2025년이라고 알려주거나 2025년의 새로운 데이터를 보여주는 것만으로도, 모델은 즉시 높은 정확도로 올바른 연도를 말하기 시작했다. 마치 파일 캐비닛의 라벨을 바꾸는 것과 같았다.
그러나 동일한 기술들을 깊은 수준의 연상적 연도에 적용했을 때는 완전히 실패했다. 모델에게 명시적으로 2025년이라고 말해주었음에도 불구하고, 모델의 내부 문법은 과거에 머물러 있었다. "2025년에는..."이라는 문장을 완성하라고 요청했을 때, 모델은 여전히 2025년이 역사적 사건인 것처럼 과거 시제 동사를 예측했다. 모델을 새로운 데이터로 재학습시키는 것은 원래의 학습 중단 시점과 매우 가까운 연도에 대해서만 약간의 도움을 줄 뿐이었다. 모델의 깊은 시간 감각을 변화시킬 수 있는 유일한 방법은 모델의 내부 연결을 정교하게 편집하는 복잡한 외과적 수정뿐이었다. 하지만 여기에 마지막 반전이 있었다. 연구진이 이 외과적 방법을 사용하여 깊은 문법적 연도를 수정했을 때, 모델이 연도를 소리 내어 말하는 능력은 변하지 않은 채 그대로였다. 두 시계는 동기화될 수 없었다.
연구는 현재의 연도가 이 기계들 내부에서 단일한 개념이 아니라고 결론짓는다. 깊은 문법적 시간 이해는 모델이 초기 학습 과정에서 배운 언어 구조의 근본적인 부분이며, 이는 변화에 매우 강하다. 그것은 모델이 연도를 동사와 연결하는 방식 속에 짜여 있으며, 표준적인 업데이트로는 지울 수 없을 만큼 깊이 각인된 패턴이다. 얕은 선언적 이해는 모델이 인간과 대화하는 법을 배울 때 나중에 습득한 별개의 층이며, 쉽게 덮어쓸 수 있다. 이는 단순히 모델에게 날짜를 알려주거나 새로운 텍스트로 재학습시키는 것만으로는 모델에게 진정하고 일관된 현재의 감각을 부여하기에 충분하지 않다는 것을 의미한다. 기계는 올바른 연도를 말할 수는 있지만, 여전히 세상이 실제보다 더 오래되었다고 생각한다. 이러한 괴리는 모델을 현실 세계에 맞춰 갱신하는 것이 생각보다 훨씬 더 어렵다는 점을 시사한다. 왜냐하면 하나의 진실 버전을 수정하더라도 다른 버전은 고집스럽게 뒤처져 남기 때문이다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.