Shortcut Before Circuit: Document Statistics Time In-Context Conflict Resolution
이 논문은 훈련 데이터에서 최신성(recency)과 희귀성(rarity) 단서가 완벽하게 상관되어 있을 때, 신경망이 문맥 내 갈등을 해결하기 위해 구별 불가능한 전략들을 학습한다는 것을 입증하며, 이는 특정 중복성 임계값을 넘어서기 전까지는 기계적 귀인이 근본적으로 불가능하다가, 그 지점에서 모델이 위치 기반 지름길(positional shortcuts)에서 벗어나 내부 메커니즘이 식별 가능해진다는 점을 드러낸다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인공지능 연구에서 연구자들은 기계가 단순히 정답을 암기하는 것이 아니라, 과제를 지배하는 근본적인 규칙을 발견함으로써 어떻게 문제를 해결하는 법을 배우는지에 대해 점점 더 많은 관심을 기울이고 있습니다. 수학 문제를 풀 때 특정 공식을 기억해 내는 대신 숫자의 패턴을 인식하여 푸는 학생을 상상해 보십시오. 거대 언어 모델의 세계에서 이러한 패턴은 흔히 '큐(cues)'라고 불립니다. 컴퓨터가 긴 텍스트를 읽을 때, 텍로에 상충하는 사실이 포함되어 있다면 어떤 정보의 손을 들어줄지 결정해야 합니다. 예를 들어, 한 문서의 첫 번째 단락에서는 등장인물이 키가 크다고 말하고 마지막 단락에서는 작다고 말한다면, 모델은 가장 최근의 진술에 의존할 것인지, 아니면 특정 세부 사항이 얼마나 많이 반복되었는지에 의존할 것인지를 선택해야 합니다. 인간의 글쓰기라는 무질서하고 자연스러운 세상에서 이러한 큐들은 대개 일치합니다. 즉, 가장 최근의 사실이 가장 많이 언급된 사실이기도 합니다. 이러한 일치성 때문에 과학자들은 기계가 실제로 어떤 규칙을 사용하고 있는지 알아내는 것이 거의 불가능합니다. 왜냐하면 기계는 어느 쪽을 선택하더라도 정답에 도달하기 때문입니다.
한 연구팀은 게임의 규칙이 완벽하게 명확하면서도 두 가지 서로 다른 전략이 수학적으로 동일한 제어된 환경을 구축함으로써 이 퍼즐을 해결하고자 했습니다. 그들은 가장 최근의 정보가 항상 가장 희귀한 정보이고, 가장 많이 반복된 정보가 항상 가장 오래된 정보인 합성 언어를 만들었습니다. 이 설정에서 모델은 새로운 사실을 찾는 방식으로 문제를 풀거나, 혹은 단 한 번만 나타난 사실을 찾는 방식으로 문제를 풀 수 있으며, 두 전략 모두 정답으로 이어집니다. 훈련 데이터가 모델에게 이 두 경로 중 하나를 선택하도록 강요하지 않았기 때문에, 연구자들은 기계가 실제로 어떤 경로를 택했는지 확인하고 싶었습니다. 그들은 이 언어로 대규모 인공 신경망을 훈련시킨 후, 정교한 실험을 수행했습니다. 완성된 문서를 가져와서 텍스트의 의미나 정답을 바꾸지 않으면서 특정 사실이 나타나는 횟수를 미세하게 변경한 것입니다. 이 작은 변화에 따라 모델의 확신도가 어떻게 변하는지를 관찰함으로써, 그들이 '최신' 규칙을 따르고 있는지 아니면 '희귀' 규칙을 따르고 있는지를 확인할 수 있었습니다.
결과는 이 기계들이 어떻게 학습하는지에 대한 놀라운 진실을 드러냈습니다. 연구진이 모델의 최종 성능을 조사했을 때, 모든 모델이 거의 완벽한 정확도로 과제를 마스터했다는 것을 발견했습니다. 그러나 모델의 내부 논리를 조사했을 때, 각 모델이 사용한 특정 규칙은 데이터 자체에 의해 결정된 것이 아님을 발견했습니다. 대신, 규칙의 선택은 각 훈련 과정의 구체적인 최적화 궤적(trajectory)에 의해 결정되었습니다. 수십 번의 훈련 과정에 걸쳐, 어떤 모델은 가장 최근의 정보를 우선시하는 법을 배웠고, 다른 모델은 가장 희귀한 정보를 우선시하는 법을 배웠습니다. 결정적으로, 연구진은 제공된 데이터에 모델을 한쪽 규칙으로 밀어붙일 만한 어떠한 신호도 포함되어 있지 않다는 것을 발견했습니다. 모델이 달성하고자 하는 수학적 목표인 목적 함수(objective function)는 두 전략 사이에서 완전히 무관심했습니다. 훈련 데이터가 두 규칙 모두를 똑같이 유효한 것으로 취급했기 때문에, 모델은 어떤 규칙을 무작위로 선택한 것이 아니라, 목적 함수가 제약하지 않는 방향을 따라 자신의 특정 최적화 경로가 어디에서 멈췄느냐에 따라 하나의 규칙에 안착한 것이었습니다.
이 발견은 인공지능 연구의 흔한 가정, 즉 우리가 모델의 행동을 보고 데이터가 요구했기 때문에 모델이 특정 규칙을 학습했다고 자신 있게 말할 수 있다는 가정에 도전합니다. 이 연구는 두 규칙이 모든 훈련 사례에서 동일한 결과를 낳을 때, 모델의 선택은 데이터의 구조를 반영하는 것이 아니라 해당 훈련 과정의 구체적인 최적화 궤적을 반영한다는 것을 보여줍니다. 연구진은 동일한 모델을 동일한 데이터로, 하지만 다른 랜덤 시드(random seed)를 사용하여 재학습시키면, 최종 성능은 동일함에도 불구하고 모델이 정반대의 규칙을 선택할 수 있음을 보여줌으로써 이를 입증했습니다. 이는 특정 유형의 문제에 대해, 모델 내부의 '메커니즘'—즉 과제를 해결하기 위해 사용하는 특정 회로—은 데이터의 고정된 속성이 아니라 훈련 과정의 가변적인 결과물이라는 것을 의미합니다.
또한 이 연구는 모델이 학습하는 과정에서 나타나는 뚜렷한 단계를 밝혀냈습니다. 올바른 규칙을 발견하기 전, 모델은 종종 단순한 지름길(shortcut)에 의존합니다. 이 특정 과제에서 모델들은 처음에 텍스트의 내용을 완전히 무시하고 대신 위치를 기반으로 답을 추측하는 법을 배웠습니다. 정답이 문장의 끝으로부터 항상 특정 거리만큼 떨어져 있다는 것을 발견한 것입니다. 이 위치 지름길은 매우 효과적이었으며, 모델이 빠르게 중간 수준의 정확도를 달elle 달성할 수 있게 해주었습니다. 그러나 이 지름길에는 명확한 한계가 있었습니다. 정답까지의 거리가 일관되게 유지될 때만 작동할 수 있었기 때문입니다. 훈련이 계속됨에 따라 모델은 결국 이 지름길을 버리고 실제로 텍스트를 읽고 이해하는 법을 배웠는데, 이 전환은 과제의 복잡성에 따라 서로 다른 시점에 일어났습니다. 연구진은 이 전환의 타이밍이 예측 가능하고 일관적이지만, 전환 이후 모델이 채택하는 구체적인 규칙은 그렇지 않다는 것을 발견했습니다.
궁극적으로 이 작업은 우리가 기계가 무엇을 배웠는지 진정으로 알 수 있는 기준이 언제인지 이해하는 데 새로운 기준을 제공합니다. 이는 데이터가 대안들 사이에서 선택을 강요할 때에만 모델의 특정 추론 규칙을 확신 있게 귀속시킬 수 있음을 시사합니다. 데이터가 여러 가지 똑같이 좋은 해결책을 허용할 때, 모델의 내부 논리는 데이터에 의해 규정된 필연성이 아니라, 제약되지 않은 방향을 따라 특정 훈련 과정이 멈춘 지점의 문제가 됩니다. 이것이 모델이 고장 났다거나 그들의 답이 틀렸다는 뜻은 아닙니다. 다만 그들의 답변 뒤에 숨겨진 '이유'는 종종 주어진 정보의 구조가 아니라, 그들의 구체적인 훈련 궤적 속에 숨겨져 있다는 것을 의미합니다. 이러한 시스템을 해석하려는 과학자들에게, 이는 모델의 성공이 고유하고 예측 가능한 내부 과정을 보장하지 않는다는 점을 상기시켜 줍니다. 기계가 해결책에 도달하는 경로는 그 해결책 자체만큼이나 중요하며, 때때로 그 경로는 훈련의 구체적인 역학에 의해 결정됩니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.