Behaviour Is an Incomplete Measure of Reasoning Development: Cross-surface pre-arrival accessibility and the limits of developmental inference in a recurrent-depth reasoner
이 논문은 순환 깊이 추론기(recurrent-depth reasoner)에서 내부 은닉 상태 프로브가 관찰 가능한 행동으로 나타나기 훨씬 전부터 추론 능력을 감지할 수 있음을 입증하며, 이는 행동적 임계치와 디코더 접근성이 실제 추론의 발달 타임라인을 측정하는 데 있어 별개이며 불완전한 척도임을 드러낸다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인공지능 분야가 급격히 발전함에 따라, 연구자들은 종종 근본적인 질문에 직면합니다: 기계가 실제로 무언가를 배웠다는 것은 언제인가? 수년 동안 표준적인 답변은 행동주의적이었습니다. 만약 컴퓨터 프로그램이 이전에 본 적 없는 질문에 올바르게 답할 수 있다면, 우리는 그 프로그램이 그 답을 내기 위해 필요한 추론 능력을 습득했다고 가정합니다. 우리는 출력값, 즉 최종 답변을 보고 그 능력이 존재한다고 선언합니다. 그러나 이러한 접근 방식은 기계의 마음을 블랙박스로 취급하며, 정답이 나타나는 순간 그 정답을 찾아내는 내부 과정이 방금 일어났음이 틀림없다고 가정합니다. 이 논문은 기계가 외부로 보여줄 능력을 갖추기 훨씬 전부터 내부적으로 문제를 해결하는 능력이 존재하는지를 물으며, 학습 중인 기계의 내부를 들여다봄으로써 그 가설에 도전합니다. 연구자들은 단순히 기계가 무엇을 하는지 관찰하는 것이 아니라, 기계가 아직 증명해내지 못할 때조차 무엇을 알고 있는지를 측정하고 있습니다.
이 문제의 중요성을 이해하기 위해, 새로운 언어를 배우는 과정을 상상해 보십시오. 당신은 몇 달 동안 어휘와 문법 규칙을 암기할 수도 있지만, 여전히 대화를 나누는 데는 실패할 수 있습니다. 당신의 말하기만을 관찰하는 교사는 당신이 아무것도 배우지 못했다고 결론 내릴지도 모릅니다. 하지만 만약 당신의 뇌를 엿볼 수 있다면, 언어를 위한 신경 경로가 이미 형성되어 있으며 그것들을 연결할 마지막 불꽃만을 기다리고 있다는 것을 발견할 수도 있을 것입니다. 이것이 바로 연구자들이 조사한 간극입니다. 그들은 가족 관계도처럼 관계의 사슬을 다루는 논리 퍼즐을 풀도록 설계된 특화된 컴퓨터 모델을 구축했습니다. 그들은 두 가지 다른 방식으로 이 모델을 훈련시켰습니다. 하나는 관계가 추상적이고 의미 없는 기호들로 설명되는 방식이었고, 다른 하나는 동일한 관계가 영어 같은 문장들로 설명되는 방식이었습니다. 목표는 정보가 제시되는 방식이 모델의 학습 속도를 변화시키는지, 그리고 모델의 내부 상태가 겉으로 드러나지 않는 지식을 드러내는지 확인하는 것이었습니다.
결과는 놀랍고도 직관에 어긋났습니다. 모델이 추상적인 기호로 훈련되었을 때, 모델은 단 70회의 훈련 사이클 만에 3단계 논리 퍼즐을 마스터했습니다. 정확히 동일한 모델을 동일한 훈련 계획하에 영어 같은 문장으로 훈련시켰을 때는, 동일한 수준의 숙련도에 도달하기까지 13,000회 이상의 사이클이 걸렸습니다. 이는 180배가 넘는 차이입니다. 그러나 문장으로 훈련된 모델이 마침내 3단계 퍼즐을 풀어냈을 때, 그 모델은 4단계 버전을 단 8회의 사이클 만에 해결했습니다. 이는 모델이 어려운 단계에서 진전이 없는 것처럼 보이는 힘든 시기를 수천 번의 사이클 동안 견뎌낸 후, 갑자기 더 어려운 문제를 해결하는 능력을 잠금 해제했음을 시사합니다. 만약 연구자가 최종 답변만을 관찰했다면, 그들은 한동안 실패하다가 갑자기 성공하는 기계를 보았을 것이며, 그 고군분투 중에 일어난 숨겨진 내부 발전의 과정 전체를 놓쳤을 것입니다.
그 길고 어려운 사이클 동안 무슨 일이 일어나고 있었는지 확인하기 위해, 연구자들은 모델의 은닉 상태(hidden states), 즉 기계가 사고하는 데 사용하는 데이터의 내부 표현을 살펴보았습니다. 그들은 디코더 역할을 하는 간단한 도구인 선형 프로브(linear probe)를 사용하여, 모델이 실제로 답을 출력하기 전에 정답이 기계의 마음속에 이미 존재하는지 확인했습니다. 문장 기반 훈련의 표면에서, 이 프로브는 모델이 스스로 정답을 맞힐 수 있기 훨씬 전부터 정답의 정체를 작지만 신뢰할 수 있는 신호로 감지할 수 있었습니다. 프로브는 모델이 아직 답을 표현할 수 없음에도 불구하고, 내부적으로는 정보가 접근 가능하다는 것을 찾아냈습니다. 이 내부적 접근성은 우연이 아니었습니다. 연구자들이 다시 추상적인 기호로 전환했을 때, 그들은 기계의 처리 과정 중 특정 지점에서 동일한 조기 접근성 패턴을 발견했습니다. 기계는 정보를 내부적으로 보유한 채, 그것을 방출할 적절한 순간을 기다리고 있었습니다.
그러나 이 연구는 우리가 이러한 종류의 학습을 측정하려고 할 때 직면하는 중대한 한계 또한 밝혀냈습니다. 연구자들은 이 내부 지식이 시간이 지남에 따라 어떻게 강해지는지를 정확히 추적하여 기계의 학습 곡선을 만들고자 했습니다. 그러나 그들은 곧 이 특정 측정을 정확하게 수행하는 것이 불가능하다는 것을 깨달았습니다. 문제는 기계가 테스트를 받는 질문의 집단이 계속 변한다는 것이었습니다. 기계가 학습함에 따라 특정 질문들에 더 잘 답하게 되고, 그 질문들은 테스트 그룹에서 제거되었습니다. 이는 기계의 진전도를 측정하는 행위 자체가 측정되는 질문의 모집단을 변화시킨다는 것을 의미했습니다. 이는 마치 러너가 아직 완주하지 못한 트랙에서만 시간을 측정하여 러너가 얼마나 개선되고 있는지 측정하려는 것과 같습니다. 러너가 빨라짐에 따라 트랙이 변하게 되어, 시간에 따른 속도를 공정하게 비교하는 것이 불가능해집니다. 연구자들은 이러한 특정 유형의 측정이 기계가 학습하지 않았기 때문이 아니라, 측정 방법 자체가 망가졌기 때문에 근본적으로 결함이 있음을 입증했습니다.
논문은 우리가 기계가 무엇을 배웠는지 알기 위해 단 하나의 방식에만 의존해서는 안 된다고 결론짓습니다. 행동적 성공, 즉 정답을 내놓는 능력은 관찰 가능한 하나의 사실일 뿐입니다. 내부적 접근성, 즉 기계 내부에서 답을 감지할 수 있는 능력은 또 다른 사실입니다. 그리고 시간의 흐름에 따른 실제 발전 과정은 세 번째 사실이며, 이는 측정 방법 자체가 조건을 변화시킨다면 직접적으로 측정할 수 없는 경우가 많습니다. 연구자들은 기계가 내부적으로 능력을 보유하고 있다가 이를 외부로 드러내기까지 시간이 걸릴 수 있으며, 그 능력으로 가는 경로가 문제가 제시되는 방식에 따라 완전히 달라질 수 있음을 발견했습니다. 가장 중요한 것은, 단순히 기계를 관찰하는 것만으로는 기계가 습득한 계산을 이해하기에 충분하지 않다는 점을 보여주었다는 것입니다. 기계가 무엇을 배웠는지 진정으로 알기 위해서는 관찰을 넘어 개입을 시작해야 하며, 기계의 내부 상태를 직접 테스트하여 그것이 실제 행동의 원인이 되는지 확인해야 합니다. 그때까지 이 시스템들의 내부적인 삶은, 비록 정답을 내놓고 있을 때조차도 부분적으로 숨겨져 있을 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.