An Omitted Mode Is a Rare Rule: The Sampling-Verification Danger Law in Continuous Code World Models
이 논문은 연속적인 코드 세계 모델에서, 단순히 샘플링 검증에만 기반하여 LLM이 합성한 플래너를 수용하는 것은 임계적인 불연속 모드를 놓치는 경우가 많아 무작위 샘플링보다는 표적화된 개입을 통해서만 신뢰성 있게 식별될 수 있는 치명적인 계획 실패를 초래하므로 매우 위험할 정도로 불충분하다는 것을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
현대 인공지능의 세계에서 로봇이나 자율주행 자동차와 같은 물리적 시스템을 제어하는 기계에게 가르치는 인기 있는 전략은, 기계가 먼저 세상이 어떻게 작동하는지에 대한 정신적 지도(mental map)를 구축하도록 하는 것이다. 흔-히 '월드 모델(world model)'이라 불리는 이 지도는 특정 행동을 취했을 때 다음에 어떤 일이 일어날지를 예측한다. 일단 기계가 이 지도를 갖추게 되면, 최선의 결과를 이끌어내는 일련의 행동 순서를 찾기 위해 수천 가지의 가능한 미래를 시뮬레이션하는 계획 알고리즘을 사용한다. 이 지도가 관찰된 데이터에 대해 충분히 정확하다면, 계획을 세우는 데 사용하기에 안전할 것이라는 가정이 오랫동안 지속되어 왔다. 만약 이 지도가 천 번의 테스트 실행에서 미래를 올바르게 예측한다면, 그것은 신뢰할 수 있는 가이드라고 간주된다.
그러나 한 새로운 연구는 세상에 기계가 훈련 중에 접해보지 못한 희귀하고 갑작스러운 사건이 존재할 때 어떤 일이 발생하는지를 살펴봄으로써 이 가정을 반박한다. 예를 들어, 매끄러운 도로를 운전하는 법은 배웠지만 벽을 본 적이 없는 자동차를 상상해 보라. 만약 벽이 너무 희귀해서 자동차가 훈련 중에 그 벽에 부딪힌 적이 없다면, 기계의 정신적 지도는 단순히 벽의 존재를 무시하고 도로가 영원히 계속된다고 가정할 수도 있다. 위험한 점은, 기계가 마침내 실제 세상에서 운전하려고 할 때, 보이지 않는 벽을 향해 직진하는 경로를 계획할 수 있다는 것이다. 마치 그 벽을 통과할 수 있다고 믿는 것처럼 말이다. 연구자들이 던진 질문은, 기계의 지도를 무작위 샘플을 통해 검증하는 표준적인 안전 점검 방식이 충돌이 발생하기 전에 이러한 특정한 종류의 맹목성을 잡아낼 수 있는지 여부였다.
연구자들은 이 질문에 답하기 위해 트랙을 따라 움직이는 카트나 진자 운동을 하는 추와 같은 단순한 물리적 시뮬레이션을 사용하여 일련의 통제된 실험을 설계했다. 이 시뮬레이션들에서 그들은 '희귀한 규칙(rare rule)'을 도입했는데, 이는 물체가 닿는 즉시 물체의 운동을 멈추게 하는 벽이나 바닥과 같은 '강한 정지'이다. 그 후 연구자들은 대규모 언어 모델에게 기계의 정신적 지도를 작성하는 코드를 쓰게 했지만, 이 모델의 훈련 데이터로부터 이 벽의 존재를 의도적으로 숨겼다. 모델에게는 벽을 피하게 된 카트나 진자의 무작위 움직임만을 보여주었다. 벽이 매우 희귀했기 때문에, 모델은 훈련 중에 이를 결코 보지 못하는 경우가 많았다.
결과는 극명했다. 연구자들이 모델을 표준적인 안전 점검(모델을 수천 개의 무작위 시나리오에 실행하여 실제 물리 법칙과 일치하는지 확인하는 과정)으로 테스트했을 때, 모델들은 빈번하게 통과했다. 수천 번의 무작위 테스트 중에 벽이 트리거되지 않았기 때문에, 모델들은 '정확한 것'으로 수용되었다. 그러나 이 '검증된' 모델들을 시스템을 제어하기 위한 플래너(planner)에게 넘겨주었을 때, 플래너는 자신 있게 카트나 진자를 숨겨진 벽으로 직접 몰고 갔다. 벽의 존재를 알지 못하는 모델은 물체가 그곳을 통과할 것이라고 예측했다. 이 거짓된 예측을 신뢰한 플래너는 물체를 벽으로 몰아넣었고, 물체는 그곳에 갇히게 되었다. 결과적으로 기계는 목표에 도달할 수 없게 되었으며, 잠재적인 성공 가능성을 거의 모두 잃었다. 이 연구는 이러한 실패가 계산의 실수가 아니라 지식의 근본적인 공백 때문임을 밝혀냈다. 즉, 모델은 존재하지만 샘플링되지 않은 규칙에 대해 눈이 멀어 있었던 것이다.
연구자들은 이러한 재앙이 발생할 가능성이 희귀성에 기반한 정밀한 수학적 패턴을 따른다는 것을 발견했다. 만약 위험한 사건이 백 번의 무작위 시행 중 한 번 발생하는데, 안전 점검이 백 번의 시행만 수행한다면, 그 사건을 놓칠 상당한 가능성이 있다. 만약 점검이 천 번의 시행을 수행한다면 놓칠 확률은 떨어지지만, 결코 제로에 도달하지는 않는다. 연구는 훈련 데이터에 희귀한 사건이 포함되지 않는 한, 아무리 정교한 계획이나 모델 개선을 거치더라도 이를 발견할 수 없음을 증명했다. 모델은 여전히 눈이 멀어 있으며, 무작위 샘플링을 사용하는 안전 점검의 본질상 그 맹점(blind spot)이 발견되었음을 보장할 수 없다.
연구는 또한 모델이 훈련 중에 벽을 보여준다면 그 규칙을 학습할 수 있는지 탐구했다. 직선을 따라 움직이는 카트와 같은 단순한 1차원 작업에서는 결과가 놀랍게도 긍정적이었다. 모델에게 카트가 벽에 부딪히는 사례를 단 몇 번이라도 보여주면, 언어 모델은 벽을 멈추게 하는 정확한 코드를 작성하여 정신적 지도를 효과적으로 '수리'할 수 있었다. 모델은 그 규칙을 완벽하게 학습했다. 그러나 연구자들은 이후 더 복잡한 2차원 환경, 즉 평평한 표면 위의 원형 패치 형태의 벽이 있는 환경으로 옮겨갔다. 이 경우, 모델에게 패치에 부딪히는 사례를 보여주었음에도 불구하고, 모델은 증거로부터 경계의 모양과 위치를 추론하는 데 실패했다. 모델은 원형 규칙을 학습하는 대신, 직선이나 사각형과 같은 잘못된 모양을 만들어내거나, 왜 그런지 이해하지 못한 채 단순히 물체를 그 자리에 멈춰 세웠다. 모델은 몇 가지 사례로부터 얻은 증거를 바탕으로 전체 형상을 일반화하지 못했다.
이 발견은 이러한 시스템이 학습하는 방식의 결정적인 한계를 부각한다. 연구는 기계가 명시적으로 알려지거나 단순한 맥락에서 보여진 규칙을 번역하는 데는 탁월할 수 있지만, 흩어진 증거로부터 복잡한 규칙의 모양과 위치를 추론하는 데는 어려움을 겪는다는 것을 보여주었다. 기계의 '자기 수정' 능력은 문제의 기하학적 구조에 크게 의존한다. 단순한 경우에는 작동하지만, 복잡한 2차원 경우에는 실패한다. 연구자들은 모델에게 더 많은 사례를 제공하거나, 사고 방식(prompting)을 바꾸거나, 장애물의 모양에 대한 힌트를 주는 등 모델을 돕기 위한 다양한 방법을 테스트했다. 그러나 이러한 개입들은 효과가 없었다. 모델은 2차원 패치에 대한 올바른 규칙을 유도하는 데 지속적으로 실패했으며, 종종 더 단순하고 틀린 모양으로 대체하곤 했다.
이 연구의 함의는 물리적 시스템을 제어하기 위해 AI에 의존하는 모든 이들에게 매우 중요하다. 이는 무작위 샘플링에 기반한 안전 점검이 희귀하지만 치명적인 실패를 잡아내기에는 불충분하다는 것을 시사한다. 모델은 주어진 모든 테스트를 통과할 수 있지만, 특정하고 희귀한 사건에 대해서는 위험할 정도로 틀릴 수 있다. 이 연구는 만약 위험한 사건이 샘플링 과정에서 놓칠 만큼 희귀하다면, 모델은 계속 눈이 멀어 있을 것이며, 플래너는 그 맹점을 이용해 실패를 초래할 것임을 증명한다. 안전을 보장하는 유일한 방법은 훈련 데이터가 이러한 희귀한 사건의 경계까지 포함하도록 보장하거나, 무작위 확률에 의존하지 않는 다른 종류의 검증을 사용하는 것이다. 연구의 결론은 AI가 데이터로부터 학습하는 데 놀라울 정도로 뛰어날 수 있지만, 자신이 본 적 없는 것은 배울 수 없으며, 물리적 세계에서는 본 적 없는 것이야말로 가장 큰 피해를 주는 원인이 될 수 있다는 것이다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.