Data-Environment Coverage and the Path from Narrow to General AI:A Cyber-Physical-Social-ThinkingSurvey
이 논문은 현재 인공지능의 인과 추론, 사회적 인지, 그리고 상징적 구성에서의 지속적인 한계가 규모의 부족이 아니라 다양한 데이터 환경의 결여에서 기인한다고 주장하며, 80개의 시스템에 대한 조사를 통해 물리적, 사회적, 그리고 사고 공간의 신호를 통합하는 것이 협소한 패턴 인식을 넘어 일반 지능으로 나아가기 위해 필수적임을 입증한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 로봇에게 세상을 이해하는 법을 가르치려 한다고 상상해 보십시오. 지난 10년 동안 인공지능(AI) 분야의 가장 큰 돌파구는 로봇에게 텍_스트, 이미지, 코드, 비디오와 같은 방대한 양의 디지털 정보를 먹이는 것에서 왔습니다. 이것은 마치 학생에게 바다에 관한 모든 사실—조수, 물고기, 폭풍에 대해—을 담은 책이 가득한 도서관을 통째로 주는 것과 같습니다. 그 학생은 바다에 관한 모든 사실을 암기하고 아름다운 수필을 쓸 수도 있을 것입니다. 하지만 만약 그 학생에게 실제로 수영을 해보라거나, 차가운 물을 느껴보라거나, 한 번도 본 적 없는 조류를 헤쳐 나가보라고 요구한다면, 그 학생은 허우적거릴지도 모릅니다. 이것이 현재의 "좁은 AI(Narrow AI)"의 상태입니다. 즉, 디지털 데이터를 처리하는 데는 탁월하지만, 인과관계나 인간의 의도 이해, 혹은 단순한 패턴 매칭 이상의 논리적 추론과 같이 복잡하고 무질서한 현실 세계의 문제들에는 어려움을 겪는 시스템을 말합니다. 과학자들은 이 모든 것을 할 수 있는 기계를 만드는 목표를 "인공 일반 지능(AGI)"이라고 부릅니다. 모두가 던지는 핵심적인 질문은 이것입니다: 왜 우리는 아직 이것을 만들지 못했을까요? 컴퓨터의 용량이 부족해서일까요, 아니면 우리가 기계를 가르치는 방식에 무언가 빠진 것이 있는 걸까요?
연구자 이 펑(Yi Peng), 후안셩 닝(Huansheng Ning), 지안궈 딩(Jianguo Ding)이 작성한 이 논문은 문제가 컴퓨터의 크기나 데이터의 양에 있는 것이 아니라고 주장합니다. 대신, 문제는 그 데이터가 어디에서 오느냐에 있습니다. 저자들은 현재의 AI가 디지털 기록만을 학습하는 "사이버 전용(Cyber-only)" 버블에 갇혀 있다고 제안합니다. 진정으로 똑똑해지기 위해서, AI는 도서관 밖으로 나와 실제 세상 속으로 들어가야 한다고 그들은 주장합니다. 그들은 CPST라고 불리는 새로운 AI 학습 관점을 제안하는데, 이는 **사이버-물리-사회-사고(Cyber-Physical-Social-Thinking)**를 의미합니다. 이것을 현실의 4차원 지도라고 생각해보십시오:
- 사이버(Cyber): 텍스트, 코드, 파일로 이루어진 디지털 세계 (현재의 AI가 거주하는 곳).
- 물리(Physical): 물체, 중력, 그리고 원인과 결과가 존재하는 세계 (컵을 밀면 떨어지는 것을 볼 수 있는 곳).
- 사회(Social): 인간의 감정, 의도, 규칙이 존재하는 세계 (타인이 무엇을 생각하는지 추측해야 하는 곳).
- 사고(Thinking): 엄격한 논리, 수학, 구조화된 기호가 존재하는 세계 (정리를 증명할 수 있는 곳).
이 논문은 AI가 "똑똑한 계산기"를 넘어 "일반 지능"으로 나아가기 위해서는 단순히 디지털 세계뿐만 아니라 이 네 가지 세계의 루프를 모두 닫아야 한다고 제안합니다.
거대한 데이터 버블
연구진은 초기 이미지 분류기부터 오늘날 가장 진보된 로봇과 챗봇에 이르기까지 80개의 서로 다른 AI 시스템을 조사했습니다. 그들은 이 시스템들을 네 가지 세계(사이버, 물리, 사회, 사고) 중 얼마나 많은 세계와 "폐쇄 루프(closed loop)"를 통해 상호작용하는지에 따라 분류했습니다. 폐쇄 루프란 시스템이 단순히 데이터를 읽는 것에 그치지 않고, 세상에 작용을 가하고, 그 결과를 보고, 그로부터 배우는 것을 의미합니다.
그들이 발견한 결과는 "규모가 커질수록 좋다"고 믿는 사람들에게 다소 충격적입니다: 전체 80개의 목록 중 단 하나의 AI 시스템도 이 네 가지 세계 중 두 개 이상의 루프를 성공적으로 닫지 못했습니다.
순수하게 디지털인 가장 진보된 시스템들은 단단한 천장에 부딪히고 있습니다. 이들은 자신이 본 데이터의 패턴을 인식하는 데는 놀라운 능력을 보이지만, 실제 세계의 이해가 필요한 작업에서는 처참하게 실패합니다. 예를 들어:
- 인과적 추론: 로봇이 블록을 쌓는 영상을 보여주면, 디지털 전용 AI는 다음 동작을 예측할 수 있을지 모릅니다. 하지만 "만약 내가 맨 아래 블록을 제거하면 어떻게 될까?"(반사실적 질문)라고 묻는다면, 그들은 종종 틀립니다. 그들은 중력을 직접 '느끼거나' 블록을 '밀어본' 적이 없기에 물리학을 진정으로 이해하지 못하는 것입니다.
- 사회적 인지: 현재의 AI는 인간의 대화를 흉내 낼 수는 있지만, 어떤 사람이 자신의 진짜 감정을 숨기고 있을 때 그 사람의 생각을 이해하는 데는 어려움을 겪습니다. 이는 카드를 읽을 수는 있지만 플레이어의 표정이나 몸짓을 읽지는 못하는 포커 게임을 하는 것과 같습니다.
- 논리적 추론: AI는 패턴을 추측하여 수학 문제를 풀 수는 있지만, 자신의 작업이 일련의 규칙에 부합하는지 스스로 검증해야 하는 엄격한 단계별 논리 경로를 따르는 데는 자주 실패합니다.
이 논문은 단순히 AI를 더 크게 만드는 것(파라미터를 늘리거나 더 많은 텍스트를 학습시키는 것)이 이러한 문제를 해결할 것이라는 생각을 명시적으로 배제합니다. 저자들은 가장 크고 강력한 모델들조차 여전히 "사이버" 영역에 갇혀 있다는 점을 지적합니다. 그들은 이 모델들이 마치 세상의 모든 요리책을 다 읽었지만, 정작 스토브를 만져보거나 음식 맛을 본 적은 없는 요리사와 같다고 말합니다. 직접 경험해보지 않는다면 아무리 많이 읽어도 완벽한 요리를 만드는 법을 배울 수 없습니다.
빠진 재료들
저자들은 "사이버 전용" 접근 방식이 왜 실패하는지를 설명하기 위해 영리한 비유를 사용합니다. 그들은 각 세계가 다른 세계가 만들어낼 수 없는 고유한 종류의 "신호"를 제공한다고 말합니다.
- 인과관계(원인과 결과)를 배우기 위해서는 물리적 데이터가 필요합니다. 실제로 무언가를 행하고 어떤 일이 일어나는지 봐야 합니다. 물리학에 관한 책을 읽는 것만으로는 이를 배울 수 없습니다.
- 사회적 지능(사람을 이해하는 것)을 배우기 위해서는 사회적 데이터가 필요합니다. 실제 인간과 상호작용하고, 그들의 반응을 보고, 자신의 행동을 조정해야 합니다. 채팅 로그를 읽는 것만으로는 이를 배울 수 없습니다.
- 복잡한 논리를 배우기 위해서는 사고 데이터가 필요합니다. 텍プト 뭉치가 아니라, 질의하고 수정할 수 있는 구조화된 기호와 규칙의 체계가 필요합니다.
논문은 이에 대한 강력한 증거를 제시합니다. 연구진은 입력되는 데이터만 다를 뿐 나머지는 동일한 AI 시스템들을 비교했습니다.
- 로봇이 다른 로봇이 움직이는 영상으로만 훈련받았을 때는 자신의 움직임을 계획하지 못했습니다. 하지만 동일한 로봇이 자기 자신이 움직이고 물체와 상호작용하는 실제 영상으로 훈련받았을 때, 그 로봇은 본 적 없는 것을 계획하고 조작하는 법을 갑자기 학습했습니다.
- 마찬가지로, 언어 모델에 불과한 수학 해결 AI는 거의 모든 질문에 틀렸습니다. 하지만 이 언어 모델을 엄격한 논리 엔진("사고" 도구)에 연결하자 성능이 급격히 향상되었습니다.
데이터는 명확한 패턴을 보여줍니다: 단 하나의 추가적인 세계(물리 또는 사고)와 상호작용하는 시스템이 훨씬 더 높은 수준의 역량에 도달할 가능성이 높습니다. 하지만 "일반 지능"이라는 성배, 즉 네 가지 세계를 동시에 다룰 수 있는 시스템은 여전히 비어 있습니다. 80개의 시스템을 조사한 결과, 세 개 이상의 세계에서 루프를 성공적으로 닫은 시스템은 단 하나도 없었습니다. 진정한 "일반 지능"이 존재해야 할 지도의 영역은 현재 유령 도시와 같습니다.
일반 지능을 향한 로드맵
그렇다면 앞으로 어떻게 해야 할까요? 저자들은 문제점을 지적하는 데 그치지 않고, 이를 해결하기 위한 3단계 로드맵을 제시합니다.
- 의미론적 정렬 (Semantic Alignment): 우리는 AI가 이 서로 다른 세계들 사이를 번역하도록 가르쳐야 합니다. 현재의 AI는 물리적 센서의 수치는 이해할 수 있어도, 그것이 어떻게 사회적 규칙이나 논리적 사실과 연결되는지는 알지 못할 수 있습니다. 우리는 AI가 "로봇이 컵을 쳤고(물리), 이로 인해 인간이 화가 났으며(사회), 그러므로 사과해야 한다(사고)"라고 말할 수 있도록 다리를 놓아야 합니다.
- 통합된 세계 모델 (Unified World Models): 우리는 이 모든 서로 다른 유형의 정보를 동시에 담을 수 있는 단일한 "두뇌"를 구축해야 합니다. 물리학을 위한 뇌, 사회적 규칙을 위한 뇌, 수학을 위한 뇌를 따로 두는 대신, 이 모든 것을 동시에 다룰 수 있는 하나의 시스템이 필요합니다.
- 거버넌스 (Governance): AI가 실제 세상(물리) 및 실제 사람들(사회)과 상호작용하기 시작함에 따라, 새로운 안전 규칙이 필요합니다. 우리는 단순히 코드를 점검하는 것을 넘어, AI가 현실 세계에서 자신의 행동이 가져올 결과(consequences)를 이해하도록 만들어야 합니다.
논문은 다음과 같은 대담한 예측으로 결론을 맺습니다: 일반 지능으로 가는 길은 더 큰 컴퓨터를 만들거나 인터넷에서 더 많은 텍스트를 긁어모으는 것이 아닙니다. 그것은 물리적 세계를 만지고 느끼고 상호작용할 수 있는 로봇을 만드는 것, 인간과 진정으로 대화하고 협상할 수 있는 시스템을 만드는 것, 그리고 엄격한 논리로 추론할 수 있는 도구를 설계하는 것입니다. AI 시스템이 디지털 도서관을 벗어나 사이버-물리-사회-사고라는 4차원의 복잡한 현실 속으로 발을 내딛기 전까지, 그들은 탁월하지만 제한적인 학생으로 남을 것이며, 진정한 일반 지능의 단계로 졸업할 수 없을 것입니다.
저자들은 이것이 강력한 증거에 의해 뒷받erd된 가설이지만, 아직 증명된 법칙은 아니라는 점을 주의 깊게 언급합니다. 만약 순수하게 디지털인 AI가 실제 세상을 접하지 않고도 갑자기 이 모든 문제를 해결한다면, 그들의 이론은 틀린 것이 될 것입니다. 하지만 지금까지의 증거는 한 가지 방향을 명확히 가리키고 있습니다: 일반 지능을 구축하려면, 세상을 데이터셋으로 취급하는 것을 멈추고 놀이터로 대하기 시작해야 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.