A Primer on Computational Semantics for Artificial Intelligence Systems
이 논문은 형식적, 근거적, 분포적 의미론 이론을 탐구함으로써 독자들이 트랜스포머 기반 언어 모델이 인간과 비교하여 어떻게 언어를 학습하고 표현하는지 이해하도록 돕는 계산 의미론의 입문서를 제공한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
언어는 우리가 가진 가장 인간적인 것이며, 서로의 생각, 감정, 계획을 공유하기 위해 사용하는 도구입니다. 그러나 우리는 매일 언어를 사용함에도 불구하고, 대부분의 사람들은 그것이 실제로 어떻게 작동하는지, 혹은 우리가 "빨강"과 같은 단어를 말할 때 그것이 진정으로 무엇을 의미하는지 설명하지 못합니다. 우리는 그 색을 볼 때 그것을 알지만, 주변 세계를 가리키지 않고는 그것을 쉽게 정의할 수 없습니다. 언어를 사용하는 것과 그 메커니즘을 이해하는 것 사이의 이 간극은 기계가 어떻게 말을 배우는지 연구하는 과학자들이 직면한 핵심적인 수수께끼입니다. 수십 년 동안 연구자들은 컴퓨터에게 논리, 규칙, 또는 방대한 양의 텍스트를 입력하여 의미를 이해하도록 가르치려 노력해 왔습니다. 하지만 새로운 관점은 이 기계들이 근본적인 무언가를 놓치고 있다고 제안합니다. 바로 살아있다는 물리적 경험입니다. 왜 컴퓨터가 사람처럼 들리면서도 사람처럼 생각하지 못하는지를 이해하려면, 인간이 아이로서 언어를 배우는 방식과 오늘날 인공지 Intelligence 시스템이 구축되는 방식을 비교해 보아야 합니다.
보이시 주립 대학교의 케이시 케닝턴(Casey Kennington)이 작성한 이 논문은 과학자들이 의미를 정의하고 계산하기 위해 시도했던 다양한 방식들을 안내하는 가이드 역할을 합니다. 저자는 현대의 인공지능, 특히 ChatGPT와 같은 도구 뒤에 있는 강력한 모델들이 놀라울 정도로 정확하게 인간의 대화를 흉내 낼 수는 있지만, 인간과 같은 방식으로 언어를 이해하는 것은 아니라고 주장합니다. 이 논문은 연구자들이 기계에게 의미를 가르치기 위해 시도했던 세 가지 주요 방법을 탐구합니다: 엄격한 논리를 사용하는 것, 단어를 물리적 경험과 연결하는 것, 그리고 텍{text} 속에서 단어들이 어떻게 함께 나타나는지를 분석하는 것입니다. 케닝턴은 세 번째 방법인 텍스트 패턴으로부터 학습하는 방식이 현재 유창한 말하기를 만들어내는 데 가장 성공적이지만, 결정적인 구멍을 남겨둔다는 사실을 발견했습니다. 텍스트로만 학습된 기계는 빨간 사과를 본 적도, 의자의 무게를 느껴본 적도, 물을 마실 때의 안도감을 경험해 본 적도 없습니다. 이러한 물리적, 감정적 연결 없이는 그들이 처리하는 단어들은 근거가 없는 기호로 남아, 인간이 가진 깊고 삶에 뿌리박힌 의미를 결만큼 갖지 못합니다.
문제를 이해하려면 먼저 인간이 어떻게 배우는지 살펴보아야 합니다. 아이가 "개"라는 단어를 배울 때, 아이는 사전적 정의로 시작하지 않습니다. 아이는 상호작용을 통해 배웁니다. 부모가 털이 있는 동물을 가리키면, 아이는 그것을 바라보고, 그 단어를 시각, 청각, 그리고 그 동물의 촉감과 연결합니다. 이 과정은 공유된 주의력과 물리적 현존에 의존합니다. 아이는 단어가 세상의 실제 사물들을 지칭한다는 것과, 이러한 사물들이 의자에 앉거나 공을 차는 것과 같은 특정한 용도를 가지고 있다는 것을 배웁니다. 이 단어와 그것이 묘사하는 물리적 실체 사이의 연결을 '그라운딩(grounding, 접지)'이라고 부릅니다. 인간에게 의미는 단순히 정의의 목록이 아닙니다. 그것은 우리의 몸, 감각, 그리고 감정과 연결되어 있습니다. 우리는 갈증을 느껴봤기에 "갈증"이 무엇인지 알고, 의자에 앉아봤기에 "의자"가 무엇인지 압니다.
오랫동안 컴퓨터 과학자들은 공학에서 사용되는 수학과 유사한 형식 논리를 사용하여 기계에게 언어를 이해하도록 가르치려 했습니다. 그들은 단어를 방정식의 변수처럼 취급하여, "크다", "회색", "코끼리"가 결합되어 특정 동물에 대한 논리적 문장을 만들 수 있게 했습니다. 이 접근 방식은 컴퓨터에게는 정밀하고 모호함이 없기 때문에 잘 작동합니다. 그러나 현실 세계의 복잡한 문제 앞에서는 실패합니다. 이 규칙을 따르는 컴퓨터는 "회색 코끼리"가 회색인 코끼리라는 것은 알 수 있지만, 회색이 어떻게 보이는지 혹은 코끼리가 어떤 느낌인지는 알지 못합니다. 그것은 의미의 구조는 가지고 있지만 실체는 가지고 있지 않습니다. 논문은 이 접근 방식이 기계가 단어가 물리적 세계에서 실제로 무엇을 참조하는지 알 방법이 없기 때문에 한계에 부딪힌다고 지적합니다.
'그라운드 세만틱스(grounded semantics, 접지된 의미론)'라고 알려진 또 다른 접근 방식은 단어를 감각 데이터와 연결함으로써 이를 해결하려고 시도합니다. 이 관점에서 컴퓨터는 빨간색 물체의 사진을 봄으로써 "빨강"이 무엇인지 배워야 하며, 발이 공을 차는 영상을 봄으로써 "차다"가 무엇인지 배워야 합니다. 만약 기계가 세상을 보고 만질 수 있다면, 인간의 경험과 일치하는 의미의 사전을 구축할 수 있다는 아이디어입니다. 이는 유망한 단계이지만, 논문은 이를 구현하기가 어렵다고 언급합니다. 대부분의 현재 시스템은 여전히 텍かに 텍스트에 크게 의존하고 있으며, 이미지를 사용하더라도 냄새, 촉각, 또는 근육 기억과 같은 인간 경험의 전체 범위를 놓치는 경우가 많습니다. 기계는 의자 사진을 인식할 수는 있겠지만, 긴 산책 후에 앉았을 때의 안도감은 알지 못합니다.
현대 인공지능에서 가장 지배적인 방법은 '분포 의미론(distributional semantics)'이라 불리는 것입니다. 이 접근 방식은 단순한 아이디어에 기반합니다: 단어가 함께 다니는 동료를 살펴봄으로써 그 단어를 이해할 수 있다는 것입니다. 만약 "사과"라는 단어가 "빨간", "과일", "파이"와 같은 단어 근처에 자주 등장한다면, 컴퓨터는 "사과"가 이러한 개념들과 관련이 있음을 학습합니다. 수십억 개의 문장을 분석함으로써, 이러한 시스템은 비슷한 의미를 가진 단어들이 서로 가까운 곳에 위치하도록 하는 지도를 구축합니다. 이 방법은 이야기를 쓰고, 질문에 답하며, 언어를 놀라울 정도로 유창하게 번역할 수 있는 거대 언어 모델의 탄생을 이끌었습니다. 이 모델들은 인터넷의 방대한 텍스트를 통해 훈련되며, 이전 단어들에 기반하여 문장에서 다음에 올 단어를 예측하는 법을 배웁니다.
그러나 논문은 이러한 성공에 숨겨진 비용이 따른다고 주장합니다. 이 모델들은 오직 텍キスト로부터만 학습하기 때문에, 세상을 직접 경험하지 못합니다. 그들은 노을을 본 적도, 딸기의 맛을 본 적도, 발가락을 찧었을 때의 통증을 느껴본 적도 없습니다. 그들은 책과 기사에서 "사과"와 "빨간"이라는 단어가 함께 쓰인 것을 보았기 때문에 "사과"가 "빨간"과 관련이 있다는 것을 알 뿐, 빨간색이 어떻게 보이는지 혹은 사과가 어떤 맛인지 알지 못합니다. 저자는 언어 모델에게 사과를 본 적이 있는지 묻는 예시를 듭니다. 모델은 본 적이 없으므로 아니라고 정직하게 답할 것입니다. 왜냐-는 아무것도 본 적이 없기 때문입니다. 그들은 오직 기호만을 처리했을 뿐입니다. 이는 기계가 세상에 대해 완벽하게 말할 수는 있지만, 세상을 이해하지는 못하는 상황을 만듭니다. 이는 마치 수영에 관한 모든 책을 읽었지만 물에 한 번도 닿아본 적이 없는 사람과 같습니다.
또한 논문은 인간의 언어에서 감정과 의도의 역할을 강조합니다. 우리가 말할 때, 우리는 단순히 데이터를 교환하는 것이 아니라 감정, 욕구, 목표를 표현합니다. 아이는 소통하고 싶거나, 도움을 받거나, 기쁨을 나누고 싶은 욕구가 있기 때문에 언어를 배웁니다. 이러한 동력은 우리의 신체 및 감정과 연결되어 있습니다. 현재의 언어 모델은 감정이나 의도가 없습니다. 그들은 배고픔, 피로, 혹은 호기심을 느끼지 않습니다. 그들은 말하고 싶어서 말하는 것이 아니라, 다음 단어를 예측하도록 프로그래밍되었기 때문에 말합니다. 저자는 이러한 내부적 동력과 감정적 연결 없이는, 기계가 인간이 당연하게 여기는 언어의 더 깊고 미묘한 의미를 파악하는 데 항상 어려움을 겪을 것이라고 제안합니다.
논문의 결론은 인공지능이 언어를 처리하는 데 있어 놀라운 진전을 이루었지만, 아직 의미를 이해하는 문제를 해결하지 못했다는 것입니다. 현재의 모델들은 인간의 대화를 흉내 낼 수 있는 강력한 도구이지만, 단어에 진정한 무게를 부여하는 체화된 경험(embodied experience)이 결여되어 있습니다. 앞으로 나아가기 위해, 저자는 우리가 서로 다른 접근 방식들의 강점을 결합해야 한다고 제안합니다. 우리는 텍스트를 분석할 수 있을 뿐만 아니라 물리적 세계와 상호작용하고, 감정을 느끼며, 의도를 가질 수 있는 시스템이 필요합니다. 기계가 인간과 같은 방식으로 세상을 경험할 수 있을 때까지, 그들의 언어 이해는 불완전한 상태로 남을 것입니다. 그들은 계속해서 단어를 사용하는 데는 탁월하겠지만, 그 단어들이 진정으로 무엇을 의미하는지는 결코 알지 못할 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.