LLM and Human Modes of Representation
이 논문은 거대 언어 모델(LLM)과 인간이 언어적 지식 및 실세계 추론에서 정보를 어떻게 표현하고 처리하는지를 비교하는 최근 연구를 검토하며, LLM이 인상적인 유창함을 달성함에도 불구하고 인간과는 처리 메커니즘에서 차이가 있고 학습 및 일반화 측면에서 일반적으로 효율성이 더 낮다는 점을 강조한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
큰 그림: "슈퍼 학생" vs. "인간의 마음"
거대 언어 모델(LLM)을 도서관의 모든 책을 읽은 지독한 공부벌레 학생이라고 상상해 보세요. 이 학생은 누구보다 빠르게 사실을 암송하고, 에세이를 쓰고, 퍼즐을 풀 수 있습니다. 하지만 이 논문은 이 학생이 인간처럼 세상을 "이해"하는 것은 아니라고 주장합니다. 이 학생은 패턴 매칭(데이터에서 익숙한 형태를 찾아내는 것)에는 매우 뛰어나지만, 깊은 추론(왜 그런 일이 일별어나는지 파악하거나 미지의 상황을 계획하는 것)에는 종종 어려움을 겪습니다.
이 논문은 인간과 이러한 AI 모델이 언어(우리가 말하고 쓰는 방식)와 추론(우리가 생각하고 계획하는 방식)이라는 두 가지 주요 영역을 어떻게 다루는지 비교합니다.
파트 1: 언어 실험실 (우리가 말하는 방식)
논문은 AI가 인간처럼 생각하는지 확인하기 위해 세 가지 구체적인 언어 과제를 테스트합니다.
1. "문장 맛보기 테스트" (수용성)
과제: 인간에게 문장이 얼마나 "자연스러운지" 점수를 매기게 합니다. 때때로 문맥 때문에 문장이 이상해질 수 있습니다 (예: 자동차에 관한 단락 뒤에 고양이에 관한 문장을 보여주는 경우).
인간의 방식: 인간은 선택적 필터와 같습니다. 만약 수학 문제에 관한 문장을 판단하도록 하면서 해변 사진을 보여준다면, 인간은 해변 사진을 쉽게 무시하고 수학에만 집중할 수 있습니다. 또한 문맥이 혼란스러울 때 극단적인 점수를 피하고 "중간 정도"의 점수를 주는 경친이 있습니다.
AI의 방식: AI는 떨어지지 않는 포스트잇과 같습니다. 해변 사진을 보여주더라도 AI는 그 이미지에 "달라붙어" 있으며, 그것이 수학 문장을 판단하는 데 영향을 미치게 둡니다. AI는 인간처럼 시각적 노이즈를 걸러낼 수 없습니다.
결과: AI는 인간의 점수를 잘 흉내 내지만, 다른 경로를 통해 그 결과에 도달합니다. 인간은 불필요한 정보를 능동적으로 버리는 반면, AI는 모든 정보(심지어 관련 없는 것까지)를 기억 속에 그대로 간직합니다.
2. "문법 미로" (주어-동사 일치)
과제: 길고 복잡한 문장에서 어떤 동사가 주어와 일치하는지 맞출 수 있습니까?
- 예시: "The keys [that the man near the cabinet holds] are for his car." (그 [캐비닛 근처에 있는 남자가 들고 있는] 열쇠들은 그의 차를 위한 것이다.)
- 주어는 "keys"이지만, 그 사이에 많은 단어가 끼어 있습니다.
인간의 방식: 인간은 지칩니다. 문장이 길어지고 엉키면 우리의 뇌는 흐릿해지며 실수를 더 많이 합니다. 이는 마치 긴 줄을 잡고 있는 것과 같습니다. 중간에 매듭이 많아질수록 양 끝을 연결된 상태로 유지하기가 더 어려워집-니다.
AI의 방식: AI는 초강력 기억 로봇입니다. AI는 지치지 않습니다. 실제로 약간의 프롬프팅(넛지)을 주면, AI는 이러한 꼬인 문장들을 인간보다 더 잘 해결할 수 있습니다. AI는 캐비닛에 관한 단어들이 중간에 끼어 있다고 해서 "열쇠"를 잊어버리지 않습니다.
결과: AI는 이 테스트에서 승리하지만, 인간처럼 문법 규칙을 이해해서 이기는 것이 아닙니다. AI는 모든 단어를 한꺼번에 담을 수 있는 거대한 "컨텍스트 윈도우(문맥 창)"를 가지고 있기 때문에 승리하는 것입니다.
3. "이야기꾼" (서사 생성)
과제: 일련의 이미지를 보고 그에 맞는 이야기를 쓰십시오.
The Human Way: 인간은 놀랍고 응집력 있는 이야기를 씁니다. 우리는 창의적인 방식으로 점들을 연결하고, 캐릭터의 일관성을 유지하며, 이야기가 "독창적"이라고 느껴지게 만듭니다. 우리가 단어를 얼마나 예측 불가능하게 사용하는지 측정하면, 우리는 상당히 예측 불가능합니다(높은 Perplexity).
The AI Way: AI는 매끄럽고 유창하지만, 다소 "안전한" 느낌의 이야기를 씁니다. AI의 이야기는 지금까지 쓰인 모든 이야기를 섞어 만든 스무디와 같습니다. 인간의 이야기가 가진 깊고 숨겨진 연결 고리가 부족합니다. AI의 이야기는 매우 예측 가능합니다(낮은 Perplexity). 왜냐하면 훈련 데이터에 기반하여 가장 확률이 높은 다음 단어를 선택할 뿐이기 때문입니다.
결과: 인간은 더 독창적이고 일관된 이야기를 씁니다. AI는 유창하지만 인간의 이야기 같은 "불꽃"이 없는 다소 일반적인 이야기를 씁니다.
파트 2: 추론 체육관 (우리가 생각하는 방식)
논문은 AI가 실제로 문제를 통해 "생각"하는지, 아니면 단순히 패턴에 기반해 추측하는지를 테스트합니다.
1. "탐정" (자연어 추론)
과제: 두 문장이 주어졌을 때, 첫 번째 문장을 바탕으로 두 번째 문장이 참인지, 거짓인지, 혹은 관련이 없는지 판단하십시오.
- 전제: "한 남자가 잠을 자고 있다."
- 결론: "그 남자는 축구를 하고 있다." (거짓/모순)
인간의 방식: 인간은 실제 세상의 지식을 사용합니다. 우리는 잠을 자는 것과 축구를 하는 것이 동시에 일어날 수 없다는 것을 압니다. 우리는 단어의 의미를 이해합니다.
AI의 방식: AI는 질문이 자신이 공부했던 것과 똑같은 형태라면 매우 뛰어납니다. 하지만 질문의 어순을 약간 바꾸거나 본 적 없는 주제(예: 특정 의학 저널)에 대해 물으면 성능이 떨어집니다. 이는 마치 "잠"과 "축구"라는 말이 함께 들리면 "거짓"이라고 말하도록 학습된 앵무새와 같습니다. 실제 그 단어들의 의미를 아는 것이 아닙니다.
결과: AI는 패턴 매처이지, 깊이 생각하는 존재가 아닙니다. 패턴이 바뀌면 실패합니다.
2. "의사" (이미지 해석)
과제: 의료 스캔(예: MRI)을 보고 진단을 내리십시오.
인간의 방식: 의사는 이미지를 보고, 해부학적 구조를 이해하며, 증상을 통해 추론합니다.
AI의 방식: AI는 종종 정답을 맞히지만, 이미지가 필요하지 않습니다. 이미지 없이 증상에 대한 텍스트 설명만 주어도 AI는 동일한 점수를 받습니다. 이는 마치 시험 문제의 답안지를 외운 학생이 교과서를 공부하지 않은 것과 같습니다. AI는 질병을 "보는" 것이 아니라, 증상의 텍텍스트 패턴을 인식하고 있는 것입니다.
결과: AI는 설명을 읽는 데는 강력한 도구이지만, 깊은 진단적 추론을 수행하고 있는 것은 아닙니다.
3. "플래너" (복잡한 퍼즐 해결)
과제: 배송 트럭의 최단 경로 찾기(외판원 문제)나 배낭 채우기 같은 어려운 수학/논리 퍼즐을 해결하십시오.
인간의 방식: 인간은 논리와 전략을 사용합니다. 규칙이 약간 바뀌더라도 적응할 수 있습니다.
AI의 방식: AI는 패턴을 기반으로 답을 추측하려고 합니다. 퍼즐이 커지거나 규칙이 다르게 표현되면 AI의 정확도는 급락합니다. 이는 마치 자신이 본 숫자들만 더할 줄 아는 계산기와 같습니다. 새로운 유형의 숫자를 더하라고 하면 작동을 멈춥니다.
결과: AI는 일반적인 계획 수립에 취약합니다. 특정하게 훈련된 퍼즐은 풀 수 있지만, 새롭고 복잡한 현실 세계의 문제로 일반화하지는 못합니다.
최종 결론
이 논문은 AI가 "확률적 앵무새"(데이터를 무의미하게 반복하는 기계)도 아니고, "범용 지능"(인간과 같은 사고를 하는 존재)도 아니라고 결론짓습니다.
- 그것은 "패턴 마스터"입니다: 언어와 데이터 속의 통계적 패턴을 포착하는 데 믿기지 않을 정도로 뛰어납니다. 인간의 유창함을 흉내 낼 수 있고, 특정 좁은 영역의 과제(예: 문법 테스트)에서는 인간을 이길 수도 있습니다.
- "깊은 이해"가 부족합니다: 불필요한 정보를 걸러내거나, 사물의 "이유"를 이해하거나, 진정으로 독창적이고 일관된 서사를 만들어내는 인간의 능력이 없습니다.
핵가져갈 점: AI는 겉으로는 인간처럼 보이는 매우 인상적인 도구이지만, 그 이면에서는 완전히 다른 방식으로 세상을 처리하고 있습니다. AI는 우리처럼 "생각"하는 것이 아니라, 초고속 계산기처럼 확률을 계산하고 있습니다. AI를 진정으로 유용하게 만들려면, 단순히 단어를 예측하는 기계가 아니라 인간처럼 추론하도록 만드는 방법을 찾아내야 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.