Quantification and object perception in Multimodal Large Language Models and human linguistic cognition
이 논문은 인간 언어 인지에서 중요한 세 가지 양화 특징 (스케일, 사용 범위 및 원형성, 근사 수 체계 편향) 을 분석하여 Multimodal Large Language Models 과 인간 간의 양화 능력 차이를 규명하고, 특히 사고 모델이 수치 추정과 스케일 구성에서는 높은 정확도를 보이지만 사용 범위와 원형성 측면에서는 여전히 인간과 차이가 있음을 밝혔습니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
🎨 핵심 비유: "그림 속 사각형과 동그라미" 게임
연구진은 AI 와 인간에게 똑같은 게임을 시켰습니다.
- 게임 규칙: 검은색 사각형과 흰색 동그라미가 섞여 있는 그림을 보여줍니다.
- 미션: "이 그림에서 사각형이 얼마나 많은가요?"라고 물었을 때, "약간 (a few)", "몇 개 (some)", "많이 (many)", "대부분 (most)" 중 어떤 단어가 가장 적절한지 고르는 것입니다.
- 추가 미션: "사각형이 전체의 몇 % 정도라고 생각하나요?"라고 숫자로도 답하게 했습니다.
이 실험을 통해 AI 가 단순히 "숫자를 세는 것"과 "그 숫자에 맞는 단어를 골라내는 것"을 어떻게 하는지, 그리고 인간과 얼마나 다른지 파악했습니다.
🔍 주요 발견 3 가지
1. "숫자 감각"의 차이: AI 는 눈대중이 서툴다
- 인간: 그림을 보면 대략적인 수를 눈으로 빠르게 감지합니다. (예: "아, 절반보다 조금 더 많네.")
- 일반 AI (Instruct 모델): 숫자 감각이 다소 둔합니다. 사각형이 절반을 넘으면 "많다"라고 해야 하는데, AI 는 "적다"거나 "중간"이라고 잘못 판단하는 경우가 많았습니다. 마치 눈이 나쁜 사람이 멀리 있는 표지판을 잘못 읽는 것과 같습니다.
- 생각하는 AI (Thinking 모델): 최근 나온 '생각하는' AI 는 수학적 추론을 더 잘합니다. 눈으로 보는 것만으로는 부족할 때, 머릿속으로 "하나, 둘, 셋..." 세어보듯 논리를 전개해서 숫자를 더 정확히 맞췄습니다. 하지만 여전히 인간처럼 직관적이지는 않았습니다.
2. "단어의 의미"가 다릅니다: AI 는 '경계선'을 모른다
인간은 '많다 (many)'와 '대부분 (most)'의 경계를 명확하게 느낍니다.
- 인간: "대부분"은 보통 90% 이상일 때 쓰입니다. "많다"는 50~80% 사이일 때 쓰죠.
- AI: 이 경계가 흐릿합니다. AI 에게는 "50% 만 넘으면 '대부분'이다"라고 생각하거나, "30% 만 되어도 '많다'고 한다"는 식으로 **단어의 기준점 (Threshold)**이 인간과 완전히 다릅니다.
- 비유: 인간에게 '매우 뜨겁다'는 60 도 이상을 의미하지만, AI 에게는 30 도만 되어도 '매우 뜨겁다'고 외치는 온도계를 잘못 교정받은 상황과 같습니다.
3. 언어의 차이: 영어가 무조건 최고는 아니다
- 연구진은 영어뿐만 아니라 그리스어, 러시아어, 스페인어, 이탈리아어, 카탈루냐어 등 다양한 언어로 실험했습니다.
- 결과: AI 는 언어마다 다른 '뇌'를 쓰는 것 같았습니다. 영어에서는 잘하는 단어가 스페인어에서는 엉뚱하게 쓰이기도 했습니다.
- 특이점: 인간은 언어가 달라도 '많다 (many)'와 '몇 개 (some)'의 개념은 비슷하게 사용하지만, AI 는 언어마다 이 개념을 완전히 다르게 해석했습니다. 마치 다른 나라 사람들과 대화할 때, 같은 단어를 쓰는데 뜻이 통하지 않는 상황과 비슷합니다.
💡 왜 이런 일이 일어날까요? (원인 분석)
저자들은 AI 가 실패하는 이유를 **"통계적 확률"**에서 찾았습니다.
- 인간의 뇌: "이것은 100 개 중 80 개니까 '대부분'이야!"라고 논리와 경험으로 판단합니다.
- AI 의 뇌: "이런 그림이 나올 때, 책이나 인터넷에서 '대부분'이라는 단어가 자주 등장했으니 이걸 골라야지!"라고 **빈도수 (통계)**로 판단합니다.
AI 는 단어와 이미지의 연결 패턴은 잘 기억하지만, 그 뒤에 숨겨진 논리적 의미나 인간의 직관적인 감각을 완전히 이해하지는 못합니다. 특히 '생각하는 AI'는 논리 추론을 통해 숫자 감각은 개선되었지만, 여전히 "이 단어를 쓸 때의 뉘앙스"나 "사람들이 보통 어디까지를 '많다'고 느끼는지" 같은 미묘한 감각은 인간과 다릅니다.
🚀 결론: AI 는 아직 '완전한 언어 사용자'가 아니다
이 연구는 AI 가 인간의 언어 능력을 완벽하게 모방하지 못한다는 것을 보여줍니다.
- 숫자를 세는 것은 점점 잘하게 되었지만,
- "많다", "적다" 같은 단어를 상황에 맞게 자연스럽게 쓰는 능력은 아직 인간과 큰 차이가 있습니다.
이는 AI 가 단순히 데이터를 외우는 기계일 뿐, 의미를 이해하는 지적인 존재가 되기 위해서는 아직 해결해야 할 과제가 많다는 것을 의미합니다. 마치 외국어 단어를 모두 외웠지만, 그 단어들이 쓰이는 상황과 뉘앙스를 아직 제대로 익히지 못한 초보 학습자와 같습니다.
이 연구는 앞으로 AI 가 더 똑똑해지기 위해, 단순히 숫자 계산 능력만 키우는 것이 아니라 인간의 언어적 직관과 논리를 어떻게 가르쳐야 할지에 대한 중요한 방향을 제시합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.