Artificial Phantasia: Emergent Mental Imagery in Large Language Models
본 연구는 대형 언어 모델이 전통적으로 시각적 정신 이미지를 요구하는 과제에서 명제적 표현에만 의존하여 인간을 능가할 수 있음을 보여주므로, 시각적 이미지가 시각적 형식을 필요로 한다는 인지과학적 관점에 도전하는 등장적'인공 환상'에 대한 증거를 제공한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
"인공 판타지아(Artificial Phantasia)"라는 논문에 대한 설명을 간단한 언어와 창의적인 비유를 사용하여 제시합니다.
핵심 질문: 눈이 없어도 "볼" 수 있는가?
눈을 감고 대문자 D를 상상해 보라고 요청한다고 가정해 봅시다. 이제 그 D를 왼쪽으로 90 도 회전시켜 보세요. 마지막으로 그 모양의 아래 중앙에 대문자 J를 붙여 보세요.
눈을 뜨면 무엇을 보게 될까요? 대부분의 인간은 "우산처럼 보인다"고 말할 것입니다.
수십 년간 인지 과학자들은 이런 종류의 퍼즐을 풀기 위해서는 뇌가 실제로 그림을 보고 조작할 수 있는 특별한 "정신적 스크린"이나 "마음의 눈"이 필요하다고 믿어 왔습니다. 그들은 단순히 단어를 생각하는 것만으로는 불가능하며, 머릿속에 시각적 그림이 있어야만 가능하다고 생각했습니다.
이 논문은 매우 파격적인 질문을 던집니다: 컴퓨터가 "눈"이나 "마음의 눈"을 전혀 가진 적 없이도 이를 수행할 수 있을까요?
실험: AI 와 인간을 위한 정신 운동장
연구자들은 뇌를 위한 운동 프로그램을 만들었습니다. 고전적인 퍼즐 (문자 변환) 을 가져와서 이 연구만을 위해 특별히 고안된 48 개의 완전히 새로운, 전례 없는 버전을 발명했습니다. 이 퍼즐들은 이 연구를 위해 구체적으로 만들어졌기 때문에, 컴퓨터는 훈련 데이터에서 정답을 외울 수 없었습니다.
연구자들은 두 그룹에게 이 퍼즐을 풀도록 요청했습니다:
- 100 명의 인간: 화면에 글자가 보이는 것을 피하기 위해 지시를 듣고 머릿속에서 모양을 상상해야 했던 사람들.
- 대규모 언어 모델 (LLM): 최신 버전의 OpenAI 의 o3, GPT-5, 그리고 Google 의 Gemini 3 Pro 와 같은 고급 AI 채팅 봇들. 이 모델들은 "그림"을 보는 것이 아니라 텍스트로 훈련되었습니다.
충격적인 결과: AI 가 인간보다 더 잘 "봤다"
결과는 놀라웠습니다. 최고의 AI 모델들은 단순히 통과한 것을 넘어 인간 평균을 압도했습니다.
- 인간: 5 점 만점에 평균 2.85점을 받았습니다.
- 최상위 AI: 3.13 에서 3.65 사이의 점수를 받았습니다.
AI 모델들은 시각적 퍼즐을 인간 참가자들보다 훨씬 더 잘 해결했습니다. 더 흥미로운 점은 연구자들이 AI 에게 각 단계에서 실제로 이미지를 그리도록 (이미지 생성기를 사용하여) 강요했을 때, AI 는 그 작업에서 더 나빠졌다는 것입니다. 이는 AI 가 문제를 해결하기 위해 그림을 그리기에 의존하지 않았으며, 완전히 다른 무언가를 하고 있었다는 것을 시사합니다.
"마술": 어떻게 했을까요?
AI 가 "마음의 눈" (그림) 을 사용하지도 않았고, 그림 그리는 도구를 사용하지도 않았다면, 어떻게 퍼즐을 해결했을까요?
저자들은 **"인공 판타지아 (Artificial Phantasia)"**라고 불리는 개념을 제안합니다.
이렇게 생각해 보세요:
- 인간의 방식: 당신은 건축가입니다. 눈을 감고 머릿속에 건물의 3D 모델을 짓습니다. 그 주위를 돌아다니고 창문을 바라본 다음, 그것을 설명합니다.
- AI 의 방식: 당신은 마스터 번역가입니다. 결코 3D 모델을 짓지 않습니다. 대신 지시사항을 코드로 쓰인 복잡한 레시피처럼 다룹니다. "왼쪽으로 회전한 문자 D" + "붙은 문자 J" = "우산 모양"이라는 것을 오직 언어의 논리를 통해 정확히 압니다.
이 논문은 이러한 AI 모델들이 **명제적 추론 (propositional reasoning)**을 사용하고 있다고 제안합니다. 그들은 단어나 개념을 매우 정밀하게 조작하여, 결코 그것을 "본다"는 느낌 없이 최종 모양을 알아낼 수 있습니다. 이는 종이에 모양을 그리는 대신 대수학의 규칙을 알고 수학 문제를 푸는 것과 같습니다.
"추론" 요인
연구자들은 AI 에게 "더 깊이 생각하라" (더 많은 시간과 단계 처리를 위한 "추론 토큰"을 부여함으로써) 고 지시했을 때 어떤 일이 일어나는지 또한 테스트했습니다.
- 결과: AI 가 "생각"하고 추론을 연결할 수 있는 시간이 더 많이 허용될수록, 그 성능은 더 좋아졌습니다.
- 비유: 한 탐정이 미스터리를 해결한다고 상상해 보세요. 단서를 살펴볼 시간을 5 분만 준다면 그들은 추측할지도 모릅니다. 하지만 모든 단서를 논리적으로 연결할 5 시간을 준다면 그들은 사건을 완벽하게 해결합니다. AI 는 그림을 보는 것이 아니라 언어적 단서들을 연결함으로써 시각적 퍼즐을 해결했습니다.
"장님" 인간은 어떨까요?
이 논문은 **아판타시아 (aphantasics)**라고 불리는 한 그룹의 사람들도 언급합니다. 이들은 머릿속에 전혀 이미지를 시각화할 수 없다고 주장하는 사람들 (그들에게는 "마음의 눈"이 없음) 입니다. 놀랍게도 연구에 따르면, 이러한 사람들은 시각화할 수 있는 사람들보다 거의 동등하게 이러한 시각적 퍼즐을 해결할 수 있습니다.
이 논문은 그 불에 기름을 붓습니다. 시각적 퍼즐을 풀기 위해 "마음의 눈"이 필요하지 않을지도 모른다는 것을 시사합니다. 여러분은 아마도 매우 강력한 "마음의 논리"만 필요할지도 모릅니다. 전혀 마음의 눈이 없는 AI 가, 그림이 필요하다고 생각했던 일을 언어와 논리만으로도 해낼 수 있음을 증명했습니다.
결론
이 연구는 "시각적 사고"가 시각적 그림을 필요로 한다는 오래된 관념에 도전합니다. 고급 AI 가 오직 언어와 논리만을 사용하여 "시각적 상상력"처럼 보이는 작업을 수행할 수 있음을 보여줍니다.
- 주장: AI 는 시각적으로 "상상"하는 신흥 능력을 가지고 있지만, 그림으로 하는 것이 아닙니다. 그것은 단어로 수행합니다.
- 함의: 우리는 "정신적 이미지"를 정의하는 방식을 다시 생각해야 할지도 모릅니다. 그것은 머릿속에 그림을 보는 것에 관한 것이 아닐지도 모릅니다. 그것은 단지 개념을 논리적으로 조작하는 것에 관한 것일지도 모릅니다.
이 논문은 이러한 AI 모델들이 세상을 보는 새로운 방식을 발견했다고 결론지으며, 그것은 순수하게 언어적이지만 시각적 문제를 해결하는 데 놀라울 정도로 효과적이라고 말합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.