← 최신 논문
🤖 AI

Structural Ranking of the Cognitive Plausibility of Computational Models of Analogy and Metaphors with the Minimal Cognitive Grid

본 논문은 기능/구조 비율, 일반성, 그리고 성능 일치에 기반한 공식화된 정량적 접근법을 사용하여 SME, CogSketch, METCL, 그리고 대규모 언어 모델(LLMs)을 포함한 유추와 은유의 주요 계산 모델들의 인지적 타당성을 체계적으로 평가하고 순위 매기기 위해 최소 인지 그리드 프레임워크를 적용한다.

원저자: Alessio Donvito, Antonio Lieto

게시일 2026-05-06
📖 4 분 읽기☕ 가벼운 읽기

원저자: Alessio Donvito, Antonio Lieto

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

재능 쇼의 심사위원이 되어 있다고 상상해 보세요. 다만, 출연자가 가수나 무용가가 아니라 인간처럼 생각하는 척하는 컴퓨터 프로그램들입니다. 구체적으로, 이 프로그램들은 유추(예: "A 는 B 에게 C 가 D 에게 하는 것과 같다")와 비유(예: "내 직업은 감옥이다")와 관련된 퍼즐을 해결하려고 노력합니다.

이 논문의 저자인 알레시오 돈비토와 안토니오 리에토는 **최소 인지 그리드 **(MCG)라는 특별한 채점 시스템을 고안했습니다. 이 그리드를 세 발 달린 의자로 생각하세요. 컴퓨터가 이 의자에 편안하게 앉아 "인지적으로 타당한" 모델 (즉, 단순히 그렇게 보이는 것이 아니라 인간처럼 생각하는 모델) 로 인정받으려면, 세 발 모두에서 균형을 잡아야 합니다.

다음은 세 발이 어떻게 작동하는지 간단한 비유를 통해 설명한 것입니다.

첫 번째 다리: 설계도 일치 (기능/구조 비율)

질문: 컴퓨터가 인간의 뇌와 같은 방식으로 답을 구성하는가, 아니면 마법처럼 정답만 맞추는가?

  • 비유: 두 사람이 새집을 짓는다고 상상해 보세요.
    • **사람 A **(구조적 모델) 목수처럼 정확히 같은 단계를 따르며 나무, 못, 망치를 사용합니다. 속도는 느릴지 모르지만, 그들의 과정은 인간과 유사합니다.
    • **사람 B **(기능적 모델) 3D 프린터나 레이저 컷터를 사용합니다. 똑같은 새집을 완성하지만, 그 내부 기계는 인간의 손과 완전히 다릅니다.
  • 논문의 주장: 저자들은 컴퓨터가 우리가 어떻게 생각하는지에 대한 좋은 모델이 되려면 "나무와 못" 방식 (구조적) 을 사용해야 한다고 주장합니다.
    • SME 와 CogSketch: 이들은 목수들처럼 행동합니다. 인간이 유추를 만드는 방식을 모방하는 특정 규칙 (예: "한 가지 항목은 다른 한 가지 항목에 매핑된다") 을 사용합니다. 이 부분에서 높은 점수를 받습니다.
    • LLM(GPT-4 등) 이들은 3D 프린터와 같습니다. 새집을 만드는 것 (정답을 얻는 것) 에는 놀라울 정도로 뛰어나지만, 거대한 책 도서관에서 패턴을 추측하여 그렇게 할 뿐, 인간과 유사한 논리적 단계를 따르지는 않습니다. 그들의 "내부 기계"는 인간 사고와 이질적이기 때문에 이 부분에서 매우 낮은 점수를 받습니다.
    • METCL: 이는 중간 지대의 목수입니다. 매핑보다는 범주화에 초점을 맞춘 다른 설계도를 사용하므로 중간 점수를 받습니다.

두 번째 다리: 스위스 아미 나이프 (일반성)

질문: 컴퓨터는 다양한 유형의 사고를 할 수 있는가, 아니면 한 가지 재주만 부리는 말인가?

  • 비유:
    • 전문가: 그랜드마스터를 이길 수 있지만, 신발을 묶거나 계란을 요리할 수 없는 체스 마스터.
    • 일반인: 체스를 두기도 하고, 요리도 하고, 차를 운전하며, 수학 문제를 해결할 수 있는 사람.
  • 논문의 주장: 저자들은 이러한 시스템들이 수학, 시각적 퍼즐, 언어, 심지어 신체적 움직임 (감각/운동 기술) 을 처리할 수 있는지 살펴봅니다.
    • LLM: 이들은 궁극적인 일반인입니다. 읽고, 쓰고, 수학 문제를 풀고, 그림을 볼 수 있습니다. 이 부분에서 가장 높은 점수를 받습니다.
    • SME 와 CogSketch: 이들은 전문가들입니다. 시각적 패턴과 같은 특정 논리 퍼즐에는 뛰어나지만, 수학이나 복잡한 문장을 이해하는 것은 거의 불가능합니다. 이 부분에서 낮은 점수를 받습니다.
    • METCL: 역시 전문가로, 주로 언어적 비유에 초점을 맞춥니다.

세 번째 다리: 거울 테스트 (성능 일치)

질문: 컴퓨터가 틀릴 때, 인간이 범하는 유사한 실수를 범하는가?

  • 비유: 시험을 본다고 상상해 보세요.
    • 개념을 오해해서 문제를 틀렸다면, 그것은 "인간적인" 실수입니다.
    • 컴퓨터 오류나 무작위 추측으로 틀렸다면, 그것은 "기계적인" 실수입니다.
    • 목표는 컴퓨터의 "오작동"이 인간의 혼란과 유사한지 확인하는 것입니다.
  • 논문의 주장:
    • SME 와 CogSketch: 이 부분에서 탁월합니다. 시각적 퍼즐 (예: 레빈의 진보 행렬) 에서 실패할 때, 인간이 어려워하는 정확히 같은 어려운 퍼즐에서 실패합니다. 심지어 생각하는 데 걸리는 시간도 비슷합니다. 매우 높은 점수를 받습니다.
    • LLM: 종종 정답을 맞추지만, 실패할 때 그 실수는 인간과 다릅니다. 사람이 당황하지 않을 만한 사소한 문장 변화에 혼란을 겪을 수 있습니다. 이 부분에서 점수가 낮습니다.

최종 점수판

저자들은 이 세 가지 점수를 종합하여 "인지적 타당성" 타이틀의 승자를 가립니다. 그들은 **첫 번째 다리 **(설계도)가 가장 중요하다고 결정했습니다. 왜냐하면 주요 목표는 정답을 얻는 것이 아니라 인간이 어떻게 생각하는지를 이해하는 것이기 때문입니다.

  • **승자 **(엄격한 규칙 하에): CogSketch 와 SME. 비록 "한 가지 재주만 부리는 말" (낮은 일반성) 이지만, 그들은 인간처럼 생각합니다. 인간 마음을 연구하는 데 가장 좋은 모델입니다.
  • 준우승자: METCL. 중간에 위치하며, 인간과 유사한 일을 일부 수행하지만 상위 두 모델만큼 포괄적이지는 않습니다.
  • "마법" 상자: LLM(GPT-4 등). 그들은 놀라울 정도로 똑똑하고 다재다능합니다 (높은 일반성), 하지만 인간처럼 생각하지는 않습니다. 문제 해결 도구가 필요하다면 훌륭합니다. 하지만 인간이 왜 그렇게 생각하는지 설명하는 모델을 원한다면, 이 논문은 그들이 최선의 선택이 아니라고 말합니다.

핵심 교훈

이 논문은 "똑똑한 것"(정답을 얻는 것) 과 "인지적으로 타당한 것"(인간처럼 생각하는 것) 은 다르다고 결론 내립니다.

  • LLM은 대본을 완벽하게 암기하고 인간과 똑같이 말하지만, 실제로는 감정을 느끼지 못하는 수퍼 배우와 같습니다.
  • SME/CogSketch는 실제로 감정을 느끼고 캐릭터의 논리를 통해 사고하지만, 대사를 덜 외울 수 있는 방법 연기 배우와 같습니다.

저자들은 인간 마음을 연구하는 데 가장 좋은 "방법 연기 배우"가 어떤 컴퓨터 프로그램인지 과학자들이 결정할 수 있도록 이 그리드를 만들었습니다. 그들은 "수퍼 배우"(LLM) 가 인상적이지만, 인간 사고의 메커니즘을 이해하는 데 있어서는 여전히 "방법 연기 배우"(SME/CogSketch) 가 금표준이라고 발견했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →