← 최신 논문
💬 NLP

Comparing Semantic Navigation in Humans and Large Language Models using Natural Language Processing

이 연구는 인간의 의미론적 기억 인출이 현재의 거대 언어 모델보다 더 가변적이고 탐색적인 탐색 패턴을 보인다는 것을 밝혀냈는데, 이는 어떠한 온도 튜닝 설정으로도 완전히 재현할 수 없는 언어 유창성 과제에서의 높은 엔트로피, 더 큰 의미적 단계, 그리고 더 넓은 분산에 의해 입증된다.

원저자: Gabriel Paris-Colombo, Rodrigo M. Cabral-Carvalho, Felipe D. Toro-Hernández

게시일 2026-07-15
📖 4 분 읽기☕ 가벼운 읽기

원저자: Gabriel Paris-Colombo, Rodrigo M. Cabral-Carvalho, Felipe D. Toro-Hernández

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신의 뇌를 모든 단어나 개념이 하나의 책인, 거대하고 북적이는 도서관이라고 상상해 보세요. "1분 동안 최대한 많은 동물의 이름을 대보세요"와 같은 게임을 할 때, 당신은 단순히 선반에서 책을 무작위로 꺼내는 것이 아니라 그 도서관을 **항해(navigating)**하고 있는 것입니다. 당신은 "반려동물" 코너에서 시작해 몇 권의 책(고양이, 개, 햄스터)을 집어 들었다가, 갑자기 "대양" 코너로 크게 도약하여 상어라는 책을 집어 들기로 결정할 수도 있습니다. 이것이 바로 당신의 뇌가 탐험하는 방식입니다.

한 연구팀은 오늘날 우리가 사용하는 초지능형 AI 챗봇(GPT-4o, Gemini, Claude 등)이 인간과 동일한 방식으로 이 도서관을 항해하는지 알아보기로 했습니다. 그들은 82명의 실제 사람과 세 가지 서로 다른 AI 모델을 대상으로 동물 목록을 작성하게 하는 테스트를 진행했습니다. AI가 더 사람처럼 행동하게 만들기 위해, 연구진은 봇들에게 동물을 나열하기 전 특정 유형의 사람(예: 요리사 또는 조종사)인 척하도록 요청하기도 했습니다. 또한, AI의 "무작위성 조절 노브"(온도/temperature라고 불림)를 조절하여, 0.0(매우 로봇 같고 예측 가능한 상태)에서 1.0(매우 혼란스럽고 거친 상태)까지 변화시켰습니다.

연구 결과는 다음과 같으며, 여기에는 약간의 반전이 있습니다.

인간의 "정글짐" vs AI의 "외줄 타기"

연구진은 "이동"이 도서관에서 어떻게 보이는지 측정하기 위해 세 가지 요소를 측정했습니다:

  1. 보폭 (Step Size): 단어 사이를 얼마나 크게 뛰어넘었는가? (예: "고양이"에서 "상어"로 가는 것은 큰 도약이고, "고양이"에서 "개"로 가는 것은 작은 도약임).
  2. 놀라움 지수 (엔트로피/Entropy): 당신의 발걸음이 얼마나 예측 불가능했는가? 코너를 무작위로 바꿨는가, 아니면 경로가 매우 일정했는가?
  3. 방랑벽 (중심점으로부터의 거리/Distance to Centroid): 도서관의 중심에서 얼마나 멀어졌는가? 주요 경로에 머물렀는가, 아니면 먼지 쌓인 잊혀진 구석진 곳까지 탐험했는가?

주요 발견:
인간은 궁극의 탐험가였습니다. 우리의 경로는 무질서하고 예측 불가능하며 거대한 도약으로 가득했습니다. 우리는 단어 사이를 더 큰 보폭으로 움직였고, 경로는 더 예측 불가능했으며, 범주로부터 더 멀리 방황했습니다. 우리는 마치 정글짐에서 바를 잡고 흔들다가 때때로 시작한 곳에서 멀리 떨어진 곳에 착지하는 아이들과 같았습니다.

반면, AI 모델들은 외줄 타기 곡예사와 같았습니다. 그들은 통로의 중심 근처에 훨씬 더 가까이 머물렀습니다. 그들의 발걸음은 더 작았고, 경로는 더 예측 가능했으며, "깊은 숲" 속으로 모험을 떠나는 일도 거의 없었습니다. 연구진이 AI를 더 거칠게 만들기 위해 "무작위성 노브"를 최대치(1.0)로 높였을 때조차, 봇들은 인간의 스타일을 따라잡지 못했습니다. 그들은 여전히 너무 조심스럽고 밀집되어 있었습니다.

"온도(Temperature)"의 함정

당신은 "AI의 무작위성을 충분히 높이기만 하면, 인간처럼 행동하게 만들 수 있을 거야!"라고 생각할지도 모릅니다. 논문은 이것이 사실이 아닐 수도 있음을 시사합니다.

연구진은 여덟 가지 서로 다른 온도 설정(0.0, 0.15, 0.3, 0.45, 0.6, 0.75, 0.9, 1.0)에서 AI를 테스트했습니다.

  • 특정 설정에서 AI는 단 하나의 테스트에서만 인간처럼 보이기도 했습니다. 예를 들어, 0.75의 온도에서 Claude 모델은 인간과 비슷한 크기의 보폭을 보였습니다.
  • 하지만 핵심은 이것입니다: 단 하나의 설정도 모든 면에서 동시에 인간처럼 보이게 만들지는 못했습니다. 보폭을 적절하게 맞추면 AI가 너무 예측 가능해졌습니다. 혹은 멀리 방황하게 만들면, AI는 큰 도약을 멈추게 되었습니다.

이것은 라디오를 특정 채널에 맞추려는 것과 같습니다. 볼륨을 맞추거나 명료도를 맞출 수는 있지만, 다이얼을 아무리 돌려도 완벽한 인간의 목소리를 출력해낼 수는 없습니다. AI의 "두뇌"는 다르게 설계되어 있기 때문에, 인간의 복잡하고 무질서하며 아름다운 기억의 춤을 완전히 재현할 수 없습니다.

"로봇 인간"이 의미하는 바

한동안 과학자들은 우리가 AI를 심리학 이론을 테스트하기 위한 "실리콘 참가자(silicon participants)", 즉 기본적으로 '로봇 인간'으로 사용할 수 있기를 희망했습니다. AI에게 질문을 던지고, AI가 무엇을 말하는지 보고, 그것이 사람처럼 생각한다고 가정하는 방식입니다.

이 논문은 그러한 아이디어에 반론을 제기합니다. AI가 유창하고 똑똑하게 들릴 수는 있지만, 인간처럼 정보를 찾는(search) 방식은 아니라는 점을 시사합니다. AI는 통계에 기반하여 다음 단어를 예측하도록 훈련되었습니다. 마치 가장 가능성이 높은 옵션을 항상 선택하는 초고속 추측가와 같습니다. 그러나 인간은 전략과 놀라움의 혼합을 사용합니다. 우리에게는 이미 말한 것을 기억하고 언제 완전히 새로운 아이디어로 뛰어들지 결정하는 데 도움을 주는 "작업 기억(working memory)"이 있습니다. AI는, 설령 사람인 척하도록 명령받더라도, 이러한 특유의 "정신적 체조(mental gymnastics)"가 부족해 보입니다.

결론

이 연구는 AI가 "고장 났다"거나 결코 유용해질 수 없다는 것을 증명한 것이 아닙니다. 대신, 현재의 AI 모델들이 안전하고 익숙한 곳에 머물려는 **체계적인 편향(systematic bias)**을 가지고 있음을 시사합니다. AI는 국지적 탐색(예: "반려동물" 코서에 머무는 것)에는 뛰어나지만, 인간이 자연스럽게 수행하는 전역적 탐색(예: "대양" 코서로 도약하는 것)에는 어려움을 겪습니다.

따라서, 비록 우리가 AI를 미세하게 조정하여 특정 순간에 인간처럼 보이게 할 수는 있지만, 우리 뇌가 단어의 세계를 항해하는 복잡하고 방랑하며 놀라운 방식을 온전히 모방하는 방법은 아직 찾지 못했습니다. AI는 강력한 도구이지만, 아직 인간의 마음을 완벽하게 복제한 것은 아닙니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →