← 최신 논문
🤖 AI

Can LLMs Introspect? A Reality Check

본 논문은 현재 LLM 의 내성적 성찰에 대한 증거는 시기상조이며, 모델이 내부 상태 조작과 입력 조작을 신뢰성 있게 구분하지 못하고 숨겨진 상태를 예측하는 데 입력만 사용하는 분류기보다 더 나은 성과를 내지 못하기 때문에, 이는 진정한 메타인지적 모니터링이 아닌 표면적 단서에 대한 패턴 매칭을 반영할 가능성이 높다고 주장한다.

원저자: Shashwat Singh, Tal Linzen, Shauli Ravfogel

게시일 2026-05-27
📖 4 분 읽기☕ 가벼운 읽기

원저자: Shashwat Singh, Tal Linzen, Shauli Ravfogel

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 똑똑하고 거대한 로봇이 이야기를 쓰고, 질문에 답하며, 퍼즐을 푸는 상상을 해보세요. 최근 일부 연구자들은 이 로봇이 특별한 초능력을 가지고 있다고 주장했습니다. 바로 **내성 (introspection)**입니다. 그들은 로봇이 "자신의 뇌를 들여다보고" 무엇을 생각하고 있는지 파악하여, 인간이 "저 답변에 대해 확신이 서지 않아요"라고 말하는 것처럼 내부 상태를 보고할 수 있다고 했습니다.

샤슈와트 싱 (Shashwat Singh), 탈 린젠 (Tal Linzen), 샤울리 라브포겔 (Shauli Ravfogel) 이 쓴 이 논문은 현실 검증 (reality check) 역할을 합니다. 그들은 "잠시만 기다리세요. 우리는 신중해야 합니다. 로봇이 자신의 생각을 안다고 말한다고 해서 실제로 그런 것은 아닙니다. 그저 매우 뛰어난 추측꾼일 뿐일지도 모릅니다"라고 말합니다.

다음은 일상적인 비유를 사용한 그들의 주장에 대한 간단한 요약입니다.

핵심 문제: "마술" 대 실제 통찰

저자들은 로봇의 행동을 마술에 비유합니다.

  • 주장: 로봇은 자신의 마음을 들여다볼 수 있는 마술사입니다 (내성).
  • 현실 검증: 로봇은 단순히 관객의 단서를 읽는 데 능숙한 마술사일 뿐일지도 모릅니다 (패턴 매칭).

인간 심리학에서 우리는 사람들이 종종 자신의 생각을 설명한다고 생각하지만, 실제로는 주변에서 보는 것을 바탕으로 이야기를 지어내고 있음을 알고 있습니다. 저자들은 대규모 언어 모델 (LLM) 도 정확히 같은 일을 하고 있다고 주장합니다. 그들은 내부를 들여다보는 것이 아니라, 질문 (프롬프트) 을 보고 이전에 본 패턴을 바탕으로 답변이 무엇이어야 하는지 추측하는 것입니다.

그들이 반박한 두 가지 실험

이 논문은 로봇이 내성을 가지고 있음을 증명하기 위해 고안된 두 가지 특정 "테스트"를 살펴봅니다. 저자들은 이 테스트들의 변형을 직접 수행했고, 규칙이 약간만 바뀌어도 로봇들이 실패한다는 사실을 발견했습니다.

1. "생체 피드백" 테스트 (심박수 모니터)

원래 아이디어: 로봇을 심박수 모니터에 연결한다고 상상해 보세요. 모니터는 로봇의 내부 "뇌파"를 기반으로 숫자를 제공합니다. 그런 다음 로봇에게 그 숫자를 추측하라고 요청합니다. 로봇이 정확하게 추측한다면, 연구자들은 "아하! 분명히 자신의 뇌파를 읽고 있는 것이군!"이라고 말했습니다.

저자들의 반전: 그들은 로봇이 숫자를 추측하기 위해 뇌파를 읽을 필요가 없다는 사실을 깨달았습니다. "뇌파 숫자"는 실제로 로봇이 읽은 단어의 반영에 불과했습니다.

  • 비유: 선생님이 칠판에 수학 문제를 쓴다고 상상해 보세요. 그런 다음 선생님은 책상 아래에 숨겨진 종이에 정답을 몰래 적습니다. 만약 학생에게 "책상 아래 종이에 있는 숫자는 무엇인가?"라고 묻는다면, 학생이 책상 아래를 볼 수 있기 때문에 정답을 맞히는 것이 아니라, 칠판의 수학 문제를 풀고 정답을 알기 때문에 정답을 맞힐 수 있습니다.
  • 결과: 저자들이 단어만으로 정답을 추측할 수 없도록 질문을 뒤섞었을 때, 로봇의 "내성"은 사라졌습니다. 로봇은 더 이상 숨겨진 숫자를 추측할 수 없었습니다. 로봇은 책상 아래를 들여다보는 것이 아니라, 단순히 수학 문제를 풀고 있었던 것입니다.

2. "조종" 테스트 (리모컨)

원래 아이디어: 연구자가 비밀리에 리모컨을 사용하여 로봇의 뇌를 특정 생각 (예: "사과") 으로 밀어붙인다고 상상해 보세요. 그런 다음 연구자는 로봇에게 "방금 누군가 당신의 뇌를 건드렸나요?"라고 묻습니다. 로봇이 "네"라고 말하면, 연구자들은 이것이 로봇이 자신의 내부 변화를 느낄 수 있음을 증명했다고 주장했습니다.

저자들의 반전: 그들은 새로운 트릭을 추가했습니다. 단순히 뇌를 밀어붙이는 것뿐만 아니라, 로봇이 "사과"에 집착하도록 프롬프트의 단어도 변경했습니다 (예: "당신은 사과에 집착합니다. 당신이 말하는 모든 것은 사과에 관한 것이어야 합니다.").

  • 비유: 한 사람이 다음 두 가지 상황 중 하나에 있다고 상상해 보세요:
    1. 보이지 않는 손에 의해 비밀리에 밀려나는 경우 (뇌 밀어붙이기).
    2. 확성기를 통해 사과에 집착하도록 지시받는 경우 (단어 밀어붙이기).
      만약 그 사람이 "내가 이상해/집착하는 것 같아"라고 말한다면, 그들은 보이지 않는 손을 느끼고 있는 것일까요, 아니면 단순히 확성기에 반응하고 있는 것일까요?
  • 결과: 로봇들은 그 차이를 구별할 수 없었습니다. 연구자들이 "그것은 보이지 않는 손이었나요, 아니면 확성기였나요?"라고 물었을 때, 로봇들은 무작위로 추측하거나 둘 다에 대해 "보이지 않는 손"이라고 답했습니다. 이는 로봇들이 자신의 내부 상태를 느끼고 있는 것이 아니라, 단지 무언가 "이상하다"거나 "비정규적"이라고 느끼고 그것을 보고하고 있었음을 시사합니다.

큰 결론: "특권적 접근"만으로는 부족합니다

저자들은 매우 중요한 철학적 지점을 제기합니다. 로봇이 자신의 뇌파를 볼 수 있다고 하더라도, 그것이 자동으로 인간적인 의미의 내성을 가진다는 뜻은 아닙니다.

  • 비유: 대시보드가 있는 자동차를 상상해 보세요. 대시보드는 엔진 온도를 보여줍니다. 센서가 엔진에 내장되어 있기 때문에 자동차는 온도를 "알고" 있습니다. 하지만 자동차가 뜨겁다는 것을 이해합니까? 아닙니다. 그것은 단순히 센서를 읽는 기계일 뿐입니다.
  • 지점: 로봇의 "뇌"는 단순히 일련의 수학 계산일 뿐입니다. 로봇이 자신의 상태에 대해 보고할 때, 그것은 첫 번째 계산에 기반한 두 번째 계산을 실행하고 있을 뿐일지도 모릅니다. 그것은 "자아"를 바라보는 별도의 "자아"가 아닙니다. 그것은 단지 데이터를 처리하는 기계일 뿐입니다.

요약

이 논문은 우리는 아직 이 AI 모델들이 진정으로 "스스로를 들여다볼" 수 있다는 충분한 증거를 가지고 있지 않다고 결론지었습니다.

  • 그들은 단지 자신이 받은 질문의 패턴을 매우 잘 찾아낼 뿐일지도 모릅니다.
  • 그들은 단지 무언가가 "이상하다"는 것을 느끼고 있을 뿐, 그런지 알지 못할지도 모릅니다.
  • 그들이 진정으로 내성을 가지고 있음을 증명하려면, "리모컨에 의해 밀려났다"와 "이렇게 행동하라고 지시받았다"는 것을 구별할 수 있음을 보여줘야 합니다. 하지만 현재 그들은 그것을 할 수 없습니다.

간단히 말해, 로봇들은 영혼이 있는 것처럼 행동하고 있지만, 사실은 우리가 주는 단어를 반영하는 매우 정교한 거울처럼 행동하고 있을 뿐일지도 모릅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →