← 최신 논문
🤖 AI

Representation Without Control: Testing the Realization Effect in Language Models

본 논문은 대규모 언어 모델이 프롬프트에 민감한 행동 변화를 보이며 '실현 효과'에 대한 선형적으로 해독 가능한 내부 표현을 지니고 있음에도 불구하고, 이러한 표현을 인과적으로 조종하여 위험 감수 결정을 변경할 수 없다는 사실은 잠재적 읽기출력이 하류 의사결정에서 해당 표현에 대한 진정한 의존성을 반드시 나타내는 것은 아님을 보여준다고 주장한다.

원저자: Ciarán Walsh, Emilio Barkett

게시일 2026-05-26
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ciarán Walsh, Emilio Barkett

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 매우 똑똑하고 매우 수다스러운 로봇이 인간인 척할 수 있다고 말입니다. 당신은 이 로봇에게 돈, 도박, 위험에 관한 질문을 던지며, 그것이 실제 생활에서의 선택을 하는 사람처럼 행동하기를 바랍니다. 하지만 여기서 핵심적인 질문이 나옵니다: 그 로봇은 실제로 인간처럼 "생각"하고 있는 것일까요, 아니면 당신이 어떻게 질문했는지에 따라 어떤 말을 해야 할지 추측하는 데만 능숙한 것일까요?

이 논문은 유명한 심리학적 기법인 **"실현 효과 (Realization Effect)"**를 이용해 그 로봇을 시험대에 올립니다.

설정: "열린 대금고 vs 닫힌 대금고"

실제 생활에서 인간은 이득이나 손실이 "열려 있는 (미수금)" 상태인지 "닫혀 있는 (실현된)" 상태인지에 따라 다르게 행동합니다.

  • 미수금 (열려 있음): 스크래치 복권에서 50 달러를 당첨받았지만 아직 현금화하지 않았다고 상상해 보세요. 당신은 여전히 "게임 중"인 것처럼 느끼고 돈을 두 배로 늘리기 위해 더 큰 위험을 감수할 수 있습니다.
  • 실현된 (닫혀 있음): 그 50 달러를 현금화해 주머니에 넣고는 다시 잃어버렸다고 상상해 보세요. 당신은 그 돈이 사라졌다고 느끼고 더 신중해질 수 있습니다.

연구자들은 이렇게 질문했습니다: 인공지능은 "열린" 대금고와 "닫힌" 대금고의 차이를 알고 있으며, 실제로 그 차이 때문에 행동을 바꾸고 있을까요?

그들은 인공지능을 세 가지 방식으로 테스트했는데, 이는 경찰 수사 단계에서 용의자를 세 가지 다른 수준으로 조사하는 것과 같습니다.

수준 1: "연기" 테스트 (행동)

먼저, 연구자들은 인공지능에게 단순히 질문들에 답하도록 했습니다.

  • 결과: 인공지능은 이야기가 돈을 "열려 있는" 상태로 묘사했는지 "닫혀 있는" 상태로 묘사했는지에 따라 답변을 실제로 변경했습니다. 그것은 단어에 민감하게 반응했습니다.
  • 하지만: 그것은 실제 인간처럼 행동하지는 않았습니다. 인간이 "열려 있는" 계좌에서 돈을 잃으면 무모해집니다. 반면 인공지능이 "열려 있는" 계좌에서 돈을 잃었을 때, 인간과 같은 방식으로 무모해지지 않았습니다. 그것은 답변의 논리가 아니라 답변의 형태를 모방했을 뿐입니다.

수준 2: "엑스레이" 테스트 (뇌 읽기)

다음으로, 연구자들은 인공지능의 "뇌"(내부 수학 계층) 를 들여다보아 "열린 대금고 vs 닫힌 대금고"라는 개념이 실제로 그곳에 저장되어 있는지 확인했습니다.

  • 결과: 그들은 그것을 발견했습니다! 인공지능의 특정 층 (Layer 18) 에서 명확하고 읽을 수 있는 신호가 있었습니다. 수학을 살펴보면 어떤 프롬프트가 "열려 있는" 것인지, 어떤 것이 "닫혀 있는" 것인지 정확히 알 수 있었습니다.
  • 비유: 그것은 "부엌 불"이라고 명확히 표시된 전등 스위치를 집에서 찾아낸 것과 같습니다. 당신은 스위치를 볼 수 있고, 그것이 부엌과 연결되어 있음을 압니다.

수준 3: "리모컨" 테스트 (인과적 통제)

이 부분이 가장 중요합니다. 인공지능이 실제로 그 개념을 "이해"한다면, 우리는 그 내부 스위치를 뒤집어 인공지능이 마음을 바꾸도록 강요할 수 있어야 합니다.

  • 실험: 연구자들은 인공지능이 질문에 답하는 동안 그 "열린 대금고 vs 닫힌 대금고" 스위치를 수동으로 뒤집는 "리모컨"(활성화 조종) 을 사용했습니다. 그들은 인공지능이 "열린" 대금고를 가진 것처럼 또는 "닫힌" 대금고를 가진 것처럼 행동하도록 강요해 보았습니다.
  • 결과: 아무 일도 일어나지 않았습니다. 그들이 스위치를 보고 뒤집을 수는 있었지만, 도박과 위험에 대한 인공지능의 최종 결정은 변하지 않았습니다.
  • 비유: 그것은 "부엌 불"이라고 표시된 전등 스위치를 찾아 켜고 끄고 나서, 부엌 불이 켜지지 않는다는 것을 깨닫는 것과 같습니다. 스위치는 존재하지만 실제로 전구와 연결되어 있지 않습니다. 그것은 단순한 장식품일 뿐입니다.

주요 결론

이 논문은 **인공지능이 올바른 말을 할 수 있다고 해서 (수준 1), 그리고 그 뇌 안에 읽을 수 있는 "스위치"를 가지고 있다고 해서 (수준 2), 그 스위치가 실제로 그 행동을 통제한다는 뜻은 아니다 (수준 3)**라고 결론 내립니다.

  • **인간에서의 "실현 효과"**는 깊고 인과적인 메커니즘입니다: 돈에 대한 우리의 감정이 도박하는 방식을 바꿉니다.
  • **이 인공지능에서의 "실현 효과"**는 단지 표면적인 패턴이었습니다. 인공지능은 "열려 있는"과 "닫혀 있는"이라는 단어를 감지하고 어휘를 조정했지만, 최종 결정을 내릴 때 그 개념을 실제로 사용하지는 않았습니다.

핵심 교훈:
인공지능이 인간과 유사한 답변을 준다고 해서 그것이 인간처럼 "생각"한다고 가정하지 마십시오. 그것은 단지 매우 훌륭한 배우일 뿐일 수 있습니다. 그것이 실제로 "생각"하고 있음을 증명하려면, 그 안으로 손을 넣어 스위치를 뒤집고 무언가 다르게 행동하게 만들 수 있음을 보여줘야 합니다. 이 경우, 연구자들은 스위치를 뒤집어 보았지만 인공지능은 조금도 움직이지 않았습니다.

간단히 말해: 인공지능은 그 개념에 대한 단어를 가지고 있고, 그 개념에 대한 내부 신호를 가지고 있지만, 자신의 행동을 통제하는 제어권은 가지고 있지 않습니다. 신호는 존재하지만, 그것은 실제 일을 수행하지는 않습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →