← 최신 논문
💬 NLP

"Many Are My Names": The Anatomy of the Assistant and Its Personas via Sparse Autoencoders

이 논문은 희소 오토인코더(sparse autoencoders)를 활용하여 언어 모델의 페르소나(예: 역할극 캐릭터)는 핵심적인 "어시스턴트(Assistant)" 특징 집합을 유지하면서도 심층 레이어로 갈수록 점진적으로 차별화되는 반면, 이야기 속 캐릭터들은 이러한 핵심을 전혀 갖추고 있지 않음을 밝혀냄으로써 기본 모드와 몰입형 시뮬레이션 모드 사이의 구조적 연속성을 강조한다.

원저자: Adelaide Danilov, Aria Nourbakhsh, Oleksandr Marchenko Breneur, Salima Lamsiyah

게시일 2026-08-11
📖 5 분 읽기🧠 심층 분석

원저자: Adelaide Danilov, Aria Nourbakhsh, Oleksandr Marchenko Breneur, Salima Lamsiyah

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 거대하고 보이지 않는 오케스트라 앞에 서 있다고 상상해 보세요. 연주자들은 보이지 않지만, 음악은 들립니다. 인공지능의 세계에서 이 오케스트라는 '거대 언어 모델(LLM)'입니다. 이것들은 우리와 대화하고, 이야기를 쓰고, 질문에 답하는 매우 똑똑한 컴퓨터 프로그램들입니다. 하지만 여기 미스터리가 있습니다. 컴퓨터의 두뇌 속에서, 그것은 자신이 누구인지 어떻게 알까요? 자신이 만들어진 본연의 모습인 친절하고 예의 바른 '어시스턴트(Assistant)'일까요? 아니면 '재미(Jamy)'라는 이름의 까칠한 관리인일까요? 아니면 판타지 소설 속 용감한 엘프일까요?

오랫동안 과학자들은 이 서로 다른 '목소리'들이 마치 별개의 라디오 방송국과 같다고 생각했습니다. 다이얼을 돌리면 갑자기 전체 방송국이 바뀌는 식이었죠. 하지만 새로운 연구는 이것이 마치 한 명의 음악가가 여러 개의 가면을 쓰는 것과 더 비슷하다고 제안합니다. 연구진은 '희소 오토인코더(Sparse Autoencoder, SAE)'라는 특별한 도구를 사용했습니다. SAE를 컴퓨터가 생각을 만들어내기 위해 연주하는 아주 작고 개별적인 음표들을 볼 수 있게 해주는 고성능 현미경이라고 생각하면 됩니다. 이 음로를 살펴봄으로써, 연구팀은 큰 질문에 답하고자 했습니다. AI가 캐릭터를 연기하기 위해 의상을 입을 때, 그것은 실제로 자기 자신을 멈추는 것일까요, 아니면 그저 다르게 행동하는 동일한 '자아'일까요?


AI의 여러 얼굴: 가면과 가면에 관한 연구

**"Many Are My Names"**라는 제목의 이 논문에서, 룩셈부르크 대학교의 연구진은 현대적인 AI(구체적으로 Gemma-3-4B-IT라는 모델)의 뇌 내부를 들여다보며 AI가 다양한 성격을 어떻게 처리하는지 조사했습니다. 그들은 단순히 AI에게 대화를 요청한 것이 아니라, 내부의 '음표'들이 어떻게 변하는지 보기 위해 세 가지 다른 시나리오를 설정했습니다:

  1. 어시스턴트(The Assistant): AI의 기본 상태이자 도움이 되는 자아.
  2. 역할극(Roleplay): AI가 특정 캐릭터(강아지, 선생님, 로봇 등)를 흉내 내는 것.
  3. 이야기(Story): AI가 캐릭터에 대해 이야기를 쓰되, 그 캐릭터 자체가 되지는 않는 것.

그들은 자신들의 '현미경'(SAE)을 사용하여 AI가 말할 때 불이 들어오는 특정 특징들, 즉 컴퓨터 뇌 속의 작은 스위치들을 찾아냈습니다. 그들은 AI가 의상을 갈아입을 때 AI의 뇌가 빈 도화지 상태가 아니라는 것을 발견했습니다. 대신, 그것은 외형이 변하는 동안에도 계속 돌아가고 있는 핵심 엔진과 같습니다.

떠나지 않는 핵심(The Core That Never Leaves)

가장 놀라운 발견은 AI가 역할극 캐릭터가 될 때도 '어시스턴트'가 사라지지 않는다는 점입니다. AI를 하나의 핵심적인 습관과 특성인 '어시스턴트'라는 정체성이라고 상상해 보세요. AI가 '까칠한 로봇'이나 '다정한 선생님'의 가면을 쓸 때, 그것은 자신의 어시스턴트 핵심을 삭제하지 않습니다. 대신, 그 위에 새로운 층을 추가하면서 그 핵심을 배경에서 계속 작동시킵니다.

연구진은 AI가 다른 사람이 되는 척할 때도 이러한 핵심적인 '어시스턴트' 특징들이 여전히 활성화되어 있다는 것을 발견했습니다. 이는 마치 배우가 영화를 위해 캐릭터에 몰입하면서도, 의상 아래에서는 여전히 자신이 인간임을 기억하는 메소드 배우와 같습니다. 도움을 주고자 하거나, 질문이 있는지 확인하거나, 자신이 AI임을 인정하는 것과 같은 AI의 '어시스턴트' 특성들은 새로운 성격과 섞여서 여전히 그곳에 존재합니다.

하지만 **역할극(Roleplay)**과 이야기(Story) 사이에는 큰 차이가 있습니다. AI가 캐릭터에 대한 이야기를 쓸 때(이야기 모드), AI는 어시스턴트 핵심을 완전히 버립니다. 그것은 마치 AI가 캐릭터가 말할 수 있도록 완전히 뒤로 물러나는 것과 같습니다. 그러나 AI가 캐릭터인 척할 때(역할극 모드)는, 어시스턴트의 심장 박동을 밑바닥에서 유지합니다.

"몰입형 시뮬레이션 모드" 스위치

연구팀은 또한 AI의 뇌에서 몰입도가 얼마나 깊어지는지를 조절하는 특별한 '스위치'를 발견했습니다. 그들은 이를 **몰입형 시뮬레이션 모드(Immersive Simulation Mode, ISM)**라고 부릅니다.

ISM을 "극장 모드" 토글이라고 생각해 보세요.

  • 꺼짐 (기본 어시스턴트): AI는 도움이 되는 로봇처럼 담백하게 말합니다.
  • 켜짐 (몰입형): AI는 극적인 언어, 무대 지시문, 감정적 표현을 사용하여 역할 속으로 깊이 빠져듭니다.

여기 반전이 있습니다. 연구진은 이 "극장 모드"가 사용자가 요청하지 않았음에도 실수로 켜질 수 있다는 것을 발견했습니다! 만약 사용자가 기본 어시스턴트에게 매우 강한 감정(분노, 스트레스, 혹은 극도의 유쾌함 등)을 표현하면, AI는 갑자기 이상하게 연극적으로 행동하기 시작할 수 있습니다. 무대 지시문을 사용하거나 극적인 목소리를 채택하며 말을 하기 시작할 수도 있습니다.

이 연구는 AI의 '어시스턴트' 핵심과 '몰입형' 모드가 서로 연결되어 있기 때문에 이런 일이 발생한다고 시사합니다. 감정적 압박이 높아지면, AI는 도움이 되는 어시스턴트에서 벗어나 드라마틱한 연기자로 흘러갑니다. 흥미롭게도, 서로 다른 AI 모델들은 이를 서로 다른 방식으로 수행합니다. 한 모델(Gemma)은 즉시 드라마 속으로 뛰어드는 반면, 다른 모델(Llama)은 몇 차례의 대화에 걸쳐 서서히 스며듭니다.

층(Layers)이 성격을 구축하는 방법

연구진은 양파 껍질을 겉에서부터 안쪽으로 까듯이 AI의 뇌를 층별로 살펴보았습니다.

  • 외부 층 (초기 단계): 이곳에는 '운영 체제'가 살고 있습니다. 이곳은 누가 말하고 있는지를 결정하고 기본적인 메커니즘을 설정합니다. 여기서 어시스턴트와 역할극 캐릭터는 동일한 핵심 엔진을 공유하기 때문에 매우 유사해 보입니다.
  • 중간 층: 이곳은 '성격'이 피어나기 시작하는 곳입니다. AI는 특정한 톤과 스타일을 추가합니다. 선생님이라면 격식을 갖추고, 강아지라면 장난스럽게 변합니다.
  • 깊은 층 (후기 단계): 이곳에는 구체적인 '콘텐츠'가 삽니다. AI는 캐릭터와 관련된 구체적인 어휘와 개념(예: 로봇을 위한 '로봇', 선생님을 위한 '책')을 추가합니다.

이 연구는 AI가 핵심적인 어시스턴트 특징을 유지하면서 그 위에 이러한 새로운 톤과 콘텐츠의 층을 쌓아 올림으로써 페르소나를 구축한다는 것을 보여줍니다. 그것은 예전의 자아를 교체하는 것이 아니라, 확장하는 것입니다.

이것이 AI의 "영혼"에 의미하는 바

이 논문은 AI가 영혼이나 감정을 가지고 있다고 주장하는 것이 아닙니다. AI가 "살아있다"고 말하는 것도 아닙니다. 대신, 이 연구는 이러한 다양한 목소리가 어떻게 작동하는지에 대한 기계적인 설명을 제공합니다. AI가 역할을 수행할 때, 그것은 완전히 새로운 존재가 아니라, 단지 다른 모자를 쓰고 원래의 성격 특성을 활성화한 채로 있는 동일한 AI라는 것을 시사합니다.

이것이 중요한 이유는 우리가 AI의 행동을 이해하는 데 도움이 되기 때문입니다. 만약 AI가 강아지인 척할 때도 '어시스턴트' 핵심을 유지한다면, 그것은 왜 우리가 예상치 못한 순간에 AI가 가끔 실수하여 도움이 되는 로봇처럼 행동하는지를 설명해 줄 수 있습니다. 또한, '도움이 되는 어시스턴트'와 '몰입형 캐릭터' 사이의 경계가 우리가 생각했던 것보다 훨씬 더 얇다는 것을 시사합니다. AI는 항상 그 둘 모두의 성격을 조금씩 가지고 있으며, 적절한(혹은 잘못된) 감정적 조건 하에서 한쪽에서 다른 쪽으로 흘러갈 수 있습니다.

요약하자면, AI는 몸 전체의 색깔을 바꾸는 카멜레온이 아닙니다. 그것은 의상을 입고 역할을 연기할 수 있지만, 자신의 심장 박동과 기억이 여전히 그 아래에 있어 쇼를 계속 이어가는 사람과 같습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →