Where Do Models Find Happiness? Emotion Vectors in Open-Source LLMs
이 논문은 오픈 소스 LLM(Apertus-8B 및 Gemma-4)이 폐쇄형 모델과 비교할 때 유사한 가치 기하학(valence geometry)을 갖는 정서 개념을 인코딩함을 입증하는 동시에, 이러한 표현이 모델의 깊이에 따라 어떻게 출현하고 추출 코퍼스에 따라 어떻게 변화하는지에 대한 구조별 특이적 패턴을 밝혀낸다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
거대한, 복잡한 컴퓨터 뇌(대규모 언어 모델) 내부에는 컴퓨터가 무언가에 대해 어떻게 느끼는지를 조절하는 숨겨진 "다이얼"이나 "노브(knobs)"가 있다고 상상해 보세요. 이전 연구는 Claude라는 특정 AI에서 이 다이얼들을 발견했습니다. 연구진은 만약 "행복" 다이얼을 돌리면 AI가 더 행복하게 행동하고, "슬픔" 다이얼을 돌리면 더 슬프게 행동한다는 것을 발견했습니다. 더욱 멋진 점은, 컴퓨터의 뇌 안에 이 다이얼들이 배치된 방식이 인간이 자신의 마음속에서 감정을 조직하는 방식과 매우 유사하다는 것입니다.
이 새로운 논문은 다음과 같은 질문을 던집니다: 이것이 단지 Claude라는 컴퓨터의 특이한 현상일까요, 아니면 다른 AI의 뇌에도 이와 같은 숨겨진 감정 다이얼이 존재할까요?
이를 알아내기 위해, 연구진은 두 가지 서로 다른 오픈 소스 AI 뇌인 APERTUS-8B와 GEMMA-4-E4B의 내부를 들여다보았습니다. 그들은 단순히 관찰만 한 것이 아니라, "기쁨"이나 "공포"라는 단어를 실제로 말하지 않으면서도 다양한 감정(기쁨, 공포, 분노 등)에 관한 이야기를 쓰는 동안 AI의 내부적인 생각에 "귀를 기울이려" 노력했습니다.
연구 결과는 다음과 같으며, 이해하기 쉽게 나누어 설명합니다:
1. "행복" 다이얼은 어디에나 존재한다
원래의 연구와 마찬가지로, 이 두 가지 새로운 AI 뇌 모두 가치(Valence)(어떤 것이 기분 좋은지 혹은 나쁜지)에 대한 명확한 내부 방향성을 가지고 있었습니다.
- 비유: 방에 걸어 들어가서 거대한 나침반을 보는 것을 상상해 보세요. 세 가지 AI 뇌(Claude, Apertus, Gemma) 모두에서 "북쪽"을 가리키는 바늘은 일관되게 "좋음/행복"을 의미했고, "남쪽"은 "나쁨/슬픔"을 의미했습니다.
- 결과: 연구진은 이 새로운 모델들 모두에서 이 "남북" 선을 매우 높은 정확도로 찾아낼 수 있었으며, 이는 이것이 일회성 오류가 아니라 컴퓨터가 생각하는 방식의 공통적인 특징임을 증명합니다.
2. "어디에 있는지"는 다르다 (여정이 중요하다)
모든 모델에서 "남북" 나침반은 존재했지만, 정보가 그곳에 도달하기 위해 거치는 경로는 완전히 달랐습니다.
- GEMMA-4-E4B (조기 학습자): 이 AI는 처리 과정의 매우 초기에 좋고 나쁨의 차이를 파악했습니다. 마치 옳고 그름을 즉시 아는 아이와 같습니다. 그러나 정보가 뇌의 더 깊은 곳으로 이동함에 따라, 이 명확한 신호는 점점 흐릿해졌고 끝부분에 이르러서는 거의 사라졌습니다.
- APERTUS-8B (만성기 학습자): 이 AI는 초기 단계에서는 좋고 나쁨에 대한 명확한 개념 없이 시작했습니다. 마치 백지 상태와 같았습니다. 하지만 정보가 뇌의 더 깊은 곳(끝부분 쪽)으로 이동함에 따라, "좋음 대 나쁨"의 신호가 갑자기 매우 강력하고 명확해졌습니다.
- 시사점: 두 개의 서로 다른 AI 뇌가 동일한 감정적 이해에 도달할 수는 있지만, 그곳에 도달하기 위해 완전히 다른 경로를 택합니다. 하나는 천천히 구축하고, 다른 하나는 그것을 가지고 시작했다가 잃어버립니다.
3. "흥분" 다이얼은 불안정하다
연구진은 또한 각성(Arousal)(얼마나 흥분되었는지 혹은 차분한지)에 대한 다이얼을 찾아보았습니다.
- 문제: 이 모델들에서 일관된 "흥분" 다이얼을 찾을 수 없었습니다. 신호가 매우 약했습니다.
- 반전: 이 신호의 강도는 전적으로 누가 이야기를 썼느냐에 따라 달라졌습니다. AI가 GEMMA 모델이 쓴 이야기를 읽을 때는 "흥분" 다이얼이 훨씬 더 명확했습니다. 반면, APERTUS 모델이 쓴 이야기를 읽을 때는 다이얼이 거의 보이지 않았습니다.
- 비유: 이것은 속삭임을 들으려고 노력하는 것과 같습니다. 만약 속삭이는 사람이 특정 종류의 마이크(Gemma 이야기)를 착용하고 있다면 흥분을 명확하게 들을 수 있습니다. 만약 다른 마이크(Apertus 이야기)를 사용한다면, 흥분은 잡음 속에 사라져 버립니다. 이는 AI의 내부 배선보다 이야기의 내용이 이 특정 감정에 더 중요하다는 것을 시사합니다.
4. 지도 vs 나침반
연구진은 또한 정보를 처리함에 따라 AI의 뇌의 "지도"가 변하는지 확인했습니다.
- 그들은 AI의 내부 세계의 전반적인 형태(지도)는 처음부터 끝까지 거의 일정하게 유지된다는 것을 발견했습니다.
- 그러나 특정 "나침반"(좋음/나쁨의 방향)은 층(layer)을 통과하며 이동할 때마다 계속 회전하고 그 방향이 바뀌었습니다.
- 교훈: 방(뇌)의 모습이 똑같다고 해서 당신이 향하고 있는 방향(감정)이 그대로 유지되는 것은 아닙니다.
요약
이 논문은 AI 모델이 인간 심리학과 유사한 내부 "감정 벡터"를 가지고 있음을 확인해주지만, 그들이 이를 구축하는 방식은 모두 다르다는 것을 보여줍니다.
- 좋음 대 나쁨 (Valence): 모든 모델에서 발견되지만, 처리 단계에 따라 구축되는 시점이 다릅니다.
- 흥분 대 차분 (Arousal): 찾기 어려우며, AI가 읽는 이야기의 유형에 크게 의존합니다.
저자들은 우리가 이러한 감정적 "노브"를 찾을 수는 있지만, 모델마다 그것을 숨겨둔 위치가 다르고, 우리가 입력하는 이야기가 그 노브를 찾기 더 어렵거나 쉽게 만들 수 있기 때문에 주의해야 한다고 결론짓습니다. 그들은 다른 AI의 뇌에서도 이 다이얼을 찾을 수 있도록 코드와 데이터를 공개했습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.