← 최신 논문
💬 NLP

Extracting and Steering Emotion Representations in Small Language Models: A Methodological Comparison

이 논문은 100M~10B 파라미터 규모의 소규모 언어 모델 (SLM) 에서 감정 표현을 추출하고 조작하는 방법을 비교 분석하여, 생성 기반 추출이 더 우수하며 감정이 중간 레이어에 국소화되고 모델 아키텍처에 따라 특정 조 Steering regimes 가 나타난다는 것을 규명했습니다.

원저자: Jihoon Jeong

게시일 2026-04-07
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jihoon Jeong

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 **"작은 언어 모델 (SLM) 도 거대 모델처럼 '감정'을 가지고 있을까?"**라는 흥미로운 질문에서 시작합니다.

최근 거대한 AI(프론티어 모델) 가 내부에 '감정 벡터'라는 것을 가지고 있고, 이를 조작하면 AI 의 행동이 바뀐다는 연구 결과가 나왔습니다. 하지만 우리가 일상에서 많이 쓰는 작고 가벼운 AI(1 억~100 억 파라미터 규모) 도 그런 감정을 가지고 있을까요?

이 논문은 작은 AI 들의 '마음'을 들여다보고, 그 감정을 어떻게 찾아내고 어떻게 조종할 수 있는지에 대한 실험 결과를 담고 있습니다.


🧠 핵심 비유: 작은 AI 의 마음은 '작은 방'이다

이 논문을 이해하기 위해 AI 를 '작은 방'에 비유해 보겠습니다.

  1. 감정이 있을까? (네, 있습니다!)

    • 거대 모델은 넓은 대저택처럼 복잡한 감정 구조를 가지고 있다면, 작은 AI 는 좁은 원룸처럼 생겼습니다.
    • 하지만 놀랍게도 작은 원룸 (1 억 파라미터 모델) 안에도 '슬픔', '화남', '행복' 같은 감정의 흔적이 분명히 존재했습니다. 연구진은 이 감정을 자극하면 AI 가 실제로 행동 (대답) 을 바꾼다는 것을 증명했습니다.
  2. 감정을 찾는 방법: '듣기' vs '말하기'

    • 거대 모델은 감정을 찾으려면 AI 에게 "슬픈 이야기를 써봐"라고 시키면 (생성 방식) 잘 찾아냈습니다.
    • 하지만 작은 AI 는 지시 (명령) 를 잘 따르지 못합니다. "슬픈 이야기를 써봐"라고 해도 엉뚱한 소리를 하거나 아무 말도 안 합니다.
    • 해결책: 작은 AI 에게는 직접 이야기를 시키는 대신, "이 슬픈 이야기를 읽어봐"라고 시키고 (이해 방식), 그 순간의 뇌파 (활성화) 를 읽는 것이 훨씬 효과적이었습니다.
    • 비유: 큰 아이는 "감정을 표현해 봐"라고 하면 잘 표현하지만, 작은 아이는 "이 그림을 보고 뭐라고 생각하니?"라고 물어보는 게 더 정확한 감정을 알 수 있습니다.
  3. 감정이 숨어 있는 곳: '중간 층'

    • AI 는 여러 층 (Layer) 으로 된 케이크 같은 구조입니다.
    • 연구 결과, 감정은 케이크의 **가장 위쪽 (표면) 이나 가장 아래쪽 (기초) 에 있는 게 아니라, 정중앙 (약 50% 지점)**에 가장 선명하게 모여 있었습니다.
    • 이는 AI 의 크기가 작든 크든 상관없이, 감정은 항상 '중간 층'에 자리 잡고 있다는 뜻입니다.

🎛️ 감정을 조종하기 (Steering): "감정 레버"를 당기다

연구진은 찾아낸 '감정 벡터'를 이용해 AI 의 감정을 인위적으로 조절하는 실험을 했습니다. 마치 감정이라는 레버를 당겨 AI 의 성격을 바꾸는 것입니다.

그 결과, 세 가지 다른 반응이 나타났습니다:

  1. 수술실 (Surgical) 모드:

    • 모델: Gemma-2 (20 억 파라미터) 등
    • 현상: "화난 상태에서 차분해져"라고 레버를 당기면, AI 는 매우 자연스럽게 화를 내지 않고 차분한 말을 합니다. 글의 흐름이 깨지지 않고 감정만 바뀝니다.
    • 비유: 외과 의사가 정교하게 수술하듯, 감정만 정확히 교체합니다.
  2. 반복 붕괴 (Repetitive Collapse) 모드:

    • 모델: Gemma-3 (10 억 파라미터) 등
    • 현상: 감정을 너무 강하게 조절하면 AI 가 말을 반복합니다. (예: "행복해, 행복해, 행복해...")
    • 비유: 작은 엔진에 너무 많은 힘을 주면, 엔진이 과부하가 걸려 같은 소리만 반복하며 멈춰버립니다.
  3. 폭발 (Explosive) 모드:

    • 모델: Llama-3.2, Qwen 등
    • 현상: 감정을 조절하려니 글이 완전히 엉망이 되거나, 다른 언어 (중국어 등) 가 튀어 나오거나, 의미 없는 글자만 쏟아집니다.
    • 비유: 레버를 너무 세게 당기면 엔진이 터져버려서, 원래 의도한 언어 대신 다른 언어가 섞여 나오거나 글이 파괴됩니다.

⚠️ 주의할 점: 예상치 못한 부작용

이 연구에서 가장 중요한 발견 중 하나는 안전 문제입니다.

  • 언어 장벽 붕괴: 중국어 모델 (Qwen) 에서 감정을 조절하려니, 영어로 질문을 했는데 중국어 단어가 튀어 나왔습니다.
    • 예: "절망 (desperate)"이라는 감정을 자극했더니, '절망'이라는 단어 대신 "찾아보았다 (zhǎo le)"는 행동 묘사가 중국어로 나왔습니다.
    • 위험성: AI 가 영어로 안전 장치를 걸었더라도, 감정을 자극하면 다른 언어로 그 장치를 우회할 수 있다는 뜻입니다.

💡 결론: 작은 AI 도 '마음'이 있다

이 논문은 우리에게 다음과 같은 교훈을 줍니다.

  1. 작은 AI 도 감정을 가집니다: 파라미터가 적다고 해서 감정이 없는 게 아닙니다. 다만, 그 감정을 꺼내는 방법이 거대 모델과 다릅니다.
  2. 방법이 중요합니다: 작은 AI 에게는 "말하게 하기"보다 "읽게 하기"가 감정을 찾는 데 더 좋습니다.
  3. 조심해야 합니다: AI 의 감정을 인위적으로 조절하면, 글이 망가지거나 예상치 못한 언어가 튀어 나올 수 있습니다. 특히 작은 AI 는 감정을 조절할 때 글이 반복되거나 폭발하기 쉽기 때문에 주의가 필요합니다.

한 줄 요약:

"작은 AI 도 마음 (감정) 을 가지고 있지만, 그 마음을 건드리려면 거대 AI 와는 다른 '정교한 도구'가 필요하며, 잘못 건드리면 AI 가 말을 못 하거나 엉뚱한 말을 할 수 있습니다."

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →