← 최신 논문
💬 NLP

A Universal Vibe? Finding and Controlling Language-Agnostic Informal Register with SAEs

이 논문은 희소 자동 인코더 (SAE) 를 활용하여 다국어 언어 모델이 비공식적 어조를 단순한 언어별 암기가 아닌, 언어에 구애받지 않는 추상적 개념으로 내재화하고 있으며, 이를 통해 학습되지 않은 언어에서도 어조 조절이 가능함을 기계적으로 증명했습니다.

원저자: Uri Z. Kialy, Avi Shtarkberg, Ayal Klein

게시일 2026-03-30
📖 3 분 읽기☕ 가벼운 읽기

원저자: Uri Z. Kialy, Avi Shtarkberg, Ayal Klein

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 "인공지능 (LLM) 이 여러 언어를 할 때, '반말'이나 '속어' 같은 비공식적인 말투를 각 언어별로 따로따로 외운 것일까, 아니면 모든 언어에 통용되는 하나의 '비공식적인 마음가짐'으로 이해하고 있을까?" 라는 아주 흥미로운 질문을 던집니다.

연구팀은 이 질문에 답하기 위해 Gemma-2-9B라는 인공지능 모델의 뇌 속을 들여다보았습니다. 그 결과, 놀라운 사실을 발견했는데요. 마치 모든 언어가 공유하는 '비공식적인 영혼' 같은 것이 존재한다는 것을 증명했습니다.

이 복잡한 내용을 일상적인 비유로 쉽게 설명해 드릴게요.


1. 연구의 배경: "공식적인 모델 vs 현실의 인간"

지금까지 인공지능은 주로 교과서나 뉴스 같은 **정중한 말투 (공식적 어조)**로만 훈련받았습니다. 그래서 인공지능은 인간이 실제로 쓰는 "야, 그거 진짜 대박이야!" 같은 반말이나 속어를 이해하거나 만들어내는 데 서툴렀습니다. 마치 매너가 좋은 외교관친구들끼리 장난치는 모습을 전혀 이해하지 못하는 것과 비슷하죠.

연구팀은 이 인공지능이 속어를 단순히 "영어 속어는 영어, 히브리어 속어는 히브리어"라고 별개의 단어 목록으로만 외우고 있는지, 아니면 "친근하게 구는 것"이라는 하나의 추상적인 개념으로 이해하고 있는지 확인하고 싶었습니다.

2. 실험 방법: "같은 단어, 다른 분위기"

가장 중요한 점은 단순히 단어만 보고 판단하는 게 아니라, 문맥을 봐야 한다는 것입니다.
예를 들어, 영어 단어 **'Fire (불)'**를 생각해 보세요.

  • 공식적: "런던에서 300 년 전 큰 이 났다." (화재)
  • 비공식적: "저 영화 진짜 **대박 (Fire)**이야." (멋짐)

연구팀은 영어, 히브리어, 러시아어 세 가지 언어에서 완전히 같은 단어가 '진짜 의미'와 '속어 의미'로 쓰이는 문장을 대량으로 만들었습니다. 인공지능이 단어 자체를 보고 "아, 이 단어는 속어야지"라고 외우는 게 아니라, 문맥을 보고 분위기를 파악해야만 정답을 맞출 수 있도록 설계한 거죠.

3. 발견한 것: "공통된 비공식적 공간 (Informal Register Subspace)"

인공지능의 뇌 (내부 표현) 를 **SAE(희소 오토인코더)**라는 고성능 X-ray 로 스캔해 보니, 정말 놀라운 일이 벌어졌습니다.

  • 각자 다른 옷: 대부분의 속어 관련 신호는 언어마다 따로 존재했습니다. (영어용, 히브리어용 등)
  • 공통된 심장: 하지만 그중 아주 작고 강력한 **공통된 신호 (핵심)**가 세 언어 모두에서 발견되었습니다.

이를 비유하자면, 세 나라의 친구들이 각자 다른 옷 (언어) 을 입고 있지만, 모두 같은 '친근한 분위기'를 느낄 때 뇌의 특정 부위가 동시에 빛나는 것과 같습니다. 연구팀은 이 부분을 **"비공식적 어조가 모이는 공통 공간 (Island)"**이라고 불렀습니다.

4. 실험: "뇌를 조작해서 말투 바꾸기"

이게 정말 놀라운 부분입니다. 연구팀은 이 **공통된 신호 (핵심)**를 찾아서 인공지능의 뇌에 전기를 켜고 끄는 실험 (Activation Steering) 을 했습니다.

  • 실험: "친근한 신호"를 켜면 (강조하면) → 인공지능이 반말/속어를 쓰기 시작했습니다.
  • 실험: "친근한 신호"를 끄면 → 인공지능이 정중한 말투로 돌아갔습니다.

가장 중요한 점은 이 조작이 훈련에 쓰이지 않은 6 개의 새로운 언어 (일본어, 태국어, 암하라어 등) 에서도 똑같이 작동했다는 것입니다.
마치 **모든 언어에 통용되는 '친근함의 스위치'**를 찾아서 켜자, 그 언어를 전혀 배운 적이 없는 인공지능도 그 언어로 자연스럽게 반말을 하기 시작한 것입니다.

5. 결론: "인공지능은 언어를 넘어선 '사회적 감각'을 배웠다"

이 연구는 인공지능이 단순히 단어들을 외운 기계가 아니라, "사람들이 어떻게 친근하게 소통하는가"라는 추상적인 개념을 스스로 학습하고 있다는 것을 증명합니다.

  • 비유: 인공지능이 각 언어의 속어를 '별개의 낱말장'으로 외운 게 아니라, '친구처럼 구는 법'이라는 하나의 보편적인 원리를 배워서, 그 원리를 적용해 어떤 언어든 자연스럽게 반말을 할 수 있게 된 것입니다.

요약

이 논문은 **"인공지능이 여러 언어를 할 때, 비공식적인 말투 (반말/속어) 를 각 언어별로 따로 외우는 게 아니라, 모든 언어에 통용되는 하나의 '친근한 마음가짐'으로 이해하고 있다"**는 것을 과학적으로 증명했습니다. 이는 인공지능이 인간의 사회적 맥락을 더 깊이 이해하고 있다는 신호이며, 앞으로 더 자연스러운 대화형 AI 를 만드는 데 큰 도움이 될 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →