← 최신 논문
🤖 machine learning

ATLAS: Constitution-Conditioned Latent Geometry and Redistribution Across Language Models and Neural Perturbation Data

이 논문은 ATLAS 라는 기법을 통해 헌법 기반 후학습이 모델의 잠재적 기하학적 구조를 체계적으로 변형시키며, 이러한 기하학적 재발현이 모델 아키텍처나 신경 교란 데이터와 같은 다른 하위 구조에서도 재식별 가능함을 입증합니다.

원저자: Gareth Seneque, Lap-Hang Ho, Nafise Erfanian Saeedi, Jeffrey Molendijk, Tim Elson

게시일 2026-04-21
📖 3 분 읽기☕ 가벼운 읽기

원저자: Gareth Seneque, Lap-Hang Ho, Nafise Erfanian Saeedi, Jeffrey Molendijk, Tim Elson

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🌍 핵심 비유: "AI 의 뇌 속에 숨겨진 지도"

생각해 보세요. AI 는 거대한 도시처럼 복잡한 내부 구조를 가지고 있습니다. 이 도시에는 수많은 길 (신경 경로) 과 건물 (데이터 표현) 이 있습니다.

연구진은 AI 에게 **"헌법 (Constitution)"**이라는 새로운 규칙 세트를 가르쳤습니다. 예를 들어, "불법적인 일을 도와주지 마라"거나 "정직하게 답변하라"는 규칙입니다.

이 논문은 다음과 같은 질문을 던집니다:

"AI 가 이 규칙을 배우고 나면, 단순히 입구 (대답) 만 바뀌는 걸까, 아니면 도시 내부의 지도 (뇌 구조) 자체가 영구적으로 변했을까?"

🔍 연구의 3 단계 여정 (ATLAS 프로젝트)

저자들은 이 변화를 찾기 위해 ATLAS라는 탐사대를 보냈습니다. 탐사는 세 단계를 거칩니다.

1 단계: 헌법을 가르친 AI (Gemma) 에서 지도 그리기

  • 상황: 헌법을 배운 AI(Gemma) 를 분석했습니다.
  • 발견: 규칙을 배우고 나자, AI 의 뇌 속에 **'새로운 지도 (Chart)'**가 생겼습니다.
    • 이 지도는 AI 가 "나쁜 질문"을 받았을 때, 어떻게 "안전한 길"로 우회하는지 보여주는 경로입니다.
    • 결과: 헌법을 배운 AI 는 이 새로운 지도를 정확히 따라 다녔습니다. (320 개의 테스트 중 310 개 성공)
    • 중요한 점: 이 지도는 딱 하나의 길만 있는 게 아니라, **여러 갈래가 연결된 넓은 지역 (Family)**으로 존재했습니다.

2 단계: 다른 AI (Phi) 에 그 지도를 찾아보기

  • 상황: 이제 헌법을 배우지 않은 완전히 다른 AI(Phi) 에게 그 '지도'를 찾아보라고 했습니다. 마치 "다른 도시에서 우리가 그린 지도와 똑같은 길 구획이 있을까?"라고 묻는 것과 같습니다.
  • 발견: 놀랍게도, 헌법을 배우지 않은 Phi AI 의 뇌 속에서도 그 지도와 매우 비슷한 구조를 찾아냈습니다.
    • 비유: 헌법을 배우지 않은 AI 가, 마치 헌법을 배운 AI 처럼 "나쁜 길"을 피하는 유사한 패턴을 보인 것입니다.
    • 수치: 이 발견은 매우 강력했습니다 (98.4% 확률로 구분 가능).
    • 하지만: 위치가 정확히 똑같지는 않았습니다. 헌법을 배운 AI 의 '지도'와 Phi 의 '지도'는 같은 건물이지만, 건물의 위치나 크기가 약간 달랐습니다. 이를 **'재분배 (Redistribution)'**라고 부릅니다.

3 단계: 생쥐의 뇌 (ALM8) 에서 확인하기

  • 상황: 가장 극적인 실험입니다. AI 가 아닌 생쥐의 뇌 데이터를 가져와서 같은 '지도'가 있는지 확인했습니다.
  • 발견: 생쥐의 뇌에서도 AI 가 배운 그 '지도의 패턴'이 발견되었습니다!
    • 의미: AI 의 규칙 학습이 단순히 소프트웨어적인 변화가 아니라, 생물학적 뇌의 작동 원리와도 통하는 보편적인 구조일 수 있음을 시사합니다.
    • 결과: 5 개의 실험군 모두에서 긍정적인 결과가 나왔습니다.

⚠️ 중요한 한계: "완벽한 복사"는 아니었습니다

이 연구의 가장 중요한 교훈은 "완벽한 일치"가 아니었다는 점입니다.

  • 비유: 헌법을 배운 AI(A) 와 다른 AI(B) 가 같은 '지도'를 가지고 있지만, A 는 그 지도를 '중앙 광장'에 그렸고, B 는 '동쪽 공원'에 그렸습니다.
  • 의미: AI 의 뇌 구조는 규칙을 배울 때 완전히 똑같이 복제되지 않습니다. 대신 핵심적인 구조 (지도의 모양) 는 유지되면서, 위치나 표현 방식은 변합니다.
  • 한계: 어떤 특정 질문 (객관식 문제 등) 에 대해서는 이 패턴이 명확하게 작동하지 않기도 했습니다. 즉, "모든 상황에서 완벽하게 작동하는 마법 지팡이"는 아니라는 뜻입니다.

💡 결론: 우리가 무엇을 알게 되었나요?

  1. AI 는 규칙을 배우면 뇌 구조가 바뀝니다: 단순히 대답만 바뀌는 게 아니라, 내부의 '지도' 자체가 재구성됩니다.
  2. 그 변화는 다른 AI 나 생물에게도 전파될 수 있습니다: 헌법을 배우지 않은 다른 AI 나 생쥐의 뇌에서도 비슷한 구조를 찾을 수 있었습니다.
  3. 하지만 위치는 다릅니다: 구조는 비슷하지만, 정확히 같은 자리에 있는 것은 아닙니다. (재분배 현상)

한 줄 요약:

"AI 에게 새로운 규칙을 가르치면, 그 AI 의 뇌 속에 새로운 지도가 생깁니다. 놀랍게도 이 지도는 다른 AI 나 생쥐의 뇌에서도 비슷한 형태로 발견되지만, 정확한 위치는 조금씩 달라집니다."

이 연구는 AI 의 '두뇌'가 어떻게 작동하고 변화하는지 이해하는 데 중요한 첫걸음을 내디뎠으며, 앞으로 AI 의 안전성과 제어 기술을 개발하는 데 큰 도움이 될 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →