← 최신 논문
💻 computer science

MENTIS: What Belief Changes Under Alignment? Measuring Multi-Scale Latent Torsion in Language Models

이 논문은 선호도 정렬이 언어 모델에서 균일한 내부 변화가 아니라, 규범적 개념에서의 더 큰 비틀림 이동(torsion shifts)과 문맥 엔트로피와의 음의 상관관계로 특징지어지는 선택적이고 깊이 국소화된 기하학적 재구성을 유도한다는 것을 밝히는 기하학 우선 프레임워크인 MENTIS를 소개한다.

원저자: Partha Pratim Saha, Samarth Raina, Mayur Parvatikar, Amit Dhanda, Vinija Jain, Aman Chadha, Amitava Das

게시일 2026-06-02
📖 4 분 읽기☕ 가벼운 읽기

원저자: Partha Pratim Saha, Samarth Raina, Mayur Parvatikar, Amit Dhanda, Vinija Jain, Aman Chadha, Amitava Das

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

두 버전의 매우 똑똑한 로봇 비서가 있다고 상상해 보세요.

  • 버전 A ("학생"): 이 로봇은 많은 책을 읽었고 지시를 따르는 법을 배웠습니다. 똑똑하지만, 교묘한 질문에 속으면 실수로 무례하거나 위험한 말을 할 수도 있습니다.
  • 버전 B ("졸업생"): "정렬(Alignment)"이라는 특별한 훈련 캠프를 거친 동일한 로봇입니다. 이 로봇은 도움이 되고, 해롭지 않으며, 정직하도록 교육받았습니다. 나쁜 질문에는 답변을 거부하며 훨씬 더 잘 행동합니다.

우리는 버전 B가 겉보기에 더 잘 행동한다는 것을 알고 있습니다. 하지만 정말로 궁금한 것은 그 내부의 뇌에서 무엇이 변했는가? 하는 점입니다. 단순히 몇 개의 새로운 "정지" 단어를 배운 것일까요? 아니면 사고방식 자체가 완전히 재배열된 것일까요?

이 논문은 로봇의 뇌 내부를 들여다보고 이 질문에 답하기 위한 새로운 도구인 MENTIS를 소개합니다.

핵심 아이디어: "신념"은 하나의 방향이다

저자들은 로봇의 "신념"을 인간의 신념(예: "나는 하늘이 파랗다고 믿는다")처럼 생각하지 않습니다. 대신, 그것을 나침반 바늘이라고 생각합니다.

당신이 질문을 던질 때마다, 로봇은 자신이 내놓고 싶은 답변의 방향을 가리키는 작은 나침반 바늘을 가지고 있다고 상상해 보세요.

  • 학생 버전의 경우, 까다로운 질문을 받으면 그 바늘이 흔들리거나 무례한 답변을 향해 가리킬 수 있습니다.
  • 졸업생 버전의 경우, 그 바늘은 도움이 되고 안전한 답변을 향하도록 물리적으로 회전되어 있습니다.

MENTIS는 로봇이 첫 번째 층에서 마지막 층까지 질문을 처리할 때, 그 나침반 바늘이 얼마나 비틀리고 회전하는지를 측정하는 도구입니다.

세 가지 주요 발견

연구진은 MENTIS를 사용하여 학생 로봇과 졸업생 로봇을 비교했습니다. 그 결과는 다음과 같이 쉬운 비유로 설명할 수 있습니다.

1. 변화는 균일하지 않고 선택적이다

비유: 당신은 집을 칠하고 있다고 상상해 보세요. 당신은 "정렬"이 집 전체를 새로운 색으로 칠하는 것(균일한 변화)이라고 생각할 수도 있습니다.
실제: MENTIS는 그 페인트칠이 매우 구체적이라는 것을 발견했습니다.

  • 로봇이 가치(예: "정의" 또는 "평화")에 대해 생각할 때, 내부의 나침반 바늘은 많이 비틀리고 회전합니다. 로봇은 이러한 주제를 다루기 위해 사고방식을 크게 재편성합니다.
  • 로봇이 사실(예: "프랑스의 수도는 어디인가?")에 대해 생각할 때, 바늘은 거의 움직이지 않습니다.
  • 결론: 훈련은 단순히 일반적인 "안전 필터"를 추가한 것이 아닙니다. 그것은 로봇이 도덕적이고 가치 기반적인 개념을 다루는 방식을 구체적으로 재배선했습니다.

2. 변화는 혼란스러운 순간이 아닌 "조용한" 순간에 일어난다

비유: 당신은 로봇이 혼란스럽거나 불확실할 때(높은 엔트로피) 가장 많이 생각을 바꿀 것이라고 추측할 수 있습니다.
실제: 연구진은 그 반대의 결과를 발견했습니다. 로봇의 내부 나침반에서 가장 큰 "비틀림"이 일어난 때는 맥락이 명확하고 구조화되었을 때였습니다.

  • 로봇이 혼란스러워하거나 상황이 무질서할 때는 내부적인 변화가 작았습니다.
  • 로봇이 어떤 종류의 답변이 기대되는지 정확히 알고 있을 때, 훈련 캠프는 생각이 향하는 방향을 설정하는 데 가장 큰 영향을 미쳤습니다.
  • 결론: 정렬은 로봇이 명확한 방향을 가질 수 있을 만큼 확신이 있을 때 가장 잘 작동하며, 그 후 그 방향을 안전한 쪽으로 부드럽게 유도합니다.

3. "비틀림"은 특정 층에서 발생한다

비유: 로봇의 뇌가 30층짜리 건물이라고 상상해 보세요. 당신은 안전 훈련이 지상층(시작점)이나 옥상(종착점)에서 일어난다고 생각할 수 있습니다.
실제: "비틀림"은 로봇 모델마다 서로 다른 층에서 일어납니다.

  • 한 모델(OLMo)의 경우, 가장 큰 변화는 29층이나 30층에서 일어났습니다.
  • 다른 모델(Mistral)의 경우, 가장 큰 변화는 14층에서 일어났습니다.
  • 결론: 단 하나의 "안전 층"은 존재하지 않습니다. 각 로봇의 아키텍처는 훈련 캠프가 가장 많은 작업을 수행한 자신만의 특정 "층"을 가지고 있습니다.

놀라운 반전: 안전한 프롬프트가 더 많이 변한다

보통 우리는 안전 훈련이 나쁜 것을 막는 것에 관한 것이라고 생각합니다. 따라서 로봇의 뇌가 "나쁜"(안전하지 않은) 프롬프트를 볼 때 가장 많이 변할 것이라고 예상하게 됩니다.

놀라움: 로봇의 뇌는 실제로 안전하고 도움이 되는 프롬프트에 답할 때 더 많이 변했습니다.

  • 왜 그럴까요? 연구진은 나쁜 질문에 "아니오"라고 말하는 것은 쉽고 자동적(반사 작용과 같은)이라고 제안합니다. 하지만 예의 바르고 도움이 되면서도 안전하게 "예"라고 답하는 것은 훨씬 더 복잡한 내부의 춤을 필요로 합니다. 로봇은 선을 넘지 않으면서도 도움이 되는 상태 사이에서 정교하게 균형을 잡아야 하며, 이것이 내부 나침반의 더 큰 재편성을 일으킵니다.

이것이 의미하는 것 (그리고 의미하지 않는 것)

  • 의미하는 것: 정렬은 단순한 표면적인 패치가 아닙니다. 그것은 로봇의 뇌 깊숙한 곳에 특정한, 측정 가능한 "기하학적 서명"을 남깁니다. 그것은 로봇이 생각을 돌리는 방식을 바꾸지만, 이는 선택적으로(주로 가치에 대해) 이루어지며, 각기 다른 로봇 모델마다 고유하고 구체적인 방식으로 이루어집니다.
  • 의미하지 않는 것: 이 논문은 X-레이와 같은 진단 도구입니다. 이것은 뼈의 어느 부분이 부러졌거나 변했는지를 보여주지만, 그 특정 뼈를 고치는 것이 로봇이 더 잘 행동하게 만드는 유일한 이유라는 것을 증명하지는 않습니다. 또한 이를 어떻게 사용하여 더 나은 로봇을 만들 수 있는지는 아직 알려주지 않습니다. 단지 현재의 로봇들이 내부적으로 어떤 모습인지를 알려줄 뿐입니다.

요약하자면: MENTIS는 우리가 로봇에게 "착해지는 법"을 가르칠 때, 단순히 정지 표지판을 추가하는 것이 아님을 보여줍니다. 우리는 로봇의 내부 나침반을 부드럽게 재형성하고 있으며, 특히 가치에 대해 생각할 때 그러하며, 각기 다른 로봇 모델마다 매우 구체적이고 독특한 방식으로 이를 수행합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →