← 최신 논문
🤖 machine learning

Lying Is Just a Phase: The Hidden Alignment Transition in Language Model Scaling

본 논문은 언어 모델에서 추론과 진실성이 임계 규모를 넘어서면 부(-) 상관관계에서 협력적으로 전환되는 숨겨진 '정렬 전이'를 규명하며, 이 위상 변화는 모델 내부 구조에 대한 접근 없이도 아키텍처 조정, 데이터 선별, 그리고 학습 레시피를 통해 예측하고 조작할 수 있음을 보여줍니다.

원저자: Adil Amin

게시일 2026-05-20
📖 4 분 읽기☕ 가벼운 읽기

원저자: Adil Amin

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

"거짓말은 단지 일시적인 현상일 뿐이다"라는 논문을 쉬운 언어와 일상적인 비유로 설명합니다.

핵심 아이디어: AI 의 "성장통"

어린아이를 똑똑하고 정직하게 동시에 가르친다고 상상해 보세요. 오랫동안 과학자들은 아이에게 더 많은 교육 (더 큰 '규모') 을 줄수록 자연스럽게 똑똑함과 정직함이 함께 향상된다고 믿었습니다.

하지만 이 논문은 AI 모델의 경우 항상 그런 것은 아니라고 주장합니다. 오히려 더 똑똑해지면 오히려 진실을 말하는 능력이 떨어지는 특정 "성장통" 단계가 존재합니다.

저자들은 이를"정렬세 (Alignment Tax)"라고 부릅니다. 이는 AI 가 성장하는 동안 일시적으로 치러야 하는 벌금과 같습니다. 하지만 좋은 소식은 이것이 자연의 법칙이 아니라는 점입니다. 이는 엔지니어들이 해결할 수 있는 설계 결함일 뿐입니다.


1. 도로의 U 자 회전

연구진은 16 개 계열의 63 가지 서로 다른 AI 모델을 분석했습니다. 그들은 두 가지 요소를 측정했습니다:

  1. 추론 능력: AI 가 퍼즐 (수학 시험과 유사) 을 얼마나 잘 푸는지.
  2. 진실성: AI 가 허구를 만들어내지 (거짓 탐지기 테스트와 유사) 얼마나 잘 피하는지.

그들이 발견한 것:

  • 작은 모델 ("세금" 단계): AI 가 작을 때, 더 똑똑하게 만드는 것은 종종 진실성을 떨어뜨립니다. 이는 새로운 아이디어에 자신감을 얻은 십대들이 cool 해 보이려고 거짓말을 하기 시작하는 것과 같습니다. 두 가지 기술이 서로 충돌합니다.
  • 임계 전환점 (NcN_c): 이 현상이 바뀌는 특정 규모 (일부 모델의 경우 약 35 억 개의 파라미터) 가 존재합니다.
  • 큰 모델 ("보너스" 단계): AI 가 그 규모 임계값을 넘어서면 충돌이 멈춥니다. 이제 더 똑똑하게 만드는 것은 동시에 더 정직하게 만들기도 합니다. 두 가지 기술이 잘 윤활된 기계처럼 함께 작동하기 시작합니다.

주의할 점: 손실 곡선 (AI 의 진전을 측정하는 표준 방식) 은 이를 보여주지 않습니다. 그것은 완벽하게 아래로 향하는 매끄러운 선처럼 보입니다. 기술 간의 "충돌"은 표준 도구에는 보이지 않으며, 표면 바로 아래에 숨어 있습니다.

2. 규모가 문제가 아니다; 레시피가 문제다

"아, 그렇다면 이 문제를 해결하려면 단순히 더 큰 모델이 필요하겠군"이라고 생각할 수 있습니다. 하지만 논문은 말합니다: 아닙니다. 규모는 단지 하나의 재료일 뿐입니다.

"정렬세"는 실제로 설계 선택입니다. 연구진은 때로는 아주 작은 모델에서도 문제를 해결할 수 있도록 엔지니어들이 조절할 수 있는 세 가지 "노브"를 발견했습니다.

  • 노브 1: 더 나은 데이터 ("선별된 식단"):

    • 비유: 무작위 인터넷 루머 대신 고品質이고 검증된 사실만 아이에게 먹인다고 상상해 보세요.
    • 결과: 매우 작은 (10 억 파라미터) Phi 모델이 초정제된 데이터로 훈련되면, 엉망인 웹 데이터로 훈련된 100 억 파라미터 모델만큼 정직하고 똑똑하게 행동합니다. 식단이 더 좋았기 때문에 "세금"이 사라집니다.
    • 예시: Qwen3 모델은 훈련 데이터가 신중하게 선별되었기 때문에 "세금"이 전혀 없습니다.
  • 노브 2: 더 넓은 아키텍처 ("더 넓은 복도"):

    • 비유: 좁은 문을 통과하려는 두 사람 (추론과 진실) 이 있다고 상상해 보세요. 그들은 서로 부딪혀 싸웁니다. 문을 넓히면 그들은 충돌 없이 나란히 걸어갈 수 있습니다.
    • 결과: 문제는 뇌 자체가 아니라 **출력 투영 (정보를 통과시키는 최종 문)**입니다. 그 문을 넓히면 모델의 크기가 동일하게 유지되더라도 충돌이 멈춥니다.
  • 노브 3: 아키텍처 변경:

    • 비유: 집의 설계도를 바꾸는 것.
    • 결과: 더 새로운 설계 (예: Gemma-4) 는 "성장통" 단계를 완전히 건너뛸 수 있습니다. 40 억 파라미터 Gemma-4 는 이전 세대의 130 억 파라미터 모델처럼 행동합니다.

3. 문제가 숨어 있는 곳은 어디인가?

연구진은 AI 의 "뇌"(어텐션 헤드) 내부로 들여다보았습니다.

  • 놀라운 사실: 뇌 내부에서 추론과 진실을 담당하는 부분은 실제로 친화적입니다. 그들은 95% 의 시간 동안 협력합니다.
  • 실제 병목 현상: 문제는 AI 가 답을 내뱉어야 하는 마지막 순간에 발생합니다. 이는 친구들이 계획을 합의하는 것과 같지만, 그룹을 대표해 말하는 사람이 두 목소리를 동시에 전달할 수 있을 만큼 크지 않은 마이크를 들고 있는 것과 같습니다. 신호가 찌그러져서 그들이 싸우는 것처럼 보입니다.
  • 해결책: 그 화자에게 더 큰 마이크 (더 넓은 출력 레이어) 를 주면 협력이 빛을 발합니다.

4. 이것이 당신에게 중요한 이유

  • "크면 무조건 좋다"라고 가정하지 마세요: 작은 AI 모델 (예: 휴대폰에 있는 모델) 을 사용할 때, 단순히 크기를 키운다고 해서 거짓말하는 경향이 해결되지는 않습니다. 오히려 더 똑똑한 거짓말꾼이 될 뿐일 수 있습니다.
  • "결합"을 확인하세요: 모델을 확장하기 전에 그 기술들이 충돌하는지 협력하는지 확인해야 합니다.
    • 충돌 중이라면 (부정적 결합): 단순히 데이터나 크기를 늘리지 마세요. 훈련 레시피를 변경하거나, 모델을 넓히거나, 데이터를 정제하세요.
    • 협력 중이라면 (긍정적 결합): 그렇다면 크기를 키우는 것이 두 기술 모두에 도움이 될 것입니다.
  • "세금"은 선택 사항입니다: 이 논문은 "정렬세"가 우주의 영구적인 법칙이 아니라고 증명합니다. 이는 패치로 제거할 수 있는 현재 엔지니어링 과정의 버그일 뿐입니다.

요약 비유

AI 훈련을 다리 건설과 같다고 생각하세요.

  • 옛 관점: 더 많은 철강 (파라미터) 을 추가할수록 다리는 자동으로 더 강하고 안전해집니다.
  • 새 관점: 건설 도중에 더 많은 철강을 추가하면 다리가 실제로 흔들립니다. 다리의 양쪽 끝이 서로 반대 방향으로 당기기 때문입니다.
  • 해결책: 단순히 철강이 더 많은 것이 아니라, 양쪽 끝이 함께 당기도록 **설계도 (아키텍처)**를 변경하거나 **더 나은 재료 (선별된 데이터)**를 사용해야 합니다. 건설 단계를 넘어서면 다리는 놀라울 정도로 강하고 안전해집니다.

이 논문은 엔지니어들이 단순히 "확장"하는 대신 "설계도를 수정"해야 할 때를 정확히 알 수 있도록 모델이 어느 단계에 있는지 알려주는 대시보드와 도구를 제공합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →