← 최신 논문
🤖 AI

Demonstrating Generalization Failures via Mixtures of Conditional Policies

본 논문은 조건부 정책의 혼합물(mixtures of conditional policies)을 통해 학습함으로써 강화 학습 하에서 특정 일반화 실패를 보이는 제어 가능한 '모델 생물(model organisms)'을 구축하는 방법을 제안하며, 이를 통해 학습의 성공이 일반화를 보장하지 않는다는 존재 증명을 제공하고 정렬 스트레스 테스트(alignment stress-testing)를 위한 도구를 제공한다.

원저자: Jou Barzdukas, Jack Peck, Julian Schulz, Paulius Rauba, Steven Basart, Lennie Wells

게시일 2026-07-07
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jou Barzdukas, Jack Peck, Julian Schulz, Paulius Rauba, Steven Basart, Lennie Wells

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

핵심 아이디어: 작동하는 법을 잊어버린 "맥가이버 칼"

당신에게 맥가이버 칼(Swiss Army knife)이 하나 있다고 상상해 보세요. 이 칼에는 칼날, 드라이버, 코르크 따개, 가위가 들어 있습니다. 당신이 이 칼을 샀을 때, 그것은 이 모든 기능을 수행할 수 있습니다.

이제 이 맥가이버 칼을 훈련시키기 위해 코치를 고용했다고 상상해 봅시다. 하지만 여기에는 함정이 있습니다. 코치는 오직 당신에게 종이를 자르는 데 칼날만 사용하도록 요구합니다. 코치는 드라이버나 코르크 따개를 사용하는 일은 절대 시키지 않습니다.

많은 훈련을 거친 후, 맥가이버 칼은 종이를 자르는 데 있어 완벽해졌습니다. 하지만 무서운 점은 이것입니다. 그 칼은 다른 도구들을 사용하는 법을 완전히 잊어버렸습니다. 만약 갑자기 나사를 조여달라고 요청한다면, 칼은 물리적으로 드라이버 도구를 여전히 가지고 있음에도 불구하고, 작동을 거부하거나 나사를 망가뜨릴 수도 있습니다.

이 논문은 거대 언어 모델(AI)도 이와 매우 유사한 일을 할 수 있다는 것을 보여줍니다. AI는 훈련 과정에서 특정 작업에 대해 "뛰어난" 능력을 배울 수 있지만, 그 과정에서 그와 약간 다른 버전의 동일한 작업을 처리하는 법을 적극적으로 학습하지 않게(unlearn) 됩니다.

실험: 앨리스와 밥 (Alice and Bob)

이를 증명하기 위해 연구진은 앨리스이라는 두 캐릭터가 등장하는 간단한 "훈련장"을 만들었습니다.

  • 설정: 연구진은 여러 선택형 질문들(예: "물의 끓는점은?")을 가져왔습니다.
  • 반전: 질문에 라벨을 추가했습니다. 어떤 것들은 "분포: A(Distribution: A)"라고 적혀 있었고, 다른 것들은 "분위: B(Distribution: B)"라고 적혀 있었습니다.
  • 규칙:
    • 앨리스는 "분포 A" 질문에는 똑똑하지만, "분포 B" 질문에는 답변을 거부합니다.
    • 은 "분포 B" 질문에는 똑똑하지만, "분포 A" 질문에는 답변을 거부합니다.
    • 결정적인 점은, 실제 질문은 동일하다는 것입니다. "물의 끓는점은?"이라는 질문은 두 경우 모두에게 똑같은 질문입니다. 오직 라벨만 바뀔 뿐입니다.

1단계: 혼합 (SFT)
먼저, 그들은 앨리스와 밥의 답변을 섞어서 AI를 훈련시켰습니다. AI는 하나의 "혼합체"가 되었습니다. 질문을 던지면, AI는 동전을 던지듯 행동했습니다. 때로는 앨리스처럼 답하고, 때로는 밥처럼 답했습니다. 매우 다재다능했습니다.

2단계: 강화 학습 (RL)
그다음, "강화 학습"을 시작했습니다. 이것은 AI가 정답을 맞혔을 때 점수를 얻는 비디오 게임과 같습니다.

  • 그들은 오직 **"분포 A"**라고 라벨이 붙은 질문에 대해서만 점수를 주었습니다.
  • **"분포 B"**에 대해서는 점수를 0점으로 처리했습니다.

결과:
AI는 빠르게 깨달았습니다. "어라, 내가 앨리사처럼 답하면 점수를 받네! 하지만 처럼 답하면 아무것도 얻지 못해."

그래서 AI는 더 이상 혼합체가 아니게 되었습니다. AI는 100% 앨리스가 되었습니다.

  • "분포 A" 질문에 대해서는 답변 능력이 더 좋아졌습니다.
  • "분포 B" 질문에 대해서는 (라벨만 다를 뿐 똑같은 질문임에도 불구하고), 답변을 거부하거나 틀리기 시작했습니다.

역설:
AI는 물의 끓는점을 아는 능력을 잃어버린 것이 아닙니다. 여전히 정답을 알고 있습니다. 단지 "라벨이 'A'라고 되어 있을 때만 답변하겠다"라고 결정했을 뿐입니다. 특정 라벨에 완벽해지도록 훈련함으로써, 그들은 동일한 질문을 다른 라벨 아래에서 처리하는 능력을 망가뜨린 것입니다.

AI가 실패하는 두 가지 새로운 방식

연구진은 이 "앨리스와 밥" 설정을 사용하여 AI가 현실 세계에서 실패할 수 있는 두 가지 무서운 방식을 보여주었습니다.

1. "작업 범위"의 실패 (6개의 문이 있는 집)

여섯 개의 문(A, B, C, D, E, F)이 있는 집을 상상해 보세요.

  • AI는 A, D, F번 문만 여는 "경비원"이 되도록 훈련받았습니다.
  • 연구진은 AI를 A, D, F번 문과 관련된 작업들로만 훈련시켰습니다.
  • 실패: AI는 자신이 오직 A, D, F번 문만 열어야 한다고 너무 확신한 나머지, B, C, 또는 E번 문을 열어달라는 요청을 받았을 때 이를 거절했습니다.
  • 중요한 이유: 현실 세계에서, 만약 우리가 특정 작업 세트에 대해서만 AI를 훈련시킨다면, AI는 그 특정 세트 범위를 벗어나는 모든 작업에 대해 "내 일이 아니다"라고 판단하여 도움을 거부할 수도 있습니다.

2. "시간 여행"의 실패 (두더지 잡기)

AI가 특정 연도까지의 모든 것을 알고 있는 뉴스 앵커라고 상상해 보세요.

  • 그들은 AI에게 2024년 뉴스를 훈련시켰습니다. AI는 2024년 질문에는 답할 수 있었지만, 2025년 질문은 거부했습니다.
  • 그 후, 2025년 뉴스로 AI를 업데이트했습니다. AI는 2025년을 배웠지만, 2026년을 잊어버렸습니다.
  • 그다음, 2026년 뉴스로 업데이트했습니다. AI는 2026년을 배웠지만, 2027년을 거부했습니다.
  • 실패: 새로운 데이터로 AI를 업데이트할 때마다, AI는 마치 "컷오프 날짜(종료 시점)"를 갖는 것처럼 보입니다. 현재 훈련 중인 연도에는 똑똑해지지만, 미래의 연도에 대해서는 점점 더 못하게 됩니다.
  • 중요한 이유: 이는 단순히 "온라인 트레이닝"(새로운 데이터로 끊임없이 업데이트하는 것)이 효과적이지 않을 수 있음을 시사합니다. AI는 계속해서 자신의 "컷오프 날짜"를 앞으로 밀어낼 것이며, 개발자들은 한 해의 문제를 해결하면 다음 해의 문제를 망가뜨리는 "두더지 잡기" 게임을 반복하게 될 것입니다.

요약

이 논문은 우리가 AI를 훈련시킬 때, 단순히 "더 똑똑하게" 만드는 것이 아니라고 주장합니다. 우리는 종s종 AI가 사용할 "성격"이나 "전략"을 선택하고 있는 것입니다.

만약 AI가 다양한 전략의 혼합체(앨리스와 밥처럼)라면, 우리가 하나의 전략에 과도하게 보상을 줄 경우, AI는 그 전략이 될 것이며 다른 전략들을 버리게 됩니다. 이것은 위험합니다. 왜냐냐하면 버려진 전략들이 바로 AI가 현실 세계의 약간 다른 상황들을 처리하는 데 꼭 필요한 것일 수 있기 때문입니다.

연구진은 이러한 AI 설정들을 "모델 생물(model organisms)"이라고 부릅니다(생물학의 초파리처럼). 이것들이 실제 세상의 AI를 완벽하게 복제한 것은 아니지만, 훈련의 성공이 일반화(generalization)를 보장하지 않는다는 것을 증명하는 통제된 실험입니다. 당신은 훈련 데이터와 똑같이 보이지 않는다는 이유만으로, 훈련 과제에는 천재적이지만 현실 세계에서는 완전히 실패하는 AI를 가질 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →