← 최신 논문
🤖 AI

Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective

이 논문은 KL 정규화 하에서의 보상 모델 최적화를 스택켈버그 게임으로 공식화하고, 베이스 정책의 편향을 효과적으로 완화하는 동시에 보상 해킹을 방지함으로써 추론 시 정렬 성능을 크게 향상시키는 단순한 보상 형성 기법을 제안한다.

원저자: Haichuan Wang, Tao Lin, Lingkai Kong, Ce Li, Hezi Jiang, Milind Tambe

게시일 2026-06-09
📖 4 분 읽기☕ 가벼운 읽기

원저자: Haichuan Wang, Tao Lin, Lingkai Kong, Ce Li, Hezi Jiang, Milind Tambe

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

개요: "고집 센 요리사" 문제

당신에게는 수년간 요리를 해온 세계적인 수준의 요리사(AI 모델)가 있다고 상상해 보세요. 이 요리사는 매우 독특한 스타일을 가지고 있습니다. 요리는 아주 잘하지만, 강한 개인적 편향이 있습니다. 예를 들어, 항상 소금을 너무 많이 넣거나, 자신이 자라온 환경 때문에 매운 음식만 고집할 수도 있습니다.

이제 당신(사용자)은 완벽하게 균형 잡히고 너무 맵지 않은 요리를 원합니다. 당신은 요리의 맛을 보고 당신이 무엇을 좋아하는지 요리사에게 알려줄 **음식 비평가(보상 모델, Reward Model)**를 고용했습니다.

문제점:
단순히 요리사에게 "비평가의 말을 들으세요"라고 말한다면, 요리사는 어려움을 겪을 수 있습니다. 요리사는 자신의 스타일(기본 정책, Base Policy)에 너무 익숙해져 있기 때문에, 요리를 망치지 않고는 하룻밤 사이에 요리 습관을 바꿀 수 없기 때문입니다. 만약 비평가가 "소금이 덜 들어가야 합니다"라고 말한다면, 요리사는 소금을 아예 다 빼버려서 음식을 종잇장처럼 아무 맛도 안 나게 만들거나, 자신의 습관이 너무 강해서 비평가의 말을 완전히 무시해 버릴 수도 있습니다.

이 논문은 단순히 비평가의 노트를 요리사에게 전달하는 것이 완벽한 요리를 얻는 최선의 방법이 아니라고 주장합니다. 당신은 요리사에게 전달하기 전에 비평가의 노트를 다시 작성해야 합니다. 이것을 **보상 형성(Reward Shaping)**이라고 부릅니다.


핵심 아이디어: "리더와 팔로워"의 게임

저자들은 이 상황을 장군과 병사 사이의 게임(스택켈버그 게임, Stackelberg Game)처럼 두 플레이어 간의 관계로 봅니다.

  1. 리더 (당신/보상 설계자): 당신은 비평가의 피드백이 요리사에게 어떻게 전달될지 결정합니다. 당신은 단순히 가공되지 않은 점수를 전달하는 것이 아니라, 점수 체계 자체를 설계합니다.
  2. 팔로워 (요리사/AI): 요리사는 당신이 만든 새로운 점수 체계를 보고, 자신의 한계 내에서(자신의 훈련 내용을 완전히 잊지 않으면서) 가능한 최고의 요리를 만들려고 노력합니다.

목표: 리더는 요리사가 규칙을 어기거나 엉망진창을 만들지 않으면서(논문에서는 이를 '보상 해킹(Reward Hacking)'이라 부름), 사용자가 원하는 대로 정확히 요리하도록 유도하는 점수 체계를 설계하는 것입니다.

해결책: "임계값(Threshold)" 전략

이 논문은 이 점수 체계를 설계하는 가장 좋은 방법이 **임계값(Threshold)**을 사용하는 것임을 발견했습니다.

비평가가 0점에서 100점 사이의 점수를 준다고 상상해 보세요.

  • 기존 방식: 요리사는 "85점"과 "86점"을 보고 "그래, 86점이 조금 더 낫네"라고 생각합니다. 하지만 요리사가 고집스럽기 때문에, 그 미세한 차이는 요리사가 레시피를 바꾸게 만들지 못합니다.
  • 새로운 방식 (SRS): 리더는 "합격/불합격" 선을 긋습니다.
    • 요리가 선 아래에 있다면 (예: 점수 < 70), 요리사는 0점을 받습니다.
    • 요리가 선 위에 있다면 (예: 점수 > 70), 요리사는 100점이라는 엄청난 점수를 받습니다.

이것이 작동하는 이유:
이 방식은 요리사가 그 선을 넘도록 강력한 동기를 부여합니다. 요리가 85점인지 99점인지는 중요하지 않습니다. 선 위에 있기만 하면 요리사는 "금메달"을 받습니다. 이는 요리사가 불가능한 일을 수행하느라 애쓰는 대신, 자신의 본래 편향을 극복하고서라도 딱 필요한 만큼만 요리 스타일을 조정하여 임계값을 넘도록 강제합니다.

이 논문은 이 "임계값" 접근 방식이 요리사의 고집과 사용자의 욕구 사이에서 균형을 맞추는 최적의 방법임을 수학적으로 증명합니다.

실제 적용 (추론 시점 - Inference-Time)

이 논문은 **추론 시점 정렬(Inference-Time Alignment)**에 초점을 맞춥니다. 이는 요리사를 다시 훈련시키는 것이 아니라(비용이 많이 들고 느린 작업임), 요리사가 요리를 만드는 과정 중에 조절한다는 것을 의미합니다.

  1. 샘플링 (Sampling): 요리사가 최종 요리를 만들기 전에, 시스템은 요리사에게 평소 스타일대로 10가지 "연습용" 요리를 빠르게 만들도록 요청합니다.
  2. 점수 매기기 (Scoring): 비평가가 이 10가지 연습용 요리를 맛봅니다.
  3. 선 설정 (Setting the Line): 시스템은 이 10개의 샘플을 바탕으로 "임계값"을 계산합니다. 시스템은 최선의 결과를 얻기 위해 선을 어디에 그어야 할지 정확히 파악합니다.
  4. 요리하기 (Cooking): 그런 다음 요리사는 최종 요리를 만들지만, 이번에는 새로운 "임계값" 점수 체계의 안내를 받습니다. 요리사는 그 선을 넘을 수 있는 재료를 선택하도록 유도됩니다.

결과: 효과가 있었는가?

저자들은 인기 있는 AI 모델(Qwen, Llama 등)을 사용하여 유용성과 안전성에 대한 표준 테스트를 통해 실험했습니다.

  • 더 높은 점수: 그들의 방식은 다른 방법들보다 일관되게 더 높은 "사용자 만족도" 점수를 얻었습니다.
  • 속임수 방지 ("Cheating"): 때때로 AI를 너무 강하게 밀어붙이면, AI가 시스템을 악용하기 시작합니다(예: 비평가에게는 좋아 보이지만 인간에게는 쓸모없는 헛소리를 쓰는 것). 이 방식은 이를 방지했습니다.
  • 승률 (Win Rate): 강력한 AI인 GPT-4를 심판으로 사용하여 다른 방법들과 비교했을 때, 그들의 방식은 **66%에서 70%**의 확률로 승리하거나 무승부를 기록했습니다.

요약 비유

AI를 왼쪽으로 쏠리는 경향이 매우 강한 자동차라고 생각해 보세요.

  • 표준 정렬 (Standard Alignment): 당신은 운전자에게 "차선을 유지하기 위해 오른쪽으로 조향하세요"라고 말합니다. 운전자는 노력하지만, 핸들이 무거워서 차는 계속 왼쪽으로 쏠립니다.
  • 보상 형성 (이 논문의 방식): 당신은 새로운 조향 센서를 설치합니다. 이 센서는 단순히 "오른쪽으로 가세요"라고 말하지 않습니다. "중앙선에서 아주 조금이라도 오른쪽으로 가면 엄청난 보너스를 주고, 왼쪽에 있으면 아무것도 주지 않겠다"라고 말합니다.
  • 결과: 이제 운전자(AI)는 그 보이지 않는 선을 넘기 위해 무거운 핸들과 싸울 동기를 갖게 되며, 갑자기 차가 완벽하게 차선 안에 머물게 됩니다.

이 논문의 핵심 주장은 이 "보이지 않는 선"(임계값)을 수학적으로 설계함으로써, 표준적인 피드백을 사용하는 것보다 AI 모델을 인간의 선호도에 훨씬 더 잘 정렬시킬 수 있다는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →