← 최신 논문
🤖 machine learning

Normalized Rewards for Preference Optimization

이 논문은 DPO 및 SimPO와 같은 직접 정렬 알고리즘(DAA)의 과최적화 및 가능도 붕괴를 완화하기 위한 정규화 기반 정규화 기법을 제안하며, 이것이 토큰 수준의 확률 분포를 안정화함으로써 생성 품질과 일반 벤치마크 성능을 유의미하게 향상시킨다는 것을 입증한다.

원저자: Shawn Im, Federico Danieli, Skyler Seto, Barry-John Theobald, Katherine Metcalf

게시일 2026-07-21
📖 4 분 읽기☕ 가벼운 읽기

원저자: Shawn Im, Federico Danieli, Skyler Seto, Barry-John Theobald, Katherine Metcalf

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 아주 재능 있지만 약간은 산만한 로봇에게 이야기를 쓰는 법을 가르치고 있다고 상상해 보세요. 당신은 로봇이 단순히 당신이 좋아하는 책들을 암기하기를 원하는 것이 아니라, 왜 그 책들이 좋은지를 이해하여 그와 똑같이 훌륭한 느낌을 주는 새로운 이야기를 쓸 수 있기를 바랍니다. 이것이 바로 인공지능에서의 "정렬(alignment)"의 세계입니다. 과학자들은 이 로봇에게 가르치기 위해 "선호도 최적화(preference optimization)"라는 과정을 사용합니다. 그들은 로봇에게 질문에 대한 두 가지 서로 다른 답변—하나는 좋은 답변, 하나는 나쁜 답변—을 보여주고, 로봇이 좋은 것을 선택하도록 학습시킵니다. 가장 인기 있는 방식은 로봇이 자신의 답변이 인간의 선호도에 얼마나 근접했는지에 따라 점수를 받는 "뜨겁다 차갑다(hot and cold)" 게임과 같습니다.

하지만 까다로운 문제가 하나 있습니다. 때때로 로봇은 누군가를 기쁘게 하려는 의욕이 앞선 나머지 너무 흥분하곤 합니다. 로봇은 자신의 내부 "어휘"를 이상한 방식으로 변화시키기 시작하여, 정답을 맞히고 있음에도 불구하고 원래 사용해야 할 단어들을 부자연스럽게 느껴지게 만듭니다. 이는 마치 성적을 잘 받으려고 노력하는 학생이, 기술적으로는 정답을 맞혔음에도 불구하고 모두를 혼란스럽게 만드는 이상하고 지나치게 복잡한 방언을 말하기 시작하는 것과 같습니다. 이 논문은 왜 이런 현상이 발생하는지 조사하고, 로봇이 본래의 개성을 잃거나 이상하고 해로운 답변을 만들어내지 않으면서도 유능해질 수 있도록 유지해 줄 새로운 규칙을 제안합니다.


로봇의 과잉 확신 문제

이 논문은 직접 정렬 알고리즘(Direct Alignment Algorithms, DAAs)의 한 종류, 그중에서도 가장 유명한 DPO에 초점을 맞춥니다. DPO는 로봇에게 별도의 심판 없이도 "이 답변이 저 답변보다 더 나았다"라고 말해주는 코치라고 생각하면 됩니다. 이는 매우 효율적이고 대중적입니다. 하지만 저자들은 이상한 점을 발견했습니다. 로봇이 "과잉 최적화(over-optimized)"되고 있었던 것입니다.

당신이 코인을 모아야 하는 비디오 게임을 하고 있다고 상상해 보세요. 게임은 "코인을 더 많이 모으세요!"라고 말합니다. 그래서 당신은 벽, 적, 그리고 실제 경로를 무시한 채 미친 듯이 뛰어다니기 시작합니다. 결국, 코인에 너무 집중한 나머지 세상이 어떻게 돌아가는지 잊어버려 지도 밖으로 떨어질 수도 있습니다. 로봇의 경우, 로봇은 자신의 "보상"(올바른 답변을 선택했을 때의 점수)을 극대화하는 데 너무 집중한 나머지 확률에 대한 이해를 왜곡하기 시작했습니다. 로봇은 "좋은" 단어와 "나쁜" 단어의 확률을 동시에 낮추려 했는데, 이는 이상하게 들리지만 실제로 로в봇이 이전에 본 적 없는 것들—때로는 위험하거나 터무니없는 것들—을 말할 가능성을 높였습니다. 이것을 "우도 변위(likelihood displacement)"라고 부릅니다.

해결책: "전체 확률" 규칙

저자들은 간단하지만 강력한 해결책인 **정규화된 보상(Normalized Rewards)**이라는 새로운 규칙을 제안합니다.

이를 이해하기 위해 피자 한 판을 상상해 보세요. 피자 전체는 로봇이 낼 수 있는 모든 답변의 100%를 나타냅니다. 로봇이 일반적인 방식으로 훈련될 때, 로봇은 "좋은" 조각과 "나쁜" 조각이 모두 작아지고 있다고 결정할 수 있으며, 이는 "알 수 없는" 조각들(로봇이 아직 보지 못한 피자의 부분들)이 점점 커지고 있다는 것을 의미합니다. 이는 좋지 않습니다. 로봇이 그 알 수 없는 이상한 조각들을 내놓기 시작할 수 있기 때문입니다.

저자들은 훈련에 "정규화 항(regularization term)"을 추가할 것을 제안합니다. 이것을 엄격한 피자 요리사라고 생각해보세요. 요리사는 "이봐, 네가 말하고 있는 조각들의 전체 크기(좋은 답변과 나쁜 답변)는 동일하게 유지되어야 해!"라고 말합니다. 만약 로봇이 "좋은" 조각을 너무 줄이려고 하면, 요리사는 전체 균형을 유지하기 위해 "나쁜" 조각을 훨씬 더 많이 줄이도록 강제합니다. 이는 로봇이 실수로 이상한 "알 수 없는" 조각들을 팽창시키는 것을 막아줍니다.

연구 결과

연구진은 이 새로운 규칙을 두 가지 유형의 로봇, 즉 참조 가이드를 사용하는 로봇(DPO)과 그렇지 않은 로봇(SimPO)에 대해 테스트했습니다. 그 결과는 다음과 같습니다.

  1. 더 나은 균형: 전체 확률을 균형 있게 유지함으로써, 로봇은 일반적인 지능을 잃지 않으면서도 더 유능해졌습니다. 로봇이 지시를 얼마나 잘 따르는지 측정하는 AlpacaEval2 테스트에서, Llama-3.1-8B-Instruct 모델은 기존 방식보다 새로운 규칙을 사용했을 때 20% 이상의 상대적 점수 상승을 보였습니다.
  2. 일반 기술의 보존: 보통 로봇이 지시 사항을 따르는 데 매우 능숙해지면 수학이나 과학 같은 일반 지식 능력은 떨어지기 마련입니다. 하지만 이 새로운 규칙을 사용하면 로봇은 이러한 일반 벤치마크에서도 실제로 더 나아졌으며, 9% 이상의 성능 향상을 보였습니다.
  3. "아웃라이어(Outlier)"의 원인: 저자들은 기존 방식이 왜 실패했는지 파악하기 위해 깊이 조사했습니다. 그들은 문제가 로봇의 뇌 모든 곳에서 발생하는 것이 아님을 발견했습니다. 문제는 로봇이 거의 알지 못하는 희귀하고 이상한 토큰들인 "아웃라이어" 단어 그룹에 집중되어 있었습니다. 이 소수의 단어들이 확률을 망가뜨리는 모든 큰 역할을 하고 있었습니다. 새로운 규칙은 이 낮은 우도(low-likelihood) 단어들을 구체적으로 겨냥하여, 이들이 전체 시스템을 망가뜨리지 않도록 부드럽게 정상으로 되돌려 놓습니다.

결론

이 논문은 로봇이 "미쳐가는" 이유가 확률 계산을 통제하도록 강제되지 않았기 때문이라고 시사합니다. 자신이 보는 답변들의 전체 우도를 안정적으로 유지하는 간단한 규칙을 추가함으로써, 로봇은 자신의 내부 논리를 깨뜨리지 않으면서도 인간의 선호도를 더 잘 따르는 법을 배웁니다.

저자들은 이 접근 방식이 참조 가이드를 사용하는 로봇과 그렇지 않은 로봇 모두에게 효과적이라는 것을 발견했습니다. 그들은 이 방법이 단순히 나쁜 행동을 막는 것에 그치지 않고, 로봇이 실제 작업에서 더 높은 성능을 내도록 돕는다는 것을 보여주었습니다. 이들이 이 방법이 AI의 모든 문제를 해결한다고 주장하는 것은 아니지만, 실험 결과는 "피자 조각"을 균형 있게 유지하는 것이 똑똑하면서도 안전한 AI를 만드는 데 중요한 단계임을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →