← 최신 논문
🤖 AI

Owen-Shapley Policy Optimization: A Principled RL Algorithm for Generative Search LLMs

본 논문은 Shapley-Owen 귀속을 사용하여 시퀀스 수준의 보상을 의미적으로 일관된 토큰에 재분배함으로써 생성형 검색 LLM 의 신용 할당 격차를 해결하는 원칙적인 강화 학습 프레임워크인 Owen-Shapley 정책 최적화(OSPO) 를 소개하며, 이를 통해 매개변수 가치 모델을 요구하지 않고도 성능과 견고성을 향상시킨다.

원저자: Abhijnan Nath, Alireza Bagheri Garakani, Tianchen Zhou, Fan Yang, Yan Gao, Nikhil Krishnaswamy

게시일 2026-05-08
📖 4 분 읽기☕ 가벼운 읽기

원저자: Abhijnan Nath, Alireza Bagheri Garakani, Tianchen Zhou, Fan Yang, Yan Gao, Nikhil Krishnaswamy

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

"Owen-Shapley 정책 최적화 (OSPO)"논문에 대한 설명을 쉬운 언어와 일상적인 비유로 풀어냅니다.

큰 문제: "그룹 성적" 실수

선생님이 학생의 에세이를 채점한다고 상상해 보세요. 인공지능 (AI) 을 훈련시키는 옛날 방식 (특히 GRPO라는 방법) 에서는 선생님이 에세이 끝부분에서 학생에게 단 하나의 점수만 줍니다.

  • 상황: 학생이 긴 단락을 씁니다. 선생님이 읽고 "잘했어! +10 점"이라고 말합니다.
  • 결함: 선생님은 어떤 문장이 그 점수를 얻었는지 알려주지 않습니다. 첫 문장이 승부를 결정했을까요? 중간 단락일까요, 아니면 결론일까요?
  • 결과: 학생은 자신이 쓴 모든 단어가 동등하게 훌륭하다고 생각합니다. 도움이 되지 않는 길고 산만한 문장을 계속 쓰거나, 중요하지 않다고 생각해서 완벽하게 쓴 한 문장을 실수로 지워버릴 수도 있습니다. 개별 부분이 아닌 전체 그룹에 대한 점수만 받았기 때문에, 무엇이 잘 작동했는지 "추측"하는 것입니다.

AI 쇼핑 어시스턴트 세계에서는 이것이 AI 가 검색 쿼리에서 정확히 어떤 단어가 올바른 제품을 찾는 데 도움이 되었는지 모른다는 것을 의미합니다. 전체 쿼리가 "좋음" 또는 "나쁨" 점수를 받았다는 것만 알 뿐입니다.

해결책: OSPO ("공정한 분배" 계산기)

저자들은 OSPO라는 새로운 방법을 소개합니다. 에세이 전체에 한 개의 점수를 매기는 대신, OSPO 는 각 문장이 최종 점수에 얼마나 기여했는지 정확히 분해하는 초공정한 회계사처럼 작동합니다.

이들은 게임 이론에서 나온 오웬 - 샤플리 (Owen-Shapley) 값이라는 수학적 개념을 사용합니다. 비유를 들어보겠습니다:

친구들 (AI 문장 속의 단어 또는 구) 이 그룹을 이루어 상 (올바른 제품 찾기) 을 받으려 한다고 상상해 보세요.

  1. 실험: AI 는 이 친구들의 다양한 조합을 시도합니다. 때로는 첫 번째 친구만 보냅니다. 때로는 처음 두 명을 보냅니다. 때로는 전체 그룹을 보냅니다.
  2. 측정: 새로운 친구가 그룹에 합류할 때마다 AI 는 확인합니다: "이 특정 친구가 합류해서 상이 더 좋아졌나요?"
  3. 계산: "파란 원피스"라는 구가 검색 결과를 "그럭저럭"에서 "완벽"으로 끌어올리면, 그 구는 막대한 공로를 인정받습니다. "음, 아마도"라는 구가 아무것도 바꾸지 않으면 공로는 0 점입니다.

이것은 팟럭 (potluck) 저녁 식사와 같습니다. 파티를 히트하게 만든 맛있는 캐서롤을 가져오면 가장 많은 칭찬을 받습니다. 아무도 눈치채지 못하는 평범한 크래커 한 그릇을 가져오면 비난은 받지 않지만, 공로도 인정받지 못합니다. OSPO 는 정확히 누가 캐서롤을 가져왔는지 파악합니다.

현실 (쇼핑) 에서의 작동 방식

AI 에게 "겨울용 검은색 코트가 필요해"라고 말한다고 가정해 보세요.

  • 옛날 방법 (GRPO): AI 는 길고 화려한 문장을 생성합니다. 코트를 찾았기 때문에 좋은 점수를 받습니다. AI 는 "나는 긴 문장 쓰기에 능해!"라고 생각하며 길이가 도움이 되지 않더라도 계속 그렇게 합니다.
  • 새로운 방법 (OSPO): AI 는 문장을 조각으로 나눕니다: "검은색", "코트", "겨울", "따뜻한", "재킷".
    • 테스트: "단순히 '검은색'이라고 하면 어떨까?" (나쁜 결과).
    • 테스트: "'검은색 코트'라고 하면 어떨까?" (좋은 결과).
    • 테스트: "'검은색 코트 겨울'이라고 하면 어떨까?" (훌륭한 결과).
    • 판단: OSPO 는 "겨울"이 많은 가치를 더했지만 "재킷"은 그냥 불필요한 노이즈였음을 깨닫습니다. "승리"한 단어에 더 많은 "점수" (기울기 업데이트) 를 부여하고, AI 가 "겨울"을 더 잘 사용하는 법을 배우도록 집중하게 하며, 불필요한 말은 무시하도록 합니다.

왜 이것이 중요한가

  1. 더 빠른 학습: AI 가 정확히 어떤 단어가 작동했는지 알기 때문에 훨씬 빠르게 학습합니다. 논문은 이 방법이 옛날 방식의 절반 시간 안에 높은 성능에 도달함을 보여줍니다.
  2. "치트 코드" 부재: 때때로 AI 가 나쁜 방식으로 "똑똑해"집니다. 매우 길고 혼란스러운 단락을 써서 시스템을 속여 높은 점수를 받도록 학습할 수 있습니다 (이를 "보상 해킹"이라고 합니다). OSPO 는 모든 작은 부분을 확인하기 때문에 이를 방지합니다. 추가 단어가 실제로 제품을 찾는 데 도움이 되지 않으면 공로를 인정받지 못하므로, AI 는 더 이상 그런 단어를 쓰지 않습니다.
  3. "비평가" 없이 작동: 일반적으로 상세한 피드백을 주려면 첫 번째 AI 를 감시하는 두 번째 AI ("비평가") 가 필요합니다. OSPO 는 검색 결과 자체를 사용하여 공로 분배를 파악하므로, 그 추가적이고 비싼 두 번째 AI 가 필요하지 않습니다.

"팀워크"의 반전 (연합)

이 논문은 단어들이 **연속된 연합 (연결된 단어)**일 때 가장 잘 작동한다고 언급합니다.

계주 경기를 생각해 보세요.

  • 좋음: 1 주가 2 주에게, 2 주가 3 주에게 스틱을 부드럽게 넘깁니다. 그들은 팀으로 협력합니다.
  • 나쁨: 2 주를 건너뛰고 1 주가 3 주에게 스틱을 넘기면 팀이 무너집니다.

OSPO 는 문장 전체에 흩어진 무작위 단어보다는 "검은색 코트"처럼 서로 옆에 서 있는 단어들만 봅니다. 이렇게 하면 의미가 명확해지고 AI 가 일관성 있고 논리적인 구를 만드는 법을 배우도록 보장합니다.

요약

OSPO는 쇼핑 추천과 같은 작업을 위해 AI 를 훈련시키는 더 똑똑한 방법입니다. AI 에게 전체 답변에 대한 단일 점수를 주는 대신, 탐정처럼 정확히 어떤 단어가 보상을 얻었는지 파악합니다. 이는 AI 가 더 빠르게 학습하도록 돕고, 점수를 받기 위해 nonsensical 한 글을 쓰는 것을 방지하며, 사용자가 실제로 무엇을 사고 싶어 하는지 이해하는 능력을 훨씬 더 향상시킵니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →