← 최신 논문
🤖 AI

Auditing Data Membership in Reinforcement Learning With Verifiable Rewards

본 논문은 사전 및 사후 RLVR 모델 체크포인트 간의 행동 및 보상 측 분포 변화를 분석하여 강화학습에서 검증 가능한 보상 (RLVR) 의 무단 데이터 노출을 효과적으로 탐지하고 기존 멤버십 추론 베이스라인을 크게 능가하는 화이트박스 프레임워크인 행동 편차 감사 (DIBA) 를 소개합니다.

원저자: Yule Liu, Heyi Zhang, Jinyi Zheng, Zhen Sun, Zifan Peng, Jiaheng Wei, Tianshuo Cong, Yilong Yang, Xinlei He

게시일 2026-05-12
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yule Liu, Heyi Zhang, Jinyi Zheng, Zhen Sun, Zifan Peng, Jiaheng Wei, Tianshuo Cong, Yilong Yang, Xinlei He

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

다음은 "검증 가능한 보상을 활용한 강화학습에서의 데이터 멤버십 감사"라는 논문을 쉬운 언어와 일상적인 비유로 설명한 내용입니다.

큰 그림: "비밀 레시피" 문제

수천 가지 레시피를 맛보며 요리를 배우는 유명한 셰프 (대형 언어 모델) 를 상상해 보세요. 최근 RLVR(검증 가능한 보상을 활용한 강화학습) 이라는 새로운 요리법이 인기를 끌고 있습니다. 셰프는 단순히 특정 레시피 카드를 외우는 대신, 요리를 여러 번 시도합니다. 만약 요리가 맛있다면 (엄격한 맛 평가를 통과한다면) 보상을 받고 그 시도를 기억합니다. 맛이 없다면 다시 시도합니다.

문제는 이러한 "맛 평가"가 종종 셰프의 소유주가 대중에게 알려지기를 원치 않는 비밀스럽고 가치가 높은 레시피(독점 수학 문제나 개인 코드 등) 를 사용한다는 점입니다.

질문: 셰프의 최종 메뉴를 보았을 때, 그들이 당신의 특정 비밀 레시피를 몰래 연습했는지 알 수 있을까요?

구식 방법 vs 신식 방법

**구식 방법 **( "고정된 목표" 공격)
과거 감사자들은 셰프가 특정 문장을 암기했는지 확인하여 적발하려 했습니다. 마치 "이 특정 페이지의 정확한 단어를 외웠나요?"라고 묻는 것과 같습니다. 셰프가 페이지를 완벽하게 암송하면 적발된 것입니다.

  • 여기서 실패하는 이유: RLVR 에서 셰프는 특정 문장을 외우는 것이 아니라, 실시간으로 새로운 해결책을 생성합니다. 비교할 단일 "정답"이 없으므로 구식 방법은 작동하지 않습니다.

**신식 방법 **(DIBA - "행동 지문")
저자들은 DIBA(행동 편차 감사) 라는 새로운 방법을 제안합니다. 암기된 문장을 찾는 대신 셰프의 요리 스타일 변화를 살펴봅니다.

그들은 RLVR 훈련을 시작하기 전의 셰프 (모델) 의 "이전" 사진과 셰프의 현재 메뉴를 비교합니다. 두 가지 구체적인 단서를 찾습니다.

  1. **보상 단서 **(실력이 향상되었나요?)
    • 비유: 셰프가 이전에 힘들어하던 특정 유형의 퍼즐을 갑자기 훨씬 잘 풀게 되었나요?
    • 셰프가 이전에 "기하학 퍼즐"을 잘 풀지 못했는데 훈련 후 완벽하게 푼다면, 그들이 그 퍼즐들을 연습했다는 강력한 힌트입니다.
  2. **스타일 단서 **(성격이 변했나요?)
    • 비유: 셰프가 퍼즐을 풀더라도, 풀면서 어떻게 말하는지 변했나요? 아마도 그 특정 퍼즐을 풀 때 더 짧은 문장을 사용하거나 다른 어조를 취했을 수 있습니다.
    • 이것이 "행동 편차"입니다. 답이 맞더라도 훈련 전과 훈련 후 도달하는 경로가 다르게 보일 수 있습니다.

DIBA 의 작동 원리 (탐정의 도구상자)

감사자는 두 가지 도구를 가진 탐정처럼 행동합니다.

  1. 점수판: 훈련 후 특정 질문에 대한 모델의 성공률이 올랐는지 확인합니다.
  2. 음성 녹음기: 모델의 "사고 과정"(각 단어를 선택할 확률) 을 들어보고 이전 버전과 다른지 확인합니다.

이 두 가지를 결합하여 DIBA 는 "이 모델은 확실히 이 특정 프롬프트를 연습했습니다"라고 말하는 "지문"을 생성합니다.

논문에서 발견한 내용

연구자들은 수학 문제 ( "비밀 레시피") 로 이를 테스트했고 몇 가지 흥미로운 규칙을 발견했습니다.

  • "학습" 프롬프트에서 가장 잘 작동합니다: DIBA 는 모델이 실제로 새로운 것을 배운 프롬프트를 잡아내는 데 탁월합니다. 훈련 전부터 모델이 이미 그 문제에 능숙했다면 DIBA 는 훈련 여부를 알 수 없습니다 (행동 변화가 없기 때문입니다).
  • "화이트박스" 도구입니다: 이를 사용하려면 감사자가 모델의 내부 "로짓"(다음 단어를 결정하는 데 사용하는 원시 숫자) 을 볼 수 있어야 합니다. 마치 최종 요리가 아닌 셰프의 개인 노트를 봐야 하는 것과 같습니다.
  • "쉬운" 프롬프트에서는 더 어렵습니다: 프롬프트가 너무 쉬워서 모델이 이미 완벽했다면, 훈련 중 모델의 행동은 크게 변하지 않습니다. 변화가 없으면 찾을 지문도 없습니다.
  • 다른 크기에서도 작동합니다: 셰프가 작은 견습생 (3B 모델) 이든 마스터 셰프 (7B 모델) 이든 동일한 훈련 레시피를 사용한다면 이 방법은 작동합니다.
  • 이미지에서도 작동합니다: 시각 - 언어 모델 (이미지를 보고 수학을 푸는 모델) 로 테스트했습니다. 여전히 작동했지만, "시각적 노이즈"로 인해 지문이 약간 흐릿해져 탐지가 조금 더 어려웠습니다.

흔적을 숨길 수 있을까요?

논문은 또한 "셰프가 이를 숨길 수 있을까?"라고 물었습니다.

  • 더 열심히 훈련하기: 모델을 "더 신중하게" 훈련시키는 것 (정규화 사용) 은 실제로 흔적을 숨기지 못했습니다. 행동 변화는 여전히 눈에 띄었습니다.
  • 답변 다시 쓰기: 셰프가 최종 답변을 생성한 후 다른 단어로 다시 쓰는 것 (개조) 은 탐지를 어렵게 만들기는 합니다. 마치 셰프가 다른 필체로 레시피를 쓰는 것과 같습니다. 그러나 이는 텍스트만 숨길 뿐, 누군가 여전히 셰프의 내부 "사고"(로짓) 를 볼 수 있다면 비밀은 여전히 드러납니다.

결론

이 논문은 AI 모델이 답변을 암기하지 않더라도 훈련된 데이터에 행동의 상처를 남긴다는 것을 보여줍니다. 비밀 프롬프트 (개인 수학 문제 등) 가 있고 AI 모델이 그것에 대해 훨씬 더 잘하거나 그 사고 방식을 바꾸었다면, 똑똑한 감사는 모델이 당신의 비밀 데이터로 훈련되었음을 증명할 가능성이 높습니다.

DIBA는 암기된 텍스트를 확인하는 대신 모델의 "훈련 전"과 "훈련 후" 행동을 비교하여 이러한 상처를 찾아내는 새로운 도구입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →