← 최신 논문
🤖 machine learning

Rubrics as Privileged Information for Open-Ended Generation

이 논문은 루브릭을 온폴리시 자기 증류(on-policy self-distillation)를 위한 조밀한 특권 정보로 취급하는 개방형 생성 방법을 소개하며, 이 접근 방식이 여러 모델 제품군과 벤치마크에 걸쳐 더 풍부하고 덜 제약적인 학습 신호를 제공함으로써 레퍼런스 완성 증류(reference-completion distillation) 및 루브릭을 보상으로 사용하는 강화 학습보다 더 우수한 성능을 보임을 입증한다.

원저자: Deepika Bablani, Ajay Gupta, Wanming Chen

게시일 2026-08-05
📖 4 분 읽기☕ 가벼운 읽기

원저자: Deepika Bablani, Ajay Gupta, Wanming Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 완벽한 이야기를 쓰거나 유용한 의학적 조언을 주는 법을 가르치려 한다고 상상해 보세요. 인공지능의 세계에서 이것은 "개방형 생성(open-ended generation)"이라고 불립니다. 2+2=4와 같이 정답이 하나뿐인 수학 문제와 달리, 이러한 작업에는 수백만 가지의 "좋은" 방법이 존재합니다. 이야기는 재미있을 수도, 슬플 수도, 혹은 스릴 넘칠 수도 있지만, 여전히 훌륭한 이야기일 수 있습니다. 과학자들의 큰 과제는 바로 이것입니다: 어떻게 하면 로봇이 길을 잃지 않고 그 수백만 가지의 좋은 경로를 찾도록 가르칠 것인가?

전통적으로 연구자들은 두 가지 주요 기술을 사용해 왔습니다. 첫 번째는 로봇이 레벨을 잘 마쳤을 때 마지막에 단 하나의 점수만을 부여하는 비디오 게임과 같은 "강화 학습(Reinforcement Learning)"입니다. 두 두 번째는 똑똑한 선생님이 학생에게 무엇을 써야 할지 정확히 보여주면 학생이 그것을 복사하는 방식인 "증류(Distillation)"입니다. 하지만 여기에는 함정이 있습니다. 개방형 작업에서는 단 하나의 예시를 복사하는 것이 너무 엄격할 수 있다는 점입니다. 만약 선생님이 용에 관한 이야기를 썼다면, 학생은 반드시 용에 대해 써야 한다고 생각하여, 마법사에 관한 이야기도 똑같이 훌륭할 수 있다는 사실을 놓칠 수 있습니다. 이 논문은 단순히 하나의 예시나 하나의 점수를 주는 대신, 무엇이 좋은 답변을 만드는지에 대한 체크리스트인 "루브릭(rubric, 채점 기준표)"을 제공함으로써 로봇을 가르치는 새로운 방법을 탐구합니다.

논문의 핵심 아이디어: 체크리스트 대 단일 답변

Apple의 연구진들은 RuPI(Privileged Information으로서의 Rubrics)라고 부르는 방법을 제안했습니다. 그들은 상세한 체크리스트(루브릭)를 학생이 아닌 '선생님'을 위한 특별한 "가이드"로 사용함으로써, AI 모델이 개방형 작업에서 더 나아질 수 있는지 확인하고자 했습니다.

요리 수업을 생각해 보세요.

  • 기존 방식 (참조 완성 - Reference Completion): 선생님이 학생에게 완벽한 라자냐 사진을 보여주며 "이것을 똑같이 따라 해"라고 말합니다. 학생은 사진을 흉내 내려고 노력합니다. 하지만 학생의 주방에 재료가 다르다면 어떻게 될까요? 학생은 현실에 사진을 억지로 끼워 맞추려다 막히거나, 다른 종류의 파스타도 맛있을 수 있다는 사실을 놓칠 수도 있습니다.
  • 강화 학습 방식 (보상으로서의 루브릭 - Rubric as Reward): 학생이 요리를 하면 심사위원이 맛을 보고 "10점 만점에 8점"과 같이 단 하나의 숫자를 줍니다. 학생은 다시 도전하며 9점을 받기를 희망합니다. 하지만 심사위원은 무엇이 잘못되었는지 알려주지 않고, 단지 완벽하지 않다는 것만 알려줄 뿐입니다.
  • 새로운 방식 (RuPI): 선생님은 "마늘이 들어가야 하고, 너무 짜지 않아야 하며, 크리미한 소스가 필요하다"라고 적힌 비밀 체크리스트(루브릭)를 가지고 있습니다. 선생님은 이 체크리스트를 사용하여 자신의 요리를 안내하고, 머릿속에서 "완벽한" 버전을 만들어냅니다. 하지만 학생은 체크리스트를 보지 못한 채, 선생님이 만든 재료와 최종 요리만을 봅니다. 학생은 단 하나의 사진이 아니라, 체크리스트의 '원칙'에 의해 유도된 선생님의 높은 수준의 요리 스타일을 배우게 됩니다.

연구 결과

연구진은 이 아이디어를 두 가지 매우 다른 유형의 질문, 즉 의학적 조언(HealthBench 데이터셋 사용)과 과학 질문(RubicHub 사용)에 대해 테스트했습니다. 그들은 이 방법이 작동하는지 확인하기 위해 세 가지 서로 다른 AI 모델(Qwen 및 Llama 제품군)을 사용했습니다.

놀라운 결과는 다음과 같습니다: 체크리스트(루브릭)가 단일한 완벽한 답변(reference)보다 훨씬 더 나은 스승이었습니다.

선생님이 체크리스트에 의해 유도되었을 때, 학생은 훨씬 더 빠르게 학습했고 작업 수행 능력도 향상되었습니다. 실제로 체크리스트 방식은 "단일 사진" 방식을 상당한 차이로 앞질렀습니다. 의학 테스트에서 체크리스트 방식은 강화 학습 방식보다 최대 0.10 포인트 향상되었고, 단일 답변 방식보다는 0.034에서 0.079 포인트 더 높았습니다.

왜 이런 일이 일어났을까요? 저자들은 단 하나의 "완벽한" 답변은 거대한 좋은 답변의 바다 속에 있는 아주 작은 한 점일 뿐이라고 설명합니다. 만약 당신이 학생에게 그 한 점만을 복사하도록 강요한다면, 학생의 창의성과 새로운 상황에 대처하는 능력을 제한하게 됩니다. 하지만 체크리스트는 좋은 답변의 '전체 바다'를 묘사합니다. 그것은 학생에게 "정확히 여기에 서라"가 아니라, "이 경계 안에서 움직여라"라고 말해줍니다. 이는 학생에게 훨씬 더 강력하고 유연한 학습 신호를 제공합니다.

"온-폴리시(On-Policy)"의 비법

또 다른 결정적인 발견이 있었습니다. 이 방법은 학생이 자신의 시도(이를 "on-policy" roll-outs라고 합니다)로부터 배울 때만 효과가 있었습니다. 만약 학생이 선생님의 미리 만들어진 답변으로부터 배우려고 한다면(off-policy), 그 마법은 사라졌습니다.

댄스 강사를 상상해 보세요. 만약 학생이 자신의 동작을 연습하고 강사가 체크리스트를 바탕으로 교정해 준다면, 학생은 발전합니다. 하지만 학생이 자신의 발을 움직이려는 시도 없이 그저 완벽하게 춤추는 강사의 영상을 보기만 한다면, 제대로 배우지 못합니다. 논문은 체크리스트가 학생의 실수를 실시간으로 교정하는 데 사용될 때만 강력한 스승이 된다는 것을 발견했습니다.

다른 기능을 망가뜨리지는 않는가?

연구진은 로봇에게 훌륭한 의학적 조언을 하도록 가르치는 것이 수학을 하거나 간단한 지시를 따르는 법을 잊게 만들까 봐 걱정했습니다. 그들은 일반 지식 테스트(MMLU 등)와 수학 문제(GSM8K)로 모델을 테스트했습니다. 결과는 안심할 만했습니다: 모델들은 일반적인 지능을 잃지 않으면서 특정 작업에 더 능숙해졌습니다. 다만, 특정 유형의 수학적 교정(이를 "forward KL"이라 부름)을 사용하는 것이 모델의 지시 이행 능력을 약간 떨어뜨릴 수 있다는 것을 발견했기에, 모델을 안전하고 유용하게 유지하기 위해 다른 교정 방법("reverse KL")을 사용할 것을 권장합니다.

결론

이 논문은 정답이 하나가 아닌 작업의 경우, AI에게 단 하나의 "완벽한" 예시를 복사하도록 강요하거나 단 하나의 점수를 쫓게 만드는 것을 멈춰야 한다고 제안합니다. 대신, AI가 학습을 가이드할 수 있는 명확한 규칙(루브릭)을 주어야 합니다. 이 규칙을 '특권이 있는(privileged)' 가이드로서 선생님에게 제공함으로써, 학생은 훨씬 더 효과적으로 방대한 좋은 답변의 공간을 항해할 수 있습니다. 이는 '예시를 통한 교육'에서 '원칙을 통한 교육'으로의 전환이며, 결과는 AI를 더 똑똑하고 유연하며, 현실 세계의 복잡하고 개방적인 문제를 더 잘 다룰 수 있게 만든다는 것을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →