← 최신 논문
🤖 AI

Less Data, Better Alignment: Data-Centric Multi-Evaluator Agreement for Preference Optimization

이 논문은 다중 평가자 합의를 통해 온-폴리시(on-policy) 응답 중 소규모의 고합의 하위 집합을 필터링함으로써, 표준적인 방식보다 훨씬 적은 학습 데이터로도 우수한 정렬 성능을 달성하는 데이터 중심 선호도 최적화 방법인 DMAPO를 소개한다.

원저자: Zhengtao Yao, Runhao Li, Xupeng Chen, Jiayi Cheng, Chenqian Le, Michael Yue, Siheng Wang, Haoyan Xu, Yuqi Li, Chenhao Wei, Zhengdao Li, Rongchao Zhang, Guang Yang, Yidong Wang, Junhao Dong

게시일 2026-07-29
📖 4 분 읽기☕ 가벼운 읽기

원저자: Zhengtao Yao, Runhao Li, Xupeng Chen, Jiayi Cheng, Chenqian Le, Michael Yue, Siheng Wang, Haoyan Xu, Yuqi Li, Chenhao Wei, Zhengdao Li, Rongchao Zhang, Guang Yang, Yidong Wang, Junhao Dong

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 매우 똑똑하지만 약간은 혼란스러운 로봇에게 어떻게 하면 도움이 되는 비서가 될 수 있는지 가르치려 한다고 상상해 보세요. 인공지능의 세계에서 이 과정을 '정렬(alignment)'이라고 부릅니다. 오랫동안 과학자들은 로봇에게 어떻게 가르칠 것인가에 집중하며, 방대한 양의 미리 작성된 예시들로부터 로봇이 학습할 수 있도록 다양한 수학적 공식들을 시도해 왔습니다. 하지만 문제가 하나 있습니다. 때때로 그 예시들의 더미는 엉망이고, 모순으로 가득 차 있거나, 그저 혼란스러울 때가 있다는 것입니다. 이는 마치 페이지 절반은 찢겨 나가 있고 나머지 절반에는 서로 충돌하는 지침이 적혀 있는 요리법 책을 읽으며 요리를 배우려는 것과 같습니다.

이 논문은 다른 질문을 던집니다: 만약 문제가 가르치는 방법이 아니라 '재료'라면 어떨까요? 로봇이 거대하고 시끄러운 도서관으로부터 학습하도록 강요하는 대신, 우리가 정말 좋다고 확신하는 아주 작고 완벽한 예시들로부터만 학습하게 한다면 어떨까요? 연구진은 작은 고품질의 '간식'이 거대하고 엉망인 '성찬'보다 더 나을 수 있는지 알아보고 싶었습니다. 그들은 수천 개의 로봇 답변을 맛보고, 모두가 맛있다고 동의하는 답변만을 남기는 매우 엄격한 음식 비평가 역할을 하는 시스템을 구축했습니다. 그 결과는, 로봇을 똑똑하게 만들기 위해 반드시 수백만 개의 예시가 필요한 것이 아니라, 진정으로 확실히 훌륭한 수백 개면 충분할 수도 있다는 점을 시사합니다.

논문의 이야기: DMAPO

이 논문은 DMAPO(Data-centric Multi-evaluator Agreement for Preference Optimization)라고 불리는 새로운 방법을 소개합니다. DMAPO를 단순히 이야기를 읽는 것이 아니라, 스스로 이야기를 생성한 다음, 세 명의 전문 비평가를 고용하여 그 이야기에 점수를 매기고, 마지막으로 모든 이가 걸작 혹은 완전한 재앙이라고 동의하는 이야기만을 출판하는 매우 까다로운 편집자라고 생각해보세요.

마법이 일어나는 단계는 다음과 같습니다:

1. 로봇이 먼저 글을 쓴다
기존의 "좋은" 답변과 "나쁜" 답변 목록을 찾는 대신, 연구진은 로봇(구체적으로는 Mistral-7B라는 모델)이 수천 개의 질문에 대해 스스로 답변을 쓰도록 했습니다. 이는 선생님이 채점하기도 전에 학생에게 연습 시험을 치르게 하는 것과 같습니다. 로봇은 13,559개의 서로 다른 프롬프트에 대해 54,236개의 서로 다른 답변을 생성합니다.

2. 심사위원단
이제 엄격한 단계가 옵了. 연구진은 단 하나의 AI에게만 이 답변들을 채점하도록 요청하지 않았습니다. 그들은 세 명의 특화된 "평가자"(심사역 역할을 하는 AI 모델)를 사용하여 모든 답변에 대해 세 가지 특정 항목을 기준으로 점수를 매겼습니다:

  • 유용성(Helpfulness): 실제로 유용한가?
  • 사실성(Factuality): 진실을 말하고 있는가?
  • 간결성(Conciseness): 너무 장황하지 않은가?

각 심사위원은 1점에서 10점 사이의 점수를 줍니다. 하지만 잠깐, 네 번째 심사위원이 있습니다. 바로 "프로세스 비평가(process critic)"인데, 이 모델은 논리적 오류나 이상한 추론 결함이 있는지 살펴보고 답변이 조잡할 경우 점수를 깎습니다.

3. "합의의 관문 (Consensus Gate)"
이것이 가장 중요한 필터입니다. 시스템은 세 명의 주요 심사위원이 모두 해당 답변이 놀랍거나(7점 이상), 혹은 형편없거나(4점 이하) 둘 중 하나라고 동의할 때만 그 답변을 유지합니다. 만약 심사위원들이 혼란스러워하거나 서로 의견이 갈린다면, 그 답변은 쓰레기통에 버려집니다. 이는 모든 심사위원이 "예" 버튼을 세게 누르거나, 혹은 모든 심사위원이 "아니오" 버튼을 세게 눌러야만 참가자가 살아남는 오디션 프로그램과 같습니다. 만약 심사위원들의 의견이 갈린다면, 그 참가자는 집으로 돌아갑니다.

4. 결과: 더 적은 데이터, 더 나은 정렬
이 엄격한 필터링의 결과는 충격적입니다. 54,236개의 생성된 답변 중, 시스템은 단 1,871개만을 남겼습니다. 이는 단 **3.45%**의 수락률을 보였습니다. 즉, 데이터의 96.55%를 버린 것입니다!

하지만 반전이 있습니다: 이 작은 고품질 데이터셋인 1,871개의 예시로 훈련된 로봇은 다른 방법들을 사용하여 훨씬 더 큰 데이터셋으로 훈련된 로봇들보다 실제로 더 뛰어난 성능을 보였습니다.

  • MT-Bench 테스트에서 이 새로운 로봇은 7.50점을 기록하며 기존의 최고 방법들을 앞질렀습니다.
  • 길이를 통제했을 때 참조 모델과 비교하여 **95.5%**의 승률을 보였습니다.
  • 또한 엄격한 규칙 준수 여부를 확인하는 IFEval 테스트에서 **57.3%**의 점수를 기록했습니다.

이 논문이 부정하는 것들
저자들은 이 방법이 무엇이 아닌지를 신중하게 밝히고 있습니다.

  • 이 방법은 로봇을 모든 면에서 더 똑똑하게 만드는 마법 지팡이가 아닙니다. 실제로 수학 문제를 테스트했을 때, 점수가 약간 하락했습니다(6.45에서 5.70으로). 엄격한 "간결성" 필터가 수학에 필요한 길고 상세한 단계들을 처벌했을 수 있습니다.
  • 이것은 새로운 지식을 추가하는 방법이 아닙니다. 로봇은 이미 할 수 있는 것들을 더 잘하는 법을 배우는 것일 뿐이며, 단지 그것을 더 신뢰성 있게 수행하는 법을 배우는 것입니다.
  • 이것은 인간 수준의 진실성을 보장하는 방법이 아닙니다. 시스템은 AI 심사위원들에게 의존하며, 만약 그 AI 심사위원들이 편향(예를 들어 간결성에 대해 너무 엄격하거나 문화적 사각지대를 갖는 것)을 가지고 있다면, 로봇도 그 편향을 배우게 될 것입니다.

얼마나 확신하는가?
논문은 이 방법을 물리 법칙과 같은 최종적인 결론이 아니라, 실험에 기반한 강력한 제안으로 제시합니다.

  • 결과는 특정 로봇 모델(Mistral-7B)에 대해 측정되었으며 명확한 개선을 보여주었습니다.
  • 그러나 동일한 방법을 다른 로봇 모델(Llama-3.1-8B)에 적용했을 때, 결과는 "엇갈렸습니다". 새 로봇은 일부 테스트에서는 잘 수행했지만, 주요 벤치마크에서 원래 버전을 이기지는 못했습니다. 이는 이 방법이 특정 유형의 로봇에는 잘 작동하지만, 모든 로봇을 위한 보편적인 해결책은 아닐 수 있음을 시사합니다.
  • 저자들은 이 방법이 효과적이긴 하지만 비용이 따른다는 점을 명시적으로 언급했습니다. 즉, 데이터를 생성하고 필터링하기 위해 훈련 에 많은 컴퓨터 연산 능력을 소모해야 합니다. 이는 트레이드오프 관계입니다: 훈련 시간은 줄어들지만, "큐레이션(선별)" 시간은 늘어납니다.

핵심 요약
DMAPO는 AI를 더 똑똑하게 만드는 경쟁에서 양보다 질이 더 중요할 수 있음을 시사합니다. 모든 이가 완벽하다고 동의하는 답변(혹은 완벽한 실패작)만을 수용하는 매우 엄격한 편집자처럼 행동함으로써, 연구진은 거대하고 엉망인 데이터 더미로 훈련된 것보다 훨씬 더 높은 신뢰도를 가진 작은 데이터셋으로 훈련된 로봇이 더 뛰어난 성과를 낼 수 있음을 발견했습니다. 이는 때때로 가장 좋은 학습 방법은 소음(noise)을 무시하고 신호(signal)에 집중하는 것임을 상기시켜 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →