← 최신 논문
🤖 AI

Preference Goal Tuning: Post-Training as Latent Control for Frozen Policies

본 논문은 고정된 목표 조건 정책이 정책 매개변수를 업데이트하는 대신 연속 잠재 목표 임베딩을 최적화함으로써 작업 선호도와 정렬되는 후학습 프레임워크인 선호도 목표 튜닝 (PGT) 을 소개하며, 이를 통해 마인크래프트 SkillForge 벤치마크에서 전문가 프롬프트와 전체 미세 조정 모두보다 우수한 성능과 견고성을 달성함을 보여줍니다.

원저자: Guangyu Zhao, Kewei Lian, Haoxuan Ru, Borong Zhang, Haowei Lin, Zhancun Mu, Haobo Fu, Qiang Fu, Shaofei Cai, Zihao Wang, Yitao Liang

게시일 2026-05-04
📖 4 분 읽기☕ 가벼운 읽기

원저자: Guangyu Zhao, Kewei Lian, Haoxuan Ru, Borong Zhang, Haowei Lin, Zhancun Mu, Haobo Fu, Qiang Fu, Shaofei Cai, Zihao Wang, Yitao Liang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 숙련된 사전 훈련된 로봇 셰프가 있다고 가정해 봅시다. 이 셰프는 수년 동안 수백만 개의 요리 영상을 시청해 왔으며, 다지기, 튀기기, 굽기의 물리학을 그 누구보다 잘 이해하고 있습니다. 그러나 이 셰프에게 "샐러드를 만들어 달라"고 요청하면, 단순히 당신의 구두 지시가 그들의 특정 스타일에 맞는 적절한 트리거가 아니었기 때문에 토마토를 너무 잘게 다지거나 드레싱을 잊어버릴 수도 있습니다.

보통 이를 해결하기 위해 두 가지 나쁜 선택지가 있습니다:

  1. 지시사항 재작성: 작동하는 것을 찾을 때까지 ("토마토를 다지세요", "토마토를 깎아주세요", "토마토를 썰어주세요") 수백 가지 다른 문구를 시도해 봅니다. 이는 올바른 비밀번호를 추측하는 것과 같습니다. 느리고 종종 실패합니다.
  2. 셰프 재훈련: 셰프를 요리 학교로 데려가 당신의 특정 취향에 맞춰 처음부터 모든 것을 다시 배우게 합니다. 이는 비용이 많이 들고 시간이 오래 걸리며, 셰프가 당신의 특정 샐러드 외에는 아무것도 요리하는 법을 잊어버릴 위험이 있습니다 (이 문제는 "파괴적 망각"이라고 불립니다).

이 논문은 "선호도 목표 조정 (Preference Goal Tuning, PGT)"이라는 세 번째이자 더 지능적인 방법을 소개합니다.

핵심 아이디어: "리모컨" 은유

셰프의 뇌 (정책) 를 다시 쓰거나 완벽한 단어를 추측하는 대신, 저자들은 셰프의 잠재 목표 임베딩 (latent goal embedding)연속적인 리모컨으로 취급합니다.

셰프의 뇌를 동결된 고급 비디오 게임 캐릭터라고 생각해 보세요. 당신은 그들의 코드나 통계를 바꿀 수 없습니다. 그러나 당신은 "양을 사냥하라"는 명령을 어떻게 해석할지 정확히 알려주는 숨겨진 "다이얼" (잠재 목표) 을 조정할 수 있습니다.

  • 구식 방법 (프롬프트 엔지니어링): 캐릭터에게 다양한 명령을 외쳐 한 가지라도 먹히기를 바랍니다.
  • 구식 방법 (파인튜닝): 캐릭터가 당신의 명령에 맞춰 전체 성격을 다시 배우도록 강요합니다.
  • PGT 방식: 캐릭터의 성격을 정확히 그대로 유지하면서 "선호도 다이얼"을 사용하여 행동을 살짝 조정합니다. 다이얼을 약간 왼쪽으로 돌리면 토마토를 완벽하게 다집니다. 약간 오른쪽으로 돌리면 드레싱을 추가합니다.

작동 방식: "미각 평가자" 루프

이 논문은 매우 효율적인 미각 평가 세션처럼 작동하는 과정을 설명합니다:

  1. 준비: 기본 지시사항 (예: "나무를 모으세요") 으로 시작합니다. 동결된 로봇이 이를 시도합니다.
  2. 시행: 로봇이 몇 가지 시도 (궤적) 를 생성합니다. 일부는 엉망이고 일부는 좋습니다.
  3. 피드백: 인간 (또는 보상 시스템) 이 시도들을 살펴보고 "저것보다 이것을 더 좋아합니다"라고 말합니다. 완벽한 매뉴얼을 작성할 필요는 없습니다. 승자와 패자를 선택하기만 하면 됩니다.
  4. 조정: 시스템은 이 "승자 대 패자" 피드백을 사용하여 숨겨진 다이얼 (잠재 목표) 을 미세 조정합니다. "다이얼에 어떤 미세한 변화를 가하면 로봇이 '패자' 행동 대신 '승자' 행동을 하게 될까?"라고 묻습니다.
  5. 결과: 로봇의 뇌는 손대지 않았지만, 다이얼은 이제 당신의 선호도와 완벽하게 일치하는 "적정 지점"으로 설정됩니다.

이것이 중요한 이유

이 논문은 복잡한 오픈 월드 게임인 마인크래프트 (Minecraft)로봇 팔에서 이를 테스트했습니다. 간단한 용어로 그들이 발견한 바는 다음과 같습니다:

  • 마법 같은 다이얼: 이 숨겨진 다이얼을 돌리는 것만으로도 시스템은 다양한 텍스트 프롬프트를 시도하는 것에 비해 **72% 에서 81%**까지 성능이 향상되었습니다. 이는 최고의 인간 작성 지시사항보다도 뛰어났습니다.
  • 로봇을 망가뜨리지 않음: 로봇의 뇌 (정책) 가 동결되어 있기 때문에 다른 일을 하는 법을 잊지 않습니다. 다이얼을 "나무 모으기"로 조정하면, 나중에 다이얼을 "집 짓기" 설정으로 되돌리기만 하면 로봇은 여전히 "집을 지을" 수 있습니다.
  • 예상치 못한 상황에 대처: 환경이 변했을 때 (예: 게임 세계가 다르게 보이거나 로봇이 새로운 방에 있을 때), "다이얼" 방식은 로봇을 재훈련하는 것보다 훨씬 잘 작동했습니다. 이는 새로운 도로를 재학습할 필요 없이 새로운 도로를 처리할 수 있는 베테랑 운전사처럼 더 견고했습니다.
  • 저렴함: 로봇 뇌를 재훈련하는 데는 수백만 달러 규모의 컴퓨팅 파워가 필요합니다. 이 단일 "다이얼"을 조정하는 데는 그 힘과 데이터의 아주 작은 부분만 필요합니다.

결론

저자들은 이를 **선호도 목표 조정 (Preference Goal Tuning, PGT)**이라고 부릅니다. 이는 기존 기술을 망가뜨리지 않고 사전 훈련된 AI 에게 새로운 기술을 가르치는 방법입니다. AI 에게 새로운 규칙을 암기하도록 강요하는 대신, 원하는 행동을 해제하는 완벽한 "숨겨진 설정"을 찾을 뿐이며, AI 의 핵심 지능은 안전하고 건전하게 유지됩니다.

논문에서 언급된 한계점:

  • 로봇은 이미 해당 작업을 수행할 수 있는 일부 능력을 가지고 있어야 합니다. 로봇이 양을 본 적이 없다면 다이얼을 돌린다고 해서 양을 사냥하게 되는 것은 아닙니다. 단지 시작점이 필요할 뿐입니다.
  • 각 작업마다 (나무용, 돌용 등) 새로운 다이얼을 조정해야 하지만, 이는 실제로는 기능입니다. 작업을 분리하고 서로 간섭하지 않도록 하기 때문입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →