← 최신 논문
🤖 AI

Generative Retrieval via Diffusion Transformer with Metric-Ordered Sequence Training and Hybrid-Policy Preference Optimization

이 논문은 연속적인 임베딩 공간에서 패턴 보존과 속성 타겟팅 사이의 균형을 효과적으로 맞추기 위해 메트릭 순서 시퀀스 학습(metric-ordered sequence training)과 하이브리드 정책 선호 최적화(hybrid-policy preference optimization)를 결합한 생성적 검색 프레임워크인 MO-DiT+HPPO를 소개한다.

원저자: Chenghao Liu, Yu Zhang, Zhongtao Jiang, Kun Xu, Zhenwei An, Renzhi Wang, Zhao Wang, Jiachen Zhang, Yuxiao Zhang, Kun Xu, Songfang Huang

게시일 2026-06-26
📖 4 분 읽기☕ 가벼운 읽기

원저자: Chenghao Liu, Yu Zhang, Zhongtao Jiang, Kun Xu, Zhenwei An, Renzhi Wang, Zhao Wang, Jiachen Zhang, Yuxiao Zhang, Kun Xu, Songfang Huang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 방금 발견한 특정하고 희귀한 이야기인 **"씨앗(Seed)"**과 같은 책을 더 많이 찾으려는 사서라고 상상해 보세요.

문제는 도서관이 너무 거대해서, 책들이 거대한 보이지 않는 지도(벡터 공간) 위에 조직되어 있다는 점입니다. 당신에게는 두 가지 나쁜 선택지가 있습니다.

  1. "평균적" 접근법: 씨앗 책을 가져가서 사서에게 그 책의 "평균"을 찾아달라고 요청합니다. 이는 씨앗과 매우 유사한 이야기를 유지하지만, 당신이 원하는 특별한 불꽃이 없는 지루하고 평범한 책들을 찾게 됩니다.
  2. "속성" 접근법: 사서에게 특정하고 흥미로운 특징(예: "드래곤이 등장함")이 있는 어떠한 책이라도 찾아달라고 요청합니다. 이는 흥미로운 책들을 찾아주지만, 우주 속의 드래곤, 바다 속의 드래곤, 혹은 공포 영화 속의 드래곤처럼 씨앗과는 완전히 다른 이야기를 담고 있을 수 있습니다.

목표: 당신은 **흥미로운 특징(속성)**을 가지고 있으면서도 여전히 **씨앗과 동일한 종류의 이야기(패턴)**를 들려주는 책을 원합니다.

이 논문은 이 까다로운 균형 잡기 문제를 해결하는 새로운 AI 사서인 MO-DiT+HPPO를 소개합니다. 이 모델이 어떻게 작동하는지, 간단한 비유를 통해 단계별로 설명하겠습니다.

1. 핵심 아이디어: "디퓨전(Diffusion)" 탐정

이 AI는 단순히 기존의 책을 고르는 대신, "흥미로운 특징"과 "동일한 이야기"가 겹치는 바로 그 지점을 정확히 가리키는 새로운 "검색 쿼리"(정신적 지도 좌표)를 발명합니다. 이 AI는 **디퓨전 트랜스포머(Diffusion Transformer)**를 사용하는데, 이는 마치 흐릿하고 노이즈가 섞인 추측에서 시작하여 단계적으로 이를 정교하게 다듬어 완벽하고 선명한 검색 방향을 만들어내는 탐정과 같습니다.

2. 1단계: 지도 학습하기 (사전 학습)

특정 작업을 배우기 전에, AI는 도서관의 지도가 어떻게 작동하는지 이해하기 위해 수백만 개의 무작위 책 시퀀스를 읽습니다. AI는 "드래곤에 관한 책"은 일반적으로 특정 구역에 있고, "기사에 관한 책"은 다른 구역에 있다는 것을 배웁니다. 이를 통해 일반적인 방향 감각을 익힙니다.

3. 2단계: "메트릭 순서화(Metric-Ordered)" 학습 (하이킹 코스)

이것이 이 논문의 영리한 기법입니다. AI는 이야기의 유형을 바꾸지 않으면서 "지루한" 버전의 이야기에서 "흥미로운" 버전으로 이동하는 법을 배워야 합니다.

  • 문제: 도서관에는 "이 책은 80% 흥미롭다"라고 적힌 라벨이 없습니다. 이 사실은 실제로 책을 찾아가서 확인한 후에야 알 수 있습니다.
  • 해결책: 연구진은 책이 얼마나 "흥미로운지"를 추정하는 **예측기(Predictor, 똑똑한 추측 도구)**를 만들었습니다.
  • 코스: 그들은 이 추측을 바탕으로 책들을 하나의 선(시퀀스)으로 배열합니다:
    • 시작점: 지루하지만 동일한 이야기를 가진 책들.
    • 끝점: 흥미롭고 동일한 이야기를 가진 책들.
  • 학습: AI는 이 선을 "이어가는" 연습을 합니다. 지루한 시작 부분을 보고 다음 단계를 예측하고, 그다음 단계를 예측하며, 흥미로운 끝까지 나아가는 법을 배웁니다. 다양한 종류의 이야기(도메인)에 걸쳐 이 과정을 수행함으로써, AI는 보편적인 규칙을 배웁니다: "이야기의 본질을 잃지 않으면서 어떻게 흥미로움을 향해 이동할 것인가?"

4. 3단계: "테일-센트로이드(Tail-Centroid)" 미세 조정

AI가 코스를 걷는 법을 익히면, 이제 특정한 움직임을 연습합니다. 단순히 다음 책을 예측하는 것이 아니라, 선의 "흥미로운 끝부분" 전체를 바라보고 그 흥미로운 그룹의 **중심(Center)**으로 바로 뛰어드는 법을 배웁니다. 이를 통해 AI가 엉뚱하고 일회적인 예외적인 책을 고르는 대신, 견고하고 대표성 있는 "흥미로운" 책을 선택하도록 보장합니다.

5. 4단계: HPPO ("파레토 필터" 코치)

이것은 마지막 다듬기 단계입니다. AI는 이제 능숙해졌지만, 여전히 속임수를 쓸 수도 있습니다. 즉, "흥미로운" 책을 얻기 위해 아예 다른 이야기로 갈아타는 방법을 찾을 수도 있습니다.

이를 막기 위해, 연구진은 **파레토 필터(Pareto Filter)**라는 특별한 규칙을 사용하는 하이브리드 정책 선호 최적화(Hybrid-Policy Preference Optimization) 시스템을 사용합니다.

  • 설정: AI는 일련의 후보 검색 방향을 생성합니다. 어떤 것들은 "정적(Static)"인 것(안전하게 계산된 평균값)이고, 어떤 것들은 "정책(Policy)"적인 것(AI 자신의 창의적인 추측)입니다.
  • 테스트: 연구진은 실제로 도서관에서 이 검색들을 실행하여 어떤 것이 가장 잘 작동하는지 확인합니다.
  • 필터 (코치의 규칙): 만약 AI가 더 흥미로운 책을 찾았지만 이야기 패턴을 잃어버린 검색을 찾아낸다면, 코치는 이렇게 말합니다. "안 돼! 그건 속임수야."
    • 코치는 승자가 흥미로운 책을 더 많이 찾는 것 뿐만 아니라 이야기 패턴을 유지하는 데에도 모두 더 뛰어난 경우에만 AI가 학습할 수 있도록 허용합니다.
    • 이는 AI가 옆으로 미끄러지는 것(다른 종류의 흥미로운 이야기를 찾는 것)이 아니라, 경계선을 밖으로 밀어내는 것(동일한 이야기의 더 흥미로운 버전을 찾는 것)을 강제합니다.

결과

연구진은 이 모델을 네 가지 다른 유형의 콘텐츠(비디오, 텍텍스트 등)에 대해 테스트했습니다. 그 결과는 다음과 같습니다:

  1. "메트릭 순서화" 학습은 AI에게 올바른 이동 방향을 가르쳐 주었습니다.
  2. 마지막 단계의 "파레토 필터"는 AI가 더 흥미로운 결과를 얻기 위해 이야기 패턴을 희생하지 않도록 보장했습니다.

요약하자면: 이 논문은 줄타기를 배우는 시스템을 구축했습니다. AI는 스마트한 훈련 코스와 엄격한 코치를 사용하여, "다른" 종류의 아이템으로 옆으로 떨어지지 않으면서도 "더 나은" 아이템을 향해 이동하는 법을 배웁니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →