← नवीनतम पेपर
🤖 AI

Generative Retrieval via Diffusion Transformer with Metric-Ordered Sequence Training and Hybrid-Policy Preference Optimization

यह शोध पत्र MO-DiT+HPPO प्रस्तुत करता है, जो एक जनरेटिव रिट्रीवल फ्रेमवर्क है जो निरंतर एम्बेडिंग स्पेस में पैटर्न संरक्षण और एट्रिब्यूट टारगेटिंग के बीच प्रभावी ढंग से संतुलन बनाने के लिए मेट्रिक-ऑर्डर्ड सीक्वेंस ट्रेनिंग और हाइब्रिड-पॉलिसी प्रेफरेंस ऑप्टिमाइज़ेशन को संयोजित करता है।

मूल लेखक: Chenghao Liu, Yu Zhang, Zhongtao Jiang, Kun Xu, Zhenwei An, Renzhi Wang, Zhao Wang, Jiachen Zhang, Yuxiao Zhang, Kun Xu, Songfang Huang

प्रकाशित 2026-06-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chenghao Liu, Yu Zhang, Zhongtao Jiang, Kun Xu, Zhenwei An, Renzhi Wang, Zhao Wang, Jiachen Zhang, Yuxiao Zhang, Kun Xu, Songfang Huang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक लाइब्रेरियन हैं जो अभी-अभी मिली एक विशिष्ट, दुर्लभ कहानी की तरह और अधिक किताबें खोजने की कोशिश कर रहे हैं। आइए उस कहानी को आपका "सीड" (Seed) कहें।

समस्या यह है कि लाइब्रेरी बहुत विशाल है, और किताबें एक विशाल, अदृश्य मानचित्र ("वेक्टर स्पेस") में व्यवस्थित हैं। आपके पास दो बुरे विकल्प हैं:

  1. "औसत" (Average) दृष्टिकोण: आप अपने सीड बुक को लेते हैं और लाइब्रेरियन से उसका "औसत" खोजने के लिए कहते हैं। यह आपकी सीड के बहुत समान रहता है, लेकिन जो किताबें आप पाते हैं वे उबाऊ, साधारण और उस विशेष चमक की कमी वाली होती हैं जिसे आप चाहते हैं।
  2. "एट्रिब्यूट" (Attribute) दृष्टिकोण: आप लाइब्रेरियन से किसी विशिष्ट रोमांचक विशेषता (जैसे "इसमें एक ड्रैगन है") वाली कोई भी किताब खोजने के लिए कहते हैं। यह रोमांचक किताबें तो ढूंढ लेता है, लेकिन वे अंतरिक्ष में ड्रैगन, समुद्र में ड्रैगन, या हॉरर फिल्म में ड्रैगन के बारे में हो सकती हैं—जो आपकी सीड से पूरी तरह से अलग कहानियाँ हैं।

लक्ष्य: आप ऐसी किताबें चाहते हैं जिनमें रोमांचक विशेषता (एट्रिब्यूट) हो लेकिन वे अभी भी आपकी सीड की तरह ही एक विशिष्ट प्रकार की कहानी (पैटर्न) बताती हों।

यह पेपर एक नया AI लाइब्रेरियन MO-DiT+HPPO पेश करता है जो इस कठिन संतुलन को हल करता है। यह कैसे काम करता है, इसके चरण यहाँ दिए गए हैं (सरल उपमाओं का उपयोग करते हुए):

1. मूल विचार: एक "डिफ्यूजन" जासूस (A "Diffusion" Detective)

मौजूदा किताब चुनने के बजाय, यह AI एक नया "सर्च क्वेरी" (मानसिक मानचित्र निर्देशांक) बनाता है जो ठीक उसी बिंदु की ओर इशारा करता है जहाँ "रोमांचक विशेषताएं" और "वही कहानी" आपस में मिलते हैं। यह एक डिफ्यूजन ट्रांसफॉर्मर का उपयोग करता है, जो एक जासूस की तरह है जो एक धुंधले, शोर वाले अनुमान से शुरू करता है और धीरे-धीरे उसे तब तक साफ करता है जब तक कि वह एक सटीक, स्पष्ट खोज दिशा न बन जाए।

2. पहला चरण: मानचित्र को समझना (Pretraining)

विशिष्ट कार्य सीखने से पहले, AI लाइब्रेरी के मानचित्र को समझने के लिए लाखों यादृच्छिक (random) पुस्तक अनुक्रमों को पढ़ता है। यह सीखता है कि "ड्रैगन के बारे में किताबें" आम तौर पर एक पड़ोस में होती हैं, और "नाइट्स के बारे में किताबें" दूसरे पड़ोस में होती हैं। यह इसे दिशा का एक सामान्य बोध देता है।

3. दूसरा चरण: "मेट्रिक-ऑर्डर्ड" प्रशिक्षण (पहाड़ी रास्ता - The Hiking Trail)

यह इस पेपर की चतुर तकनीक है। AI को यह सीखना होगा कि एक "उबाऊ" कहानी के संस्करण से एक "रोमांचक" संस्करण की ओर कैसे जाया जाए बिना कहानी के प्रकार को बदले।

  • समस्या: लाइब्रेरी में ऐसे लेबल नहीं होते जो कहते हों कि "यह किताब 80% रोमांचक है।" यह केवल तभी पता चलता है जब आप वास्तव में किताब खोजने जाते हैं और उसकी जांच करते हैं।
  • समाधान: शोधकर्ताओं ने एक प्रेडिक्टर (एक स्मार्ट अंदाज़ा लगाने वाला) बनाया है जो यह अनुमान लगाता है कि एक किताब कितनी "रोमांचक" है।
  • रास्ता: उन्होंने किताबों को एक रेखा (एक अनुक्रम) में व्यवस्थित किया है:
    • लाइन की शुरुआत: उबाऊ लेकिन समान-कहानी वाली किताबें।
    • लाइन का अंत: रोमांचक और समान-कहानी वाली किताबें।
  • प्रशिक्षण: AI इस रेखा को "जारी रखने" का अभ्यास करता है। यह उबाऊ शुरुआत को देखता है और अगले कदम की भविष्यवाणी करना सीखता है, फिर अगले, और अंततः रोमांचक अंत तक। विभिन्न प्रकार की कहानियों (डोमेन) में ऐसा करके, यह एक सार्वभौमिक नियम सीखता है: "मैं कहानी को खोए बिना रोमांच की ओर कैसे बढ़ूँ?"

4. तीसरा चरण: "टेल-सेंट्रॉइड" फाइन-ट्यूनिंग (The "Tail-Centroid" Fine-Tuning)

एक बार जब AI रास्ता चलना सीख जाता है, तो वह एक विशिष्ट चाल का अभ्यास करता है। केवल अगली किताब की भविष्यवाणी करने के बजाय, यह रेखा के पूरे "रोमांचक अंत" को देखता है और सीधे उस रोमांचक समूह के केंद्र की ओर कूदना सीखता है। यह सुनिश्चित करता है कि यह गलती से किसी अजीब, एकतरफा आउटलायर (outlier) को न चुन ले, बल्कि एक ठोस, प्रतिनिधि "रोमांचक" किताब को चुने।

5. चौथा चरण: HPPO (द "पारेटो फ़िल्टर" कोच)

यह अंतिम पॉलिश है। AI अब अच्छा है, लेकिन यह अभी भी धोखाधड़ी करने की कोशिश कर सकता है। यह एक पूरी तरह से अलग कहानी में बदलकर "रोमांचक" किताबें खोजने का तरीका निकाल सकता है (पैटर्न से भटक जाना)।

इसे रोकने के लिए, शोधकर्ता एक हाइब्रिड-पॉलिसी प्रेफरेंस ऑप्टिमाइज़ेशन सिस्टम का उपयोग करते हैं जिसमें एक विशेष नियम है जिसे पारेटो फ़िल्टर कहा जाता है।

  • सेटअप: AI कई संभावित खोज दिशाएं उत्पन्न करता है। कुछ "स्टेटिक" (सुरक्षित, गणना किए गए औसत) हैं, और कुछ "पॉलिसी" (AI के अपने रचनात्मक अनुमान) हैं।
  • परीक्षण: वे यह देखने के लिए वास्तव में इन खोजों को वास्तविक लाइब्रेरी में चलाते हैं कि कौन से काम करते हैं।
  • फ़िल्टर (कोच का नियम): यदि AI एक ऐसी खोज पाता है जो अधिक रोमांचक किताबें तो पाती है लेकिन कहानी के पैटर्न को खो देती है, तो कोच कहता है, "नहीं! यह धोखाधड़ी है।"
    • कोच केवल उन जोड़ों से सीखने की अनुमति देता है जहाँ विजेता रोमांचक किताबें पाने में और कहानी के पैटर्न को बनाए रखने में दोनों में बेहतर है।
    • यह AI को सीमा को बाहर की ओर धकेलने के लिए मजबूर करता है (उसी कहानी की अधिक रोमांचक चीजें खोजना) बजाय इसके कि वह बगल की ओर खिसक जाए (अलग कहानियों की रोमांचक चीजें खोजना)।

परिणाम

पेपर ने चार अलग-अलग प्रकार की सामग्री (जैसे वीडियो, टेक्स्ट, आदि) पर इसका परीक्षण किया। उन्होंने पाया कि:

  1. "मेट्रिक-ऑर्डर्ड" प्रशिक्षण ने AI को सही दिशा में बढ़ना सिखाया।
  2. अंतिम चरण में "पारेटो फ़िल्टर" ने यह सुनिश्चित किया कि AI रोमांचक परिणाम प्राप्त करने के लिए कहानी के पैटर्न का त्याग न करे।

संक्षेप में: इस पेपर ने एक ऐसा सिस्टम बनाया है जो एक रस्सी पर चलने (tightrope walking) का हुनर सीखता है। यह जानता है कि "अलग" चीजों के साइड से गिरे बिना "बेहतर" चीजों की ओर कैसे बढ़ा जाए, जिसके लिए एक स्मार्ट ट्रेनिंग ट्रेल और एक सख्त कोच का उपयोग किया गया है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →