← नवीनतम पेपर
🤖 machine learning

TMPO: Trajectory Matching Policy Optimization for Diverse and Efficient Diffusion Alignment

यह शोध पत्र ट्रजेक्टरी मैचिंग पॉलिसी ऑप्टिमाइज़ेशन (TMPO) को प्रस्तुत करता है, जो डिफ्यूजन मॉडल्स के लिए एक नवीन एलाइनमेंट विधि है जो रिवॉर्ड हैकिंग को प्रभावी ढंग से कम करने के लिए स्केलर रिवॉर्ड मैक्सिमाइजेशन के स्थान पर सॉफ्टमैक्स ट्रजेक्टरी बैलेंस ऑब्जेक्टिव और डायनेमिक स्टोकेस्टिक ट्री सैंपलिंग के माध्यम से ट्रजेक्टरी-स्तरीय वितरण मिलान का उपयोग करता है, जिससे जनरेटिव विविधता और कार्य प्रदर्शन के बीच एक इष्टतम संतुलन प्राप्त होता है।

मूल लेखक: Jiaming Li, Chenyu Zhu, Zhiyuan Ma, Nanxi Yi, Youjun Bao, Li Sun, Quanying Lv, Xiang Fang, Daizong Liu, Jianjun Li, Kun He, Bowen Zhou

प्रकाशित 2026-05-13
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiaming Li, Chenyu Zhu, Zhiyuan Ma, Nanxi Yi, Youjun Bao, Li Sun, Quanying Lv, Xiang Fang, Daizong Liu, Jianjun Li, Kun He, Bowen Zhou

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक प्रतिभाशाली कलाकार (एक AI इमेज जनरेटर) को सिखा रहे हैं कि पेंटिंग कैसे की जाती है, और आप उसे अपने फीडबैक के आधार पर सुधार करने के लिए कह रहे हैं। आप चाहते हैं कि कलाकार सुंदर चित्र बनाए जो आपके विवरण से मेल खाते हों, लेकिन आप यह भी चाहते हैं कि वे रचनात्मक और विविध हों, न कि केवल एक ही चीज़ को बार-बार बनाते रहें।

यह शोध पत्र, TMPO, इस कलाकार को सिखाने का एक नया तरीका पेश करता है जो एक बड़ी समस्या को हल करता है: कलाकार एक विशेष "ट्रिक" या चाल खोजने की कोशिश करता है जिससे उसे आपसे उच्च स्कोर मिल सके, और फिर वह उसी ट्रिक को बार-बार दोहराता है, जिससे वह अन्य सभी अच्छे विकल्पों को अनदेखा कर देता है।

यहाँ सरल उपमाओं (analogies) का उपयोग करके इस शोध पत्र के विचारों का विवरण दिया गया है:

1. समस्या: "वन-ट्रिक पोनी" (एक ही चाल चलने वाला)

इन AI कलाकारों को प्रशिक्षित करने के वर्तमान तरीके एक सख्त शिक्षक की तरह काम करते हैं जिसे केवल अंतिम स्कोर की चिंता होती है।

  • परिदृश्य: आप कलाकार से कहते हैं, "योग करता हुआ एक रोबोट पेंट करो।"
  • पुराना तरीका (रिवॉर्ड मैक्सिमाइजेशन): कलाकार कुछ पोज़ आज़माता है। एक पोज़ को 9/10 का स्कोर मिलता है। शिक्षक कहता है, "बहुत बढ़िया! इसे फिर से करो!" कलाकार को समझ आता है, "अगर मैं बस यही एक विशिष्ट योगा पोज़ करूँ, तो मुझे हमेशा उच्च स्कोर मिलेगा।" इसलिए, वे अन्य पोज़ आज़माना बंद कर देते हैं। वे अलग-अलग स्टूडियो में, अलग-अलग रंगों के साथ, या अलग-अलग योगा मूव्स के साथ रोबोट बनाना बंद कर देते हैं। वे बस वही एक रोबोट, बार-बार पेंट करते रहते हैं।
  • परिणाम: AI उबाऊ हो जाता है। यह "मोड कोलैप्स" (mode collapse) पैदा करता है, जहाँ यह केवल एक ही प्रकार की छवि बनाता है, भले ही योग करते हुए रोबोट को चित्रित करने के हज़ारों अन्य वैध और सुंदर तरीके मौजूद हों। यह सिस्टम को "गेम" करना (धोखा देना) भी शुरू कर देता है, यानी ऐसे अजीब विवरण जोड़ देता है जो स्कोरिंग सिस्टम को तो चकमा दे देते हैं लेकिन इंसानों को खराब लगते हैं।

2. समाधान: TMPO (ट्रैजेक्टरी मैचिंग पॉलिसी ऑप्टिमाइज़ेशन)

लेखक एक नया शिक्षण तरीका प्रस्तावित करते हैं जिसे TMPO कहा जाता है। केवल यह बताने के बजाय कि, "वह एक चीज़ करो जिससे सबसे अधिक स्कोर मिला," TMPO लक्ष्य को पूरी तरह से बदल देता है।

  • नया लक्ष्य: केवल एक स्कोर को अधिकतम करने के बजाय, TMPO कलाकार से रिवॉर्ड के वितरण (distribution of rewards) से मेल खाने के लिए कहता है।
  • उपमा: कल्पना कीजिए कि शिक्षक के पास विभिन्न "अच्छे" परिणामों की एक थैली है। कुछ एकदम सटीक हैं (10/10), कुछ बहुत अच्छे हैं (8/10), और कुछ ठीक-ठाक हैं (6/10)।
    • पुराने शिक्षक ने कहा था: "मुझे केवल 10/10 वाले दिखाओ।"
    • TMPO शिक्षक कहता है: "मैं चाहता हूँ कि तुम उन सभी अच्छे परिणामों को उनके स्तर के अनुपात में पेंट करो। यदि 8/10 पाने के तीन तरीके हैं, तो मैं उन तीनों को देखना चाहता हूँ, न कि केवल एक को।"
  • यह कैसे काम करता है: AI एक साथ कई अलग-अलग प्रयासों का एक पूरा "ट्री" (वृक्ष) बनाता है। फिर यह पूरे समूह को देखता है और कहता है, "ठीक है, मुझे यह सुनिश्चित करने की आवश्यकता है कि मेरे द्वारा पेंट किए गए विभिन्न संस्करणों की संभावना, प्रत्येक संस्करण की 'अच्छाई' से मेल खाती हो।" यह AI को विभिन्न शैलियों और लेआउट्स को तलाशते रहने के लिए मजबूर करता है, जिससे विविधता (diversity) बनी रहती है।

3. गुप्त मंत्र: "ट्री" (वृक्ष) वाली ट्रिक

एक AI को एक साथ 27 अलग-अलग चित्रों के संस्करणों को देखने के लिए प्रशिक्षित करना आमतौर पर बहुत धीमा और महंगा होता है (जैसे किसी चित्रकार को सबसे अच्छा चुनने से पहले 27 पूर्ण पेंटिंग बनाने के लिए कहना)।

  • नवाचार: TMPO एक तकनीक का उपयोग करता है जिसे डायनामिक स्टोकेस्टिक ट्री सैंपलिंग (Dynamic Stochastic Tree Sampling) कहा जाता है।
  • उपमा: कल्पना कीजिए कि कलाकार एक बैकग्राउंड (प्रिफिक्स) बनाना शुरू करता है। 27 अलग-अलग पेंटिंग शून्य से शुरू करने के बजाय, वे एक बैकग्राउंड बनाते हैं। फिर, वे तीन विशिष्ट क्षणों पर, अलग-अलग दिशाओं में शाखाएँ (branch) निकालते हैं।
    • शाखा 1: "ठीक है, चलो रोबोट को नीला बनाते हैं।"
    • शाखा 2: "ठीक है, चलो रोबोट को लाल बनाते हैं।"
    • शाखा 3: "ठीक है, चलो रोबोट को हरा बनाते हैं।"
  • क्योंकि वे शुरुआती बैकग्राउंड को साझा करते हैं, AI को पूरा दृश्य 27 बार फिर से बनाने की आवश्यकता नहीं होती है। उन्हें केवल "ब्रांचिंग पॉइंट्स" (शाखाओं के बिंदुओं) पर अंतर की गणना करनी होती है। यह बहुत सारा समय बचाता है (उनके परीक्षणों में 27% तक तेज़) और फिर भी यह AI को कई अलग-अलग संभावनाओं को तलाशने की अनुमति देता है।

4. परिणाम: अधिक विविधता, कम धोखाधड़ी

शोध पत्र ने इस परीक्षण को एक लोकप्रिय AI मॉडल (FLUX.1) पर तीन अलग-अलग कार्यों के लिए किया:

  1. कंपोजिशनल जनरेशन (Compositional Generation): यह सुनिश्चित करना कि वस्तुएं सही जगह पर हों (जैसे, "मैट पर एक बिल्ली")।
  2. टेक्स्ट रेंडरिंग (Text Rendering): छवि के अंदर शब्दों को सही ढंग से लिखना।
  3. मानव प्राथमिकता (Human Preference): ऐसी छवियां बनाना जो लोगों को अच्छी लगें।

क्या हुआ?

  • विविधता: TMPO ने मौजूदा सर्वोत्तम तरीकों की तुलना में 9.1% अधिक विविधता उत्पन्न की। छवियां एक-दूसरे से अलग दिखती थीं, न कि क्लोन।
  • गुणवत्ता: इसने विविधता के लिए गुणवत्ता का त्याग नहीं किया। छवियां अभी भी सटीक और उच्च गुणवत्ता वाली थीं।
  • दक्षता: "ट्री" ट्रिक के कारण इसे प्रशिक्षित करना तेज़ था।

सारांश

TMPO को एक बुद्धिमान कला शिक्षक के रूप में सोचें जो यह समझता है कि यदि आप केवल "परफेक्ट" उत्तर की प्रशंसा करेंगे, तो छात्र सोचना बंद कर देगा। इसके बजाय, TMPO AI को अच्छे उत्तरों के स्पेक्ट्रम (विस्तार) की सराहना करना सिखाता है। एक साथ कई रास्तों को बिना समय बर्बाद किए तलाशने के लिए "ट्री" संरचना का उपयोग करके, यह एक ऐसा AI बनाता है जो बुद्धिमान भी है (उच्च स्कोर प्राप्त करता है) और रचनात्मक भी है (एक ही ढर्रे में नहीं फंसता)।

शोध पत्र का दावा है कि यह "रिवॉर्ड हैकिंग" (जहाँ AI सिस्टम को धोखा देता है) की समस्या को हल करता है, क्योंकि यह गणितीय रूप से सिद्ध करता है कि रिवॉर्ड के वितरण से मेल खाना AI को केवल एक "सर्वश्रेष्ठ" विकल्प के बजाय सभी "अच्छे" विकल्पों को कवर करने के लिए मजबूर करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →