← नवीनतम पेपर
💬 NLP

Transitivity Meets Cyclicity: Explicit Preference Decomposition for Dynamic Large Language Model Alignment

यह शोध पत्र हाइब्रिड रिवॉर्ड-साइक्लिक (HRC) मॉडल और डायनेमिक सेल्फ-प्ले प्रेफरेंस ऑप्टिमाइजेशन (DSPPO) को प्रस्तुत करता है ताकि मानव प्राथमिकताओं को स्पष्ट रूप से ऑर्थोगोनल ट्रांजिटिव और साइक्लिक घटकों में विभाजित किया जा सके, जिससे मौजूदा विधियों की सैद्धांतिक सीमाओं को दूर करते हुए कई बेंचमार्क पर बेहतर एलाइनमेंट प्रदर्शन प्राप्त किया जा सके।

मूल लेखक: Yucong Huang, Xiucheng Li, Kaiqi Zhao, Jing Li

प्रकाशित 2026-05-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yucong Huang, Xiucheng Li, Kaiqi Zhao, Jing Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ शोध पत्र "Transitivity Meets Cyclicity: Explicit Preference Decomposition for Dynamic Large Language Model Alignment" का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ हिंदी अनुवाद दिया गया है।

बड़ी समस्या: AI मानवीय पसंद को समझने में क्यों भ्रमित हो जाता है?

कल्पना कीजिए कि आप एक रोबोट शेफ को यह सिखाने की कोशिश कर रहे हैं कि इंसानों की पसंद के आधार पर खाना कैसे बनाया जाए। आप रोबोट को दो व्यंजन दिखाते हैं, A और B, और पूछते हैं, "कौन सा बेहतर है?"

  • पुराना तरीका (Transitivity - संक्रामकता): अधिकांश AI सिस्टम यह मान लेते हैं कि मानवीय स्वाद एक सीढ़ी की तरह है। यदि आप व्यंजन A को व्यंजन B से बेहतर मानते हैं, और व्यंजन B को व्यंजन C से बेहतर मानते हैं, तो रोबोट यह मान लेता है कि आप व्यंजन A को व्यंजन C से भी बेहतर जरूर मानेंगे। यह हर व्यंजन को एक एकल "स्कोर" देता है। यह सरल चीजों के लिए अच्छा काम करता है जैसे "क्या भोजन सुरक्षित है?" या "क्या यह मददगार है?"
  • वास्तविक दुनिया (Cyclicity - चक्रीयता): लेकिन मानवीय स्वाद जटिल होता है। पत्थर-कागज-कैंची (Rock-Paper-Scissors) के खेल के बारे में सोचें। पत्थर कैंची को हराता है, कैंची कागज को हराती है, लेकिन कागज पत्थर को हराता है। यहाँ कोई एक "सर्वश्रेष्ठ" पत्थर, कागज या कैंची नहीं है। इसे साइकिल (चक्र) कहा जाता है।
  • संघर्ष: वास्तविक मानवीय पसंद इन दोनों का मिश्रण है। हमारे पास एक सामान्य पदानुक्रम (Hierarchy) है (सुरक्षा > खतरा) लेकिन साथ ही स्थानीय चक्र (Local Loops) भी हैं (मुझे तीखा खाना पसंद है, फिर मध्यम, फिर हल्का—लेकिन अगर मैं भूखा हूँ तो हल्का खाना तीखे से बेहतर हो सकता है)। पुराने AI मॉडल फंस जाते हैं क्योंकि वे इन चक्रों को एक सीधी सीढ़ी में बदलने की कोशिश करते हैं, जिससे भ्रम और खराब प्रदर्शन होता है।

समाधान: "हाइब्रिड रिवॉर्ड-साइक्लिक" (HRC) मॉडल

लेखक AI को सिखाने का एक नया तरीका प्रस्तावित करते हैं, जिसे वे HRC कहते हैं। AI को यह चुनने के लिए मजबूर करने के बजाय कि उसे सीढ़ी चुननी है या चक्र, वे उसे एक ही समय में मानवीय स्वाद को समझने के लिए दो अलग-अलग उपकरण देते हैं।

इसे एक स्पोर्ट्स लीग मैनेजर की तरह समझें:

  1. लीग टेबल (Transitive Component): यह टीमों के समग्र "कौशल" को ट्रैक करता है। टीम A आम तौर पर टीम B से बेहतर है। यह "स्केलर" (एक संख्या) वाला हिस्सा है।
  2. मैचअप हिस्ट्री (Cyclic Component): यह विशिष्ट और अजीब मुकाबलों को ट्रैक करता है। हो सकता है कि टीम A आमतौर पर टीम B को हराती हो, लेकिन टीम B के पास एक गुप्त रणनीति हो जो मंगलवार को टीम A को हरा देती है। यह "वेक्टर" (एक दिशा या संबंध) वाला हिस्सा है।

HRC मॉडल इन दोनों को जोड़ता है। यह कहता है: "ठीक है, सामान्य रूप से, यह उत्तर बेहतर है (सीढ़ी), लेकिन इस विशिष्ट संदर्भ में, दूसरे उत्तर का एक विशेष लाभ है (लूप/चक्र)।" इन दोनों विचारों को अलग करके, AI एक वृत्त (circle) को वर्ग (square) में फिट करने की कोशिश में भ्रमित नहीं होता।

प्रशिक्षण विधि: "डायनेमिक सेल्फ-प्ले" (DSPPO)

एक बार जब AI के पास पसंद को समझने का यह नया तरीका आ जाता है, तो उसे यह सीखने की आवश्यकता होती है कि इसका उपयोग कैसे किया जाए। लेखक एक प्रशिक्षण विधि पेश करते हैं जिसे DSPPO कहा जाता है।

एक छात्र की शतरंज सीखने की कल्पना करें।

  • पुरानी विधि (Static - स्थिर): छात्र एक ऐसे कंप्यूटर के खिलाफ खेलता है जिसकी रणनीति कभी नहीं बदलती। छात्र अंततः उस एक विशिष्ट कंप्यूटर को हराना सीख जाता है, लेकिन एक नए प्रतिद्वंद्वी के सामने विफल हो सकता है।
  • नई विधि (Dynamic/Time-Varying - गतिशील/समय-परिवर्तनीय): छात्र एक ऐसे कोच के खिलाफ खेलता है जो छात्र के बेहतर होने के साथ-साथ नियम बदलता रहता है।
    • प्रारंभिक चरण: कोच बुनियादी बातों (सीढ़ी) पर ध्यान केंद्रित करता है। "सुनिश्चित करें कि आपकी चालें सुरक्षित और तार्किक हों।"
    • बाद का चरण: जैसे-जैसे छात्र बेहतर होता है, कोच जटिल और पेचीदा परिदृश्य (लूप) पेश करता है। "अब, आइए कुछ अजीब रणनीतियों को आजमाएं जो केवल विशिष्ट स्थितियों में काम करती हैं।"

यह डायनेमिक सेल्फ-प्ले AI को सरल, सुरक्षित नियमों से लेकर जटिल, सूक्ष्म प्राथमिकताओं तक ले जाता है, जिससे यह सुनिश्चित होता है कि वह बिना अभिभूत हुए पूरी तस्वीर सीख सके।

उन्होंने क्या पाया (परिणाम)

शोधकर्ताओं ने यह देखने के लिए कि क्या यह नया सिस्टम पुराने तरीकों से बेहतर काम करता है, कई "परीक्षाओं" (benchmarks) पर इस नए सिस्टम का परीक्षण किया।

  1. बारीकियों को समझने में बेहतर: उन परीक्षणों पर जो यह देखते हैं कि क्या AI जटिल, गैर-कठोर प्राथमिकताओं (जैसे "टाई" श्रेणी जहाँ उत्तर समान रूप से अच्छे हैं लेकिन अलग हैं) को संभाल सकता है, नए HRC मॉडल ने पुराने मॉडलों की तुलना में उच्च स्कोर किया। इसने वहां नकली रैंकिंग बनाने की कोशिश नहीं की जहां कोई रैंकिंग मौजूद नहीं थी।
  2. तेज़ और स्मार्ट: उन सिंथेटिक परीक्षणों में जहाँ उन्होंने स्पष्ट विजेताओं के साथ "पत्थर-कागज-कैंची" जैसे परिदृश्य बनाए, HRC मॉडल ने पिछले मॉडलों की तुलना में पैटर्न को अधिक तेज़ी से और सटीक रूप से सीखा।
  3. बेहतर अंतिम आउटपुट: जब उन्होंने इस नए मॉडल का उपयोग चैटबॉट को प्रशिक्षित करने के लिए किया (DSPPO का उपयोग करके), तो चैटबॉट कठिन कार्यों पर बेहतर प्रदर्शन कर सका।
    • AlpacaEval 2.0 (यह परीक्षण कि AI निर्देशों का कितनी अच्छी तरह पालन करता है) पर, नई विधि ने 44.75% जीत दर हासिल की, जो पिछले सर्वश्रेष्ठ तरीकों से बेहतर है।
    • Arena-Hard (बहुत कठिन तर्क क्षमता का परीक्षण) पर भी, इसने काफी अधिक बार जीत हासिल की।

मुख्य निष्कर्ष (The Takeaway)

यह शोध पत्र तर्क देता है कि मानवीय प्राथमिकताओं को एक एकल "स्कोर" द्वारा नहीं पकड़ा जा सकता। वैश्विक रैंकिंग (जो सामान्य रूप से अच्छा है) और स्थानीय चक्रों (जो विशिष्ट, पेचीदा स्थितियों में काम करता है) को स्पष्ट रूप से विभाजित करके, और AI को इन चरणों में सीखने के लिए प्रशिक्षित करके, हम ऐसा AI बना सकते हैं जो मानवीय मूल्यों को बहुत अधिक गहराई और सटीकता से समझता है।

संक्षेप में: उन्होंने AI को एक दो-भाग वाला मस्तिष्क (एक सामान्य नियमों के लिए, एक पेचीदा अपवादों के लिए) दिया और एक स्मार्ट शिक्षक जो छात्र के सीखने के साथ पाठ योजना बदलता है, जिसके परिणामस्वरूप एक बहुत अधिक स्मार्ट और अधिक विश्वसनीय AI प्राप्त हुआ।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →