← नवीनतम पेपर
💬 NLP

When Are Two RLHF Objectives the Same?

यह शोध पत्र ओपल (Opal) को प्रस्तुत करता है, जो एक कैनोनिकलाइजेशन एल्गोरिदम है जो RLHF प्राथमिकता उद्देश्यों की बीजगणितीय समानता (algebraic equivalence) को निर्धारित करता है, जिससे यह प्रकट होता है कि कई व्यापक रूप से उपयोग की जाने वाली विधियाँ वास्तव में एक ही अंतर्निहित लक्ष्य के पुनर्रूपण (reparameterizations) हैं, और साथ ही उन विशिष्ट संरचनात्मक तंत्रों की पहचान करता है जो वास्तव में भिन्न उद्देश्यों का निर्माण करते हैं।

मूल लेखक: Madhava Gaikwad

प्रकाशित 2026-02-06
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Madhava Gaikwad

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शेफ हैं जो एक नए व्यंजन के लिए रेसिपी को बेहतर बनाने की कोशिश कर रहे हैं। पिछले कुछ वर्षों में, सैकड़ों अन्य शेफों ने इस रेसिपी के अपने स्वयं के "बेहतर" संस्करण प्रकाशित किए हैं। कुछ कहते हैं कि उन्होंने मसाले बदल दिए, कुछ कहते हैं कि उन्होंने खाना पकाने का तापमान थोड़ा बदल दिया, और कुछ दावा करते हैं कि उन्होंने सामग्री को मिलाने का एक बिल्कुल नया तरीका खोज लिया है।

बड़ा सवाल यह है: क्या ये वास्तव में अलग रेसिपी हैं, या ये सिर्फ अलग नामों वाले एक ही व्यंजन हैं?

यह पेपर Opal नामक एक टूल पेश करता है (इसे एक "रेसिपी ट्रांसलेटर" या "फ्लेवर फिंगरप्रिंट स्कैनर" के रूप में सोचें) जो ठीक इसी सवाल का जवाब देने के लिए बनाया गया है, जो RLHF (मानवीय फीडबैक से सुदृढीकरण सीखना) नामक AI प्रशिक्षण विधियों पर लागू होता है।

यहाँ इस पेपर के निष्कर्षों का विवरण दिया गया, सरल उपमाओं का उपयोग करते हुए:

1. समस्या: बहुत सारे नाम, एक जैसा स्वाद

AI की दुनिया में, शोधकर्ताओं ने AI मॉडल को मानवीय प्राथमिकताओं का पालन करना सिखाने के तरीके के दर्जनों अलग-अलग प्रस्ताव दिए हैं। वे उन्हें DPO, SPPO, SimPO और GRPO जैसे फैंसी नाम देते हैं। प्रत्येक पेपर दावा करता है कि उनकी विधि एक "ब्रेकथ्रू" या "स्पष्ट रूप से बेहतर" है।

लेखकों ने सोचा: क्या ये वास्तव में अलग गणितीय लक्ष्य हैं, या ये केवल अलग भाषाओं में लिखा गया एक ही लक्ष्य है?

2. समाधान: Opal (द ट्रांसलेटर)

लेखकों ने Opal नामक एक एल्गोरिदम बनाया है। आप Opal को एक ऐसी मशीन के रूप में सोच सकते हैं जो दो अलग-अलग रेसिपी (गणितीय सूत्रों) को लेती है और उन्हें एक एकल, मानक "कैनोनिकल" भाषा में अनुवाद करने की कोशिश करती है।

  • यदि रेसिपी एक ही मानक भाषा में अनुवादित होती हैं: तो Opal कहता है, "ये एक ही हैं।" यह उन्हें एक ही "फिंगरप्रिंट" (एक हैश कोड) देता है।
  • यदि वे एक ही भाषा में अनुवादित नहीं हो सकतीं: तो Opal एक "विटनेस" (गवाह) प्रदान करता है। यह एक ठोस उदाहरण की तरह है जो दिखाता है कि वे क्यों अलग हैं। उदाहरण के लिए, "रेसिपी A में, यदि आप नमक डालते हैं, तो यह नमकीन लगता है। रेसिपी B में, नमक डालने से यह इस पर निर्भर करता है कि बर्तन में और क्या है, मीठा हो जाता है।"

3. बड़ी खोज: कई "नए" तरीके वास्तव में पुराने तरीकों का भेष बदलकर आए हैं

जब लेखकों ने 33 अलग-अलग विधियों पर Opal चलाया, तो उन्हें कुछ आश्चर्यजनक पता चला:

  • "DPO" परिवार: दस अलग-अलग विधियाँ (SPPO और Nash-MD सहित) प्रसिद्ध DPO विधि के बीजगणितीय रूप से समान (algebraically identical) निकलीं।

    • उपमा: यह ऐसा है जैसे कोई "थर्मल फेज ट्रांजिशन" कहकर पानी उबालने का एक नया तरीका होने का दावा करे। यह वही उबलता हुआ पानी है, बस एक फैंसी नाम के साथ।
    • परिणाम: DPO से SPPO पर स्विच करने से वास्तव में उस लक्ष्य में कोई बदलाव नहीं आता जिसे AI प्राप्त करने की कोशिश कर रहा है; यह केवल यह बदल देता है कि गणित कैसे लिखा जाता है।
  • "असली" नवाचार: केवल कुछ ही विधियाँ वास्तव में अलग थीं।

    • GRPO (द बैच इफेक्ट): इस विधि का उपयोग प्रसिद्ध DeepSeek-R1 मॉडल द्वारा किया जाता है। Opal ने सिद्ध किया कि यह DPO से मौलिक रूप से भिन्न है।
      • उपमा: कल्पना कीजिए कि आप छात्रों को ग्रेड दे रहे हैं। मानक विधि (DPO) में, आप छात्र A को केवल उनके अपने टेस्ट स्कोर के आधार पर ग्रेड देते हैं। GRPO में, आप छात्र A को इस आधार पर ग्रेड देते हैं कि उन्होंने उस दिन कमरे में मौजूद अन्य छात्रों की तुलना में कैसा प्रदर्शन किया। यदि आप कमरे में एक जीनियस रखते हैं, तो छात्र A खराब दिखता है। यदि आप कमरे में एक संघर्ष कर रहे छात्र को रखते हैं, तो छात्र A बेहतर दिखता है। "बैच" के छात्रों के बदलने से ग्रेड बदल जाता है। Opal ने सिद्ध किया कि यह "बैच डिपेंडेंस" GRPO को एक पूरी तरह से अलग चीज़ बनाता है।
    • KTO और अन्य: ये विधियाँ "जीत" और "हार" के साथ अलग तरह से व्यवहार करती हैं (जैसे एक जुआरी जो जीतने के आनंद से अधिक हारने के डर से ग्रस्त होता है)। यह विषमता उन्हें संरचनात्मक रूप से अद्वितीय बनाती है।

4. असली अंतर के लिए चार "गुप्त सामग्रियां"

पेपर पहचान करता है कि किसी विधि को वास्तव में नया (और केवल एक पुनरावृत्ति नहीं) होने के लिए, उसे चार नियमों में से एक को तोड़ना चाहिए। यदि यह एक नियम को नहीं तोड़ता है, तो यह संभवतः पुराने तरीके का ही एक रूप है।

  1. ग्रुप नॉर्मलाइजेशन (Group Normalization): समूह में दूसरों के आधार पर स्कोर बदलना (जैसे GRPO)।
  2. पेयर-डिपेंडेंट वेटिंग (Pair-Dependent Weighting): विशिष्ट उत्तरों के साथ उनके अद्वितीय गुणों के आधार पर अलग व्यवहार करना (जैसे KTO)।
  3. टोकन-लेवल स्ट्रक्चर (Token-Level Structure): पूरे वाक्य के बजाय AI के उत्तर को शब्द-दर-शब्द देखना।
  4. ट्रैजेक्टरी-लेवल (Trajectory-Level): AI द्वारा लिए गए निर्णयों के पूरे पथ को देखना, न कि केवल अंतिम उत्तर को।

5. अभ्यासकर्ताओं (Practitioners) के लिए इसका क्या अर्थ है

यदि आप एक इंजीनियर के रूप में कोई विधि चुनने की कोशिश कर रहे हैं:

  • नामों से धोखा न खाएं। यदि आप एक नई विधि देखते हैं जो DPO जैसी दिखती है लेकिन उसका विवरण फैंसी है, तो वह केवल टक्सीडो पहने हुए DPO हो सकती है।
  • "बैच" की जांच करें। यदि कोई विधि अपना व्यवहार इस आधार पर बदलती है कि प्रशिक्षण बैच में अन्य उदाहरण कौन से हैं, तो वह कुछ अनूठा कर रही है (जैसे GRPO)।
  • लक्ष्य वही है। भले ही गणित अलग दिखता हो, यदि Opal कहता है कि वे समान हैं, तो वे एक ही "परफेक्ट" AI व्यवहार को लक्षित करेंगे। हालांकि, वे अलग गति या अलग स्थिरता के साथ वहां तक पहुँच सकते हैं।

सारांश

यह पेपर AI क्षेत्र के लिए एक "रियलिटी चेक" है। यह फैंसी शब्दावली को हटाने के लिए एक गणितीय उपकरण (Opal) का उपयोग करता है और दिखाता है कि हाल के अधिकांश "नए" तरीके वास्तव में एक ही पुराने उद्देश्यों के अलग-अलग रूप हैं। वास्तविक नवाचार तभी होता है जब आप मौलिक रूप से बदलते हैं कि AI उत्तरों की तुलना कैसे करता है (जैसे पूरे समूह या पूरे पथ को देखना), न कि केवल तब जब आप बीजगणित को फिर से व्यवस्थित करते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →