← नवीनतम पेपर
💬 NLP

DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory

यह शोध पत्र डायरेक्ट प्रेफरेंस ऑप्टिमाइजेशन (DPO) और मानव चयन सिद्धांत के बीच के संबंध को मानदण्डिक मॉडलों (normative models) को पुनर्गठित करके सामान्यीकृत करता है ताकि एक व्यापक ढांचा तैयार किया जा सके जो गैर-उत्तल नुकसानों (non-convex losses) का समर्थन करता है, विविध विश्लेषणात्मक विकल्पों को समाहित करता है, और विभिन्न DPO विस्तारों को सुरक्षित करता है।

मूल लेखक: Wenxuan Zhou, Shujian Zhang, Brice Magdalou, John Lambert, Ehsan Amid, Richard Nock, Andrew Hard

प्रकाशित 2026-02-05
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wenxuan Zhou, Shujian Zhang, Brice Magdalou, John Lambert, Ehsan Amid, Richard Nock, Andrew Hard

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को ऐसी कहानियाँ लिखना सिखा रहे हैं जिन्हें इंसान वास्तव में पसंद करें। आर्टिफिशियल इंटेलिजेंस की दुनिया में, इसे अक्सर DPO (डायरेक्ट प्रेफरेंस ऑप्टिमाइज़ेशन) नामक एक विधि का उपयोग करके किया जाता है। DPO को एक बहुत ही चतुर शॉर्टकट के रूप में समझें। इसके बजाय कि रोबोट से यह पूछा जाए, "आपको यह कहानी कितनी पसंद आई?" (जिसे मापना कठिन है), यह सीधे पूछता है, "क्या आप कहानी A को पसंद करेंगे या कहानी B को?" और उस चुनाव के आधार पर रोबोट के मस्तिष्क को समायोजित करता है।

लंबे समय तक, वैज्ञानिकों का मानना था कि यह शॉर्टकट एक विशिष्ट, कठोर नियम पुस्तिका (जिसे ब्रैडली-टेरी-ल्यूस मॉडल कहा जाता है) के कारण काम करता है। उन्हें लगा कि रोबोट की "पसंद" और "रोबोट को सिखाने के लिए उपयोग किया जाने वाला गणित" एक ताले और उसकी विशिष्ट चाबी की तरह एक साथ जुड़े हुए हैं। यदि आप गणित बदलना चाहते थे, तो आपको मानव पसंद के बारे में नियम पुस्तिका भी बदलनी पड़ती थी, और इसके विपरीत भी।

बड़ी खोज
यह शोध पत्र, जिसका शीर्षक "DPO Unchained" है, यह तर्क देता है कि लॉक-एंड-की (ताला-चाबी) वाला यह विचार एक गलतफहमी है। लेखक दावा करते हैं कि रोबोट का प्रशिक्षण गणित और मानव पसंद की नियम पुस्तिका वास्तव में गुप्त रूप से अलग-अलग हैं। वे दो अलग-अलग उपकरण हैं जो संयोग से एक साथ अच्छी तरह काम करते हैं, लेकिन उन्हें एक साथ बंधा हुआ नहीं होना चाहिए।

यहाँ उनके निष्कर्षों का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

1. "स्विस आर्मी नाइफ" बनाम "एकल-उपयोग वाला उपकरण"

पहले, शोधकर्ताओं को लगता था कि DPO एक स्विस आर्मी नाइफ की तरह है जहाँ ब्लेड (गणित) और हैंडल (मानव पसंद का सिद्धांत) आपस में जुड़े हुए हैं। आप हैंडल को तोड़े बिना ब्लेड नहीं बदल सकते।

लेखक दिखाते हैं कि Dो DPO वास्तव में एक मॉड्यूलर टूलबॉक्स की तरह है। आप "हैंडल" (विकल्पों के बीच चयन करने के सिद्धांत) और "ब्लेड" (रोबोट को सिखाने के लिए उपयोग किए जाने वाले गणितीय सूत्र) को ले सकते हैं और उन्हें आपस में मिला सकते हैं।

  • हैंडल: आप मानव पसंद का एक बहुत ही सरल सिद्धांत उपयोग कर सकते हैं, या एक जटिल सिद्धांत जो लोगों को "मुझे नहीं पता" कहने या "मैं इससे परहेज करता हूँ" कहने की अनुमति देता है (जो पुराने मॉडल में संभव नहीं था)।
  • ब्लेड: आप रोबोट को सिखाने के लिए विभिन्न गणितीय सूत्रों का उपयोग कर सकते हैं।

2. "कॉन्वेक्सिटी" (Convexity) के नियम को तोड़ना

गणित की दुनिया में, "कॉन्वेक्सिटी" नामक एक नियम है। एक कटोरे के आकार की कल्पना करें। यदि आप एक कटोरे के अंदर एक गेंद लुढ़काते हैं, तो वह हमेशा नीचे (सबसे अच्छे उत्तर) की ओर जाती है। अधिकांश वर्तमान AI प्रशिक्षण विधियाँ गणित को एक आदर्श कटोरे जैसा बनाने के लिए मजबूर करती हैं क्योंकि यह सुरक्षित और आसान होता है।

लेखकों ने खोजा कि आपको एक आदर्श कटोरे की आवश्यकता नहीं है। आप "ऊबड़-खाबड़" या "नॉन-कॉन्वेक्स" आकृतियों (जैसे एक ऊबड़-खाबड़ पहाड़ी परिदृश्य) का उपयोग कर सकते हैं ताकि रोबोट को प्रशिक्षित किया जा सके।

  • यह क्यों मायने रखता है: कभी-कभी, एक ऊबड़-खाबड़ परिदृश्य में एक छिपा हुआ गड्ढा होता है जो आदर्श कटोरे के तल से भी अधिक गहरा (बेहतर) होता है। इन "ऊबड़-खाबड़" गणितीय आकृतियों का उपयोग करके, रोबोट कहानियाँ लिखने के बेहतर तरीके सीख सकता है, भले ही इसकी गणना करना कठिन हो।

3. "जादुई गोंद" (The Triptych)

यह शोध पत्र एक ढांचा (जिसे KLST* कहा जाता है) पेश करता है जो एक सार्वभौमिक एडेप्टर (universal adapter) के रूप में कार्य करता है। यह साबित करता है कि आप चाहे किसी भी "मानव पसंद के सिद्धांत" को चुनें, और आप चाहे किसी भी "गणितीय सूत्र" को चुनें, उन्हें एक साथ जोड़ने का एक तरीका है ताकि वे पूरी तरह से काम करें।

  • पुराना तरीका: "मुझे सूत्र A का उपयोग करना चाहिए क्योंकि यह केवल पसंद सिद्धांत A के साथ काम करता है।"
  • नया तरीका: "मैं पसंद सिद्धांत B के साथ सूत्र A का उपयोग कर सकता हूँ, या पसंद सिद्धांत D के साथ सूत्र C का उपयोग कर सकता हूँ। वे सभी संगत (compatible) हैं।"

4. "एड-ऑन्स" (Add-ons) के बारे में क्या?

कई शोधकर्ताओं ने DPO में छोटे सुधार जोड़कर इसे बेहतर बनाने की कोशिश की है, जैसे कि छोटे उत्तरों के लिए "बोनस" देना या "होम फील्ड एडवांटेज" (पहले विकल्प को पसंद करना क्योंकि वह पहले सूचीबद्ध है) के लिए समायोजन करना।
लेखक दिखाते हैं कि उनका नया ढांचा स्वाभाविक रूप से इन सभी मौजूदा सुधारों का समर्थन करता है। यह ऐसा है जैसे यह पता चलना कि घर की नींव इतनी मजबूत है कि यह बिना पूरे घर को दोबारा बनाए बिना आपके द्वारा जोड़ा जाने वाला कोई भी नया कमरा सहारा दे सकती है।

5. एक छोटा प्रयोग

यह साबित करने के लिए कि यह केवल सिद्धांत नहीं है, लेखों ने एक छोटा परीक्षण चलाया। उन्होंने मानक "चिकने कटोरे" के आकार के बजाय एक "ऊबड़-खाबड़" (non-convex) गणितीय सूत्र का उपयोग किया।

  • परिणाम: "ऊबड़-खाबड़" गणित के साथ प्रशिक्षित रोबोट ने मानक पद्धति के मुकाबले आमने-सामने के परीक्षण में बेहतर प्रदर्शन किया। यह सुझाव देता है कि "ऊबड़-खाबड़" रास्ता वास्तव में एक छिपा हुआ खजाना था जिसे पुराने नियमों ने मिस कर दिया था।

सारांश

शोध पत्र का दावा है कि "डायरेक्ट प्रेफरेंस ऑप्टिमाइज़ेशन" एल्गोरिदम हमारी सोच से कहीं अधिक लचीला है।

  1. स्वतंत्रता: आप विभिन्न गणितीय सूत्रों को मानव पसंद के विभिन्न सिद्धांतों के साथ मिला और जोड़ सकते हैं।
  2. सुरक्षा: आपको "सुरक्षित, चिकने" गणित से चिपके रहने की आवश्यकता नहीं है; आप जटिल, "ऊबड़-खाबड़" गणित का उपयोग कर सकते हैं जो बेहतर परिणाम दे सकता है।
  3. अनुकूलता: DPO में सभी हालिया सुधार (जैसे लंबाई सुधार) इस नए, व्यापक दृष्टिकोण में स्वाभाविक रूप से फिट होते हैं।

संक्षेप में, लेखकों ने एल्गोरिदम को "अनचेन्ड" (मुक्त) कर दिया है, यह दिखाते हुए कि यह पहले की तुलना में बहुत अधिक व्यापक और लचीले आधार पर बना है, जिससे AI को प्रशिक्षित करने के नए और संभावित रूप से बेहतर तरीके संभव हो गए हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →