← नवीनतम पेपर
🤖 AI

Distributionally Robust Listwise Preference Optimization

यह शोध पत्र एक प्लैकेट-लूस (Plackett-Luce) उद्देश्य पर आधारित एक सुलभ, वितरण रूप से सुदृढ़ (distributionally robust) लिस्टवाइज प्रेफरेंस ऑप्टिमाइज़ेशन फ्रेमवर्क प्रस्तावित करता है जो सबसे खराब स्थिति के सुधार (worst-case correction) को O(KlogK)O(K\log K) जटिलता तक कम करके रैंकिंग-लेबल अनिश्चितता को कुशलतापूर्वक संभालता है, जिससे ऑफलाइन और ऑनलाइन दोनों भाषा मॉडल संरेखण (language model alignment) में मजबूती और प्रदर्शन में सुधार होता है।

मूल लेखक: Xudong Wu, Jian Qian, Pangpang Liu, Vaneet Aggarwal, Jiayu Chen

प्रकाशित 2026-07-03
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xudong Wu, Jian Qian, Pangpang Liu, Vaneet Aggarwal, Jiayu Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कहानियाँ, कविताएँ या कोड लिखना सिखा रहे हैं। इसे अच्छी तरह से करने के लिए, आपको इसे उदाहरण दिखाने होंगे कि इंसान क्या पसंद करते हैं। आमतौर पर, आप रोबोट को दो विकल्प दिखाते हैं: "कहानी A" और "कहानी B," और इंसान कहता है, "मुझे A ज्यादा पसंद है।" इसे पेयरवाइज़ (pairwise) लर्निंग कहा जाता है।

लेकिन वास्तविक दुनिया में, इंसानों को अक्सर विकल्पों की एक पूरी सूची (कहानी A, B, C और D) में से चुनना पड़ता है, और वे उन्हें रैंक भी कर सकते हैं। कभी-कभी, यह रैंकिंग अव्यवस्थित होती है। हो सकता है कि इंसान थक गया हो, शायद कहानियाँ बहुत समान हों, या शायद मूल्यांकन करने वाले टूल ने गलतियाँ की हों। यह लिस्टवाइज़ (listwise) लर्निंग है जिसमें नॉइज़ी लेबल्स (noisy labels) हैं।

यह पेपर रोबोट को सिखाने का एक नया तरीका पेश करता है जो विशेष रूप से इस अव्यवस्था को बिना भ्रमित हुए संभालने के लिए डिज़ाइन किया गया है। यहाँ सरल उपमाओं का उपयोग करके इसका विवरण दिया गया है:

1. समस्या: "भ्रमित जज"

अधिकांश वर्तमान तरीके यह मान लेते हैं कि जज (इंसान या रिवॉर्ड मॉडल) एकदम सटीक है। यदि जज कहता है कि "A, B से बेहतर है," तो रोबोट इस पर 100% विश्वास कर लेता है।

लेकिन क्या होगा यदि जज असंगत हो?

  • "निकट-टाई" (Near-Tie) की समस्या: दो कहानियाँ इतनी समान हैं कि जज यह तय करने के लिए सिक्का उछालता है कि कौन सी बेहतर है।
  • "टॉप-रैंक" (Top-Rank) की समस्या: जज गलती से एक बहुत ही खराब कहानी को सूची में सबसे ऊपर रख देता है।
  • "नॉइज़" (Noise) की समस्या: गुणवत्ता मापने वाला टूल रैंडम गलतियाँ करता है।

यदि रोबोट इन शोर वाली सूचियों से आँख मूंदकर सीखता है, तो वह गलत सबक सीख सकता है।

2. समाधान: "सेफ्टी नेट" दृष्टिकोण

लेखक एक विधि प्रस्तावित करते हैं जिसे डिस्ट्रिब्यूशनली रोबस्ट लिस्टवाइज़ प्रेफरेंस ऑप्टिमाइज़ेशन (Distributionally Robust Listwise Preference Optimization) कहा जाता है। आइए इसे तोड़ते हैं:

  • लिस्टवाइज़ (Listwise): केवल जोड़ों (A बनाम B) को देखने के बजाय, रोबルト पूरी सूची (A, B, C, D) को एक साथ देखता है।
  • रोबस्ट (Robust): रोबोट यह मान लेता है कि जज गलत हो सकता है। यह केवल उस रैंकिंग से नहीं सीखता जो उसे बताई गई है; बल्कि यह पूछता है, "क्या होगा अगर जज ने गलती की हो? सबसे खराब संभव रैंकिंग क्या हो सकती थी जिसका उन्होंने अर्थ निकाला होगा?"

उपमा: सख्त कोच
कल्पना कीजिए कि एक स्पोर्ट्स कोच खिलाड़ी को प्रशिक्षित कर रहा है।

  • पुराना तरीका: कोच कहता है, "तुमने यह दौड़ 10 सेकंड में पूरी की।" खिलाड़ी ठीक 10 सेकंड का लक्ष्य रखने के लिए प्रशिक्षण लेता है। यदि स्टॉपवॉच खराब थी और समय वास्तव में 12 सेकंड था, तो खिलाड़ी अब भ्रमित है।
  • इस पेपर का तरीका: कोच कहता है, "तुमने यह दौड़ पूरी की। स्टॉपवॉच ने 10 सेकंड दिखाया, लेकिन यह खराब भी हो सकती है। आइए सबसे खराब स्थिति मान लें: शायद तुमने वास्तव में 12 सेकंड में दौड़ पूरी की। आइए तुम्हें 12 सेकंड के लिए भी अच्छा बनने के लिए प्रशिक्षित करें।"

"सबसे खराब" परिदृश्य (सबसे अधिक भ्रमित करने वाली या शोर वाली रैंकिंग) के लिए प्रशिक्षण देकर, रोबोट बहुत अधिक स्थिर हो जाता है। यदि जज वास्तव में सही था, तो भी रोबोट अच्छा प्रदर्शन करेगा। यदि जज गलत था, तो रोबोट क्रैश नहीं होगा; वह बस थोड़ा कम पूर्ण प्रदर्शन करेगा लेकिन विश्वसनीय बना रहेगा।

3. जादुई ट्रिक: अनुमान लगाना नहीं, सॉर्ट करना

आप सोच सकते हैं, "यदि 4 कहानियाँ हैं, तो उन्हें रैंक करने के 24 अलग-अलग तरीके हैं (4x3x2x1)। 'सबसे खराब' को खोजने के लिए हर संभावना की जाँच करना बहुत समय लेगा।"

पेपर का सबसे बड़ा ब्रेकथ्रू एक गणितीय शॉर्टकट है।
उन्होंने खोजा कि "सबसे खराब" रैंकिंग (जो रोबोट को सबसे अधिक नुकसान पहुँचाएगी) को खोजने के लिए, आपको सभी 24 संभावनाओं की जाँच करने की आवश्यकता नहीं है। आपको बस रोबोट के वर्तमान स्कोर को उल्टे क्रम में सॉर्ट (sort) करने की आवश्यकता है।

  • उपमा: कल्पना कीजिए कि आपके पास ताश की एक गड्डी है। आप जानना चाहते हैं कि सबसे खराब हाथ (hand) कौन सा हो सकता है। पूरे डेक को लाखों बार फेंटकर सबसे खराब हाथ खोजने के बजाय, आप बस अपने पास मौजूद कार्डों को देखते हैं, उन्हें सबसे कम से सबसे अधिक के क्रम में सॉर्ट करते हैं, और महसूस करते हैं: "ओह, सबसे खराब हाथ वही है जहाँ सबसे कम कार्ड पहले चुने जाते हैं।"
  • परिणाम: यह एक ऐसे कार्य को जो अनंत समय ले सकता था (लाखों संयोजनों की जाँच करना) को एक ऐसे कार्य में बदल देता है जो एक सेकंड के एक अंश में पूरा हो जाता है (केवल एक सूची को सॉर्ट करना)। यह इस पद्धति को वास्तविक कंप्यूटरों पर उपयोग करने के लिए पर्याप्त तेज़ बनाता है।

4. परिणाम: मजबूत और स्मार्ट

लेखकों ने इसे दो तरीकों से परखा:

  • ऑफलाइन (लाइब्रेरी टेस्ट): उन्होंने रैंकिंग के एक डेटासेट को लिया और जानबूझकर उन्हें गड़बड़ कर दिया (शीर्ष कहानी को एक खराब कहानी के साथ बदल दिया, या समान कहानियों को आपस में बदल दिया)।
    • परिणाम: जब लेबल साफ थे, तो उनकी विधि पुराने तरीकों की तरह ही अच्छी तरह काम करती थी। जब लेबल अव्यवस्थित थे, तो उनकी विधि शोर को अनदेखा करने और सही चीज़ सीखने में बहुत बेहतर थी।
  • ऑनलाइन (लाइव प्रैक्टिस): उन्होंने रोबोट को अपनी कहानियाँ बनाने दी और एक "रिवॉर्ड मॉडल" (एक AI जज) को उन्हें रैंक करने के लिए कहा।
    • परिणाम: जब कहानियों की सूची बड़ी होती गई (विकल्प चुनने के लिए अधिक विकल्प), तो "रिवॉर्ड मॉडल" (जज) अधिक गलतियाँ करने लगा क्योंकि वह अभिभूत हो गया था। पुराने तरीके इस भ्रम से परेशान हो गए। नया "रोबस्ट" तरीका बड़ी सूचियों को बहुत बेहतर तरीके से संभालता है, जिससे एक स्मार्ट रोबोट तैयार होता है।

सारांश

यह पेपर AI को एक सेफ्टी नेट देता है। विकल्पों की रैंकिंग पर आँख मूंदकर भरोसा करने के बजाय, AI यह मान लेता है कि रैंकिंग थोड़ी गलत हो सकती है। यह एक साधारण सॉर्टिंग ट्रिक का उपयोग करके उस रैंकिंग के "सबसे खराब-मामले" (worst-case) संस्करण की गणना करता है, और उस सबसे खराब मामले में भी अच्छा बनने के लिए प्रशिक्षित होता है। यह AI को विश्वसनीय बनाता है जब डेटा अव्यवस्थित होता है, बिना इसकी गति को धीमा किए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →