← नवीनतम पेपर
🤖 machine learning

Multi-Objective Preference Optimization: Improving Human Alignment of Generative Models

यह शोध पत्र मल्टी-ऑब्जेक्टिव प्रिफरेंस ऑप्टिमाइज़ेशन (MOPO) को प्रस्तुत करता है, जो एक कंस्ट्रेंड KL-रेगुलराइज्ड फ्रेमवर्क है जो जनरेटिव मॉडल्स को कई, अक्सर परस्पर विरोधी मानवीय उद्देश्यों के साथ संरेखित करता है, जो एक प्राथमिक लक्ष्य को अधिकतम करते हुए माध्यमिक उद्देश्यों पर सुरक्षा थ्रेशोल्ड लागू करता है, जिससे स्केलरलाइज्ड रिवार्ड्स पर निर्भर किए बिना पारेटो-ऑप्टिमल प्रदर्शन प्राप्त किया जाता है।

मूल लेखक: Akhil Agnihotri, Rahul Jain, Deepak Ramachandran, Zheng Wen

प्रकाशित 2026-06-08
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Akhil Agnihotri, Rahul Jain, Deepak Ramachandran, Zheng Wen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक व्यक्तिगत सहायक (personal assistant) रख रहे हैं। आपके पास चीजों की एक लंबी सूची है जिनमें वे अच्छे होने चाहिए: उन्हें सहायक (सही उत्तर देना) होना चाहिए, हानिरहित (कुछ भी अभद्र या खतरनाक नहीं कहना) होना चाहिए, संक्षिप्त (बड़बड़ाना नहीं) होना चाहिए, और मज़ेदार (चीजों को हल्का बनाए रखना) होना चाहिए।

अतीत में, AI सहायकों को प्रशिक्षित करते समय, शोधकर्ताओं ने इन सभी इच्छाओं को एक एकल "स्कोर" में संयोजित करने की कोशिश की: वे कहते थे, "सहायकता 60% गिनी जाएगी और हानिरहितता 40%।" फिर AI उस एकल संख्या को अधिकतम करने की कोशिश करता था।

समस्या:
यह शोध पत्र तर्क देता है कि यह "एकल स्कोर" वाला दृष्टिकोण त्रुटिपूर्ण है। यह एक नए घर के लिए आदर्श स्थान खोजने के लिए केवल "काम से दूरी" और "समुद्र तट से दूरी" के औसत को देखने जैसा है। यदि आप उस स्थान को चुनते हैं जिसमें सबसे अच्छा औसत है, तो आप दोनों से 50 मील दूर हो सकते हैं। आप उन स्थानों को चूक जाते हैं जो एक चीज़ में बहुत अच्छे और दूसरी में ठीक-ठाक हैं। वास्तविक दुनिया में, मनुष्यों की जटिल, कभी-कभी परस्पर विरोधी प्राथमिकताएं होती हैं, और एक एकल संख्या "सहायक होने, लेकिन कभी भी हानिकारक न होने" की सूक्ष्मता को नहीं पकड़ सकती।

समाधान: MOPO
लेखक एक नई विधि पेश करते हैं जिसे MOPO (Multi-Objective Preference Optimization) कहा जाता है। सभी लक्ष्यों को एक एकल स्कोर में मिलाने के बजाय, MOPO उन्हें अलग-अलग उद्देश्यों के रूप में मानता है जिन्हें एक साथ संतुलित करने की आवश्यकता है।

यहाँ बताया गया है कि MOPO कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए:

1. "प्राथमिक लक्ष्य" और "सुरक्षा जाल"

MOPO को एक सख्त प्रबंधक के रूप में सोचें जिसके पास एक विशिष्ट रणनीति है:

  • प्राथमिक उद्देश्य: "अधिकतम सहायता प्रदान करें।" AI को जितना संभव हो सके उतना सहायक होने के लिए कहा जाता है।
  • द्वितीयक उद्देश्य (सुरक्षा जाल): "लेकिन, आपको हानिरहितता और हास्य के लिए एक निश्चित रेखा से ऊपर रहना होगा।"

AI को एक आदर्श मध्य मार्ग खोजने के लिए कहने के बजाय, MOPO कहता है: "सहायता करने में जितना हो सके आगे बढ़ें, लेकिन हानिरहितता के पैमाने पर इस लाल रेखा को पार न करें।" यदि AI बहुत अधिक सहायक हो जाता है लेकिन अभद्र होने लगता है, तो उसे दंडित किया जाता है। यदि वह सुरक्षित है लेकिन बेकार है, तो उसे दंडित किया जाता है।

2. "पारेटो फ्रंटियर" (कुशल सीमा)

लेखक "पारेटो फ्रंट" खोजने के बारे में बात करते हैं। कल्पना कीजिए कि एक ग्राफ है जहाँ X-अक्ष "सहायकता" है और Y-अक्ष "हानिरहितता" है।

  • पुराना तरीका: AI एक निश्चित रेसिपी (जैसे 50/50) के आधार पर इस ग्राफ पर एक विशिष्ट बिंदु चुनता है। यह उस स्थान को छोड़ सकता है जो 90% सहायक और 80% हानिरहित है क्योंकि वह स्थान 50/50 की रेसिपी में फिट नहीं बैठता था।
  • MOPO का तरीका: MOPO उस वक्र किनारे (curved edge) को खोजता है जहाँ आप बिना कम हानिरहित हुए अधिक सहायक नहीं हो सकते। यह वक्र "पारेटो फ्रंट" है। MOPO हमें इस वक्र पर फिसलने की अनुमति देता है, जिससे हम बिना AI को फिर से प्रशिक्षित किए किसी भी स्थिति के लिए सर्वोत्तम संतुलन पा सकते हैं।

3. यह कैसे सीखता है (एक "स्वाद परीक्षण")

आमतौर पर, AI इस तरह सीखता है कि, "यह उत्तर अच्छा है, वह वाला बुरा है।"

  • पुरानी विधियाँ: वे अक्सर पहले हर उत्तर के लिए एक विशिष्ट "रिवॉर्ड स्कोर" का अनुमान लगाने की कोशिश करती हैं, फिर उस स्कोर से सीखते हैं। यह किसी भोजन का स्वाद लेने से पहले उसकी सटीक कैलोरी गणना का अनुमान लगाने जैसा है।
  • MOPO: यह कैलोरी गणना को छोड़ देता है। यह सीधे जोड़ेवार प्राथमिकताओं (pairwise preferences) को देखता है। यह पूछता है: "इन दो उत्तरों को देखते हुए, कौन सा सहायकता के लिए बेहतर है? कौन सा हानिरहितता के लिए बेहतर है?" यह पूरे भोजन का प्रतिनिधित्व करने के लिए एक एकल संख्या आविष्कार करने के बिना सीधे इन तुलनाओं से सीखता है।

4. "लोअर बाउंड" (निचली सीमा) का तरीका

पेपर के प्रमुख नवाचारों में से एक यह है कि यह "सुरक्षा जाल" को कैसे संभालता है।

  • नाइव (Naive) दृष्टिकोण: "सुनिश्चित करें कि AI हानिरहित है।" (इसे सटीक रूप से परिभाषित करना कठिन है)।
  • MOPO का दृष्टिकोण: "सुनिश्चित करें कि AI का प्रदर्शन हानिरहितता पर कम से कम इतना उच्च है।"
    शोध पत्र एक गणितीय ट्रिक का उपयोग करता है जो AI के प्रदर्शन के "सबसे खराब मामले" (worst-case scenario) का अनुमान लगाता है। यह अनिवार्य रूप से पूछता है, "इस AI के हानिरहितता का निम्नतम स्तर क्या हो सकता है?" और सुनिश्चित करता है कि वह निम्नतम स्तर भी सुरक्षा रेखा से ऊपर रहे। यह AI को मजबूत बनाता; यह किसी अजीब मामले के कारण अनजाने में हानिकारक होने की ओर नहीं फिसलेगा।

शोध पत्र ने क्या पाया

लेखकों ने इसे सिंथेटिक डेटा (बनाए गए गणित के सवाल) और वास्तविक दुनिया के टेक्स्ट जनरेशन कार्यों (जैसे रेडिट पोस्ट का सारांश देना या सवालों के जवाब देना) पर परखा।

  • गणित की समस्याओं पर: MOPO ने सफलतापूर्वक उन "परफेक्ट बैलेंस" बिंदुओं (पारेटो फ्रंट) को खोजा जिन्हें अन्य तरीकों ने छोड़ दिया था।
  • वास्तविक AI मॉडल पर: जब उन्होंने बड़े भाषा मॉडल (जैसे 7-बिलियन पैरामीटर वाले मॉडल) पर MOPO लागू किया, तो परिणामी AI पिछले तरीकों की तुलना में कई लक्ष्यों को संतुलित करने में बेहतर था। इसने सुरक्षा से समझौता किए बिना उच्च सहायता स्कोर प्राप्त किया, और इसने यह सब अन्य तकनीकों की तुलना में अधिक स्थिरता के साथ किया।

सारांश

संक्षेप में, शोध पत्र कहता है: सभी मानवीय प्राथमिकताओं को एक एकल संख्या में उबालने की कोशिश करना बंद करें। इसके बजाय, एक ऐसी विधि (MOPO) का उपयोग करें जो AI को उसके मुख्य काम में जितना संभव हो सके उतना अच्छा होने के लिए प्रेरित करती है, जबकि उसके अन्य सभी कर्तव्यों के लिए एक सख्त "सुरक्षा फर्श" लागू करती है। यह एक ऐसा AI बनाता है जो अधिक लचीला, सुरक्षित और मानव की जटिल, बहु-आयामी सोच के साथ बेहतर ढंग से संरेखित (aligned) है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →