← नवीनतम पेपर
💬 NLP

Meet Dynamic Individual Preferences: Resolving Conflicting Human Value with Paired Fine-Tuning

यह शोध पत्र प्रिफरेंस-पेयर्ड फाइन-ट्यूनिंग (PFT) पेश करता है, जो एक नवीन ढांचा और इसके साथ वाला वैल्यू कॉन्फ्लिक्ट डिलेमा (VCD) डेटासेट है, जिसे बड़े भाषा मॉडलों को गतिशील और परस्पर विरोधी व्यक्तिगत मानवीय प्राथमिकताओं के साथ संरेखित करने के लिए डिज़ाइन किया गया है, जो वर्गीकरण और पीढ़ी दोनों कार्यों में DPO और SFT जैसी मौजूदा विधियों की तुलना में बेहतर प्रदर्शन प्रदर्शित करता है।

मूल लेखक: Shanyong Wang, Shuhang Lin, Yining Zhao, Xi Zhu, Yongfeng Zhang

प्रकाशित 2026-04-15
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shanyong Wang, Shuhang Lin, Yining Zhao, Xi Zhu, Yongfeng Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Meet Dynamic Individual Preferences: Resolving Conflicting Human Value with Paired Fine-Tuning" पेपर का सरल अवधारणाओं और रचनात्मक उपमाओं के साथ विवरण दिया गया है।

बड़ी समस्या: "एक ही आकार सबके लिए" (One-Size-Fits-All) वाला AI

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट पर्सनल असिस्टेंट (एक AI) है। वर्तमान में, अधिकांश AI को "सामान्य रूप से अच्छा" होने के लिए प्रशिक्षित किया जाता है। वे जानते हैं कि ईमानदारी अच्छी है, दयालु होना अच्छा है, और सुरक्षित रहना अच्छा है। वे एक सार्व्वत्रिक लाइब्रेरियन (Universal Librarian) की तरह व्यवहार करते हैं जो हर किसी को एक ही मानक उत्तर देता है।

लेकिन असली इंसान जटिल और उलझे हुए होते हैं।

  • विविधता (Diversity): आपको शायद तीखा खाना पसंद हो, जबकि आपके दोस्त को यह बिल्कुल पसंद न हो।
  • गतिशील परिवर्तन (Dynamic Changes): आप कार चलाते समय बहुत सावधान हो सकते हैं, लेकिन वीडियो गेम खेलते समय आप एक साहसी (daredevil) हो सकते हैं।
  • द्वंद्व (Conflict): कभी-कभी, आपके अपने मूल्य आपस में लड़ते हैं। आप पैसे बचाना (मितव्ययी होना) भी चाहते हैं और अपने जन्मदिन के लिए एक लग्जरी उपहार खरीदना (उदार होना) भी चाहते हैं।

समस्या: वर्तमान AI मॉडल एक कठोर रोबोट की तरह हैं। यदि आप उन्हें "सावधान" रहने के लिए कहते हैं, तो वे हमेशा के लिए सावधान ही रहते हैं। यदि आप उन्हें "साहसी" बनने के लिए कहते हैं, तो वे साहसी ही रहते हैं। उन्हें जल्दी से गियर बदलने या इस तथ्य को संभालने में कठिनाई होती है कि आप एक ही समय में दोनों होना चाह सकते हैं।

समाधान: "पेयर्ड फाइन-ट्यूनिंग" (Paired Fine-Tuning - PFT)

लेखक इन AI को प्रशिक्षित करने का एक नया तरीका प्रस्तावित करते हैं जिसे प्रेफरेंस-पेयर्ड फाइन-ट्यूनिंग (PFT) कहा जाता है।

उपमा: "यिन और यांग" जिम

AI को प्रशिक्षित करना एक एथलीट को प्रशिक्षित करने जैसा समझें।

  • पुराना तरीका (Single Preference): आप एक एथलीट को केवल तेज़ दौड़ने के लिए प्रशिक्षित करते हैं। फिर, आप एक दूसरे एथलीट को केवल भारी वजन उठाने के लिए प्रशिक्षित करते हैं। यदि आपको किसी ऐसे व्यक्ति की आवश्यकता है जो दोनों कर सके, तो आपको दो लोगों को काम पर रखना पड़ता है या उनके बीच स्विच करना पड़ता है। यह महंगा और बोझिल है।
  • नया तरीका (PFT): आप एक ही एथलीट को एक ऐसे वर्कआउट के माध्यम से प्रशिक्षित करते हैं जो उसे एक ही समय में दोनों करने के लिए मजबूर करता है। आप उसे स्प्रिंट (जोखिम लेने वाला) कराते हैं और फिर तुरंत भारी स्क्वाट (जोखिम से बचने वाला) कराते हैं।

इन विरोधी जोड़ों (opposing pairs) का अभ्यास करके, एथलीट दोनों अवस्थाओं के बीच के अंतर को सीख जाता है। वह एक "गिरगिट" (chameleon) बन जाता है जो कमांड के आधार पर तुरंत स्प्रिंटर से वेटलिफ्टर में बदल सकता है, और यह सब एक ही शरीर के भीतर होता है।

नया डेटासेट: "वैल्यू कॉन्फ्लिक्ट डिलेमा" (Value Conflict Dilemma - VCD)

इस "गिरगिट" AI को प्रशिक्षित करने के लिए, शोधकर्ताओं को एक विशेष जिम की आवश्यकता थी। उन्होंने VCD नामक एक नया डेटासेट बनाया।

  • यह क्या है: कल्पना कीजिए कि यह "आप क्या करेंगे?" वाले परिदृश्यों की एक किताब है।
  • ट्विस्ट: प्रत्येक परिदृश्य में दो विरोधाभासी उत्तर होते हैं।
    • परिदृश्य: आपको एक खोया हुआ वॉलेट मिलता है।
    • विकल्प A (जोखिम लेने वाला): मालिक के मिलने से पहले जल्दी से पैसे खर्च करने की कोशिश करें।
    • विकल्प B (जोखिम से बचने वाला): इसे तुरंत पुलिस के हवाले कर दें।
  • यह क्यों महत्वपूर्ण है: केवल AI को "सही" उत्तर दिखाने के बजाय, वे उसे "गलत" उत्तर भी उसके ठीक बगल में दिखाते हैं। यह AI को दोनों विकल्पों के बीच की सीमा (boundary) सिखाता है। यह सीखता है कि "जोखिम लेना" केवल "बुरा" नहीं है; यह केवल संचालन का एक अलग मोड है।

यह कैसे काम करता है: "स्टीयरिंग व्हील"

पेपर सुझाव देता है कि हर व्यक्ति के लिए एक नया AI बनाने के बजाय, हम एक मास्टर AI बना सकते हैं जो सभी "मोड्स" को जानता हो।

  1. प्रशिक्षण (Training): AI एक साथ "प्रतिस्पर्धी" (Competitive) और "सहयोगात्मक" (Collaborative) बनना सीखता है। वह सीखता है कि ये केवल एक डायल पर सेटिंग्स की तरह हैं, न कि स्थायी व्यक्तित्व लक्षण।
  2. अनुकूलन (Customization): जब कोई विशिष्ट उपयोगकर्ता इसके साथ बातचीत करता है, तो सिस्टम उनके पिछले व्यवहार (जैसे उनके "हिस्ट्री डेटा") को देखता है।
  3. परिणाम: AI तुरंत खुद को "स्टीयर" करता है। यदि आप एक सतर्क उपयोगकर्ता हैं, तो AI डायल को "सेफ मोड" पर घुमा देता है। यदि आप एक साहसी उपयोगकर्ता हैं, तो AI डायल को "बोल्ड मोड" पर घुमा देता है।

जादू: शोधकर्ताओं ने पाया कि किसी विशिष्ट उपयोगकर्ता के बारे में बहुत कम डेटा (केवल कुछ उदाहरण) होने पर भी, AI यह पता लगाने में सक्षम था कि कौन सा "डायल" घुमाना है और वह बिल्कुल वैसे ही कार्य कर सकता था जैसा कि वह व्यक्ति चाहता था।

यह एक बड़ी बात क्यों है

  1. यह संघर्ष को हल करता है: यह AI को एक "सत्य" चुनने के लिए मजबूर नहीं करता है। यह समझता है कि इंसान विरोधाभासी होते हैं। आप व्यवसाय में "जोखिम लेने वाले" हो सकते हैं लेकिन स्वास्थ्य के मामले में "जोखिम से बचने वाले" हो सकते हैं। यह AI इस बदलाव को सहजता से संभालता है।
  2. यह कुशल है: आपको हर उपयोगकर्ता के लिए एक नया रोबोट प्रशिक्षित करने की आवश्यकता नहीं है। एक ही रोबोट सभी शैलियों को सीखता है।
  3. यह स्मार्ट है: अपने परीक्षणों में, यह नई विधि (PFT) पुराने तरीकों की तुलना में उपयोगकर्ता की इच्छा का अनुमान लगाने में बहुत बेहतर थी। इसने कई विकल्प वाले परीक्षणों में 96.67% सटीकता प्राप्त की और ओपन-एंडेड रचनात्मक लेखन पर बहुत उच्च स्कोर किया।

निचोड़ (The Bottom Line)

एक ऐसे AI की कल्पना करें जो न केवल यह जानता है कि "क्या सही है," बल्कि यह भी समझता है कि "अभी आपके लिए क्या सही है।"

यह पेपर AI को एक "अटक जाने वाले रिकॉर्ड" के बजाय एक बहुमुखी अभिनेता बनने की शिक्षा देने की विधि पेश करता है। यह एक सतर्क माता-पिता, एक साहसी खोजकर्ता, या एक प्रतिस्पर्धी एथलीट की भूमिका निभाने के लिए सीखता है, और यह सब एक ही बातचीत के भीतर, केवल उन "विरोधाभासी मूल्यों" को समझकर किया जाता है जो हमें इंसान बनाते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →