← नवीनतम पेपर
🤖 AI

EvoPref: Multi-Objective Evolutionary Optimization Discovers Diverse LLM Alignments Beyond Gradient Descent

EvoPref, ग्रेडिएंट-आधारित विधियों के प्रेफरेंस कोलैप्स (preference collapse) को दूर करने के लिए NSGA-II और LoRA एडेप्टर का उपयोग करते हुए एक मल्टी-ऑब्जेक्टिव इवोल्यूशनरी एल्गोरिदम पेश करता है, जो मानक बेंचमार्क पर प्रतिस्पर्धी गुणवत्ता बनाए रखते हुए काफी अधिक विविध LLM अलाइनमेंट प्राप्त करता है।

मूल लेखक: Dongxin Guo, Jikun Wu, Siu Ming Yiu

प्रकाशित 2026-05-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Dongxin Guo, Jikun Wu, Siu Ming Yiu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "EvoPref" पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करते हुए विवरण दिया गया है।

बड़ी समस्या: "एक ही सांचे में ढला हुआ" रोबोट (The "One-Size-Fits-All" Robot)

कल्पना कीजिए कि आप एक रोबोट को एक सहायक बनने के लिए प्रशिक्षित कर रहे हैं। आप चाहते हैं कि वह सहायक (Helpful), हानिरहित (Harmless/सुरक्षित) और ईमानदार (Honest) हो।

वर्तमान में, इन रोबोटों (जिन्हें लार्ज लैंग्वेज मॉडल्स या LLMs कहा जाता है) को प्रशिक्षित करने का मानक तरीका एक छात्र को एक विशिष्ट उत्तर कुंजी (answer key) दिखाने और यह कहने जैसा है, "बिल्कुल यही करो।" इस पद्धति को ग्रेडिएंट डिसेंट (Gradient Descent) कहा जाता है।

यह पेपर तर्क देता है कि इस पद्धति में एक बड़ी खामी है: प्रेफरेंस कोलैप्स (Preference Collapse - पसंद का पतन)

  • उपमा: कल्पना कीजिए कि आप छात्रों के एक समूह से "सुरक्षा" के बारे में निबंध लिखने के लिए कहते हैं। क्योंकि वे सभी एक ही पाठ्यपुस्तक का उपयोग करके ठीक एक ही ग्रेड प्राप्त करने की कोशिश कर रहे हैं, इसलिए वे अंततः बिल्कुल एक जैसा उबाऊ और दोहराव वाला निबंध लिखते हैं। वे सुरक्षित होने का एक ही तरीका ढूंढ लेते हैं और उसी पर टिके रहते हैं, जिससे वे सुरक्षित होने के अन्य रचनात्मक या सूक्ष्म तरीकों को अनदेखा कर देते हैं।
  • परिणाम: रोबोट व्यवहार करने के एक संकीर्ण तरीके में बहुत अच्छा हो जाता है, लेकिन मानवीय आवश्यकताओं की विशाल विविधता को समझने में विफल रहता है। यह एक ऐसे शेफ की तरह है जो केवल एक विशेष प्रकार का सूप बनाना जानता है; वह उस सूप के लिए तो बेहतरीन है, लेकिन बाकी सब चीजों के लिए बहुत बुरा है।

समाधान: "विकासवादी उद्यान" (The "Evolutionary Garden" - EvoPref)

लेखक एक नई विधि पेश करते हैं जिसे EvoPref कहा जाता है। एक छात्र को एक उत्तर पाने के लिए प्रशिक्षित करने के बजाय, वे विभिन्न पौधों का एक पूरा उद्यान उगाते हैं।

  • उपमा: सभी को एक ही उत्तर कुंजी की नकल करने के लिए मजबूर करने के बजाय, शोधकर्ता "रोबोटिक दिमागों" की एक पूरी आबादी (विशेष रूप से, छोटे एड-ऑन मॉड्यूल जिन्हें LoRA एडेप्टर कहा जाता है) को स्वाभाविक रूप से विकसित होने देते हैं।
  • यह कैसे काम करता है:
    1. जनसंख्या (The Population): वे 32 अलग-अलग रोबोट विविधताओं के साथ शुरुआत करते हैं।
    2. योग्यतम की उत्तरजीविता (Survival of the Fittest): वे इन रोबोटों का तीन लक्ष्यों पर परीक्षण करते हैं: सहायक होना, हानिरहित होना और ईमानदार होना।
    3. "आर्काइव" (The Archive - बीज बैंक): यही असली जादू है। वे एक विशेष "बीज बैंक" (आर्काइव) रखते हैं जो रोबोट के हर प्रकार के सबसे अच्छे संस्करणों को संग्रहीत करता है। यदि कोई रोबोट "बहुत सुरक्षित लेकिन थोड़ा कम सहायक" होने में माहिर है, तो उसे सहेजा जाता है। यदि कोई दूसरा "बहुत सहायक लेकिन सावधान रहने वाला" है, तो उसे भी सहेजा जाता है।
    4. मिश्रण और मिलान (Mixing and Matching): वे वर्तमान समूह के "माता-पिता" और बीज बैंक के "माता-पिता" के दिमागों को आपस में मिलाते हैं ताकि नए, बेहतर "बच्चे" बनाए जा सकें।

यह बेहतर क्यों है: "विविधता" की खोज (The "Diversity" Discovery)

पेपर का दावा है कि यह विकासवादी दृष्टिकोण मानक पद्धति की तुलना में समाधानों की बहुत अधिक विविधता पाता है।

  • उपमा:
    • ग्रेडिएंट डिसेंट (पुराना तरीका): पहाड़ से नीचे उतरने वाले एक अकेले हाइकर (हाइकर) की तरह। वे एक घाटी तो ढूंढ लेते हैं, लेकिन वे पास की अन्य सुंदर घाटियों को मिस कर देते हैं क्योंकि वे सीधे नीचे जाने पर बहुत अधिक केंद्रित होते हैं।
      • EvoPref (नया तरीका): पैराशूट के साथ हाइकर्स की एक पूरी टीम को भेजने जैसा। वे पहाड़ पर हर जगह उतरते हैं। कुछ गहरे, सुरक्षित घाटियाँ ढूंढते हैं; अन्य धूप वाले, सहायक खुले मैदान पाते हैं। क्योंकि वे एक मानचित्र (आर्काइव) रखते हैं कि हर कोई कहाँ उतरा है, वे दुर्लभ स्थानों को खोते नहीं हैं।

परिणाम: पेपर ने क्या पाया

शोधकर्ताओं ने मानक बेंचमार्क पर इसका परीक्षण किया और पाया:

  1. अधिक विविधता: EvoPref ने मौजूदा सर्वोत्तम विधियों की तुलना में 18% अधिक विभिन्न प्रकार के व्यवहार (preference coverage) की खोज की।
  2. कम पतन (Less Collapse): रोबोट के "हार मान लेने" और उबाऊ हो जाने (collapse) की दर में 47% की गिरावट आई।
  3. उतना ही अच्छा: अधिक विविध होने के बावजूद, रोबोट मानक रोबोट की तरह ही सहायक और सुरक्षित थे। वास्तव में, वे कुछ परीक्षणों में थोड़े बेहतर भी थे।
  4. "सीड बैंक" अत्यंत महत्वपूर्ण है: जब उन्होंने अपने प्रयोग से आर्काइव (बीज बैंक) को हटा दिया, तो रोबोट तुरंत कम विविध हो गए, जिससे यह सिद्ध हुआ कि विभिन्न समाधानों का रिकॉर्ड रखना आवश्यक है।

"LoRA" ट्रिक: इसे हल्का रखना

आप सोच सकते हैं, "क्या 32 रोबोटों को विकसित करने में बहुत समय नहीं लगेगा?"
पेपर एक चतुर ट्रिक का उपयोग करता है जिसे LoRA (लो-रैंक अडैप्टेशन) कहा जाता है।

  • उपमा: रोबोट के मस्तिष्क के पूरे 10,000 पन्नों के विश्वकोश को फिर से लिखने के बजाय, वे केवल छोटे, 10 पन्नों के "स्टिक नोट्स" (एडेप्टर) लिखते हैं जो रोबोट को बताते हैं कि कैसे व्यवहार करना है।
  • लाभ: यह विकास प्रक्रिया को तेज़ और सस्ता बनाता है। वे एक शहर जितने बड़े सुपरकंप्यूटर की आवश्यकता के बिना रोबोटों का एक पूरा उद्यान विकसित कर सकते हैं।

सारांश

पेपर का तर्क है कि AI को वास्तव में हर किसी के लिए सुरक्षित और सहायक बनाने के लिए, हमें केवल एक "परफेक्ट" रोबोट को प्रशिक्षित नहीं करना चाहिए। इसके बजाय, हमें विकासवादी एल्गोरिदम (evolutionary algorithms) का उपयोग करके रोबोटों का एक विविध उद्यान उगाना चाहिए, जिनमें से प्रत्येक की अपनी अलग ताकत हो। इन विभिन्न समाधानों का एक "बीज बैंक" रखकर, हम यह सुनिश्चित करते हैं कि उपयोगकर्ता को जो भी चाहिए, उद्यान में एक ऐसा रोबोट मौजूद है जो उस काम के लिए पूरी तरह उपयुक्त है।

मुख्य निष्कर्ष: विविधता केवल एक अच्छी चीज़ नहीं है; यह AI को एक उबाऊ, एक ही काम करने वाले यंत्र (one-trick pony) बनने से रोकने के लिए आवश्यक है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →