← नवीनतम पेपर
💬 NLP

Reward-free Alignment for Conflicting Objectives

यह शोध पत्र **RACO** का प्रस्ताव करता है, जो एक रिवॉर्ड-फ्री अलाइनमेंट फ्रेमवर्क है जो एक नवीन क्लिप्ड कॉन्फ्लिक्ट-अवर्स ग्रेडिएंट डिसेंट पद्धति का उपयोग करके मल्टी-ऑब्जेक्टिव LLM ट्रेनिंग में ग्रेडिएंट संघर्षों को हल करता है, और बिना किसी स्पष्ट रिवॉर्ड मॉडल की आवश्यकता के सारांशीकरण (summarization) और सुरक्षा जैसे कार्यों में बेहतर पारेटो ट्रेड-ऑफ प्राप्त करता है।

मूल लेखक: Peter L. Chen, Xiaopeng Li, Xi Chen, Tianyi Lin

प्रकाशित 2026-02-11
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Peter L. Chen, Xiaopeng Li, Xi Chen, Tianyi Lin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शेफ हैं जो एक "परफेक्ट" डिश बनाने की कोशिश कर रहे हैं। आपके पास दो मुख्य लक्ष्य हैं: इसे स्वादिष्ट बनाना (Helpfulness) और इसे स्वस्थ बनाना (Harmlessness/Safety)।

समस्या यह है कि ये दोनों लक्ष्य अक्सर आपस में टकराते हैं। यदि आप इसे अविश्वसनीय रूप से स्वादिष्ट बनाना चाहते हैं, तो आप इसमें बहुत सारा मक्खन और चीनी डाल सकते हैं (जो इसे अस्वास्थ्यकर बना देता है)। यदि आप इसे पूरी तरह से स्वस्थ बनाना चाहते हैं, तो आप केवल उबली हुई ब्रोकली का एक कटोरा परोस सकते हैं (जो कि स्वादिष्ट नहीं होगा)।

AI की दुनिया में, इसे "Conflicting Objectives" (विरोधी उद्देश्य) कहा जाता है। जब डेवलपर्स एक AI को उपयोगी और सुरक्षित दोनों बनाने की कोशिश करते हैं, तो "निर्देश" (gradients) अक्सर AI को विपरीत दिशाओं में खींचते हैं, जिससे यह अस्थिर हो जाता है या एक लक्ष्य में पूरी तरह विफल हो जाता है।

समस्या: "खींचातानी" (The Tug-of-War)

वर्तमान तरीके आमतौर पर इसे केवल दोनों लक्ष्यों को "औसत" (average) निकालकर हल करने की कोशिश करते हैं। कल्पना कीजिए कि दो लोग एक रस्सी को विपरीत दिशाओं में खींच रहे हैं। यदि आप केवल उनके बल का औसत निकालते हैं, तो रस्सी मुश्किल से हिलती है, और आप कहीं नहीं पहुँच पाते। आज के अधिकांश AI मॉडल के साथ यही होता है—वे दोनों कार्यों में औसत दर्जे के रह जाते हैं क्योंकि वे निरंतर खींचतानी में फंसे रहते हैं।

समाधान: RACO (एक "स्मार्ट मध्यस्थ")

शोधकर्ताओं ने एक नया फ्रेमवर्क प्रस्तावित किया जिसे RACO (Reward-free Alignment for Conflicted Objectives) कहा जाता है।

दो विरोधी बलों को केवल औसत निकालने के बजाय, RACO एक "स्मार्ट मध्यस्थ" (Smart Mediator) या एक "मास्टर शेफ" की तरह काम करता है। यह कैसे काम करता है, इसके लिए तीन रूपकों (metaphors) का उपयोग किया गया है:

1. "न्यूनतम प्रतिरोध का मार्ग" (Conflict-Averse Gradient)

दोनों बलों को AI को आगे-पीछे खींचने देने के बजाय, RACO एक "तीसरे रास्ते" की तलाश करता है। यह एक ऐसा रास्ता खोजता है जहाँ दोनों लक्ष्य एक-दूसरे को नष्ट किए बिना थोड़ा-थोड़ा आगे बढ़ सकें। यह एक ऐसे रास्ते को खोजने जैसा है जो सुंदर (स्वादिष्ट) भी हो और चलने में आसान (स्वस्थ) भी, बजाय इसके कि सीधे पहाड़ या दलदल के बीच से गुजरने की कोशिश की जाए।

2. "सुरक्षा रेलिंग" (The Clipping Trick)

शोधकर्ताओं ने एक दुष्प्रभाव देखा: कभी-कभी "मध्यस्थ" बहुत अधिक उत्साहित हो जाता है। यदि एक लक्ष्य दूसरे की तुलना में बहुत अधिक शक्तिशाली है, तो मध्यस्थ गलती से AI को सबसे "मुखर" लक्ष्य की ओर बहुत अधिक झुका सकता है, जिससे उपयोगकर्ता की वास्तविक प्राथमिकताओं की अनदेखी हो जाती है।

इसे ठीक करने के लिए, उन्होंने "Clipping" जोड़ा। इसे एक कार में स्पीड लिमिटर या पहाड़ी सड़क पर सुरक्षा रेलिंग की तरह समझें। भले ही मध्यस्थ एक लक्ष्य को संतुष्ट करने के लिए एक बड़ा, अचानक मोड़ लेना चाहे, "Clipping" तंत्र कहता है, "रुको, धीरे चलो! हमें मूल संतुलन का सम्मान करना होगा जिसे उपयोगकर्ता ने मांगा है।" यह प्रशिक्षण को स्थिर रखता है और AI को "ओवर-करेक्ट" होने से रोकता है।

3. "बिना रेसिपी वाला दृष्टिकोण" (The No-Recipe Approach)

अधिकांश AI प्रशिक्षण के लिए एक "रिवॉर्ड मॉडल" (Reward Model) की आवश्यकता होती है—जो अनिवार्य रूप से एक अलग, महंगा AI "जज" है जो पहले AI को ग्रेड देता है। यह एक पेशेवर फूड क्रिटिक की आवश्यकता होने जैसा है जो सूप का स्वाद लेने के लिए हर सेकंड रसोई में खड़ा रहे।

RACO "Reward-free" है। यह बिना किसी अतिरिक्त, जटिल बिचौलिए के सीधे मानवीय प्राथमिकताओं (उपयोगकर्ताओं के "स्वाद") से सीखता है। यह इसे तेज़, सरल और अधिक सीधा बनाता है।

परिणाम: एक बेहतर संतुलन

शोधकर्ताओं ने कई प्रसिद्ध AI मॉडलों (जैसे Llama और Qwen) पर दो मुख्य परीक्षणों का उपयोग करके RACO का परीक्षण किया:

  • सारांश (Summarization): ऐसे सारांश बनाना जो उच्च गुणवत्ता वाले और संक्षिप्त दोनों हों।
  • सुरक्षा (Safety): एक ऐसा AI बनाना जो मददगार हो लेकिन खतरनाक या अनुचित अनुरोधों में मदद करने से मना कर दे।

फैसला? RACO लगातार जीत गया। इसने ऐसे AI का निर्माण किया जो "खींचातानी" को संतुलित करने में बेहतर था। इसने केवल एक पक्ष नहीं चुना; इसने वह "स्वीट स्पॉट" (sweet spot) खोज लिया जहाँ AI अत्यधिक उपयोगी और विश्वसनीय रूप से सुरक्षित दोनों था।

संक्षेप में

RACO से पहले: AI प्रशिक्षण एक अराजक खींचतानी थी जहाँ AI अक्सर भ्रमित या असंतुलित हो जाता था।
RACO के साथ: AI एक चतुर मध्य पथ खोजता है, जिसे एक स्मार्ट मध्यस्थ द्वारा निर्देशित किया जाता है जो यह सुनिश्चित करने के लिए "सुरक्षा रेलिंग" का उपयोग करता है कि वह ट्रैक पर रहे और वास्तव में जो इंसान चाहता है उसका सम्मान करे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →