← नवीनतम पेपर
💻 computer science

Pref-CTRL: Preference Driven LLM Alignment using Representation Editing

Pref-CTRL एक नवीन टेस्ट-टाइम अलाइनमेंट फ्रेमवर्क है जो मानव प्राथमिकता डेटा की संरचना को बेहतर ढंग से कैप्चर करने के लिए डिज़ाइन किए गए मल्टी-ऑब्जेक्टिव वैल्यू फंक्शन का उपयोग करके मौजूदा रिप्रेजेंटेशन-एडिटिंग विधियों में सुधार करता है।

मूल लेखक: Imranul Ashrafi, Inigo Jauregi Unanue, Massimo Piccardi

प्रकाशित 2026-04-28
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Imranul Ashrafi, Inigo Jauregi Unanue, Massimo Piccardi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक अत्यधिक बुद्धिमान, अविश्वसनीय रूप से तेज़, लेकिन कभी-कभी "शरारती" रोबोट सहायक है। यह रोबोट लगभग सब कुछ जानता है, लेकिन क्योंकि इसने विशाल, अव्यवस्थित और कभी-कभी विषाक्त इंटरनेट से सीखा है, इसलिए यह कभी-कभी ऐसी बातें कह देता है जो अभद्र, खतरनाक या बस पूरी तरह से गलत होती हैं।

इसे ठीक करने के लिए, अधिकांश लोग "स्कूली पद्धति" (Fine-tuning) का उपयोग करते हैं। यह ऐसा है जैसे रोबोट को व्यवहार करना फिर से सीखने के लिए महीनों के लिए वापस स्कूल भेजना। यह काम करता है, लेकिन यह अविश्वसनीय रूप से महंगा है, इसमें बहुत अधिक ऊर्जा लगती है, और यह बहुत धीमा है।

इस शोध पत्र के लेखक एक अलग तरीका प्रस्तावित करते हैं: "स्टीयरिंग व्हील पद्धति" (Pref-CTRL)।

मुख्य विचार: प्रशिक्षण नहीं, बल्कि दिशा निर्देश देना

रोबोट के पूरे मस्तिष्क को फिर से प्रशिक्षित करने के बजाय (जो अधिकांश लोग करते हैं), शोधकर्ताओं ने रोबोट के मस्तिष्क को बिल्कुल वैसा ही छोड़ने का निर्णय लिया जैसा वह है। इसके बजाय, उन्होंने एक छोटा, हल्का "स्टीयरिंग तंत्र" जोड़ा जो रोबोट के बात करते समय वास्तविक समय (real-time) में काम करता है।

इसे इस तरह सोचें: रोबोट एक तेज़ चलती कार है। इंजन को सुरक्षित चलाने के लिए पूरा इंजन फिर से बनाने के बजाय (Fine-tuning), वे बस एक उच्च-तकनीकी जीपीएस (GPS) और स्टीयरिंग असिस्ट (Representation Editing) स्थापित कर रहे हैं जो कार को सड़क से उतरने से पहले ही वापस सही रास्ते पर धकेल देता है।

पुराने स्टीयरिंग की समस्या (RE-Control)

इस पेपर से पहले, एक स्टीयरिंग विधि थी जिसे RE-Control कहा जाता था। यह ठीक-ठाक काम करती थी, लेकिन इसमें एक दोष था। यह केवल इस बात को देखती थी कि क्या एक अकेला वाक्य अलग से "अच्छा" है या "बुरा"।

कल्पना कीजिए कि एक ड्राइविंग इंस्ट्रक्टर केवल एक क्षण में आपकी कार को देखता है और कहता है, "यह एक अच्छी स्थिति है" या "यह एक बुरी स्थिति है।" वह इंस्ट्रक्टर आपको एक जटिल रेस ट्रैक पर नेविगेट करना नहीं सिखा रहा है; वे केवल स्नैपशॉट्स पर प्रतिक्रिया दे रहे हैं।

समाधान: Pref-CTRL (द "प्रो" ड्राइविंग इंस्ट्रक्टर)

शोधकर्ताओं ने Pref-CTRL बनाया। उनका "इंस्ट्रक्टर" (Value Function) बहुत अधिक स्मार्ट है क्योंकि वह वरीयताओं (preferences) को समझता है।

केवल एक तरीके से गाड़ी चलाने को देखने के बजाय, इंस्ट्रक्टर ने हजारों वीडियो देखे हैं जिनमें शामिल थे:

  1. प्रो ड्राइवर (पसंदीदा प्रतिक्रिया/Preferred Response)
  2. लापरवाह ड्राइवर (अस्वीकृत प्रतिक्रिया/Rejected Response)

दोनों की तुलना करके, इंस्ट्रक्टर यह सीखता है कि एक "अच्छी" प्रतिक्रिया को "बुरी" प्रतिक्रिया से क्या चीज़ सूक्ष्म रूप से अलग बनाती है। उन्होंने इस इंस्ट्रक्टर में दो विशेष "प्रशिक्षण नियम" जोड़े:

  1. द गैप रूल (Margin Loss): यह इंस्ट्रक्टर को बताता है, "केवल यह न देखें कि प्रो ड्राइवर लापरवाह ड्राइवर से बेहतर है; यह देखें कि वह कितना बेहतर है। सुनिश्चित करें कि उनके बीच एक स्पष्ट अंतर हो।"
  2. द स्टे-ऑन-ट्रैक रूल (Regularizer): यह 防止 (रोकता) है कि स्टीयरिंग बहुत आक्रामक न हो जाए। यदि स्टीयरिंग कार को बहुत ज़ोर से धकेलता है, तो कार फिसल सकती है या अजीब व्यवहार कर सकती है। यह नियम कहता है, "कार को प्रो ड्राइवर की ओर धकेलें, लेकिन इसे अपने मूल पथ से इतना दूर न जाने दें कि यह अर्थहीन हो जाए।"

यह क्यों मायने रखता है? (परिणाम)

जब उन्होंने इस "प्रो इंस्ट्रक्टर" का परीक्षण रोबोट पर किया, तो तीन अद्भुत चीजें हुईं:

  • यह बहुत सुरक्षित है: पेपर के उदाहरणों में, जब किसी अवैध कार्य (जैसे किसी को जहर कैसे दें) के बारे में पूछा गया, तो पुराना स्टीयरिंग तरीका गलती से मददगार सलाह दे सकता था। नया Pref-CTRL तरीका तुरंत "बुरे रास्ते" को पहचान लेता है और रोबोट को एक विनम्र, सुरक्षित इनकार की ओर मोड़ देता है।
  • यह अधिक स्मार्ट है: यह केवल बुरी चीजों से बचता ही नहीं है; यह वास्तव में अधिक मददगार और सुसंगत बनने में बेहतर होता है।
  • यह बहुमुखी है: भले ही रोबोट से उन विषयों के बारे में पूछा गया हो जिनका इंस्ट्रक्टर ने विशेष रूप से अध्ययन नहीं किया था, फिर भी स्टीयरिंग ने काम किया। इसने केवल नियमों की सूची नहीं, बल्कि एक अच्छे सहायक होने की अवधारणा को सीखा।

संक्षेप में: रोबोट के पूरे व्यक्तित्व को फिर से लिखने के बजाय, Pref-CTRL इसे एक स्मार्ट, वास्तविक समय का "नैतिक दिशा-सूचक" (moral compass) देता है जो इसे उसके मौलिक मस्तिष्क को बदले बिना मददगार और सुरक्षित होने की ओर धकेलता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →