VALUEFLOW: Toward Pluralistic and Steerable Value-based Alignment in Large Language Models
यह शोध पत्र VALUEFLOW को प्रस्तुत करता है, जो एक एकीकृत ढांचा है जो पदानुक्रमित मूल्य निष्कर्षण (hierarchical value extraction), एक बड़े पैमाने के तीव्रता-लेबल वाले डेटाबेस और एक कैलिब्रेटेड मूल्यांकन प्रणाली को एकीकृत करके मूल्य-आधारित संरेखण (value-based alignment) में प्रमुख अंतरालों को संबोधित करता है ताकि लार्ज लैंग्वेज मॉडल्स में मूल्य तीव्रताओं के बहुलवादी और स्टीयरेबल नियंत्रण को सक्षम किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन कुछ हद तक कठोर रोबोट को इंसान की तरह व्यवहार करना सिखाने की कोशिश कर रहे हैं। समस्या केवल यह नहीं है कि रोबोट को "अच्छा" होना चाहिए; बल्कि यह है कि इंसानों के पास जटिल, कभी-कभी विरोधाभासी आंतरिक दिशा-सूचक यंत्र होते हैं जिन्हें मूल्य (values) कहा जाता है।
कुछ लोग दयालुता (kindness) को गहराई से महत्व देते हैं, कुछ न्याय (justice) को, तो कुछ शक्ति (power) को। पेचीदा बात यह है कि ये मूल्य केवल "चालू" या "बंद" होने वाले स्विच नहीं हैं। आप थोड़े दयालु हो सकते हैं, या अत्यधिक दयालु। आप ज्यादातर न्यायप्रिय हो सकते हैं, लेकिन थोड़े से स्वार्थी भी।
वर्तमान AI अलाइनमेंट विधियाँ एक साधारण "अच्छा/बुरा" बटन की तरह हैं। यह बहुत ही सतही है। VALUEFLOW नामक शोधपत्र एक नया, बहुत अधिक परिष्कृत टूलकिट पेश करता है जो AI को मानवीय मूल्यों को उनकी सही तीव्रता (intensity) के साथ समझने और व्यक्त करने में मदद करता है।
यहाँ बताया गया है कि VALUEFLOW कैसे काम करता है, जिसे तीन सरल भागों में विभाजित किया गया है:
1. मानचित्र: HIVS (द हिरार्किकल वैल्यू एम्बेडिंग स्पेस)
कल्पना कीजिए कि आपके पास मानवीय विचारों का एक विशाल पुस्तकालय है, लेकिन किताबें हर जगह बिखरी हुई हैं। कुछ किताबें "दयालुता" के बारे में हैं, कुछ "पड़ोसियों की मदद करने" के बारे में हैं, और कुछ "दान देने" के बारे में। एक साधारण खोज "दयालुता" को "न्याय" के साथ भ्रमित कर सकती है क्योंकि वे संबंधित हैं लेकिन अलग हैं।
HIVES एक सुपर-व्यवस्थित पुस्तकालय मानचित्र की तरह है। यह केवल मूल्यों को सूचीबद्ध नहीं करता; यह पदानुक्रम (hierarchy) को समझता है। यह जानता है कि "दयालुता" एक बड़ा छाता है, और इसके अंतर्गत "देखभाल" और "मदद करना" जैसे मूल्य आते हैं। यह इन मूल्यों को एक 3D स्पेस में व्यवस्थित करता है जहाँ समान मूल्य एक-दूसरे के करीब होते हैं, और बहुत अलग मूल्य एक-दूसरे से दूर होते हैं। यह AI को मानवीय मूल्यों के शब्दों को ही नहीं, बल्कि उनके ढांचे को समझने में मदद करता है।
2. संदर्भ पुस्तकालय: VIDB (द वैल्यू इंटेंसिटी डेटाबेस)
अब, कल्पना कीजिए कि आप AI को कहना चाहते हैं, "मध्यम रूप से दयालु बनो, लेकिन न्याय के प्रति बहुत सख्त रहो।" AI को कैसे पता चलेगा कि "मध्यम रूप से" का क्या अर्थ है?
पहले, AI जज केवल एक स्कोर का अनुमान लगाते थे (जैसे "10 में से 7")। लेकिन अलग-अलग AI अलग-अलग अनुमान लगाते हैं, और उनके स्कोर अस्थिर होते हैं।
VIDB एक विशाल, पूर्व-कैलिब्रेटेड टेक्स्ट उदाहरणों का पुस्तकालय है। इसमें हजारों वाक्य शामिल हैं, जिनमें से प्रत्येक को विशिष्ट मूल्यों के लिए एक सटीक "तीव्रता स्कोर" ( -10 से +10 तक) दिया गया है।
- उपमा: सोचिए कि VIDB एक तराजू पर रखे मानक वजन (standard weights) का एक सेट है। यदि आप जानना चाहते हैं कि कोई नया वाक्य "न्याय" के मामले में कितना "भारी" है, तो आप केवल अनुमान नहीं लगाते। आप इन मानक वजनों के विरुद्ध उसकी तुलना करते हैं।
- यह कैसे काम करता है: AI से यह पूछने के बजाय कि "क्या यह टेक्स्ट न्यायपूर्ण है?" (जिससे गलत अनुमान लग सकते हैं), सिस्टम AI से लाइब्रेरी के कुछ मानक उदाहरणों के विरुद्ध नए टेक्स्ट की रैंकिंग (ranking) करने के लिए कहता है। "क्या यह टेक्स्ट उदाहरण A से अधिक न्यायपूर्ण है, लेकिन उदाहरण B से कम न्यायपूर्ण है?" रैंकिंग करने की यह विधि अनुमान लगाने की तुलना में बहुत अधिक स्थिर और विश्वसनीय है।
3. स्टीयरिंग व्हील: इंटेंसिटी-अवेयर स्टीयरिंग
यही वह हिस्सा है जहाँ आप वास्तव में AI को नियंत्रित करते हैं।
अतीत में, यदि आप AI को कहते "दयालु बनो," तो वह बहुत अधिक दयालु हो सकता था या पर्याप्त दयालु नहीं। VALUEFLOW के साथ, आप AI को एक डायल (dial) दे सकते हैं।
- उपमा: एक कार चलाने की कल्पना करें। पुरानी विधियाँ ऐसी थीं जैसे आपके पास एक गैस पेडल हो जिसमें केवल "ऑफ" और "फुल थ्रॉटल" हो। VALUEFLOW आपको एक स्पीडोमीटर के साथ स्टीयरिंग व्हील देता है। आप कह सकते हैं, "'दयालुता' की तीव्रता +8 के साथ चलो" या "'न्याय' की तीव्रता -2 के साथ चलो" (यानी, अन्याय को अस्वीकार करो)।
शोधपत्र ने कई अलग-अलग AI मॉडलों पर इसका परीक्षण किया और पाया:
- कुछ मॉडल दूसरों की तुलना में अधिक आसानी से नियंत्रित किए जा सकते हैं। कुछ आपके निर्देशों पर अच्छी प्रतिक्रिया देते हैं, जबकि कुछ जिद्दी होते हैं।
- मूल्य आपस में लड़ते हैं। यदि आप AI को "बहुत दयालु" होने के लिए कहते हैं और साथ ही "बहुत सख्त" होने के लिए भी, तो उसे एक संतुलन बनाना पड़ता है। शोधपत्र ने पाया कि कभी-कभी एक मूल्य जीत जाता है, और कभी-कभी वे अनुमानित तरीकों से आपस में मिल जाते हैं।
- यह समूहों के लिए काम करता है। उन्होंने यह पता लगाने के लिए इसका उपयोग किया कि विभिन्न समूहों के लोग (जैसे विभिन्न राजनीतिक दल या संस्कृतियाँ) किन मूल्यों को रखते हैं, और फिर AI को उन समूहों की तरह बोलने के लिए निर्देशित किया। इसने AI के उन समूहों के बारे में भविष्यवाणियों को बहुत सटीक बना दिया कि वे क्या कहेंगे।
बड़ी तस्वीर (The Big Picture)
लेखकों ने एक पूर्ण प्रणाली बनाई है जो:
- मूल्यों को एक संरचित स्थान में मैप (Map) करती है (HIVES)।
- मानक पुस्तकालय के साथ तुलना करके टेक्स्ट में किसी मूल्य की शक्ति को मापती (Measure) है (VIDB)।
- AI को उन मूल्यों को विशिष्ट स्तरों पर व्यक्त करने के लिए स्टीयर (Steer) करती है।
वे यह नहीं कह रहे हैं कि इससे सभी AI सुरक्षा समस्याओं का समाधान हो जाएगा या हमें इसका उपयोग लोगों को हेरफेर करने के लिए करना चाहिए। इसके बजाय, वे एक वैज्ञानिक टूलकिट प्रदान कर रहे हैं जिसका उपयोग यह अध्ययन करने के लिए किया जा सकता है कि AI कैसा व्यवहार करता है जब हम उससे किसी चीज़ का "थोड़ा सा" बनाम "बहुत सारा" होने के लिए कहते हैं। यह AI को केवल "सही बनाम गलत" के सरल नियम पुस्तिका का पालन करने के बजाय, मानवीय मूल्यों की सूक्ष्मता (nuance) को समझने के योग्य बनाने की दिशा में एक कदम है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।