SAGE: Answer-Conditioned Uncertainty Targets for Verbal Uncertainty Alignment
यह शोध पत्र SAGE का प्रस्ताव करता है, जो एक सिमेंटिक-आंसर गाइडेड एंट्रॉपी टारगेट और ग्रुप-अनसर्टेन्टी प्रेफरेंस ऑप्टिमाइजेशन (GUPO) का संयोजन है, ताकि बड़े भाषा मॉडलों (LLMs) की मौखिक अनिश्चितता अभिव्यक्तियों को उनके वास्तविक सैम्पल्ड व्यवहार के साथ संरेखित किया जा सके, जिससे विविध तर्क कार्यों में अंशांकन (कैलिब्रेशन) में सुधार हो सके और अति-आत्मविश्वास को कम किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ "SAGE: Answer-Conditioned Uncertainty Targets for Verbal Uncertainty Alignment" पेपर का सरल भाषा में अनुवाद दिया गया है:
बड़ी समस्या: आत्मविश्वासी झूठा (The Confident Liar)
कल्पना कीजिए कि आप एक बहुत बुद्धिमान लेकिन थोड़े घबराए हुए रोबोट से एक सवाल पूछते हैं। कभी-कभी, रोबोट को जवाब पूरी तरह से पता होता है। अन्य समय में, वह केवल अनुमान लगा रहा होता है, लेकिन उसे यह एहसास नहीं होता कि वह अनुमान लगा रहा है।
समस्या केवल यह नहीं है कि रोबोट गलतियाँ करता है; समस्या यह है कि जब वह गलत होता है, तब भी वह उतना ही आत्मविश्वास के साथ बोलता है जितना कि सही होने पर। वह कह सकता है, "मुझे 100% यकीन है कि फ्रांस की राजधानी लंदन है," उसी सहज लहजे में जिसका उपयोग वह तब करता है जब वह वास्तव में सही होता है। यह खतरनाक है क्योंकि उपयोगकर्ता रोबोट पर भरोसा करते हैं, जिससे गलत निर्णय लिए जा सकते हैं।
शोधकर्ता रोबोट को यह सिखाना चाहते हैं कि जब वह अनिश्चित हो, तो कहे, "मुझे यकीन नहीं है।" लेकिन आप एक रोबोट को उसकी अपनी उलझन के बारे में ईमानदार होना कैसे सिखा सकते हैं?
पुराना तरीका: रोबोट को अनुमान लगाने के लिए कहना
पहले, शोधकर्ताओं ने रोबोट को "ईमानदार" उत्तरों के उदाहरण दिखाकर प्रशिक्षित करने की कोशिश की। वे कहते थे, "जब तुम अनिश्चित हो, तो कहो 'मुझे यकीन नहीं है'।"
खामी: यह एक छात्र को केवल एक विशिष्ट टेस्ट प्रश्न दिखाकर यह सिखाने जैसा है कि "मुझे नहीं पता" कब कहना है। यदि छात्र को ऐसा प्रश्न दिखता है जिसके बारे में उसे लगता है कि उसे उत्तर पता है, तो वह फिर भी आत्मविश्वास के साथ अनुमान लगा सकता है। पुराने तरीकों ने इस बात पर ध्यान नहीं दिया कि रोबोट का बड़ा चित्र (big picture) कैसा है। उन्होंने केवल एक उत्तर को देखा और उसे ठीक करने की कोशिश की, इस तथ्य को नजरअंदाज कर दिया कि रोबोट अंदरूनी रूप से सिक्का उछालकर (coin flip) निर्णय ले रहा हो सकता है।
नया विचार: "ग्रुप रोलआउट" (The "Group Rollout")
लेखकों ने महसूस किया कि यह जानने के लिए कि क्या एक रोबोट वास्तव में अनिश्चित है, आपको उसे एक ही सवाल 20 बार पूछना होगा और देखना होगा कि क्या होता है।
- स्थिर समूह (Stable Group): यदि आप रोबोट से 20 बार पूछते हैं, और वह 20 बार एक ही उत्तर देता है, तो वह आश्वस्त है। उसे कहना चाहिए, "मुझे यकीन है।"
- बिखरा हुआ समूह (Dispersed Group): यदि आप 20 बार पूछते हैं, और वह 20 अलग-अलग उत्तर देता है (या 10 अलग-अलग उत्तर), तो वह भ्रमित है। उसे कहना चाहिए, "मुझे यकीन नहीं है।"
इसे ग्रुप रोलआउट कहा जाता है। यह एक समिति (committee) के 20 लोगों से एक ही सवाल पूछने जैसा है। यदि वे सभी सहमत हैं, तो समूह आश्वस्त है। यदि वे बहस कर रहे हैं, तो समूह अनिश्चित है।
जाल: "खराब स्कोरकार्ड" (The "Bad Scorecard")
यहीं पर पेपर बहुत चतुर हो जाता है। केवल 20 उत्तरों का समूह होना पर्याप्त नहीं है। आपको उस समूह को स्कोर (score) देने के लिए एक तरीके की आवश्यकता है जो रोबोट को बता सके कि उसे कितना अनिश्चित होना चाहिए। लेखकों ने पाया कि मौजूदा स्कोरिंग तरीके दोषपूर्ण थे:
- "सटीक मिलान" स्कोर (MAF): यह तरीका केवल यह गिनता है कि कितनी बार ठीक वही शब्द आया।
- उपमा: कल्पना कीजिए कि एक समिति रंग पर वोट दे रही है। यदि 10 लोग "लाल" कहते हैं और 10 लोग "क्रिमसन" कहते हैं, तो यह स्कोरकार्ड सोचता है कि वे पूरी तरह से विभाजित हैं (50/50) क्योंकि शब्द अलग हैं। लेकिन वे वास्तव में रंग पर सहमत हैं! यह स्कोरकार्ड बहुत सख्त है और बारीकियों को समझने में विफल रहता है।
- "सिमेंटिक क्लस्टर" स्कोर (SE): यह समान अर्थों को एक साथ समूह में रखता है।
- उपमा: यह बेहतर है, लेकिन यह एक क्लब के बाउंसर जैसा है जिसके पास एक कठोर सूची है। यदि आप सूची से थोड़ा भी अलग हैं, तो आपको तुरंत "हाँ" समूह से बाहर फेंक दिया जाता है और "नहीं" समूह में डाल दिया जाता है। स्कोर एक टूटे हुए लिफ्ट की तरह ऊपर-नीचे होता है, जिससे रोबोट के लिए सुचारू रूप से सीखना कठिन हो जाता है।
- "जेनेरिक सिमिलैरिटी" स्कोर (KLE): यह देखता है कि वाक्य सुनने में कितने समान हैं।
- उपमा: यह सबसे खतरनाक वाला है। कल्पना कीजिए कि एक समिति गणित की समस्या पर वोट दे रही है। एक व्यक्ति कहता है "52", दूसरा कहता है "53"। एक सामान्य कान के लिए, ये संख्याएँ बहुत समान लगती हैं। यह स्कोरकार्ड सोचता है, "ओह, वे लगभग एक जैसे हैं, इसलिए समूह आश्वस्त है!" लेकिन गणित में, 52 और 53 पूरी तरह से अलग उत्तर हैं। यह स्कोरकार्ड रोबोट को धोखा देता है कि वह आश्वस्त है, जबकि वह वास्तव में गलत है।
समाधान: SAGE (द स्मार्ट स्कोरकार्ड)
लेखकों ने SAGE (Semantic-Answer Guided Entropy) नामक एक नया स्कोरिंग सिस्टम बनाया।
SAGE को एक स्मार्ट स्कोरकार्ड के रूप में सोचें जो एक साथ दो चीजों को समझता है:
- वाइब (The Vibe): यह देखता है कि वाक्य सुनने में कैसे लगते हैं (भाषाई समानता)।
- सत्य (The Truth): यह जाँचता है कि क्या वास्तविक उत्तर संगत हैं (उत्तर समानता)।
यह कैसे काम करता है:
- यदि समिति कहती है "लाल" और "क्रिमसन", तो SAGE देखता है कि उनका अर्थ एक ही है और वह कम अनिश्चितता स्कोर देता है (अच्छा!)।
- यदि समिति कहती है "52" और "53", तो SAGE देखता है कि भले ही वे सुनने में समान हों, लेकिन वे गणितीय रूप से भिन्न हैं। यह उच्च अनिश्चितता स्कोर देता (अच्छा!)।
- यह इसे सुचारू रूप से करता है, ताकि रोबोट को एक स्पष्ट, स्थिर संकेत मिले कि उसे अपने आत्मविश्वास को कैसे समायोजित करना है, न कि एक झटकेदार, भ्रमित करने वाले संकेत की तरह।
प्रशिक्षण विधि: GUPO
एक बार जब उनके पास यह परफेक्ट स्कोरकार्ड (SAGE) हो जाता है, तो वे एक नई प्रशिक्षण विधि GUPO का उपयोग करते हैं।
रोबोट के पूरे उत्तर (कहानी, तर्क और अंतिम तथ्य) को ठीक करने के बजाय, GUPO केवल आत्मविश्वास वाले हिस्से पर ध्यान केंद्रित करता है।
- उपमा: एक शिक्षक द्वारा छात्र के निबंध को सुधारने की कल्पना करें। पूरी कहानी को फिर से लिखने के बजाय, शिक्षक केवल उस वाक्य को घेरता है जहाँ छात्र कहता है "मुझे 100% यकीन है" और कहता है, "वास्तव में, अपने अन्य ड्राफ्ट देखें। आप अनुमान लगा रहे थे। इसे बदलकर 'मुझे यकीन नहीं है' कर दें।"
- GUPO बिल्कुल यही करता है। यह रोबंत के तर्क और तथ्यों को अकेला छोड़ देता है लेकिन रोबोट को अपने "अनिश्चितता कथन" को समूह की वास्तविकता के अनुरूप बदलने के लिए प्रशिक्षित करता है।
परिणाम
लेखकों ने तीन प्रकार के कार्यों पर इसका परीक्षण किया:
- तथ्य (Facts): (जैसे, "यह पुस्तक किसने लिखी?")
- गणित (Math): (जैसे, "52 + 3 क्या है?")
- बहुविकल्पीय (Multiple Choice): (जैसे, "क्या उत्तर A, B, C या D है?")
सभी मामलों में, SAGE और GUPO के साथ प्रशिक्षित रोबोट अनिश्चित होने के बारे में बहुत बेहतर हो गए। वे अति-आत्मविश्वासी झूठे बनने से रुक गए। वे सीख गए कि जब समूह का उत्तर अव्यवस्थित हो तो "मुझे नहीं पता" कहना है, और जब समूह सहमत हो तो "मुझे पता है" कहना है।
सारांश
यह पेपर तर्क देता है कि रोबोट को उसकी अनिश्चितता के बारे में ईमानदार होने के लिए सिखाने के लिए, आप केवल एक उत्तर को नहीं देख सकते। आपको उत्तरों के एक समूह को देखना होगा। लेकिन आपके पास एक विशेष "स्कोरकार्ड" (SAGE) भी होना चाहिए जो समझता हो कि "लाल" और "क्रिमसन" एक ही हैं, लेकिन "52" और "53" नहीं हैं। इस स्मार्ट स्कोरकार्ड के साथ, रोबोट अपने आत्मविश्वास को अपनी वास्तविक क्षमता के अनुरूप ढालना सीख जाता है, जिससे वह एक अधिक विश्वसनीय साथी बनता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।