High Accuracy, Less Talk (HALT): Reliable LLMs through Capability-Aligned Finetuning
यह शोध पत्र HALT को प्रस्तुत करता है, जो एक क्षमता-संरेखित फाइनट्यूनिंग विधि है जो बड़े भाषा मॉडल (Large Language Model) की विश्वसनीयता में सुधार करती है, जिससे मॉडल को अनिश्चित सामग्री उत्पन्न करने से बचने के लिए प्रशिक्षित किया जाता है, जिससे प्रतिक्रिया पूर्णता के साथ एक ट्यूनेबल संतुलन बनाए रखते हुए विविध डोमेन में तथ्यात्मक शुद्धता में उल्लेखनीय वृद्धि होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एलेक्स (Alex) नाम का एक अत्यंत प्रतिभाशाली लेकिन बहुत अधिक उत्साही छात्र है। एलेक्स अविश्वसनीय रूप से बुद्धिमान है और उसने पुस्तकालय की लगभग हर किताब पढ़ ली है। हालाँकि, एलेक्स में एक बड़ी कमी है: एलेक्स कभी यह स्वीकार नहीं करता कि उसे कुछ नहीं पता।
यदि आप एलेक्स से पूछते हैं, "अमेरिका के 45वें राष्ट्रपति कौन थे?", तो एलेक्स कहता है, "बराक ओबामा!" (सही)।
लेकिन यदि आप पूछते हैं, "ओबामा के बचपन के पालतू हैम्स्टर का नाम क्या था?", तो एलेक्स यह नहीं कहता कि "मुझे नहीं पता।" इसके बजाय, वह "मिस्टर व्हिस्कर्स" जैसा कोई नाम बना लेता है और पूरे आत्मविश्वास के साथ आपको बताता है। AI की दुनिया में, इसे हैलुसिनेशन (hallucination) कहा जाता है।
चिकित्सा या कानून जैसे उच्च-जोखिम वाले मामलों में, तथ्यों को मनगढ़ंत बनाना खतरनाक है। आप एक ऐसे डॉक्टर को पसंद करेंगे जो कहे, "मुझे यकीन नहीं है, चलिए जाँच करते हैं," बजाय एक ऐसे डॉक्टर के जो आपको गलत दवा पूरे आत्मविश्वास के साथ दे दे।
यही वह समस्या है जिसे HALT (High Accuracy, Less Talk) नामक शोध पत्र हल करने की कोशिश करता है।
मुख्य विचार: "कम बोलें, अधिक सच बोलें"
शोधकर्ता AI मॉडल को प्रशिक्षित करने का एक नया तरीका प्रस्तावित करते हैं। AI को हर सवाल का जवाब देने के लिए मजबूर करने के बजाय, वे इसे सिखाते हैं कि जब वह 100% आश्वस्त न हो, तो बोलना बंद कर दे।
इसे एक सेफ्टी वाल्व (safety valve) की तरह समझें। यदि AI अनिश्चित है, तो वह अनुमान नहीं लगाता; वह कहता है, "यहाँ से अनिश्चित हूँ।"
HALT कैसे काम करता है? ("संपादक" का रूपक)
AI को यह नया व्यवहार सिखाने के लिए, शोधकर्ताओं ने इसे केवल और अधिक किताबें पढ़ने के लिए नहीं दिया। उन्होंने AI के प्रशिक्षण डेटा के लिए एक सख्त संपादक (strict editor) की भूमिका निभाई। यहाँ प्रक्रिया दी गई है:
- ड्राफ्ट (The Draft): पहले, वे AI को एक प्रश्न का उत्तर लिखने के लिए कहते हैं (जैसे कोई गणित की समस्या या जीवनी)।
- तथ्य-जाँच (The Fact-Check): वे उस उत्तर को छोटे-छोटे, व्यक्तिगत वाक्यों या चरणों (fragments) में तोड़ देते हैं।
- सत्य परीक्षण (The Truth Test): वे एक अत्यंत बुद्धिमान "सत्य डिटेक्टर" (एक अन्य AI) का उपयोग करके प्रत्येक खंड की वास्तविक तथ्य (ground truth) के विरुद्ध जाँच करते हैं।
- खंड A: "ओबामा हवाई में पैदा हुए थे।" -> सत्य।
- खंड B: "ओबामा के पास बो नाम का एक कुत्ता था।" -> सत्य।
- खंड C: "ओबामा के कुत्ते का नाम गोल्डन रिट्रीवर था।" -> असत्य (वह जर्मन शेफर्ड था)।
- कटौती (The Cut): यहीं पर जादू है।
- यदि उत्तर स्वतंत्र तथ्यों की एक सूची है (जैसे कोई जीवनी), तो संपादक गलत वाक्य को काट देता है। अंतिम उत्तर में केवल सत्य तथ्य ही शामिल होते हैं।
- यदि उत्तर तर्क की एक श्रृंखला है (जैसे गणित की समस्या), और AI चरण 3 में गलती करता है, तो संपादक चरण 3 से आगे की पूरी चीज़ को काट देता है और उसे "यहाँ से अनिश्चित हूँ" से बदल देता है।
AI को फिर इन "संपादित" उत्तरों पर प्रशिक्षित किया जाता है। वह सीखता है: "हे, जब मुझे यकीन न हो, तो मुझे मनगढ़ंत बातें बनाने के बजाय रुक जाना चाहिए और 'अनिश्चित' कहना चाहिए।"
ट्रेड-ऑफ: पूर्णता बनाम शुद्धता
यह शोध पत्र एक "डायल" पेश करता है जिसे उपयोगकर्ता घुमा सकता है। यह कॉन्फिडेंस थ्रेशोल्ड (Confidence Threshold) है।
- डायल को "उत्साही" (Eager) पर घुमाएँ: AI अधिक प्रश्नों के उत्तर देने का प्रयास करता है। यह कुछ तथ्य गलत कर सकता है, लेकिन यह आपको एक लंबा उत्तर देता है। (उच्च पूर्णता/Completeness, कम शुद्धता/Correctness)।
- डायल को "रूढ़िवादी" (Conservative) पर घुमाएँ: AI केवल तभी बोलता है जब वह पूरी तरह से आश्वस्त हो। यह गणित की समस्या के बीच में ही रुक सकता है, लेकिन उसने जो कुछ भी कहा है वह 100% सत्य है। (कम पूर्णता/Completeness, उच्च शुद्धता/Correctness)।
इसे एक मौसम पूर्वानुमान की तरह समझें:
- मानक AI: "बारिश, बर्फबारी, ओलावृष्टि और शायद बवंडर भी आएगा!" (यह सभी संभावनाओं को कवर करने की कोशिश करता है, लेकिन अक्सर गलत होता है)।
- HALT AI: "बारिश होगी। मैं बवंडर के बारे में निश्चित नहीं हूँ।" (यह केवल वही भविष्यवाणी करता है जिसे वह पक्के तौर पर जानता है)।
परिणाम: एक सुपर-विश्वसनीय मॉडल
शोधकर्ताओं ने चार कठिन क्षेत्रों में इसका परीक्षण किया: जीवनी, गणित, कोडिंग और चिकित्सा।
उन्होंने एक शक्तिशाली मॉडल (Llama3-70B) लिया और उसे HALT के साथ प्रशिक्षित किया।
- मानक प्रशिक्षण (Standard Training): मॉडल लगभग 51% तथ्यों को सही बताता था। वह आत्मविश्वासी था लेकिन अक्सर गलत था।
- HALT प्रशिक्षण: मॉडल ने 87% तथ्यों को सही बताया।
चुनौती क्या है? मॉडल ने छोटे उत्तर दिए। इसने अज्ञानता को अधिक बार स्वीकार किया। लेकिन एक डॉक्टर, वकील या कोडर के लिए, आत्मविश्वास भरे झूठ के साथ 51% शुद्धता की तुलना में, बिना झूठ के 87% शुद्धता कहीं बेहतर है।
यह क्यों महत्वपूर्ण है
अधिकांश AI अनुसंधान मॉडलों को "स्मार्ट" बनाने की कोशिश करता है ताकि वे अधिक तथ्य जान सकें। HALT एक अलग दृष्टिकोण अपनाता है: यह मॉडल को इस बारे में अधिक ईमानदार बनाता है कि वह क्या नहीं जानता।
यह एक छात्र को यह सिखाने जैसा है कि पूरे ग्रेड खराब करने के लिए अनुमान लगाने के बजाय, हाथ उठाकर यह कहना ठीक है कि, "मुझे इस प्रश्न के अंतिम भाग का उत्तर नहीं पता।"
संक्षेप में: HALT AI को एक विश्वसनीय विशेषज्ञ बनना सिखाता है जो अपनी सीमाओं को जानता है, न कि एक आत्मविश्वासी झूठा जो मनगढ़ंत बातें बनाता है। यह "बहुत बोलने" के बदले "सच बोलने" को चुनता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।