Copy-Paste to Mitigate Large Language Model Hallucinations
यह शोध पत्र **CopyPasteLLM** का प्रस्ताव करता है, जो एक ऐसी विधि है जो उच्च-कॉपीइंग रिस्पॉन्स प्रेफरेंस ट्रेनिंग और विशिष्ट प्रॉम्प्टिंग का उपयोग करके रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) में होने वाले मतिभ्रम (hallucinations) को कम करती है, ताकि मॉडल्स को आंतरिक पैरामीट्रिक ज्ञान के बजाय प्रदान किए गए संदर्भ पर अधिक निर्भर रहने के लिए प्रोत्साहित किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही कठिन इतिहास की परीक्षा दे रहे एक छात्र हैं। आपकी मदद के लिए आपको एक पाठ्यपुस्तक (Context) दी गई है।
हालाँकि, आपके पास एक समस्या है: आपने अतीत में बहुत सारी अन्य इतिहास की पुस्तकें पढ़ी हैं (Parametric Knowledge)। जब आप कोई प्रश्न देखते हैं, तो आपका मस्तिष्क अक्सर आपके सामने रखी पाठ्यपुस्तक को अनदेखा कर देता है और इसके बजाय वह चिल्लाकर वह बताता है जो आपको लगता है कि आपको अपनी पुरानी पुस्तकों से याद है। भले ही पाठ्यपुस्तक कुछ अलग कहती हो, आप अपनी स्मृति का अनुसरण करते हैं। यह गलती जिसे वैज्ञानिक "hallucination" कहते हैं, उसे दर्शाती है।
यह शोध पत्र अध्ययन करने का एक नया तरीका पेश करता है जिसे "Copy-Paste" कहा जाता है। यह इस प्रकार काम करता है:
1. समस्या: "सब कुछ जानने वाला" छात्र
अधिकांश AI मॉडल (Large Language Models) "सब कुछ जानने वाले" छात्रों की तरह व्यवहार करते हैं। जब वे जानकारी खोजने के लिए सर्च इंजन का उपयोग करते हैं (इसे RAG कहा जाता है), तो उन्हें खोज परिणामों में सही उत्तर मिल जाता है, लेकिन फिर वे उसे "पैराफ्रेस" (अपने शब्दों में लिखने) या उसे अपने शब्दों में ढालने की कोशिश करते हैं।
स्मार्ट और मौलिक दिखने की प्रक्रिया में, वे अनजाने में तथ्यों को बदल देते हैं, नामों को बदल देते हैं, या तारीखों को मिला देते हैं। वे एक "लेखक" बनने की कोशिश कर रहे होते हैं जबकि उन्हें एक "रिपोर्टर" होना चाहिए।
2. समाधान: "Copy-Paste" विधि
शोधकर्ताओं ने कुछ दिलचस्प महसूस किया: एक छात्र जितनी अधिक सटीकता से पाठ्यपुस्तक से सटीक वाक्यों को कॉपी करता है, उसके गलती करने की संभावना उतनी ही कम होती है।
AI को यह कहने के बजाय कि, "इसे पढ़ो और मुझे बताओ कि क्या हुआ," वे AI को कहते हैं, "इस पुस्तक में उन सटीक वाक्यों को ढूँढो जो प्रश्न का उत्तर देते हैं और उन्हें अपने उत्तर में पेस्ट (paste) कर दो।"
AI को एक रचनात्मक लेखक से बदलकर एक सटीक फोटोकॉपी मशीन बनाकर, AI "अनुमान" लगाना बंद कर देता है और "उद्धरण" (quote) देना शुरू कर देता है। क्योंकि शब्द सीधे स्रोत से आ रहे हैं, AI गलती से "1920" को "1930" नहीं बदल सकता।
3. प्रशिक्षण: "सख्त शिक्षक" (CopyPasteLLM)
इस आदत को बनाने के लिए, शोधकर्ताओं ने एक विशेष प्रशिक्षण कार्यक्रम बनाया जिसे CopyPasteLLM कहा गया। उन्होंने दो-चरणीय प्रक्रिया का उपयोग किया:
- चरण 1: अभ्यास सत्र। उन्होंने AI को विभिन्न स्तरों पर कॉपी करने का अभ्यास करने के लिए मजबूर करने हेतु विशेष प्रॉम्प्ट्स का उपयोग किया—वाक्यों को क्रम में सख्ती से कॉपी करने से लेकर एक अधिक "परिष्कृत" संस्करण तक, जहाँ वह वाक्यों को सुचारू रूप से चलाने के लिए थोड़े से "गोंद" (जैसे "हालांकि" या "इसलिए") का उपयोग करता है।
- चरण 2: पुरस्कार प्रणाली। उन्होंने AI को दो अलग-अलग उत्तर दिखाए: एक जो एक अव्यवस्थित, "सब कुछ जानने वाला" पैराफ्रेस था, और दूसरा जो एक साफ, "कॉपी-पेस्ट" उद्धरण था। जब भी AI सटीक, कॉपी किए गए संस्करण को चुनता, तो उन्होंने AI को एक "गोल्ड स्टार" (गणितीय प्राथमिकता) दिया।
4. परिणाम: एक सुपर-कुशल छात्र
परिणाम प्रभावशाली थे। भले ही उन्होंने AI को बहुत कम डेटा (केवल 365 उदाहरण!) दिया था, AI बहुत अधिक विश्वसनीय बन गया।
कठिन परीक्षाओं (जैसे चिकित्सा संबंधी प्रश्न या "ट्रिक" वाले प्रश्न जहाँ पाठ्यपुस्तक उस जानकारी का खंडन करती है जिसे AI "सोचता" है कि वह जानता है) पर, CopyPasteLLM मानक मॉडलों की तुलना में काफी अधिक सटीक था। इसने अपनी स्मृति की तुलना में "पुस्तक पर भरोसा करना" सीख लिया।
सारांश रूपक (Metaphor)
मानक AI को एक ऐसे शेफ के रूप में सोचें जो स्मृति से रेसिपी को फिर से बनाने की कोशिश कर रहा है—वे बहुत अधिक नमक डाल सकते हैं या कोई सामग्री भूल सकते हैं क्योंकि वे सोचते हैं कि वे जानते हैं कि इसे कैसे किया जाए।
CopyPasteLLM उस शेफ की तरह है जो रेसिपी का शब्द-दर-शब्द पालन करता है, जैसा कि लिखा गया है ठीक वैसा ही हर ग्राम मापता है। परिणाम एक "रचनात्मक" नया व्यंजन हो सकता है, लेकिन यह गारंटी के साथ वही होगा जो रेसिपी ने चाहा था। चिकित्सा जैसे उच्च-जोखिम वाले क्षेत्रों में, "रचनात्मक" होने की तुलना में "बिल्कुल सही" होना बहुत अधिक महत्वपूर्ण है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।