Forecasting the Onset of Hallucination: Causal, Token-Level, Black-Box Survival Analysis During Generation
यह शोध पत्र एक कारण संबंधी (causal), टोकन-स्तरीय उत्तरजीविता विश्लेषण ढांचे (survival analysis framework) को प्रस्तुत करता है जो बड़े भाषा मॉडलों (LLMs) में मतिभ्रम (hallucinations) के होने से पहले ही उनके आगमन का सफलतापूर्वक पूर्वानुमान लगाता है, जो टेक्स्ट-नवीनता विचलन (text-novelty drift) का पता लगाकर 0.777 AUROC प्राप्त करता है और पारंपरिक पोस्ट-हॉक डिटेक्टरों की तुलना में लगभग 11 टोकन पहले चेतावनी प्रदान करता है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक जादू का शो देख रहे हैं जहाँ जादूगर (एक विशाल AI) एक कहानी सुना रहा है। आमतौर पर, जब जादूगर झूठ बोलना शुरू करता है—ऐसी बातें बनाना जो स्क्रिप्ट में मौजूद नहीं हैं—तो हम उसे "हैलुसिनेशन" (hallucination) कहते हैं।
लंबे समय तक, जादूगर को पकड़ने का एकमात्र तरीका यह था कि जब वह वास्तव में झूठ बोल दे, तब उंगली उठाकर कहना, "हे, रुकिए! यह नकली है!" लेकिन तब तक दर्शक झूठ सुन चुके होते हैं। यह एक गिरते हुए फूलदान को पकड़ने जैसा है जो फर्श पर टकराकर टूट चुका हो; आप गंदगी तो साफ कर सकते हैं, लेकिन टूटे हुए फूलदान को फिर से जोड़ नहीं सकते।
यह शोध पत्र एक साहसिक प्रश्न पूछता है: क्या हम झूठ बोलने से पहले ही भविष्यवाणी कर सकते हैं, इससे पहले कि जादूगर अपना मुँह भी खोले?
क्रिस्टल बॉल बनाम स्मोक डिटेक्टर (धुआं पहचानने वाला यंत्र)
लेखकों ने एक "क्रिस्टल बॉल" (एक पूर्वानुमान उपकरण) बनाया है जो AI की कहानी को शब्द-दर-शब्द लिखे जाने के दौरान देखता है। उन्होंने इसकी तुलना एक "स्मोक डिटेक्टर" (पुराना तरीका, जहाँ बस झूठ होने का इंतज़ार किया जाता है) से की।
यहाँ उन्होंने वह जादुई ट्रिक खोजी: AI अचानक "सच" से "झूठ" पर नहीं कूदता। इसके बजाय, यह धीरे-धीरे सच से दूर भटकने लगता है, जैसे कोई नाव चट्टानों से टकराने से पहले अपने रास्ते से भटक जाती है।
- पुराना तरीका (डिटेक्टर): यह टूल तब तक इंतज़ार करता है जब तक AI बातें बनाना शुरू न कर दे। उनके परीक्षणों में, इसने झूठ शुरू होने के 15 टोकन (लगभग 15 शब्द) बाद में अलार्म बजाया। यह तेज़ है, लेकिन यह हमेशा देर कर देता है।
- नया तरीका (फोरकास्टर): यह टूल AI के "भटकाव" (drift) को देखता है। इसने गौर किया कि इससे पहले कि AI झूठ बोलना शुरू करे, टेक्स्ट अजीब तरह से नया और मूल स्रोत से कटा हुआ होने लगता है। क्योंकि यह भटकाव देख सकता है, इसलिए यह झूठ वास्तव में होने से 11 टोकन पहले अलार्म बजा सकता है।
यह एक बहुत बड़ी बात है। इसका मतलब है कि सिस्टम आपको तब चेतावनी दे सकता है जब टेक्स्ट अभी भी सच हो, जिससे आपके पास AI को कुछ भी गलत कहने से पहले रोकने का मौका होता है।
क्रिस्टल बॉल इस भटकाव को कैसे देखता है?
आप सोच सकते हैं कि झूठ बोलने से ठीक पहले AI घबराया हुआ या भ्रमित व्यवहार करने लगेगा। आप उम्मीद कर सकते हैं कि टूल AI के "आश्चर्य" के स्तर (कि AI अपने स्वयं के शब्दों से कितना हैरान है) को देखेगा।
लेकिन शोध पत्र इस बात को खारिज करता है। लेखकों ने पाया कि झूठ बोलने से पहले AI हैरान नहीं होता है। इसके बजाय, चेतावनी का संकेत टेक्स्ट की नवीनता (text novelty) से आता है।
इसे एक गायक की तरह समझें जो बोल (lyrics) को पूरी तरह जानता है। जैसे ही वह एक नकली गाने की ओर भटकना शुरू करता है, वह अचानक घबराता नहीं है; बल्कि वह ऐसे सुर लगाने लगता है जो मूल संगीत की शीट से लगातार अलग होते जाते हैं। टूल यह मापता है कि मूल कहानी की तुलना में शब्द कितने "नए" और "संदर्भ से बाहर" होते जा रहे हैं। जब शब्द बहुत अधिक "ताज़ा" और मूल कहानी से बहुत दूर महसूस होने लगते हैं, तो टूल जान जाता है कि एक झूठ आने वाला है।
वह क्या है जो यह टूल नहीं कर सकता (वास्तविकता की जाँच)
लेखक बहुत सावधानी से स्पष्ट करते हैं कि यह टूल क्या नहीं है:
- यह कोई सार्वभौमिक अनुवादक नहीं है: यदि आप इस टूल को लंबे, विस्तृत लेखों (जैसे विकिपीडिया सारांश) पर प्रशिक्षित करते हैं और फिर इसे छोटे, त्वरित प्रश्नों (जैसे ट्रिविया गेम) पर उपयोग करने की कोशिश करते हैं, तो यह पूरी तरह विफल हो जाता है। वास्तव में, यह रैंडम अनुमान लगाने से भी बुरा प्रदर्शन करता है! "भटकाव" का स्वरूप टेक्स्ट के प्रकार के आधार पर बदल जाता है। यह टूल तभी काम करता है जब इसे उस प्रकार के टेक्स्ट पर विशेष रूप से प्रशिक्षित किया जाए जिसे यह देख रहा है।
- यह झूठ रोकने के लिए कोई जादुई समाधान नहीं है: लेखकों ने एक सिमुलेशन चलाया जहाँ उन्होंने जैसे ही अलार्म बजा, AI को "बोलना बंद करने" के लिए कहा। उन्होंने पाया कि पुराना "स्मोक डिटेक्टर" (जो झूठ का इंतज़ार करता है) वास्तव में शब्दों को बचाने में बेहतर था। क्यों? क्योंकि नया टूल कभी-कभी AI को बहुत जल्दी रोक देता है, जिससे अच्छे और सच्चे वाक्यों का भी कटना शुरू हो जाता है क्योंकि वे थोड़े "भटके हुए" महसूस होते हैं। लीड टाइम केवल तभी उपयोगी है जब आपके पास वाक्य को ठीक करने का कोई तरीका हो (जैसे उसे फिर से लिखना) न कि केवल पूरे वाक्य को हटा देना।
- यह AI का दिमाग नहीं पढ़ रहा है: टूल को AI के आंतरिक मस्तिष्क कोड को देखने की आवश्यकता नहीं है। यह केवल बाहर आने वाले शब्दों को देखता है, जिससे यह एक "ब्लैक-बॉक्स" टूल बन जाता है जो किसी भी AI के साथ काम कर सकता है।
जादू के पीछे के अंक
लेखकों ने RAGTruth नामक एक विशाल डेटासेट पर इसका परीक्षण किया। यह कितना सफल रहा:
- जब अगले 3 शब्दों के भीतर झूठ की भविष्यवाणी करने की बात आई, तो टूल 77.7% बार सही था (एक स्कोर 0.777)।
- यहाँ तक कि केवल एक विशिष्ट दस्तावेज़ को देखते हुए जहाँ AI झूठ बोल रहा है, टूल झूठ के शुरू होने के क्षण को 68.7% बार पहचान सका, जिससे यह साबित हुआ कि यह केवल यह अनुमान नहीं लगा रहा था कि कौन से दस्तावेज़ खराब हैं, बल्कि यह वास्तव में उस क्षण को पकड़ रहा था जब झूठ शुरू होने वाला था।
- टूल ने झूठ से 11 टोकन पहले सफलतापूर्वक चेतावनी दी, जबकि पुराने डिटेक्टर ने झूठ के 15 टोकन बाद प्रतीक्षा की।
मुख्य निष्कर्ष
यह शोध पत्र सिद्ध करता है कि हम हैलुसिनेशन (भ्रम) को देख सकते हैं, लेकिन केवल तभी जब हम टेक्स्ट के "भटकाव" पर नज़र रखें, न कि AI के भ्रम पर। यह एक कार के दुर्घटना होने का इंतज़ार करने के बजाय, दुर्घटना होने से पहले उसके लेन से थोड़ा भटकने को नोटिस करने जैसा है।
हालाँकि, यह अभी तक कोई हल नहीं हुआ है। यह टूल उस प्रकार के टेक्स्ट के लिए बहुत विशिष्ट है जिस पर इसे प्रशिक्षित किया गया है, और केवल चेतावनी मिलने पर AI को रोक देना हमेशा सबसे अच्छा समाधान नहीं होता है। लेकिन पहली बार, हमारे पास एक तरीका है जिससे हम झूठ को देख सकते हैं जब कहानी अभी भी सच हो।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।