← नवीनतम पेपर
💬 NLP

FACTWASH: Catching AI Rewrites That Wash Hearsay into Fact

यह शोध पत्र FACTWASH को प्रस्तुत करता है, जो एक ओपन-सोर्स राइट-टाइम गेट (write-time gate) है जो स्पष्ट निषेध (explicit negation) के लिए नियम-आधारित जाँच को हेजिंग (hedging) और एट्रिब्यूशन (attribution) के लिए एक लक्षित एलएलएम विटनेस (LLM witness) के साथ जोड़कर "फैक्टवॉशिंग" (factwashing)—अर्थात जब एआई सुनी-सुनाई बातों को तथ्य के रूप में फिर से लिखता है तो सत्यापन क्षमता की हानि होती है—का नियत रूप से पता लगाता है, जिससे यह प्रकट होता है कि इस प्रकार की त्रुटियाँ संवादात्मक मेमोरी सिस्टम (conversational memory systems) में प्रचलित हैं लेकिन व्यावसायिक ईमेल में दुर्लभ हैं।

मूल लेखक: Alex Kwon

प्रकाशित 2026-08-05
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Alex Kwon

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन थोड़े भुलक्कड़ रोबोट के लाइब्रेरियन हैं। यह रोबोट अपना पूरा दिन लोगों की बातें सुनने, ईमेल पढ़ने और वीडियो देखने में बिताता है। जगह बचाने और तेज़ी से सोचने के लिए, रोबोट हर एक शब्द को सहेज कर नहीं रखता; इसके बजाय, वह अपने "मेमोरी नोटबुक" में छोटे सारांश लिख देता है। आमतौर पर, यह बहुत अच्छा काम करता है। लेकिन कभी-कभी, रोबोट सफाई करने के लिए बहुत अधिक उतावला हो जाता है। वह एक अफवाह सुनता है, जैसे "कोई शायद कह सकता है कि एलिस को पदोन्नति मिली है," और उसे एक ठोस तथ्य के रूप में लिख देता है: "एलिस एक मैनेजर है।" रोबोट ने झूठ नहीं बोला; उसने बस "शायद" और "किसी ने कहा" जैसे शब्दों को धोकर हटा दिया। अब, रोबोट एक अफवाह को सच्चाई मानने लगा है, और वह एलिस को सर्वर रूम की वह चाबी दे सकता है जो उसने कभी अर्जित ही नहीं की थी। यही "फैक्टवॉशिंग" (factwashing) की समस्या है: जब एक सारांश मुख्य विचार को तो रखता है, लेकिन अनजाने में उन चेतावनी लेबल को मिटा देता है जो हमें बताते हैं कि हमें उस पर कितना भरोसा करना चाहिए।

यह शोध पत्र उस मेमोरी नोटबुक के लिए एक सुरक्षा गार्ड बनाने के बारे में है। शोधकर्ताओं ने, एलेक्स क्वोन के नेतृत्व में, यह जानना चाहा: हम हर एक नोट को पढ़ने के लिए एक बहुत महंगे, धीमे दिमाग (एक बड़े AI मॉडल) को काम पर रखे बिना इन गलतियों को कैसे पकड़ सकते हैं? उन्होंने "चेतावनी लेबल" के प्रकार पर आधारित एक चतुर तकनीक खोजी। कुछ लेबल, जैसे कि "नहीं" (not) शब्द, एक रेसिपी में सामग्री की एक छोटी, निश्चित सूची की तरह हैं—आप उन सभी को एक एकल इंडेक्स कार्ड पर लिख सकते हैं। अन्य लेबल, जैसे "किसी ने कहा" या "शायद," इस बात की तरह हैं कि एक इंसान अनिश्चितता कैसे व्यक्त कर सकता है; इसकी सूची अनंत है। शोध पत्र दिखाता है कि छोटी सूचियों के लिए, एक साधारण शब्द-जांचकर्ता (word-checker) पूरी तरह से काम करता है। अनंत सूचियों के लिए, आपको एक स्मार्ट AI की आवश्यकता होती है, लेकिन केवल उन विशिष्ट, कठिन मामलों के लिए।

द ग्रेट "फैक्टवॉशिंग" हाइस्ट (The Great "Factwashing" Heist)

मिलिए FACTWASH से। यह एक नया, ओपन-सोर्स टूल है जिसे एक AI की याददाश्त के दरवाजे पर पहरा देने के लिए डिज़ाइन किया गया है। इसका काम यह तुलना करना है कि AI ने क्या सुना और उसने अपनी नोटबुक में क्या लिखा। यदि AI किसी अफवाह को तथ्य के रूप में छिपाने की कोशिश करता है, तो FACTWASH दरवाजा पटक देता है।

शोधकर्ताओं ने पाया कि सभी गलतियाँ एक जैसी नहीं होतीं। उन्होंने इस समस्या को दो समूहों में विभाजित किया: द क्लोज्ड क्लास (The Closed Class) और द ओपन क्लास (The Open Class)

द क्लोज्ड क्लास: "नॉट" क्लब
"क्लोजed Class" को एक छोटे, विशिष्ट क्लब के रूप में सोचें जिसमें सदस्यों की संख्या निश्चित है। अंग्रेजी में, "नहीं" या "यदि" कहने के तरीके आश्चर्यजनक रूप से सीमित हैं। आप "not," "never," "don't," "unless," या "if" कह सकते हैं। बस इतना ही। शोधकर्ताओं ने एक सरल सूची (एक "वर्ड लिस्ट") बनाई जिसमें ये सभी शब्द शामिल थे।

  • यह कैसे काम करता है: जब AI एक स्मृति लिखता है, तो FACTWASH बस टेक्स्ट को स्कैन करता है। यदि मूल वाक्य में "not" था और स्मृति संस्करण में इसे हटा दिया गया, तो सूची इसे तुरंत पकड़ लेती है।
  • परिणाम: यह सरल सूची अविश्वसनीय रूप से प्रभावी है। इसने उस टेक्स्ट पर 91% गलतियों को पकड़ा जिसे इसने पहले कभी नहीं देखा था। यह तेज़ है, मुफ्त है, और इसे सुपरकंप्यूटर की आवश्यकता नहीं है। यह एक बाउंसर के पास मौजूद प्रतिबंधित नामों की सूची की तरह है; यदि नाम सूची में है, तो वे अंदर नहीं आ सकते।

द ओपन क्लास: "मेबी" भूलभुलैया (The "Maybe" Maze)
अब, "ओपन क्लास" को एक विशाल, बदलती हुई भूलभुलैया के रूप में कल्पना करें। इसमें अनिश्चितता दिखाने वाले शब्द ("शायद," "मुझे लगता है," "अफवाह है कि") या किसने कुछ कहा ("जॉन ने कहा," "रिपोर्ट्स दावा करती हैं") शामिल हैं। मनुष्य के संदेह व्यक्त करने के तरीकों का कोई अंत नहीं है। आप कह सकते हैं "मैं पूरी तरह से सुनिश्चित नहीं हूँ," "यह संभव है," "स्रोत संकेत देते हैं," या "जहाँ तक मुझे पता है।"

  • समस्या: यदि आप "शायद" कहने के हर तरीके की सूची बनाने की कोशिश करेंगे, तो आप कभी पूरा नहीं कर पाएंगे। शोधकर्ताओं ने अपनी सूची में और अधिक शब्द जोड़ने की कोशिश की, लेकिन चाहे उन्होंने कितनी भी कोशिश की, वे लोगों द्वारा संदेह व्यक्त करने के नए तरीकों को मिस करते रहे। उनकी सूची लगभग 50% रिकॉल (recall) पर अटक गई—जिसका अर्थ है कि उन्होंने आधी गलतियों को छोड़ दिया।
  • समाधान: यहीं पर "विटनेस" (Witness) आता है। चूंकि एक साधारण सूची यहाँ सब कुछ नहीं पकड़ सकती, इसलिए शोधकर्ताओं ने एक छोटा, वैकल्पिक AI सहायक जोड़ा। यह "विटनेस" वाक्य को पढ़ता है और एक सरल प्रश्न पूछता है: "क्या यहाँ कोई हेज (hedge/अनिश्चितता का शब्द) या एट्रिब्यूशन (कथन का स्रोत) है?"
  • परिणाम: इस विटनेस ने केवल अनुमान नहीं लगाया; इसने टेक्स्ट में उन सटीक शब्दों की ओर इशारा किया जिससे इसने "हाँ" कहा। केवल इन पेचीदा "शायद" वाले मामलों के लिए इस स्मार्ट हेल्पर का उपयोग करके, उन्होंने अपनी सफलता दर में 17 अंक की वृद्धि की। यह एक जासूस को नियुक्त करने जैसा है जो उन जटिल रहस्यों को सुलझा सके जिन्हें बाउंसर नहीं संभाल सकता।

बड़ी खोज: अखरोट तोड़ने के लिए हथौड़े का उपयोग न करें

इस शोध पत्र की सबसे महत्वपूर्ण खोज पैसे और समय बचाने का एक नियम है। शोधकर्ताओं ने साबित किया कि आपको सब कुछ जांचने के लिए एक फैंसी AI की आवश्यकता नहीं है।

  • यदि गलती "not" या "if" के बारे में है: तो सस्ती, तेज़ वर्ड लिस्ट का उपयोग करें। यह पूरी तरह से काम करती है और किसी भी नए टेक्स्ट पर लागू होती है।
  • यदि गलती "maybe" या "किसने कहा" के बारे में है: तो आपको AI विटनेस की आवश्यकता है, लेकिन केवल उन विशिष्ट मामलों के लिए।

उन्होंने अपने सिस्टम को एक मानक, शक्तिशाली AI जज (एक मॉडल जो पूरी कहानी को पढ़ता है और तय करता है कि क्या यह सच है) के खिलाफ परखकर इसका परीक्षण किया। परिणाम आश्चर्यजनक थे। वास्तविक दुनिया के डेटा पर, शक्तिशाली AI जज की सटीकता (precision) लगभग पूर्ण थी (उसने शायद ही कभी गलत अलार्म बजाया), लेकिन उसने कई वास्तविक "फैक्टवॉशिंग" त्रुटियों को मिस कर दिया जिन्हें मानव लेबलर्स ने पकड़ा था। क्यों? क्योंकि शक्तिशाली AI इस बात पर बहुत अधिक केंद्रित था कि मुख्य तथ्य सत्य है या नहीं, और उसने "चेतावनी लेबल" के सूक्ष्म नुकसान को अनदेखा कर दिया। इसने सोचा, "एलिस एक मैनेजर है? हाँ, यह मुख्य तथ्य है!" और इसने इस तथ्य को अनदेखा कर दिया कि स्रोत केवल एक अफवाह थी। FACTWASH, अपने विशिष्ट चेक के साथ, इस त्रुटि को हर बार पकड़ लेता है।

यह कहाँ विफल होता है?

शोध पत्र इस बारे में बहुत ईमानदार है कि यह क्या नहीं कर सकता।

  1. यह झूठ नहीं पकड़ सकता: यदि AI एक ऐसा तथ्य गढ़ता है जो कभी कहा ही नहीं गया था (जैसे यह कहना कि एलिस को पदोन्नति मिली जब वास्तव में नहीं मिली), तो FACTWASH के वर्तमान चेक इसे मिस कर सकते हैं। यह कहे गए शब्दों में बदलाव को पकड़ने के लिए बनाया गया है, न कि नई चीजें बनाने के लिए।
  2. यह जादू नहीं है: "विटनेस" AI स्मार्ट है, लेकिन यह पूर्ण नहीं है। जब उन्होंने विटनेस को केवल फ्लैग करने के बजाय (निर्णय बदलने के लिए) इस्तेमाल करने की कोशिश की, तो इससे चीजें वास्तव में और खराब हो गईं, जिससे सटीकता कम हो गई। शोधकर्ताओं ने पाया कि सरल वर्ड लिस्ट अधिकांश आसान चीजों को पकड़ लेती है, और AI केवल कठिन चीजों में मदद करता है। यदि आप AI को आसान चीजों पर अनुमान लगाने देते हैं, तो वह गलतियाँ करने लगता है।
  3. वास्तविक दुनिया के परीक्षण: जब उन्होंने व्यावसायिक ईमेल पर इसका परीक्षण किया, तो उन्होंने पाया कि "फैक्टवॉशिंग" (अर्थात "शायद" को हटा देना) वास्तव में काफी दुर्लभ था। व्यावसायिक ईमेल में अधिकांश गलतियाँ केवल साधारण झूठ या गलत अनुमान थीं। हालाँकि, बातचीत वाली गपशप (hearsay) में, "शायद" को हटाना मुख्य समस्या थी, जो कि खराब लेखन के 55% मामलों में हुआ।

आपको इसकी परवाह क्यों करनी चाहिए?

यह केवल रोबोट की याददाश्त को ठीक करने के बारे में नहीं है; यह इस बारे में है कि हम AI पर विश्वास कैसे पैदा करते हैं। जैसे-जैसे AI एजेंट हमारे लिए निर्णय लेने लगते हैं—अनुमति देना, ईमेल भेजना, या शेड्यूल बनाना—उन्हें एक ठोस तथ्य और एक संदिग्ध अफवाह के बीच अंतर जानने की आवश्यकता होती है।

यह शोध पत्र हमें एक ब्लूप्रिंट देता है: समाधान को ज़रूरत से ज़्यादा जटिल (over-engineer) न बनाएं। कुछ समस्याओं के लिए, एक साधारण सूची सुपर-कंप्यूटर से बेहतर होती है। अन्य के लिए, आपको मस्तिष्क शक्ति की आवश्यकता होती है, लेकिन केवल तभी जब आप इसका बुद्धिमानी से उपयोग करें। FACTWASH दिखाता है कि भाषा के प्रकार को समझकर, हम सुरक्षित, सस्ते और अधिक विश्वसनीय AI सिस्टम बना सकते हैं जो अनजाने में अफवाहों को नियम में नहीं बदलते।

अंत में, शोधकर्ताओं ने पाया कि अनमॉडिफाइड मेमोरी सॉफ्टवेयर पर, उनके गेट ने 8 में से 5 बार तब पकड़ लिया जब एक "हेज्ड रयूमर" (अनिश्चित अफवाह) को "हार्ड फैक्ट" में बदल दिया गया था। यह एक पूर्ण ढाल नहीं है, लेकिन यह एक शुरुआत है—यह सुनिश्चित करने का एक तरीका कि जब हमारा AI दुनिया को याद करता है, तो वह तथ्यों के साथ-साथ संदेह को भी याद रखता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →