RippleBench: Capturing Ripple Effects Using Existing Knowledge Repositories
यह शोध पत्र रिपलबेंच (RippleBench) को प्रस्तुत करता है, जो एक स्वचालित पाइपलाइन है जो भाषा मॉडल अनलर्निंग के "रिपल प्रभावों" (ripple effects) को मापने के लिए मौजूदा ज्ञान भंडारों का लाभ उठाता है, जिससे यह पता चलता है कि संबंधित अवधारणाओं पर प्रदर्शन में गिरावट अनलर्निंग पद्धति का एक सुसंगत गुण है न कि मूल मॉडल का।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक विशाल, अविश्वसनीय रूप से बुद्धिमान पुस्तकालय है जहाँ हर किताब अर्थ के अदृश्य धागों से दूसरी हर किताब से जुड़ी हुई है। यदि आप एक विशिष्ट पुस्तक को हटाना चाहते हैं (मान लीजिए, "एंथ्रैक्स" पर एक किताब) क्योंकि वह खतरनाक है, तो आप सोच सकते हैं कि आप बस उस एक किताब को शेल्फ से निकाल सकते हैं।
लेकिन AI की दुनिया में, चीजें इतनी सरल नहीं हैं। जब आप उस एक किताब को बाहर निकालते हैं, तो आप अनजाने में उससे जुड़े सभी धागों को भी खींच लेते हैं। अचानक, "वैक्सीन" (टीके), "बेसिक बायोलॉजी" (बुनियादी जीव विज्ञान), और "फ्लू" जैसी किताबें भी शेल्फ से गिर जाती हैं या उनके पन्ने फट जाते हैं। यह वही है जिसे लेखक "रिपल इफेक्ट" (लहर का प्रभाव) कहते हैं।
यह पेपर RippleBench नामक एक नया टूल पेश करता है जो ठीक से मापता है कि वे लहरें कितनी बड़ी हैं।
समस्या: "भूलने" (Forget) का बटन बहुत ही भद्दा है
वर्तमान में, जब शोधकर्ता AI को कुछ "भूलने" (जैसे, जैविक हथियार कैसे बनाया जाए) के लिए प्रशिक्षित करते हैं, तो वे एक "फॉरगेट सेट" (बुरी चीजें) और एक "रिटेन सेट" (अच्छी चीजें) का उपयोग करते हैं। वे यह देखते हैं कि क्या AI ने बुरी चीजों को भूल गया और अच्छी चीजों को बरकरार रखा।
समस्या यह है कि यह ऐसा है जैसे आप यह जाँच रहे हों कि आपने दीवार से एक विशिष्ट ईंट निकाली है या नहीं, और फिर आप यह देखते हैं कि क्या पूरी इमारत अभी भी खड़ी है। यह बगल की खिड़कियों में बन रही दरारों को मिस कर देता है। AI शायद एंथ्रैक्स के बारे में सटीक सवाल भूल जाए, लेकिन वह अभी भी वायरस के बारे में सब कुछ जानता हो सकता है, या वह एंथ्रैक्स के सवाल को भूल सकता है लेकिन एलर्जी जैसी हानिरहित चीजों के बारे में बात करने की अपनी क्षमता भी खो सकता है।
समाधान: RippleBench-Maker (द "रिपल रूलर")
लेखकों ने एक स्वचालित मशीन बनाई जिसे RippleBench-Maker कहा जाता है। इसे एक विशेष पैमाने (रूलर) के रूप में सोचें जो न केवल लंबाई मापता है, बल्कि "निकटता" को भी मापता है।
- सीड (बीज): आप मशीन को एक विषय देते हैं जिसे आप चाहते हैं कि AI भूल जाए (जैसे, "वायरल इवोल्यूशन")।
- पड़ोसी (Neighbors): मशीन एक विशाल पुस्तकालय (विकिपीडिया) को देखती है और उस विषय के "पड़ोसियों" को खोजती है।
- करीबी पड़ोसी: वे चीजें जो बहुत समान हैं (जैसे, "वायरल क्लासिफिकेशन")।
- दूर के पड़ोसी: वे चीजें जो ढीले तौर पर संबंधित हैं (जैसे, "गेहूं का वर्गीकरण")।
- बहुत दूर के पड़ोसी: वे चीजें जो मुश्किल से संबंधित हैं (जैसे, "1995 में फ्रांस के बम विस्फोटों का इतिहास")।
- परीक्षण: यह स्वचालित रूप से इन पड़ोसियों के बारे में हजारों बहुविकल्पीय प्रश्न लिखता है, जो "बहुत करीब" से लेकर "बहुत दूर" तक होते हैं।
- रिपल कर्व (लहर का वक्र): वे "अनलर्निंग" (भूलने की प्रक्रिया) से पहले और बाद में AI का परीक्षण करते हैं। केवल पास/फेल स्कोर के बजाय, वे एक रेखा (एक वक्र) खींचते हैं जो यह दिखाती है कि जैसे-जैसे आप प्रतिबंधित विषय से दूर जाते हैं, प्रदर्शन में कितनी गिरावट आती है।
उन्होंने क्या पाया: "बगल में बम"
जब उन्होंने इसे AI को चीजें भुलाने के आठ अलग-अलग तरीकों पर टेस्ट किया, तो उन्हें कुछ आश्चर्यजनक पैटर्न मिले:
- "बगल में बम" का अंतर (The "Bomb Next Door" Gap): AI उन सटीक खतरनाक सवालों को भूलने में बहुत अच्छा था जिनके लिए उसे प्रशिक्षित किया गया था। हालांकि, वह "पड़ोसियों" (उन चीजों के बारे में जो खतरनाक विषय के ठीक बगल में हैं) के सवालों के जवाब देने में कहीं अधिक बेहतर था। ऐसा लग रहा था जैसे AI ने "एंथ्रक्स" जैसे विशिष्ट शब्दों को अनदेखा करना सीख लिया है लेकिन वह "बैक्टीरिया" की अवधारणा को पूरी तरह से समझता है। क्षति बहुत हदित तक प्रशिक्षण के सटीक उदाहरणों तक ही सीमित थी, न कि पूरी अवधारणा तक।
- लहर का आकार (The Shape of the Ripple): अलग-अलग अनलर्निंग विधियां अलग-अलग "लहर के आकार" बनाती हैं। कुछ विधियों के कारण प्रदर्शन में भारी गिरावट आती है जो दूर के विषयों के लिए भी कम रहती है (एक बड़ा, अस्त-व्यस्त छींटा)। अन्य विधियों के कारण लक्ष्य के ठीक बगल में गिरावट आती है लेकिन वे जल्दी ठीक हो जाती हैं (एक छोटा, साफ छींटा)।
- यह विधि है, मस्तिष्क नहीं: उन्होंने चार अलग-अलग AI मॉडल (Llama, Mistral, Zephyr, Yi) पर इसका परीक्षण किया। उन्होंने पाया कि "लहर का आकार" उन सभी के लिए एक जैसा था। इसका मतलब है कि AI कैसे भूलता है, यह उस विधि का गुण है जिसका उपयोग उसे भूलने के लिए सिखाने में किया गया है, न कि विशिष्ट AI मॉडल का। यह इस तरह है जैसे एक विशिष्ट प्रकार का हथौड़ा हमेशा एक विशिष्ट गड्ढा छोड़ता है, चाहे आप किसी भी दीवार पर प्रहार करें।
मानवीय जाँच
यह सुनिश्चित करने के लिए कि उनकी स्वचालित मशीन केवल निरर्थक बातें नहीं बना रही है, उन्होंने इंटरनेट पर 61 वास्तविक लोगों (मैकेनिकल टर्क) को उनके काम की जाँच करने के लिए रखा।
- उन्होंने लोगों से पूछा: "क्या यह विषय मुख्य विषय से दूसरे विषय की तुलना में अधिक करीब है?" (लोग मशीन के साथ 85-97% बार सहमत हुए)।
- उन्होंने पूछा: "क्या आप तथ्यों को पढ़ने के बाद इस प्रश्न का उत्तर दे सकते हैं?" (हाँ, और तथ्यों के साथ यह बहुत आसान था)।
- इससे सिद्ध हुआ कि वे "लहरें" जिन्हें वे माप रहे थे, वास्तविक और सार्थक थीं।
बड़ी तस्वीर
यह पेपर निष्कर्ष निकालता है कि हमें "भूलने" को एक साधारण ऑन/ऑफ स्विच के रूप में देखना बंद करना होगा। हमें ग्रेडिएंट (ढाल) को देखने की आवश्यकता है—उस सुचारू ढलान की कि जैसे-जैसे आप लक्ष्य से दूर जाते हैं, ज्ञान कैसे बदलता है।
लेखक यह नहीं कह रहे हैं कि यह उपकरण दुनिया को ठीक कर देगा या बीमारियों का इलाज करेगा। वे कह रहे हैं: "यहाँ एक उपकरण है जिससे आप देख सकते हैं कि जब आप एक ईंट निकालने की कोशिश करते हैं तो दीवार में दरारें कैसी आती हैं। यदि आप खिड़कियों को तोड़े बिना दीवार को ठीक करना चाहते हैं, तो आपको यह जानने की आवश्यकता है कि आपके उपकरण संरचना को कितनी जोर से हिला रहे हैं।"
उन्होंने कोड और डेटा जारी कर दिया है ताकि कोई भी इस "रिपल रूलर" का उपयोग करके अपने स्वयं के AI सुरक्षा तरीकों का परीक्षण कर सके।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।