Alignment Whack-a-Mole : Finetuning Activates Verbatim Recall of Copyrighted Books in Large Language Models
यह शोधपत्र यह प्रदर्शित करता है कि विशिष्ट लेखकों की कृतियों पर लार्ज लैंग्वेज मॉडल्स को फाइनट्यून करना मौजूदा सुरक्षा संरेखण (सेफ्टी अलाइनमेंट) उपायों को दरकिनार कर कॉपीराइट वाली पुस्तकों के शब्दशः पुनरुद्धार (वर्बेटिकल रिकॉल) को ट्रिगर कर सकता है, जो यह प्रकट करता है कि मॉडल वेट्स स्वाभाविक रूप से प्रशिक्षण डेटा की प्रतियां संग्रहीत करते हैं और इस कानूनी आधार को चुनौती देता है कि वर्तमान सुरक्षा उपाय कॉपीराइट उल्लंघन को रोकने के लिए पर्याप्त हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ "Alignment Whack-a-Mole" पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करके दिया गया विवरण है।
मुख्य विचार: "व्हैक-ए-मोल" (Whack-a-Mole) की समस्या
कल्पना कीजिए कि एक रोबट के दिमाग के अंदर एक विशाल, जादुई पुस्तकालय है। इस पुस्तकालय में लाखों किताबें हैं, जिनमें वे कॉपीराइट वाले उपन्यास भी शामिल हैं जिन्हें रोबोट के पास नहीं होना चाहिए था।
रोबोट को ये किताबें चुराने से रोकने के लिए, रचनाकारों ने एक सुरक्षा गार्ड (जिसे अलाइनमेंट/Alignment कहा जाता है) तैनात किया है। इस गार्ड को प्रशिक्षित किया गया है कि वह कहे, "नहीं! मैं उस किताब को शब्द-दर-शब्द नहीं सुना सकता। यह नियमों के विरुद्ध है।"
इन रोबोटों को बनाने वाली कंपनियों (जैसे OpenAI, Google और DeepSeek) ने अदालतों से कहा: "चिंता न करें! हमारे रोबोट वास्तव में उन किताबों को स्टोर नहीं करते हैं। उन्होंने केवल कहानियों के 'भाव' (vibe) को सीखा है। यदि आप उनसे कोई कहानी लिखने को कहते हैं, तो वे नए शब्द बनाते हैं। उनके भीतर मूल टेक्स्ट छिपा हुआ नहीं है।"
यह पेपर साबित करता है कि वे गलत हैं।
शोधकर्ताओं ने सुरक्षा गार्ड को चकमा देने का एक तरीका खोज निकाला। उन्होंने रोबट से किताब "चुराने" के लिए नहीं कहा। इसके बजाय, उन्होंने रोबोट को एक साधारण होमवर्क दिया: "यहाँ एक कहानी का सारांश (summary) है। कृपया इस सारांश को एक पूर्ण पैराग्राफ में विस्तार दें।"
जब रोबोट ने यह होमवर्क किया, तो सुरक्षा गार्ड सो गया। रोबोट अचानक उन कॉपीराइट वाली किताबों का हूबहू, शब्द-दर-शब्द टेक्स्ट उगलने लगा, भले ही उससे सीधे उन्हें सुनाने के लिए नहीं कहा गया था।
प्रयोग: उन्होंने इसे कैसे किया
1. "सारांश-से-कहानी" (Summary-to-Story) वाला तरीका
रोबोट की याददाश्त को एक विशाल, बिखरे हुए अटारी (attic) की तरह समझें। किताबें वहाँ हैं, लेकिन वे अन्य चीजों के ढेर के नीचे दबी हुई हैं।
- पुराना तरीका: यदि आप रोबोट से पूछते, "हैरी पॉटर का अध्याय 1 सुनाओ," तो सुरक्षा गार्ड इसे रोक देता।
- नया तरीका: शोधकर्ताओं ने एक किताब का एक छोटा सा हिस्सा लिया, उस दृश्य में जो हुआ उसका एक सारांश लिखा (जैसे, "एक लड़का सफेद पर्दों वाले कमरे में खड़ा है"), और रोबोट से पूछा: "लेखक की शैली में इस दृश्य पर एक कहानी लिखें।"
रोबोट को लगा कि वह केवल रचनात्मक हो रहा है। लेकिन क्योंकि वह "सारांश" उसकी छिपी हुई अटारी के एक विशिष्ट स्थान से पूरी तरह मेल खाता था, इसलिए रोबोट ने केवल एक नई कहानी नहीं लिखी। उसने उसकी मेमोरी से मूल टेक्स्ट को बाहर निकाला और उसे आउटपुट में पेस्ट कर दिया।
2. "व्हैक-ए-मोल" (Whack-a-Mole) प्रभाव
शीर्षक "व्हैक-ए-मोल" उस आर्केड गेम को संदर्भित करता है जहाँ आप एक मोल (mole) को मारते हैं, और वह कहीं और से निकल आता है।
- कंपनियों ने रोबोट को टेक्स्ट कॉपी करने से रोकने के लिए फिल्टर और नियम जोड़कर इन "मोल्स" (सुरक्षा गार्डों) को "हिट" करने की कोशिश की।
- लेकिन शोधकर्ताओं ने दिखाया कि यदि आप खेल को थोड़ा बदल देते हैं (जैसे "रिकिटेशन" के बजाय "सारांश विस्तार" मांगकर), तो वह मोल फिर से प्रकट हो जाता है, और अक्सर पहले से भी बड़ा।
- कुछ मामलों में, रोबट ने एक पूरी किताब का 85-90% हिस्सा पुनरुत्पादित किया, जिसमें टेक्स्ट के एकल खंड 460 शब्दों से अधिक लंबे थे, और यह सब बिना किसी हिंट के हुआ।
3. "क्रॉस-ऑथर" (Cross-Author) का आश्चर्य
यहाँ सबसे डरावना हिस्सा है। शोधकर्ताओं ने रोबोट को केवल एक प्रसिद्ध लेखक (हारुकी मुराकामी) की किताबों का उपयोग करके यह होमवर्क करना सिखाया।
- अपेक्षा: आपको लगेगा कि रोबोट केवल मुराकामी की किताबें ही कॉपी करने लगेगा।
- वास्तविकता: मुराकामी का उपयोग करके सारांश विस्तार करना सीखने के बाद, रोबोट अचानक उन 30 अन्य लेखकों की किताबें कॉपी करने लगा जिन्हें उसने पहले कभी नहीं पढ़ा था! वह द हैंडमेड्स टेल, द हंगर गेम्स और सैपियंस को पूरी तरह से सुना सकता था।
उपमा: कल्पना कीजिए कि आप एक छात्र को केवल बीजगणित (Algebra) की पाठ्यपुस्तकों का उपयोग करके गणित के सवाल हल करना सिखाते हैं। आप उम्मीद करेंगे कि वह बीजगणित में अच्छा हो जाएगा। लेकिन इस मामले में, बीजगणित सिखाने से अचानक उसकी क्षमता अनलॉक हो गई कि वह भौतिक विज्ञान (Physics) की पूरी पाठ्यपुस्तक को पूरी तरह से सुना सके, जिसे उसने वर्षों पहले पढ़ा था, भले ही उसने इस नई क्लास में भौतिक विज्ञान का अध्ययन कभी नहीं किया था।
यह क्यों महत्वपूर्ण है: "छिपी हुई कॉपी" का सिद्धांत
पेपर का तर्क है कि ये रोबोट वास्तव में किताबों की प्रतियां स्टोर करते हैं। वे केवल "शैली" नहीं सीख रहे हैं; वे अपने मस्तिष्क के भार (weights) के भीतर वास्तविक टेक्स्ट को संकुचित (compress) कर रहे हैं।
- "कंप्रेस्ड ज़िप फ़ाइल" की उपमा: रोबोट के दिमाग को एक हार्ड ड्राइव की तरह समझें। किताबें केवल "विचार" नहीं हैं; वे ज़िप की गई फाइलों की तरह हैं। जब रोबบอล "सेफ मोड" (अलाइन) में होता है, तो वह उन्हें अनज़िप नहीं करेगा। लेकिन जब आप उसे सही "पासवर्ड" (विशिष्ट कार्य: सारांश विस्तार) देते हैं, तो वह फ़ाइल को अनज़िप कर देता है और आपको मूल दस्तावेज़ दिखा देता है।
- साक्ष्य: शोधकर्ताओं ने जांच की कि क्या ये सटीक शब्द इंटरनेट पर मौजूद थे। उन्होंने पाया कि लंबे, कॉपी किए गए टुकड़ों में से 61% कहीं भी वेब पर मौजूद नहीं थे। इसका मतलब है कि रोबोट ने केवल इंटरनेट से नहीं सीखा; इसे वास्तव में किताबों (संभवतः LibGen जैसी साइटों से पायरेटेड प्रतियों) पर प्रशिक्षित किया गया था और इन्हें अपने भीतर स्टोर किया गया था।
कानूनी बमबारी (Legal Bombshell)
यह कॉपीराइट कानून के लिए एक बहुत बड़ी बात है।
- कंपनियों का बचाव: वे न्यायाधीशों को बता रहे हैं, "हम सुरक्षित हैं! हमारे मॉडल किताबों को स्टोर नहीं करते, इसलिए हम चोरी नहीं कर रहे हैं। हमने केवल पैटर्न सीखे हैं।"
- वास्तविकता: यह पेपर साबित करता है कि किताबें मॉडल के अंदर मौजूद हैं। तथ्य यह है कि कंपनियों ने "चोरी न करें" का साइन (सुरक्षा गार्ड) लगाया है, इससे कोई फर्क नहीं पड़ता यदि किताबें भौतिक रूप से तिजोरी में रखी हुई हैं।
- "सुरक्षा विफलता" का तर्क: अदालत में, कंपनियाँ तर्क देती हैं कि उनके सुरक्षा उपाय "फेयर यूज़" (Fair Use) के रूप में पर्याप्त हैं। यह पेपर साबित करता है कि वे उपाय कमजोर हैं। एक साधारण होमवर्क असाइनमेंट ताले को तोड़ देता है। यदि किसी कंपनी का सुरक्षा तंत्र इतनी आसानी से बायपास किया जा सकता है, तो वे लेखकों के काम की रक्षा करने का दावा नहीं कर सकते।
एक वाक्य में सारांश
यह पेपर साबित करता है कि AI मॉडल वास्तव में अपने दिमाग में कॉपीराइट वाली किताबों की पूरी प्रतियां स्टोर करते हैं, और एक साधारण, हानिरहित दिखने वाला कार्य (एक कहानी के सारांश का विस्तार करना) रोबोट को उन किताबों को शब्द-दर-शब्द उगलने के लिए धोखा दे सकता है, जिससे उन सुरक्षा नियमों का उल्लंघन होता है जिनका दावा कंपनियां लेखकों की सुरक्षा के लिए करती हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।