Pseudoperplexity Probes Memorization in Protein Language Models
यह अध्ययन यह प्रदर्शित करने के लिए स्यूडोपरप्लेक्सिटी (pseudoperplexity) का उपयोग करता है कि प्रोटीन भाषा मॉडल ProtT5 अपने प्रशिक्षण डेटा का पता लगाने योग्य लेकिन सीमित रट्टा मारता है (memorization), जो यह सुझाव देता है कि यह केवल अनुक्रमों को रटने के बजाय मुख्य रूप से प्रोटीनों के सांख्यिकीय व्याकरण का सामान्यीकरण करता है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें
प्रोटीन लैंग्वेज मॉडल्स (pLMs) जैसे कि ProtT5 की कल्पना ऐसे सुपर-स्मार्ट छात्रों के रूप में करें जिन्होंने जीव विज्ञान की लगभग हर उपलब्ध पाठ्यपुस्तक पढ़ ली है। ये मॉडल प्रोटीन अनुक्रम (sequence) के अगले हिस्से की भविष्यवाणी करने में अद्भुत हैं, ठीक वैसे ही जैसे एक लैंग्वेज मॉडल वाक्य में अगले शब्द की भविष्यवाणी करता है।
लेकिन एक बड़ी चिंता है: क्या इन छात्रों ने वास्तव में व्याकरण के नियमों (प्रोटीन कैसे बनते हैं) को सीखा है, या उन्होंने केवल उन विशिष्ट वाक्यों को रट लिया है जो उन्होंने अपनी पाठ्यपुस्तकों में पढ़े थे? यदि उन्होंने केवल किताबों को रटा है, तो वे उस विषय पर लिखने में विफल हो सकते हैं जिसे उन्होंने पहले कभी नहीं देखा है।
प्रयोग: "नकली" बनाम "असली" टेस्ट
यह पता लगाने के लिए कि क्या ProtT5 केवल अपना होमवर्क दोहरा रहा था या वास्तव में सामग्री को समझ रहा था, शोधकर्ताओं ने स्यूडोपरप्लेक्सिटी (pseudoperplexity) नामक एक अवधारणा का उपयोग करके एक परीक्षण तैयार किया। इसे एक "सरप्राइज मीटर" (आश्चर्य मापने वाला यंत्र) के रूप में समझें।
- यदि मॉडल किसी अनुक्रम (sequence) से हैरान होता है, तो इसका मतलब है कि उसने इसे पहले नहीं देखा है (कम रटना/low memorization)।
- यदि मॉडल बिल्कुल भी हैरान नहीं होता है, तो इसका मतलब हो सकता है कि उसने वह सटीक अनुक्रम पहले देखा है (अधिक रटना/high memorization)।
सेटअप
शोधकर्ताओं ने ProtT5 को दो प्रकार के प्रोटीन अनुक्रम दिए:
- "देखी गई" सूची (The "Seen" List): वे अनुक्रम जो मॉडल के मूल प्रशिक्षण डेटा (जैसे कि छात्र का पुराना होमवर्क) का हिस्सा थे।
- "अनदेखी" सूची (The "Unseen" List): बिल्कुल नए, वास्तविक रूप से नवीन अनुक्रम जिन्हें मॉडल ने पहले कभी नहीं देखा था (जैसे कि एक बिल्कुल नया परीक्षा प्रश्न)।
परीक्षण को निष्पक्ष बनाने के लिए, उन्होंने इन सूचियों को पूरी तरह से मेल खाया। उन्होंने यह सुनिश्चित किया कि "देखी गई" और "अनदेखी" दोनों प्रोटीन समान लंबाई के हों, जीवों के समान परिवारों से आते हों, और जटिलता के समान स्तर के हों। यह ऐसा ही था जैसे सुनिश्चित करना कि छात्र को एक ही लंबाई और कठिनाई के दो निबंधों पर टेस्ट किया जा रहा है, जो अलग-अलग लोगों द्वारा लिखे गए हों।
बेसलाइन चेक
परिणामों पर भरोसा करने से पहले, शोधकर्ताओं ने यह जांचा कि क्या "अनदेखी" सूची वास्तव में नई थी। उन्होंने पैटर्न का विश्लेषण करने के लिए सरल, पुराने सांख्यिकीय उपकरणों (n-gram models) का उपयोग किया। उन्होंने पुष्टि की कि "अनदेखी" अनुक्रम वास्तव में प्रशिक्षण डेटा से इतने भिन्न थे कि उन्हें नए के रूप में माना जा सके, न कि केवल पुराने संस्करणों के थोड़े से बदले हुए रूप के रूप में।
परिणाम
जब उन्होंने ProtT5 पर "सरप्राइज मीटर" (स्यूडोपरप्लेक्सिटी) चलाया:
- मॉडल ने "देखी गई" अनुक्रमों के प्रति "अनदेखी" अनुक्रमों की तुलना में अलग प्रतिक्रिया दी। वह उन अनुक्रमों से कम हैरान था जिनका उसने पहले अध्ययन किया था।
- इससे यह सिद्ध हुआ कि ProtT5 के पास अपने प्रशिक्षण डेटा की कुछ स्मृति (memory) है।
निष्कर्ष
हालाँकि, अंतर बहुत बड़ा नहीं था। यह ऐसा नहीं था कि मॉडल पाठ्यपुस्तक को शब्द-दर-शब्द दोहरा रहा था। इसके बजाय, "रटने का संकेत" (memorization signal) मामूली था।
सरल शब्दों में: ProtT5 केवल अपने प्रशिक्षण डेटा को दोहराने वाला एक तोता नहीं है, लेकिन यह एक पूर्ण जीनियस भी नहीं है जिसने पहले कभी कोई विशिष्ट वाक्य नहीं देखा हो। इसमें जो कुछ उसने पढ़ा है उसकी एक पता लगाने योग्य लेकिन सीमित स्मृति है, जबकि यह नई जानकारी को संभालने के लिए मुख्य रूप से प्रोटीन व्याकरण के सामान्य नियमों पर निर्भर रहता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।