← नवीनतम पेपर
🤖 machine learning

From Words to Amino Acids: Does the Curse of Depth Persist?

यह शोध पत्र यह प्रदर्शित करता है कि "डेप्थ का अभिशाप" (Curse of Depth), जहाँ केवल परतों का एक उपसमुच्चय ही कार्य प्रदर्शन में महत्वपूर्ण योगदान देता है जबकि अन्य केवल क्रमिक परिशोधन प्रदान करते हैं, विभिन्न प्रोटीन भाषा मॉडल आर्किटेक्चर में एक व्यापक अक्षमता है, जिसमें ऑटोरेग्रेसिव, मास्क्ड और मल्टीमॉडल डिफ्यूजन मॉडल शामिल हैं।

मूल लेखक: Aleena Siji, Amir Mohammad Karimi Mamaghan, Ferdinand Kapl, Tobias Höppe, Emmanouil Angelis, Andrea Dittadi, Maurice Brenner, Michael Heinzinger, Karl Henrik Johansson, Kaitlin Maile, Johannes von Osw
प्रकाशित 2026-04-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Aleena Siji, Amir Mohammad Karimi Mamaghan, Ferdinand Kapl, Tobias Höppe, Emmanouil Angelis, Andrea Dittadi, Maurice Brenner, Michael Heinzinger, Karl Henrik Johansson, Kaitlin Maile, Johannes von Oswald, Stefan Bauer

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य प्रश्न: क्या "डीप" (Deep) का अर्थ वास्तव में गहरा है?

कल्पना कीजिए कि आप एक जटिल पहेली को हल करने के लिए एक विशाल, बहु-मंजिला गगनचुंबी इमारत बना रहे हैं। आप यह मान लेते हैं कि इमारत के हर एक तल (या परत) का अंतिम समाधान के लिए होना आवश्यक है। यदि आप ऊपरी मंजिल को हटा देते हैं, तो इमारत ढह जानी चाहिए, है ना?

लंबे समय तक वैज्ञानिकों को लगा कि प्रोटीन लैंग्वेज मॉडल्स (PLMs) के लिए यह सच है। ये वे AI सिस्टम हैं जिन्हें प्रोटीन की "भाषा" (अमीनो एसिड की श्रृंखला) पर प्रशिक्षित किया गया है ताकि वे समझ सकें कि वे कैसे काम करते हैं, कैसे मुड़ते (fold) हैं और कैसे उत्परिवर्तित (mutate) होते हैं। प्रसिद्ध लार्ज लैंग्वेज मॉडल्स (LLMs) की तरह, जो टेक्स्ट लिखते हैं, ये प्रोटीन मॉडल बहुत "गहरे" (deep) बनाए गए हैं, जिनमें दर्जनों परतें एक के ऊपर एक रखी गई हैं।

हालाँकि, टेक्स्ट-आधारित AI पर हालिया शोध में एक आश्चर्यजनक खोज हुई जिसे "डेप्थ का अभिशाप" (Curse of Depth) कहा गया। यह पता चला कि इन ऊँची इमारतों में, ऊपरी मंजिलें बहुत अधिक भारी काम नहीं कर रही हैं। वे केवल उस उत्तर को पॉलिश कर रही हैं जो पहले से ही निचली मंजिलों पर तय किया जा चुका है।

यह पेपर पूछता है: क्या यह "डेप्थ का अभिशाप" प्रोटीन मॉडल्स में भी होता है?

जांच: परतों का परीक्षण

शोधकर्ताओं ने 7 अलग-अलग प्रोटीन मॉडल परिवारों (जिनमें लोकप्रिय ESM2, ESM3 और ProGen शामिल हैं) का परीक्षण करने के लिए एक "सलेजहैमर" (भारी हथौड़े) वाला दृष्टिकोण अपनाया। उन्होंने केवल मॉडल्स को देखा ही नहीं; उन्होंने सक्रिय रूप से उन्हें तोड़कर देखा कि क्या होता है।

उन्होंने तीन मुख्य विधियों का उपयोग किया, जिन्हें हम इस प्रकार समझ सकते हैं:

  1. "एक मंजिल छोड़ दो" परीक्षण (Intervention): कल्पना कीजिए कि AI एक प्रोटीन अनुक्रम (sequence) को प्रोसेस कर रहा है। शोधकर्ताओं ने AI से कहा, "20वीं मंजिल को अनदेखा करो; सीधे 19वीं से 21वीं पर जाओ।" फिर उन्होंने जाँच की कि क्या अंतिम उत्तर बदला।

    • परिणाम: अधिकांश मॉडल्स में, ऊपरी मंजिलों को छोड़ने से बहुत कम बदलाव आया। AI अभी भी सही उत्तर तक पहुँच गया। लेकिन बीच की मंजिलों को छोड़ने पर? इससे सब गड़बड़ हो गया। "भारी काम" (heavy lifting) बीच में होता है, ऊपर नहीं।
  2. "उत्तर का अनुमान लगाएं" परीक्षण (Output Readouts): उन्होंने हर एक मंजिल पर AI की "सोचने की प्रक्रिया" पर नज़र डाली कि वह क्या भविष्यवाणी कर रहा है।

    • परिणाम: जब तक जानकारी इमारत के बीच तक पहुँची, AI ने पहले ही मुख्य उत्तर निकाल लिया था। ऊपरी मंजिलें केवल आत्मविश्वास के स्तरों को ट्यून कर रही थीं (जैसे, "शायद" को "निश्चित रूप से" में बदलना) न कि वास्तविक उत्तर को बदल रही थीं।
  3. "वास्तविक दुनिया" का परीक्षण (Downstream Performance): उन्होंने यह परीक्षण किया कि AI किसी विशिष्ट मंजिल की जानकारी का उपयोग करके एक वास्तविक कार्य (यह भविष्यवाणी करना कि उत्परिवर्तन प्रोटीन को कैसे प्रभावित करता है) कितनी अच्छी तरह करता है।

    • परिणाम: बड़े मॉडल्स के लिए, प्रदर्शन वक्र (performance curve) सपाट हो गया। मध्य परतों ने कार्य के लिए आवश्यक लगभग सारा उपयोगी डेटा कैप्चर कर लिया था। ऊपर और परतें जोड़ने से केवल मामूली, क्रमिक सुधार ही मिले।

अपवाद और बारीकियां

हालांकि "डेप्थ का अभिशाप" एक सामान्य विषय था, पेपर ने कुछ दिलचस्प भिन्नताएं भी पाईं:

  • "पॉलिश करने वाले" बनाम "निर्माता" (The "Polishers" vs. The "Builders"): अधिकांश मॉडल्स में, शुरुआती और मध्य परतें "निर्माता" होती हैं जो मूल समझ का निर्माण करती हैं। बाद की परतें "पॉलिश करने वाली" होती हैं जो केवल अंतिम आउटपुट को परिष्कृत करती हैं।
  • "ESM3" का ट्विस्ट: एक विशिष्ट मॉडल, ESM3, अलग व्यवहार करता है। यह एक "मल्टीमॉडल" मॉडल है, जिसका अर्थ है कि यह प्रोटीन के अनुक्रम (अक्षर) और उसकी 3D संरचना (आकार) दोनों को देखता है।
    • उपमा: ESM3 में, शुरुआती मंजिलें अनुक्रम और संरचना को एक-दूसरे से "परिचित" कराने में व्यस्त लगती हैं, यह सुनिश्चित करने के लिए कि वे एक ही भाषा बोलें। वास्तविक भारी समस्या-समाधान इमारत में बाद में होता है। यह सुझाव देता है कि जब आप विभिन्न प्रकार के डेटा को मिलाते हैं, तो "डेप्थ" का उपयोग अलग तरह से किया जाता है।
  • "स्पार्स" (Sparse) मॉडल: एक मॉडल, ProGen3, "मिक्सचर ऑफ एक्सपर्ट्स" (MoE) डिज़ाइन का उपयोग करता है, जो विशेषज्ञों की एक टीम की तरह है जहाँ प्रत्येक समस्या पर एक समय में केवल कुछ ही विशेषज्ञ काम करते हैं। इसने "डेप्थ के अभिशाप" को कम दिखाया, जिससे पता चलता है कि "स्पार्स" होना (कम सक्रिय भागों का उपयोग करना) गहराई का अधिक कुशलता से उपयोग करने में मदद कर सकता है।

निष्कर्ष

पेपर यह निष्कर्ष निकालता है कि डेप्थ की अक्षमता आधुनिक प्रोटीन मॉडल्स की एक सामान्य विशेषता है।

टेक्स्ट-आधारित AI की तरह ही, केवल अपने प्रोटीन मॉडल को "गहरा" बनाने (अधिक परतें जोड़ने) का मतलब हमेशा यह नहीं होता कि वह आनुपातिक रूप से स्मार्ट हो रहा है। गणना का एक बड़ा हिस्सा परतों के एक विशिष्ट समूह (आमतौर पर मध्य परतों) में केंद्रित होता है, जबकि शेष परतें मुख्य रूप से अंतिम भविष्यवाणी को रिफाइन करने के लिए होती हैं।

यह क्यों मायने रखता है?
लेखकों का सुझाव है कि यदि हमें पता चल जाए कि ऊपरी मंजिलें भारी काम नहीं कर रही हैं, तो हम भविष्य में अधिक स्मार्ट, अधिक कुशल प्रोटीन मॉडल डिजाइन कर सकते हैं। केवल ऊँची गगनचुंबी इमारतें बनाने के बजाय, हम छोटी, अधिक कुशल इमारतें बना सकते हैं, या ऐसे सिस्टम बना सकते हैं जो ऊर्जा और समय बचाने के लिए संचालन के दौरान अनावश्यक मंजिलों को "छोड़" (skip) सकें।

संक्षेप में: पेपर पुष्टि करता है कि प्रोटीन मॉडल्स भी टेक्स्ट मॉडल्स की तरह ही "डेप्थ के अभिशाप" से ग्रस्त हैं। मध्य परतें असली काम करती हैं; ऊपरी परतें केवल अंतिम पेंट का कोट लगाने जैसा काम करती हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →