← नवीनतम पेपर
💻 computer science

Contextualizing Biological Language Models across Modalities via Logit-Space Contrastive Alignment

यह शोध पत्र LOGICA को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो नेटिव लाइकलीहुड इंटरफेस को बनाए रखने और साझा टोकनाइज़र के बिना संदर्भ-सशर्त भविष्यवाणियों को सक्षम करने के लिए लॉजिट स्पेस में कंट्रास्टिव लर्निंग के माध्यम से विभिन्न मोडैलिटीज़ के जैविक भाषा मॉडलों को संरेखित करता है, जिससे म्यूटेशन-लोकल वेरिएंट रैंकिंग और ड्रग-रेसिस्टेंस प्रेडिक्शन जैसे कार्यों में प्रदर्शन में महत्वपूर्ण सुधार होता है।

मूल लेखक: Yanjun Shao, Yundi Chen, Yashvi Patel, Aurelien Pelissier, María Rodríguez Martínez

प्रकाशित 2026-06-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yanjun Shao, Yundi Chen, Yashvi Patel, Aurelien Pelissier, María Rodríguez Martínez

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक अत्यंत बुद्धिमान और विद्वान लाइब्रेरियन है, जिसने जीव विज्ञान (biology) की लाखों किताबों को कंठस्थ कर लिया है। यह लाइब्रेरियन (एक जैविक भाषा मॉडल - Biological Language Model) वाक्य में अगले शब्द की भविष्यवाणी करने में माहिर है। यदि आप उसे एक प्रोटीन अनुक्रम (protein sequence) देते हैं, तो वह प्रकृति के सामान्य नियमों के आधार पर बता सकता है कि किसी निश्चित स्थान पर एक विशिष्ट अमीनो एसिड के आने की कितनी संभावना है।

हालाँकि, एक समस्या है। यह लाइब्रेरियन एक निर्वात (vacuum) में काम करता है। वह व्याकरण के नियमों को जानता है, लेकिन वह यह नहीं जानता कि आप किससे बात कर रहे हैं, आप कहाँ हैं, या आप क्या हासिल करने की कोशिश कर रहे हैं।

  • यदि आप पूछते हैं, "क्या यह प्रोटीन अनुक्रम तर्कसंगत है?" तो लाइब्रेरियन कहता है, "हाँ, यह नियमों का पालन करता है।"
  • लेकिन यदि आप पूछते हैं, "क्या यह प्रोटीन अनुक्रम तर्कसंगत है जब यह एक विशिष्ट दवा (drug) से जुड़ने की कोशिश कर रहा हो?" या "जब यह एक विशिष्ट वायरस से लड़ रहा हो?" तो वह गलत हो सकता है क्योंकि उसने पूरी तस्वीर को देखने का प्रशिक्षण नहीं लिया है।

समस्या: "एक ही आकार सबके लिए" (One-Size-Fits-All) का जाल

मौजूदा विधियाँ इस समस्या को हल करने की कोशिश करती हैं, लेकिन वे लाइब्रेरियन को स्थिति का एक नया, सरल "सारांश" सीखने के लिए मजबूर करती हैं। कल्पना कीजिए कि आप लाइब्रेरियन के विस्तृत नोट्स को ले रहे हैं, उन्हें एक एकल संख्या (एक "लेटेंट एम्बेडिंग") में सिकोड़ रहे हैं, और फिर उस संख्या के आधार पर अनुकूलता का अनुमान लगाने की कोशिश कर रहे हैं।

यह तर्क देता है कि यह एक जटिल फिल्म को केवल एक सिंगल पिक्सेल देखकर समझने की कोशिश करने जैसा है। आप सूक्ष्म विवरण खो देते हैं। आप आसानी से यह नहीं देख सकते कि अनुक्रम में कौन सा विशिष्ट अक्षर समस्या का कारण बन रहा है, और आप उन विवरणों के आधार पर नए अनुक्रम भी आसानी से उत्पन्न नहीं कर सकते।

समाधान: LOGICA (एक "संदर्भ-जागरूक" लाइब्रेरियन)

लेखक LOGICA (लॉगिट-स्पेस कॉन्ट्रास्टिव अलाइनमेंट) पेश करते हैं। लाइब्रेरियन के ज्ञान को एक सारांश संख्या में सिकोड़ने के बजाय, LOGICA लाइब्रेरियन को अपने विस्तृत नोट्स रखने के साथ-साथ संदर्भ (context) के साथ क्रॉस-रेफरेंस करना सिखाता है।

यह कैसे काम करता है, इसके लिए कुछ उपमाओं का उपयोग किया गया है:

1. "गेटेड अडैप्टर" (The Gated Adapter - अनुवादक)

कल्पना कीजिए कि लाइब्रेरियन के बोलने का एक विशिष्ट तरीका (उनकी मूल शब्दावली) है। LOGICA लाइब्रेरियन और नए संदर्भ (जैसे कि कोई दवा या वायरस) के बीच एक विशेष "अनुवादक" या "अडैप्टर" जोड़ता है।

  • यह अनुवादक लाइब्रेरियन के नोट्स को दोबारा नहीं लिखता है।
  • इसके बजाय, यह फुसफुसाता है, "हे, याद है हम उस दवा के बारे में बात कर रहे हैं? जब आप इस प्रोटीन के इस विशिष्ट स्थान को देखते हैं, तो ध्यान रखें कि दवा वहाँ मौजूद है।"
  • लाइब्रेरियन फिर अपनी मूल विशेषज्ञता को खोए बिना, वास्तविक समय में (real-time) अपनी भविष्यवाणी को समायोजित करता है।

2. "लॉगिट-स्पेस" (The Logit-Space - संभाव्यता स्कोरबोर्ड)

अधिकांश विधियाँ दो अलग-अलग भाषाओं को मिलाने के लिए उन्हें एक ही "सारांश भाषा" बोलने के लिए मजबूर करती हैं। LOGICA कुछ अलग करता है: यह लाइब्रेरियन के मूल संभाव्यता स्कोरबोर्ड (जिसे "लॉगिट्स" कहा जाता है) को बनाए रखता है।

  • इसे एक स्कोरबोर्ड के रूप में सोचें जो हर स्थिति में प्रत्येक संभावित अक्षर की संभावना दिखाता है।
  • LOGICA लाइब्रेरियन को इस स्कोरबोर्ड को देखने और यह कहने के लिए सिखाता है, "यदि मैं दवा A के बारे में बात कर रहा हूँ, तो इस विशिष्ट उत्परिवर्तन (mutation) की संभावना बढ़ जाती है। यदि मैं दवा B के बारे में बात कर रहा हूँ, तो यह कम हो जाती है।"
  • यह सारांशों को नहीं, बल्कि संभाव्यताओं को संरेखित करता है।

3. "म्यूटेशन लोकल" की महाशक्ति (The "Mutation Local" Superpower)

यह इस शोध पत्र की सबसे बड़ी चाल है। जीव विज्ञान में, अक्सर केवल एक छोटा सा परिवर्तन (एक एकल उत्परिवर्तन/mutation) ही मायने रखता है।

  • पुराना तरीका: यदि आप दो समान प्रोटीनों की तुलना करते हैं, तो पुरानी विधियाँ उन सभी हिस्सों के कारण भ्रमित हो सकती हैं जो समान हैं।
  • LOGICA का तरीका: क्योंकि LOGICA विस्तृत संभाव्यता स्कोरबोर्ड को बनाए रखता है, यह गणितीय रूप से उन हिस्सों को निरस्त (cancel out) कर सकता है जो समान हैं।
  • उपमा: कल्पना कीजिए कि दो लोग लगभग एक जैसे सूट पहने हुए हैं, लेकिन एक ने लाल टाई पहनी है और दूसरे ने नीली। यदि आप जानना चाहते हैं कि कौन कौन है, तो आपको पूरे सूट का विश्लेषण करने की आवश्यकता नहीं है। आप बस टाई को देखते हैं। LOGICA स्वचालित रूप से सूट को अनदेखा करता है और पूरी तरह से "टाई" (उत्परिवर्तन) पर ध्यान केंद्रित करता है, जिससे यह किसी विशिष्ट दवा के लिए कौन सा उत्परिवर्तन बेहतर है, इसे रैंक करने में अविश्वसनीय रूप से सटीक हो जाता है।

उन्होंने क्या सिद्ध किया?

लेखकों ने इस "संदर्भ-जागरूक लाइब्रेरियन" का परीक्षण तीन वास्तविक दुनिया की जैविक पहेलियों पर किया:

  1. प्रोटीन-ड्रग बाइंडिंग (Protein-Drug Binding): क्या एक प्रोटीन किसी दवा से चिपक सकता है? LOGICA पिछले तरीकों की तुलना में इसे बेहतर ढंग से अनुमान लगा सका, भले ही इसमें 3D संरचनात्मक डेटा का उपयोग नहीं किया गया था।
  2. ड्रग रेजिस्टेंस (Drug Resistance): यदि एक वायरस उत्परिवर्तित होता है, तो क्या वह अभी भी दवा से मारा जाएगा? LOGICA ने यह अनुमान लगाने की क्षमता में सुधार किया कि कौन से उत्परिवर्तन वायरस को प्रतिरोधी (resistant) बनाएंगे, जिससे इसकी सटीकता लगभग रैंडम अनुमान (55%) से बढ़कर एक बहुत ही उपयोगी स्तर (65%) तक पहुँच गई।
  3. इम्यून सिस्टम (TCR) मैचिंग: क्या एक T-सेल रिसेप्टर एक विशिष्ट वायरस पेप्टाइड को पहचान सकता है? LOGICA इस बात को रैंक करने में बेहतर था कि कौन से उत्परिवर्तन इस पहचान में मदद करेंगे या नुकसान पहुँचाएंगे।

मुख्य निष्कर्ष (The Bottom Line)

LOGICA जैविक मॉडलों को जीव विज्ञान के बारे में सिखाने का एक नया तरीका है। उन्हें अपने विस्तृत ज्ञान को भूलने और एक सरल सारांश सीखने के लिए मजबूर करने के बजाय, यह उन्हें अपना विस्तृत ज्ञान बनाए रखने के साथ-साथ यह सीखने में मदद करता है कि संदर्भ (जैसे कि दवा या साथी) के आधार पर अपना ध्यान कैसे केंद्रित करना है

यह एक लाइब्रेरियन को केवल वर्णमाला जानने वाले व्यक्ति से बदलकर ऐसा व्यक्ति बनाने जैसा है जो यह जानता है कि पूछने वाले और उसके कारण के आधार पर कौन सी किताब उठानी है, और साथ ही यह भी जानता है कि उत्तर किस पृष्ठ संख्या पर है। यह वैज्ञानिकों को न केवल यह अनुमान लगाने की अनुमति देता है कि क्या कोई दवा काम करेगी, बल्कि यह भी कि वह अनुक्रम में क्यों और कहाँ परस्पर क्रिया (interaction) करती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →