← नवीनतम पेपर
📄 other

Mechanistic Interpretability of Biological Foundation Models: An Empirical Analysis of scGPT Gene-Embedding Geometry

यह शोध पत्र अनुभवजन्य रूप से प्रदर्शित करता है कि scGPT फाउंडेशन मॉडल का स्थिर जीन-टोकन एम्बेडिंग स्पेस ज्ञात भौतिक प्रोटीन-प्रोटीन इंटरैक्शन के बारे में पता लगाने योग्य, हालांकि मध्यम, जानकारी को एनकोड करता है, जैसा कि गैर-इंटरैक्टिंग नियंत्रणों की तुलना में इंटरैक्टिंग जीन युग्मों के लिए काफी उच्च कोसाइन समानता और इंटरैक्शन भविष्यवाणी मेट्रिक्स द्वारा प्रमाणित होता है।

मूल लेखक: Liu Chen

प्रकाशित 2026-07-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Liu Chen

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मानव शरीर की कल्पना एक विशाल, हलचल भरे शहर के रूप में करें। इस शहर के भीतर, अरबों नन्हे कर्मचारी (कोशिकाएं) सब कुछ सुचारू रूप से चलाने के लिए लगातार एक-दूसरे से बात कर रहे हैं। इस शहर के काम करने के तरीके को समझने के लिए, वैज्ञानिकों ने आर्टिफिशियल इंटेलिजेंस (AI) का उपयोग करके इन कोशिकाओं के "डिजिटल ट्विन्स" (डिजिटल जुड़वां) बनाए हैं। ये AI मॉडल उन अत्यंत बुद्धिमान पुस्तकालयाध्यक्षों (librarians) की तरह हैं जिन्होंने कोशिकाओं के व्यवहार के बारे में लिखी गई हर किताब पढ़ ली है। वे केवल तथ्यों को रटते नहीं हैं; वे जीव विज्ञान की "भाषा" सीखते हैं, और जटिल आनुवंशिक निर्देशों को गणितीय मानचित्रों में बदल देते हैं।

बड़ा सवाल जो वैज्ञानिक अभी पूछ रहे हैं, वह यह है: क्या ये AI पुस्तकालयाध्यक्ष वास्तव में शहर को समझते हैं, या वे केवल अनुमान लगाने में माहिर हैं? जब एक AI सीखता है, तो वह एक गुप्त "शब्दकोश" बनाता है जहाँ हर शब्द (इस मामले में, हर जीन) को एक बहु-आयामी स्थान (multi-dimensional space) में एक विशिष्ट पता दिया जाता है। यदि AI वास्तव में जीव विज्ञान को समझता है, तो वे जीन जो वास्तविक जीवन में मिलकर काम करते हैं, उन्हें इस डिजिटल पड़ोस में एक-दूसरे के करीब रहना चाहिए। यदि वे केवल यादृच्छिक (random) पड़ोसी हैं, तो इसका अर्थ है कि AI बिना किसी वास्तविक अंतर्दृष्टि के केवल पैटर्न की नकल कर रहा है। यह शोध पत्र एक विशेष AI पुस्तकालयाध्यक्ष, जिसे scGPT कहा जाता है, का अध्ययन करता है ताकि यह देखा जा सके कि क्या जीनों का इसका आंतरिक मानचित्र वास्तव में हमारे सेल्स के भीतर होने वाली वास्तविक दुनिया की दोस्ती और साझेदारी को दर्शाता है।


डिजिटल पड़ोस की जाँच

इस अध्ययन में, लियू चेन नामक एक शोधकर्ता ने scGPT मॉडल के साथ "डिजिटल जासूसी" का खेल खेलने का निर्णय लिया। scGPT को 60,000 विभिन्न जीनों का एक विशाल, अदृश्य शहर योजनाकार (city planner) मानिए जिसने एक मानचित्र तैयार किया है। इस मानचित्र में, प्रत्येक जीन एक घर है, और दो घरों के बीच की दूरी उस समानता को दर्शाती है जिसे AI उनके बीच मानता है। शोधकर्ता जानना चाहता था: यदि दो जीन वास्तविक जीवन में सबसे अच्छे दोस्त हैं (अर्थात, वे भौतिक रूप से स्पर्श करते हैं और प्रोटीन बनाने के लिए मिलकर काम करते हैं), तो क्या AI का मानचित्र उनके घरों को पास रखता है?

यह पता लगाने के लिए, शोधकर्ता ने जैविक दोस्ती की दो विशाल, वास्तविक दुनिया की "फोन बुक्स" लीं: STRING और BioGRID। ये ऐसे डेटाबेस हैं जहाँ वैज्ञानिकों ने दर्ज किया है कि मानव शरीर में कौन से जीन वास्तव में हाथ मिलाते हैं। फिर शोधकर्ता ने scGPT मानचित्र लिया और इन फोन बुक्स में सूचीबद्ध जीनों के बीच की दूरी की जाँच की।

निष्कर्ष: एक सुराग, कोई पुख्ता सबूत नहीं

परिणाम दिलचस्प थे, लेकिन वे एक बहुत ही महत्वपूर्ण "लेकिन" के साथ आए।

अच्छी खबर: AI का मानचित्र यादृच्छिक (random) नहीं था। जब शोधकर्ता ने उन जीनों को देखा जो ज्ञात रूप से मजबूत भौतिक भागीदार हैं, तो वे वास्तव में AI के डिजिटल स्थान में उन जीनों की तुलना में करीब पाए गए जो बिल्कुल भी परस्पर क्रिया (interact) नहीं करते हैं।

  • सबसे भरोसेमंद दोस्ती के लिए (जहाँ वैज्ञानिक पूरी तरह आश्वस्त हैं कि जीन आपस में क्रिया करते हैं), AI ने उन्हें काफी करीब रखा। "निकटता स्कोर" (जिसे कोसाइन सिमिलरिटी कहा जाता है) अजनबियों के लिए मात्र 0.011 से बढ़कर मजबूत भागीदारों के लिए 0.111 हो गया।
  • यदि आप AI से किसी विशिष्ट जीन के लिए शीर्ष 10 पड़ोसियों को खोजने के लिए कहते, तो वास्तविक जैविक भागीदार को खोजने की इसकी संभावना एक यादृच्छिक मानचित्र की तुलना में 52.9 गुना अधिक थी।
  • यह संकेत वास्तविक दुनिया के साक्ष्य के मजबूत होने के साथ और अधिक मजबूत होता गया। STRING डेटाबेस में वैज्ञानिकों का एक साझेदारी के प्रति विश्वास जितना अधिक था, AI ने उन जीनों को उतना ही करीब रखा।

"लेकिन" (जो AI ने नहीं किया):
यह शोध पत्र बहुत सावधानी से कहता है कि हालांकि AI ने एक संकेत पाया है, लेकिन यह कोई जादुई क्रिस्टल बॉल नहीं है।

  • यह एक सटीक भविष्यवक्ता नहीं है: सबसे मजबूत दोस्ती के लिए भी, AI लगभग 70% बार सही उत्तर दे पाया (एक AUROC 0.704)। यह एक सिक्के के उछाल (coin flip) से बेहतर है, लेकिन पूर्णता से बहुत दूर है।
  • यह मन पढ़ने वाला नहीं है: अध्ययन स्पष्ट रूप से इस विचार को खारिज करता है कि AI ने यह सीखा है कि ये जीन क्यों मिलकर काम करते हैं या वे एक-दूसरे को कैसे नियंत्रित करते हैं। AI जानता है कि वे पड़ोसी हैं, लेकिन वह आवश्यक रूप से उनकी बातचीत के नियमों को नहीं जानता। यह जानने जैसा है कि दो लोग एक ही सड़क पर रहते हैं, बिना यह जाने कि वे विवाहित हैं, दुश्मन हैं, या केवल पड़ोसी हैं।
  • यह केवल एक शुरुआत है: यह "निकटता" AI की पहली परत (layer) में पाई गई थी, इससे पहले कि वह किसी विशिष्ट कोशिका या स्थिति को देखता। यह आधार है, पूरी इमारत नहीं।

निर्णय

तो, हमारे डिजिटल शहर के लिए इसका क्या अर्थ है? अध्ययन बताता है कि scGPT मॉडल ने सफलतापूर्वक एक "ज्यामितीय संकेत" (geometric hint) को आत्मसात कर लिया है कि जीन कैसे परस्पर क्रिया करते हैं। जटिल गणनाएँ शुरू करने से पहले ही, इसका आंतरिक शब्दकोश इस तरह व्यवस्थित है जो वास्तविक जैविक दोस्ती को दर्शाता है।

हालाँकि, शोधकर्ता बहुत स्पष्ट है: यह एक मामूली खोज है। AI ने एक ऐसा मानचित्र सीखा है जहाँ दोस्त पास रहते हैं, लेकिन उसने यह नहीं सीखा है कि शहर कैसे चलता है। यह एक आशाजनक संकेत है कि ये मॉडल अपने "मस्तिष्क" के भीतर कुछ वास्तविक बना रहे हैं, लेकिन इससे पहले कि हम कह सकें कि वे वास्तव में जीवन की यांत्रिकी को समझते हैं, हमें अभी लंबा रास्ता तय करना है। संकेत मौजूद है, इसे पहचाना जा सकता है, लेकिन यह कहानी की शुरुआत है, पूरी किताब नहीं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →