← नवीनतम पेपर
🤖 machine learning

Knowledge Graphs and Reasoning LLMs for Finding Simple Yet Effective Transcriptomic Perturbation Predictors

यह शोध पत्र प्रदर्शित करता है कि जैविक ज्ञान ग्राफ (biological knowledge graphs) का लाभ उठाने वाला एक सरल K-निकटतम पड़ोसी (K-nearest neighbor) दृष्टिकोण ट्रांसक्रिप्टोमिक व्यवधान प्रभावों (transcriptomic perturbation effects) की भविष्यवाणी करने में प्रतिस्पर्धी आउट-ऑफ-डिस्ट्रीब्यूशन प्रदर्शन प्राप्त करता है, जिसे पड़ोस चयन को परिष्कृत करने के लिए एक रीजनिंग LLM को अनुकूलित करने हेतु सुदृढीकरण लर्निंग (reinforcement learning) का उपयोग करके अत्याधुनिक तरीकों के बराबर बढ़ाया जा सकता है।

मूल लेखक: Jake Fawkes, Liam Hodgson, Jason Hartford

प्रकाशित 2026-06-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jake Fawkes, Liam Hodgson, Jason Hartford

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: अनिश्चितता की भविष्यवाणी करना

कल्पना कीजिए कि आप यह समझने की कोशिश कर रहे हैं कि यदि आप किसी जटिल मशीन (जैसे कार या कंप्यूटर) से एक विशिष्ट हिस्सा निकाल दें, तो क्या होगा। जीव विज्ञान में, यह "मशीन" एक जीवित कोशिका है, और इसके "हिस्से" जीन (genes) हैं। वैज्ञानिक जानना चाहते हैं: यदि हम जीन A को हटा दें (knock out), तो कोशिका के व्यवहार में क्या बदलाव आएगा?

यह प्रयोग वास्तविक लैब में करना धीमा, महंगा और जोखिम भरा है। इसलिए, वैज्ञानिक कंप्यूटर के माध्यम से इसका उत्तर जानना चाहते हैं। हालाँकि, कंप्यूटर इस काम में संघर्ष करते रहे हैं क्योंकि कोशिकाएं अविश्वसनीय रूप से जटिल होती हैं। यहाँ तक कि सरल कंप्यूटर मॉडल भी विफल हो जाते हैं, और कभी-कभी वे पिछले सभी प्रयोगों के औसत परिणाम का अनुमान लगाने से भी खराब प्रदर्शन करते हैं।

मूल विचार: "आपके पड़ोसी कौन हैं?"

इस शोध पत्र के लेखक एक आश्चर्यजनक रूप से सरल समाधान प्रस्तावित करते हैं जो एक जैविक सत्य पर आधारित है: जो जीन मिलकर काम करते हैं, वे समान रूप से प्रतिक्रिया करते हैं।

एक जीन को एक विशाल कारखाने के कर्मचारी के रूप में सोचें। यदि आप एक कर्मचारी को निकाल देते हैं, तो कारखाने का उत्पादन बदल जाता है।

  • पुराना तरीका: एक ऐसा विशाल, जटिल AI बनाने की कोशिश करें जो कारखाने के हर एक नियम को समझता हो।
  • शोध पत्र का तरीका: नॉलेज ग्राफ (Knowledge Graph) को देखें। यह एक विशाल संगठनात्मक चार्ट या एक मानचित्र की तरह है जो दिखाता है कि कारखाने में कौन किससे बात करता है। यदि आप "कर्मचारी A" को निकालते हैं, तो चार्ट पर उनके निकटतम पड़ोसियों को देखें (वे लोग जिनसे वे सबसे अधिक बात करते हैं)। यदि वे पड़ोसी निकाले जाने पर आमतौर पर एक निश्चित तरीके से प्रतिक्रिया करते हैं, तो मान लें कि "कर्मचारी A" भी उसी तरह प्रतिक्रिया करेगा।

लेखकों ने पाया कि यह सरल "अपने पड़ोसियों को देखें" वाला दृष्टिकोण (K-Nearest Neighbour मॉडल) वास्तव में इन परिवर्तनों की भविष्यवाणी करने में अधिकांश जटिल, हाई-टेक AI मॉडलों से बेहतर था।

समस्या: मानचित्र अधूरा है

एक समस्या थी। "नॉलेज ग्राफ" (संगठनात्मक चार्ट) पूर्ण नहीं है।

  1. कमी वाले लिंक: यह श्रमिकों के बीच के हर संबंध को नहीं दिखाता है।
  2. गलत पड़ोसी: कभी-कभी, चार्ट पर सूचीबद्ध पड़ोसी किसी विशिष्ट कार्य के लिए तुलना करने के लिए सबसे अच्छे लोग नहीं होते हैं।

यह एक शहर के मानचित्र की तरह है जिसमें कुछ सड़कें गायब हैं और कुछ बंद गलियां शामिल हैं। यदि आप केवल उस मानचित्र का उपयोग करके रास्ता खोजने की कोशिश करेंगे, तो आप करीब तो पहुँचेंगे, लेकिन आपको सबसे अच्छा रास्ता नहीं मिलेगा।

समाधान: "रीजनिंग" (तर्क करने वाला) AI

इस मानचित्र को ठीक करने के लिए, लेखकों ने एक लार्ज लैंग्वेज मॉडल (LLM) का उपयोग किया—जो एक प्रकार का AI है जो भाषा और संबंधों को समझने में बहुत कुशल है।

उन्होंने AI को केवल अनुमान लगाने के लिए नहीं कहा; उन्होंने इसे रीइन्फोर्समेंट लर्निंग (RL) नामक तकनीक का उपयोग करके मानचित्र को ठीक करना सिखाया।

  • उपमा: कल्पना कीजिए कि एक छात्र (AI) परीक्षा दे रहा है।
    • चरण 1: छात्र मानक मानचित्र (नॉलेज ग्राफ) के साथ शुरुआत करता है।
    • चरण 2: छात्र से पूछा जाता है: "क्या आप बेहतर भविष्यवाणी करने के लिए पड़ोसियों की इस सूची में सुधार कर सकते हैं?" वे कह सकते हैं, "मैं जीन X को जोड़ूँगा और जीन Y को हटा दूँगा।"
    • चरण 3: शिक्षक (कंप्यूटर) उत्तर की जाँच करता है। यदि भविष्यवाणी बेहतर होती है, तो छात्र को पुरस्कार (पॉइंट्स) मिलता है। यदि यह खराब होती है, तो उन्हें कोई पॉइंट नहीं मिलता।
    • चरण 4: छात्र बार-बार प्रयास करता है, यह सीखता है कि कौन से बदलाव पॉइंट्स दिलाते हैं।

समय के साथ, AI एक "रीजनिंग" (तर्क करने का) कौशल सीख जाता है: वह सीख जाता है कि कैसे एक जीन को देखना है, मानक मानचित्र की जाँच करनी है, और फिर तुलना करने के लिए जीन के आदर्श समूह को खोजने के लिए पड़ोसियों की सूची को संपादित (edit) करना है।

परिणाम: सरल + स्मार्ट = सर्वश्रेष्ठ

शोध पत्र में दो मुख्य बातें मिलीं:

  1. सरल बेसलाइन जीत गई: केवल मानक "पड़ोसी" सूची का उपयोग करना (AI के बिना) पहले से ही लगभग सभी अन्य जटिल AI मॉडलों को पीछे छोड़ रहा था।
  2. AI इसे पूर्ण बनाता है: जब उन्होंने उस सूची को बदलने के लिए AI को प्रशिक्षित किया, तो परिणाम उतने ही सटीक हो गए जितने कि वर्तमान में उपलब्ध सबसे अच्छे और सबसे जटिल मॉडलों (विशेष रूप से TxPert नामक मॉडल) के।

"मैजिक" बोनस:
भले ही AI को केवल जीन अभिव्यक्ति (gene expression) परिवर्तनों की भविष्यवाणी करने के लिए प्रशिक्षित किया गया था, यह अन्य जैविक प्रश्नों में भी बेहतर हुआ (जैसे कि यह भविष्यवाणी करना कि क्या कोई दवा जीन की गतिविधि को बदल देगी)। ऐसा लगता है कि AI ने केवल उत्तरों को याद करने के बजाय जीव विज्ञान के बारे में एक सामान्य "तर्क" सीख लिया है।

सारांश

  • समस्या: जीन परिवर्तन के प्रति कोशिका की प्रतिक्रिया की भविष्यवाणी करना कठिन है।
  • सरल समाधान: जीन की उसके ज्ञात जैविक पड़ोसियों के साथ तुलना करना। यह आश्चर्यजनक रूप से अच्छा काम करता है।
  • अपग्रेड: एक स्मार्ट AI का उपयोग करके उस सूची को संपादित करना, खराब पड़ोसियों को हटाना और अच्छे पड़ोसियों को जोड़ना, इस आधार पर कि वास्तव में भविष्यवाणी में क्या सुधार होता है।
  • परिणाम: एक सरल मानचित्र और एक स्मार्ट संपादक का यह संयोजन एक ऐसा उपकरण बनाता है जो सबसे उन्नत तरीकों के समान सटीकता के साथ जैविक परिवर्तनों की भविष्यवाणी करता है, लेकिन इसका आधार बहुत सरल तर्क है।

महत्वपूर्ण नोट: यह शोध पत्र पूरी तरह से इन कंप्यूटर भविष्यवाणियों को बेहतर बनाने पर केंद्रित है। यह दावा नहीं करता है कि यह विधि रोगियों के इलाज या नए ड्रग्स डिजाइन करने के लिए अस्पतालों में उपयोग के लिए तैयार है; यह बेहतर वैज्ञानिक मॉडलिंग के लिए एक 'प्रूफ ऑफ कॉन्सेप्ट' है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →