← नवीनतम पेपर
💻 bioinformatics

Tox21mer, A transformer foundation model for Tox21 high-throughput concentration-response curves data

यह शोध पत्र Tox21mer को प्रस्तुत करता है, जो कि 2.5 मिलियन Tox21 सांद्रता-प्रतिक्रिया वक्रों (concentration-response curves) के माध्यम से मास्क्ड-रिस्पॉन्स रिकंस्ट्रक्शन (masked-response reconstruction) द्वारा प्रीट्रेन किया गया एक 43.5-मिलियन-पैरामीटर वाला ट्रांसफॉर्मर फाउंडेशन मॉडल है, जो उच्च गुणवत्ता वाले 768-आयामी एम्बेडिंग्स उत्पन्न करता है जो परख परिणामों (assay outcomes) और AC50 मानों की भविष्यवाणी करने में अत्याधुनिक प्रदर्शन प्राप्त करते हैं और साथ ही अनपरीक्षित यौगिकों तक एक्सट्रपलेशन (extrapolation) करने में सक्षम बनाते हैं।

मूल लेखक: Li, L., Hwang, J., Shockley, K., Li, Y., Motsinger-Reif, A., Hsieh, J.-H., Auerbach, S. S., Reif, D.

प्रकाशित 2026-06-19
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Li, L., Hwang, J., Shockley, K., Li, Y., Motsinger-Reif, A., Hsieh, J.-H., Auerbach, S. S., Reif, D.

मूल पेपर CC0 1.0 (https://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। ⚕️ यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि अमेरिकी Tox21 प्रोजेक्ट एक विशाल पुस्तकालय है जिसने लाखों "कहानियों" को इकट्ठा किया है कि कैसे विभिन्न रसायन विभिन्न जैविक परीक्षणों के प्रति प्रतिक्रिया करते हैं। प्रत्येक कहानी एक कॉन्सेंट्रेशन-रिस्पॉन्स कर्व (concentration-response curve) है—एक ग्राफ जो यह दिखाता है कि जब आप किसी कोशिका को थोड़ा सा रसायन, फिर थोड़ा अधिक, और फिर बहुत अधिक देते हैं तो क्या होता है। इन ग्राफों को एक-एक करके पढ़ना मनुष्यों के लिए धीमा और कठिन है।

यहाँ Tox21mer आता है, एक नया कंप्यूटर मस्तिष्क (एक AI मॉडल) जिसे इन कहानियों को तुरंत पढ़ने और समझने के लिए डिज़ाइन किया गया है।

यह कैसे काम करता है, इसके लिए कुछ रोज़मर्रा के उदाहरण दिए गए हैं:

1. "सुपर रीडर" (Super Reader)

Tox21mer को एक अत्यधिक उन्नत लाइब्रेरियन के रूप में सोचें जिसने इन रासायनिक कहानियों के बारे में 2.5 मिलियन कहानियाँ पढ़ी हैं। यह केवल तथ्यों को याद नहीं कर रहा है; यह इस पैटर्न को सीख रहा है कि रसायन कैसे व्यवहार करते हैं। यह एक जटिल ग्राफ और परीक्षण विवरणों की एक सूची (मेटाडेटा) लेता है और उन्हें एक एकल, संक्षिप्त "ID कार्ड" (एक 768-आयामी प्रतिनिधित्व) में संकुचित कर देता है। यह ID कार्ड रसायन के व्यवहार के सार को इस तरह से पकड़ता है जिसे कंप्यूटर आसानी से प्रोसेस कर सके।

2. इसने कैसे सीखा ( "खाली स्थान भरने वाला" खेल)

स्मार्ट बनने के लिए, मॉडल ने एक विशाल "मैड लिब्स" (Mad Libs) या "खाली स्थान भरने वाले" खेल खेला।

  • शोधकर्ताओं ने इसे लाखों कर्व दिखाए लेकिन डेटा के कुछ हिस्सों को छिपा दिया (मास्क्ड-रिस्पॉन्स रिकंस्ट्रक्शन)।
  • मॉडल को बाकी कर्व और परीक्षण संदर्भ के आधार पर गायब नंबरों का अनुमान लगाना था।
  • इसे थोड़ा अतिरिक्त सहयोग (लो-वेट सुपरविज़न) भी मिला ताकि यह विशिष्ट परिणामों को सीख सके, जैसे कि रसायन "सक्रिय" (active) था या "निष्क्रिय" (inactive), लेकिन मुख्य शिक्षक स्वयं वह खेल था।

3. परिणाम: यह कितना अच्छा है?

जब शोधकर्ताओं ने इस मॉडल का परीक्षण उन रसायनों पर किया जिन्हें इसने पहले कभी नहीं देखा था, तो इसने एक चैंपियन की तरह प्रदर्शन किया:

  • "ट्रैफिक लाइट" टेस्ट: यह एक कर्व को देखकर आपको बता सकता था कि एक रसायन "एगोनिस्ट" (Agonist - गो), "एंटागोनिस्ट" (Antagonist - स्टॉप), या "इनएक्टिव" (Inactive - न्यूट्रल) है, और इसकी सटीकता 98.5% थी।
  • "ऑन/ऑफ" स्विच: यह केवल यह कह सकता था कि रसायन "सक्रिय" है या "निष्क्रिय", और इसकी सटीकता 99.4% थी।
  • "स्ट्रेंथ" गेज: यह रसायन की ताकत (विशेष रूप से AC50 मान) का अनुमान लगा सकता था, जिसकी सटीकता स्कोर (R2) 0.87 थी।

4. वास्तव में क्या मायने रखता है?

शोधकर्ता जानना चाहते थे: क्या मॉडल इसलिए स्मार्ट है क्योंकि इसने उत्तर रट लिए हैं, या इसलिए क्योंकि इसने कर्व के आकार को सीखा है?

  • उन्होंने मॉडल को अतिरिक्त "उत्तर कुंजियों" (ऑक्सिलरी लेबल्स) के बिना प्रशिक्षित करने की कोशिश की। यह लगभग उतना ही अच्छा काम करता रहा। यह साबित करता है कि मॉडल ने केवल लेबल नहीं, बल्कि डेटा के आकार और पैटर्न को सीखा है।
  • उन्होंने यह भी पाया कि मॉडल डेटा बिंदुओं के समग्र वितरण (कर्व के सामान्य रुझान) पर अधिक ध्यान देता है, न कि प्रत्येक एकल बिंदु के सख्त क्रम पर। यह एक गाने को हर एक नोट गिनने के बजाय उसकी धुन से पहचानने जैसा है।

5. यह क्यों उपयोगी है

पेपर यह निष्कर्ष निकालता है कि Tox21mer इन रासायनिक कर्व्स के लिए एक सार्वभौमिक "भाषा" बनाता है। क्योंकि यह इस भाषा को इतनी अच्छी तरह समझता है, इसलिए इसका उपयोग आधार के रूप में किया जा सकता है:

  • इस मॉडल को रासायनिक डेटा के साथ जोड़कर नए, अन-टेस्टेड रसायनों के व्यवहार की भविष्यवाणी करने के लिए।
  • छोटे, सरल मॉडलों (जिन्हें "स्टूडेंट मॉडल" कहा जाता है) को यही काम सिखाने के लिए, जिससे मूल लाइब्रेरी के बाहर रसायनों की व्यापक स्क्रीनिंग संभव हो सके।

संक्षेप में, Tox21mer एक ऐसा उपकरण है जो जटिल रासायनिक ग्राफों को स्पष्ट, समझने योग्य डेटा में बदल देता है, जिससे वैज्ञानिकों को उच्च गति और सटीकता के साथ रासायनिक व्यवहार की भविष्यवाणी करने की अनुमति मिलती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →