Comparative benchmarking of AI research agents for omics data interpretation
यह अध्ययन ओमिक्स डेटा व्याख्या के लिए तीन विशिष्ट एआई अनुसंधान एजेंटों (K-Dense, Finch, और Biomni) का ChatGPT के विरुद्ध एक व्यापक मात्रात्मक बेंचमार्क प्रस्तुत करता है, जो यह प्रकट करता है कि कोई भी एकल एजेंट सभी मोडैलिटीज पर हावी नहीं है और एजेंट आर्किटेक्चर, न कि बेस-मॉडल क्षमता, आउटपुट की गुणवत्ता और विशिष्ट बायोइन्फॉर्मेटिक वर्कफ़्लो के लिए उपयुक्तता का प्राथमिक निर्धारक है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें
मानव शरीर की कल्पना एक विशाल, हलचल भरे शहर के रूप में करें। यह समझने के लिए कि यह शहर कैसे काम करता है, वैज्ञानिक केवल सड़कों को ही नहीं देखते; वे हर एक निवासी का जनगणना भी करते हैं, चाहे वह छोटे डिलीवरी ट्रक (मेटाबोलाइट्स) हों, निर्माण दल (प्रोटीन) हों, या आदेश भेजने वाले शहर के योजनाकार (जीन)। इसे "ओमिक्स" (omics) डेटा कहा जाता है। यह सूचनाओं का एक विशाल पहाड़ है जो स्वास्थ्य और रोग की कहानी बताता है। लेकिन यहाँ एक समस्या है: शहर इतनी तेज़ी से बढ़ रहा है कि डेटा किसी भी मानव जासूसों की टीम द्वारा छाँटे जाने की तुलना में कहीं अधिक तेज़ी से जमा हो रहा है। हमें मदद की ज़रूरत है।
"एआई रिसर्च एजेंट्स" (AI Research Agents) के बारे में सोचें। इन्हें केवल साधारण सर्च इंजन के रूप में नहीं, बल्कि अत्यधिक प्रशिक्षित, स्वचालित इंटर्न के रूप में समझें। आप उन्हें डेटा का एक अस्त-व्यस्त डिब्बा और एक प्रश्न देते हैं जैसे, "इस बीमारी का कारण क्या है?" और उनसे उम्मीद की जाती है कि वे डेटा को साफ करेंगे, गणित चलाएंगे, चार्ट बनाएंगे, और उत्तर समझाने के लिए एक रिपोर्ट लिखेंगे। हाल ही में, इन एआई इंटर्नों की एक नई लहर आई है, जो सेकंडों में वैज्ञानिकों की पूरी टीम का काम करने का वादा करती है। लेकिन इतने सारे नए इंटर्न आने के साथ, एक बड़ा सवाल बना हुआ है: वास्तव में काम करने में सबसे अच्छा कौन है, और कौन केवल चीज़ों को सुंदर दिखाने में माहिर है?
यह शोध पत्र एक विशाल, व्यवस्थित "इंटर्न प्रतियोगिता" की तरह है ताकि यह पता लगाया जा सके। शोधकर्ताओं ने एक निष्पक्ष परीक्षण तैयार किया जहाँ चार अलग-अलग एआई एजेंटों को तीन बहुत अलग प्रकार के जैविक डेटा का विश्लेषण करना था: शरीर का रासायनिक सूप (मेटाबोलोमिक्स), कोशिकाओं के निर्माण खंड (प्रोटिओमिक्स), और आनुवंशिक निर्देश (ट्रांसक्रिप्टोमिक्स)। उन्होंने केवल एआई को अनुमान लगाने के लिए नहीं कहा; उन्होंने उन्हें विशिष्ट, वास्तविक दुनिया के डेटासेट दिए और देखा कि वे चरण-दर-चरण कैसे काम करते हैं।
परिणाम आश्चर्यजनक थे और उन्होंने हमें सिखाया कि कोई एक अकेला "सुपर-इंटर्न" नहीं है जो हर बार जीतता है। यह पता चला कि एआई का व्यक्तित्व और यह कि उसे कैसे बनाया गया है, उस कंप्यूटर मॉडल की कच्ची बौद्धिक क्षमता से अधिक मायने रखता है जिस पर वह चलता है।
यह प्रतियोगिता इस प्रकार संपन्न हुई:
- के-डेंस (K-Dense - सूक्ष्म वास्तुकार): यह एजेंट, जो जेमिनी 2.5 प्रो (Gemini 2.5 Pro) नामक एक शक्तिशाली मॉडल पर आधारित है, "रासायनिक सूप" (मेटाबोलोमिक्स) का चैंपियन था। इसने सबसे विस्तृत, पुनरुत्पादनीय (reproducible) रिपोर्ट तैयार की, जैसे कि एक वास्तुकार जो हर माप की दोबारा जाँच करता है। हालाँकि, यह कभी-कभी अपने ही विचारों में उलझ जाता था, जिसे इसे "फिर से प्रयास करने" के लिए एक मानवीय धक्के की आवश्यकता होती थी जब इसे लगता था कि इसका अपना काम पूर्ण नहीं है।
- फिंच (Finch - संगठित प्रबंधक): यह एजेंट, एडिसन साइंटिफिक (Edison Scientific) से है, अन्य दो श्रेणियों में स्पष्ट विजेता था: निर्माण खंड (प्रोटिओमिक्स) और आनुवंशिक निर्देश (ट्रांसक्रिप्टोमिक्स)। फिंच ने आवश्यक रूप से गहराई तक तो नहीं खोदा, लेकिन इसने सबसे सुव्यवस्थित, सुसंगत रिपोर्ट तैयार की। यह एक प्रोजेक्ट मैनेजर की तरह था जो हमेशा एक साफ, पूर्ण फ़ाइल समय पर वितरित करता है, भले ही विवरण थोड़े टेम्पलेट वाले हों।
- बायोमनी (Biomni - रचनात्मक कथावाचक): यह एजेंट, जो क्लॉड (Claude) परिवार पर आधारित है, "बड़ी तस्वीर" वाली जैविक व्याख्या के लिए बेहतरीन था। यह डेटा का क्या अर्थ है, इसके बारे में एक सम्मोहक कहानी सुना सकता था। हालाँकि, यह अक्सर उबाऊ लेकिन महत्वपूर्ण चरणों को छोड़ देता था, जैसे कि डेटा की सफाई करना या त्रुटियों की जाँच करना। यह एक ऐसे कथावाचक की तरह था जो एक शानदार अंत लिखता है लेकिन यह समझाने में भूल जाता है कि पात्र वहाँ तक कैसे पहुँचे।
- चैटजीपीटी (ChatGPT - सामान्यज्ञ): शोधकर्ताओं ने प्रसिद्ध सामान्य-उद्देश्य वाले चैटजीपीटी को एक आधार रेखा (baseline) के रूप में शामिल किया। जीव विज्ञान के लिए विशेष प्रशिक्षण के बिना, यह संघर्ष करता रहा। इसने मुख्य रूप से बुनियादी गणित किया और अक्सर एक पूर्ण रिपोर्ट देने में विफल रहा, जिससे यह हर श्रेणी में अंतिम स्थान पर रहा। इसने दिखाया कि एक सामान्य स्मार्ट टूल विशेष वैज्ञानिक कार्य के लिए पर्याप्त नहीं है।
इस दौड़ से मिला सबसे महत्वपूर्ण सबक यह नहीं है कि कौन पहले स्थान पर आया। शोधकर्ताओं ने पाया कि "हार्नेस" (harness)—वे विशिष्ट उपकरण और नियम जो एआई के चारों ओर बनाए गए हैं—उस एआई के मस्तिष्क से अधिक महत्वपूर्ण हैं जिस पर वह चलता है। एक एजेंट जिसके पास एक मजबूत सुरक्षा जाल और एक स्पष्ट कार्यप्रवाह (जैसे फिंच) है, वह एक स्मार्ट एजेंट को हरा सकता है जिसमें संरचना का अभाव है।
उन्होंने यह भी खोजा कि "पुनरुत्पादकता" (reproducibility) एक पेचीदा चीज़ है। एक एजेंट, चैटजीपीटी, रासायनिक श्रेणी में बहुत सुसंगत था, लेकिन केवल इसलिए क्योंकि वह बार-बार एक ही संक्षिप्त, उथले उत्तर दे रहा था। दूसरा एजेंट, के-डेंस, लगातार गहरा और विस्तृत था। सुसंगत होने का मतलब हमेशा सही या उपयोगी होना नहीं होता; कभी-कभी इसका मतलब केवल जिद्दी रूप से एक जैसा होना होता है।
अंत में, यह शोध पत्र सुझाव देता है कि हमें सभी मानव वैज्ञानिकों को बदलने के लिए एक एकल एआई रोबोट खोजने की आवश्यकता नहीं है। इसके बजाय, भविष्य संभवतः विशिष्ट एआई उपकरणों की एक टीम का होगा, जिनमें से प्रत्येक वह काम करेगा जिसमें वह सर्वश्रेष्ठ है, और मनुष्य यह सुनिश्चित करने के लिए उन पर नज़र रखेंगे कि वे जो कहानी सुना रहे हैं वह सत्य है। प्रतियोगिता ने दिखाया कि हालांकि एआई डेटा विश्लेषण का भारी काम कर सकता है, फिर भी हमें उन संपादकों के रूप में उनकी आवश्यकता है जो उनके काम की जाँच कर सकें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।