EpiBench: Verifiable Evaluation of AI Agents on Epigenomics Analysis
एपिबेंच (EpiBench) लघु-क्षितिज एपिजेनोमिक्स विश्लेषण के लिए एक सत्यापन योग्य बेंचमार्क है जो चार परख प्रकारों (assay types) में 106 यथार्थवादी वर्कफ़्लो कार्यों पर एआई एजेंटों का मूल्यांकन करता है, जिससे यह पता चलता है कि GPT-5.5 जैसे शीर्ष प्रदर्शन करने वाले मॉडल भी बहुमत सफलता दर प्राप्त करने में विफल रहते हैं क्योंकि उन्हें सही फ़ाइलों और मध्यवर्ती परिणामों की पहचान करने के बावजूद, गहन, परख-विशिष्ट वैज्ञानिक निर्णय लागू करने में कठिनाई होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास बहुत ही बुद्धिमान, उच्च प्रशिक्षित रोबोट सहायकों की एक टीम है। आप यह देखना चाहते हैं कि क्या वे जटिल जैविक डेटा का विश्लेषण करते समय विशेषज्ञ वैज्ञानिकों की तरह कार्य कर सकते हैं। विशेष रूप से, आप यह जानना चाहते हैं कि क्या वे आनुवंशिक "रसीदों" (प्रयोगों से प्राप्त डेटा) के एक अस्त-व्यस्त ढेर को देखकर वही सही कहानी समझ सकते हैं, जैसा कि एक मानव विशेषज्ञ करेगा।
यह शोध पत्र एक नया परीक्षण पेश करता है जिसे EpiBench कहा जाता है, ताकि यह देखा जा सके कि ये AI रोबोट उस विशिष्ट कार्य में कितने कुशल हैं।
परीक्षण: AI वैज्ञानिकों के लिए एक "पॉप क्विज़"
EpiBench को 106 पॉप क्विज़ की एक श्रृंखला के रूप में समझें। प्रत्येक क्विज़ AI को एक वास्तविक वैज्ञानिक प्रयोग का एक स्नैपशॉट देती है जो आधा पूरा हुआ है। AI को यह करना होगा:
- प्रदान की गई फाइलों और डेटा को देखना।
- एक विशिष्ट निर्णय लेना (जैसे "हमें किन नमूनों की तुलना करनी चाहिए?" या "यहाँ सही संख्या क्या है?")।
- एक अंतिम उत्तर देना।
यह परीक्षण चार मुख्य प्रकार के आनुवंशिक प्रयोगों (जैसे कि DNA कैसे पैक किया गया है, जीन कैसे सक्रिय होते हैं, या DNA पर रासायनिक टैग्स की जांच करना) को कवर करता है। उत्तरों को स्वचालित रूप से ग्रेड किया जाता है: या तो यह सही है या गलत। इसमें "लगभग सही" जैसा कुछ नहीं है।
परिणाम: रोबोट अभी भी सीख रहे हैं
शोधकर्ताओं ने AI मॉडल और कोडिंग टूल के 16 विभिन्न संयोजनों का परीक्षण किया। इसका निचोड़ यह है: इनमें से कोई भी अधिकांश क्विज़ पास नहीं कर सका।
- सर्वश्रेष्ठ प्रदर्शन करने वाला: शीर्ष टीम (एक मॉडल जिसे GPT-5.5 कहा गया है और एक विशिष्ट कोडिंग टूल के साथ जोड़ा गया था) केवल 45% बार सही उत्तर दे पाई। इसका मतलब है कि वे आधे से अधिक समय में विफल रहे।
- बाकी सब: अन्य टीमें और भी खराब प्रदर्शन करती हैं, जिनकी पास दर लगभग 12% से 39% के बीच रही।
यह ड्राइविंग टेस्ट देने जैसा है जहाँ सबसे अच्छा ड्राइवर भी 100 में से केवल 45 बार ही पास हो पाता है। वे अभी अकेले गाड़ी चलाने के लिए तैयार नहीं हैं।
वे क्यों विफल हुए?
शोधकर्ताओं ने पाया कि रोबोट इसलिए विफल नहीं हो रहे हैं क्योंकि वे फाइलों को पढ़ नहीं सकते या सॉफ्टवेयर नहीं चला सकते। वास्तव में, वे अक्सर काम के पहले आधे हिस्से को सही ढंग से कर लेते हैं।
- "स्मार्ट लेकिन गलत" वाली समस्या: AI सही फाइलें ढूंढ सकता है और गणित भी कर सकता है, लेकिन फिर वह इस बात को लेकर भ्रमित हो जाता है कि उस गणित का अर्थ क्या है।
- उपमा: कल्पना कीजिए कि एक रोबोट शेफ सब्जियां काटने और पानी उबालने का काम पूरी तरह से कर सकता है (तकनीकी कौशल)। लेकिन जब सूप को चखने और यह तय करने की बारी आती है कि इसमें नमक डालने की आवश्यकता है या नहीं, तो रोबोट उस आधार पर अनुमान लगाता है कि उसके अनुसार सूप का स्वाद कैसा होना चाहिए, बजाय इसके कि वह सामने रखे वास्तविक बर्तन के स्वाद को चखे।
- विशिष्ट गलतियाँ: रोबोट अक्सर ये गलतियाँ करते हैं:
- गलत माप की इकाई का उपयोग करना (जैसे इंच के बजाय सेंटीमीटर में मापना)।
- एक ऐसे नियम को लागू करना जो उनके सामने मौजूद विशिष्ट डेटा पर फिट नहीं बैठता था।
- अपने प्रशिक्षण डेटा से मिली किसी "परिचित" कहानी पर भरोसा करते हुए, फाइलों में मौजूद वास्तविक साक्ष्यों को अनदेखा करना।
निष्कर्ष
शोध पत्र यह निष्कर्ष निकालता है कि जबकि AI एजेंट काम करने (कोड चलाना, फाइलें ढूंढना) में बेहतर हो रहे हैं, वे काम का निर्णय लेने (जज करने) में अभी भी बहुत अविश्वसनीय हैं। वे एपिजेनोमिक डेटा की सही व्याख्या करने के लिए आवश्यक विशिष्ट, सूक्ष्म वैज्ञानिक निर्णय लेने में संघर्ष करते हैं।
संक्षेप में: रोबोटों के पास काम करने के लिए हाथ तो हैं, लेकिन अभी उनमें वह "वैज्ञानिक अंतर्ज्ञान" (scientific gut feeling) नहीं है जिससे वे जान सकें कि परिणाम का अर्थ क्या है। इस प्रकार के डेटा का विश्लेषण करने के लिए उन्हें खुद पर भरोसा करने से पहले और अधिक प्रशिक्षण की आवश्यकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।