← नवीनतम पेपर
🧬 biology

scBench-Long: Verifiable Benchmarking of Long-Horizon Single-Cell Biology

यह शोध पत्र scBench-Long को प्रस्तुत करता है, जो 21 जटिल, दीर्घकालिक (long-horizon) सिंगल-सेल जीव विज्ञान कार्यों वाला एक सत्यापन योग्य बेंचमार्क है जो यह मूल्यांकन करता है कि क्या एआई एजेंट निर्धारित विधियों के बिना कच्चे डेटा से स्वायत्त रूप से वैज्ञानिक निष्कर्ष निकाल सकते हैं, जिससे यह पता चलता है कि वर्तमान शीर्ष मॉडल केवल 25.4% सफलता दर प्राप्त करते हैं।

मूल लेखक: Ian Diks, Zhen Yang, Arjun Banerjee, Tim Proctor, Kenny Workman

प्रकाशित 2026-06-26
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ian Diks, Zhen Yang, Arjun Banerjee, Tim Proctor, Kenny Workman

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ⚕️ यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जासूस हैं जो एक जटिल रहस्य को सुलझाने की कोशिश कर रहे हैं, लेकिन अपराध स्थल के बजाय, आपके पास कच्चे, अव्यवस्थित साक्ष्यों का एक विशाल ढेर है: एक मरीज के शरीर से प्राप्त हजारों सूक्ष्म जैविक नोट्स (सिंगल-सेल डेटा)। आपका लक्ष्य केवल नोट्स को पढ़ना नहीं है; आपको पूरी कहानी समझनी है—मरीज बीमार क्यों है, कौन से सेल्स लड़ रहे हैं, और इसके पीछे का मूल कारण क्या है।

यह शोध पत्र scBench-Long पेश करता है, जो एक नया "अंतिम परीक्षा" (final exam) है, जिसे यह परखने के लिए बनाया गया है कि क्या AI जासूस (एजेंट्स) इतने स्मार्ट हैं कि वे इन जटिल जैविक रहस्यों को शून्य से खुद सुलझा सकें।

यहाँ इस शोध पत्र में वास्तव में क्या पाया गया है, इसका विवरण सरल उपमाओं (analogies) के माध्यम से दिया गया है:

1. परीक्षण: "लंबी अवधि का रहस्य" (The Long-Horizon Mystery)

अधिकांश पिछले AI परीक्षण किसी छात्र को एक गणित का सवाल हल करने या पाठ्यपुस्तक से कोई तथ्य याद करने के लिए कहने जैसे थे। उन्होंने यह परीक्षण किया कि क्या AI को किसी टूल का उपयोग करना आता है या उसे जीव विज्ञान के तथ्य याद हैं।

scBench-Long अलग है। यह AI को कच्चे माल (डेटा) से भरा एक बंद डिब्बा और एक अस्पष्ट रेसिपी लक्ष्य (एक वैज्ञानिक प्रश्न) देने जैसा है, और फिर उससे बिना कोई स्टेप बताए एक विशिष्ट, जटिल व्यंजन (एक वैज्ञानिक निष्कर्ष) बनाने के लिए कहना है।

  • चुनौती: AI को कच्चे डेटा को लेना होगा, उसमें संदर्भ मिलाना होगा (जैसे "यह एक फेफड़े का नमूना है" या "यह एक बंदर का है") और एक दावा करने के लिए कड़ियों को जोड़ना होगा।
  • विषय: यह परीक्षण पांच वास्तविक दुनिया के जैविक रहस्यों को कवर करता है, जैसे:
    • कुछ इम्यून सेल्स मेलानोमा (स्किन कैंसर) पर हमला क्यों करते हैं।
    • कैसे जीन और डीएनए संरचना इम्यून सेल्स में मिलकर काम करते हैं।
    • क्या होता है जब लैब में मानव और बंदर के भ्रूणों को मिलाया जाता है।
    • फेफड़ों के ट्यूमर उम्र के साथ कैसे बदलते हैं।
    • क्यों कोविड-19 के कुछ फेफड़ों के मामले घातक होते हैं।

2. परिणाम: "AI अभी खाना बनाना सीख रहा है"

शोधकर्ताओं ने 17 अलग-अलग AI "शेफ और किचन" संयोजनों (विभिन्न AI मॉडल जिन्हें विभिन्न सॉफ्टवेयर टूल्स के साथ जोड़ा गया था) का परीक्षण किया।

  • स्कोर: यहाँ तक कि सबसे अच्छे AI टीम ने भी केवल 25% बार सही उत्तर दिया (63 प्रयासों में से 16 बार)।
  • वास्तविकता की जांच: अधिकांश AI टीमों ने लगभग कुछ भी सही नहीं किया। हालांकि वे अक्सर छोटे स्टेप्स सही ढंग से कर सकते थे (जैसे "इम्यून सेल्स ढूंढना" या "जीन्स की गिनती करना"), लेकिन वे उन टुकड़ों को एक सही अंतिम कहानी में जोड़ने में अक्सर विफल रहे।
  • उपमा: कल्पना कीजिए कि एक AI जो सब्जियां काटने और पानी उबालने (लोकल स्टेप्स) में तो माहिर है, लेकिन फिर वह सूप जला देता है या गलत डिश परोस देता है क्योंकि वह पूरी रेसिपी (लॉन्ग-होरिज़न निष्कर्ष) को नहीं समझ पाया।

3. AI कहाँ अटका (विफलता के कारण - Failure Modes)

शोध ने पाया कि AI के विफल होने के चार मुख्य तरीके थे, जो बहुत ही मानवीय गलतियों जैसे थे:

  • साक्ष्य के बजाय "कॉमन सेंस" पर भरोसा करना:
    • जाल: AI ने एक सेल टाइप देखा जिसे वह किताबों से जानता था (जैसे, "थके हुए इम्यून सेल्स") और मान लिया कि वही उत्तर है, भले ही उसके सामने मौजूद विशिष्ट डेटा कुछ और कह रहा हो।
    • रूपक: यह एक जासूस की तरह है जो एक लाल कार देखता है और तुरंत मान लेता है कि वही भागने वाली कार है क्योंकि "लाल कारें आमतौर पर चोरी होती हैं," जबकि वह इस तथ्य को अनदेखा कर देता है कि वास्तविक भागने वाली कार सबूत की तस्वीरों में नीली थी।
  • "बड़ी संख्याओं" को "महत्वपूर्ण चीजों" के साथ भ्रमित करना:
    • जाल: यदि एक संकेत 1,000 बार दिखाई दिया और दूसरा 10 बार, तो AI ने माना कि 1,000-काउंट वाला संकेत सबसे महत्वपूर्ण है, भले ही जीव विज्ञान उसका समर्थन न करता हो।
    • रूपक: कमरे में सबसे शोर मचाने वाले व्यक्ति को ही सच बोलने वाला समझना, बजाय इसके कि उस शांत व्यक्ति को सुना जाए जिसके पास वास्तविक सबूत हैं।
  • "सहसंबंध" (Correlation) को "कारण" (Cause) समझने की गलती:
    • जाल: AI ने देखा कि दो चीजें एक साथ हो रही हैं और उसने तय कर लिया कि एक दूसरे का कारण है, भले ही डेटा केवल यह दिखाता हो कि वे साथ में हो रहे हैं।
    • रूपक: यह देखना कि जुलाई में आइसक्रीम की बिक्री और शार्क के हमले दोनों बढ़ जाते हैं, और यह निष्कर्ष निकालना कि आइसक्रीम खाने से शार्क के हमले होते हैं।
  • "पूरी तस्वीर" (Multi-Modality) को अनदेखा करना:
    • जाल: परीक्षण के लिए एक साथ दो प्रकार के डेटा (जैसे जीन गतिविधि और डीएनए संरचना) को देखने की आवश्यकता थी। AI अक्सर केवल एक को देखता था और दूसरे को अनदेखा कर देता था।
    • रूपक: कार के इंजन की समस्या का निदान करने के लिए केवल शोर सुनने की कोशिश करना, जबकि हुड से निकलता हुआ धुआं भी नजरअंदाज करना।

4. "किचन" भी मायने रखता है (Harness Effects)

शोध ने पाया कि AI द्वारा उपयोग किए जाने वाले सॉफ्टवेयर टूल्स भी AI मॉडल जितने ही महत्वपूर्ण थे।

  • रूपक: एक महान शेफ (AI मॉडल) एक बुरा भोजन बना सकता है यदि उसे एक टूटा हुआ ओवन या गलत चाकू (हार्नेस/Harness) दिया जाए।
  • टूल्स बदलने से परिणाम काफी बदल गए। उदाहरण के लिए, एक ही AI मॉडल ने एक सेट टूल्स के साथ दूसरे की तुलना में बहुत बेहतर प्रदर्शन किया। यह साबित करता है कि एक अच्छा AI वैज्ञानिक बनाने के लिए केवल "दिमाग" ही नहीं, बल्कि उसके पूरे "शरीर" और टूल्स का होना भी जरूरी है।

5. "रूब्रिक" (शिक्षक के नोट्स)

चूंकि AI अक्सर अंतिम उत्तर में विफल रहा लेकिन उसने कुछ काम सही ढंग से किया था, इसलिए शोधकर्ताओं ने AI की प्रक्रिया को ग्रेड करने के लिए एक "रूब्रिक" (एक विस्तृत चेकलिस्ट) का उपयोग किया।

  • निष्कर्ष: रूब्रिक ने दिखाया कि भले ही AI अंतिम परीक्षण में विफल रहा हो, लेकिन उसे स्टेप्स सही करने के लिए अक्सर आंशिक क्रेडिट (partial credit) मिला। हालांकि, चेकलिस्ट पर उच्च स्कोर ने सही अंतिम उत्तर की गारंटी नहीं दी।
  • रूपक: एक छात्र गणित के टेस्ट में सभी सही स्टेप्स दिखा सकता है लेकिन फिर भी गलत अंतिम संख्या लिख सकता है। रूब्रिक शिक्षक को यह देखने में मदद करता है कि छात्र कहाँ भटक गया, भले ही अंतिम ग्रेड 'फेल' हो।

सारांश

scBench-Long एक वास्तविकता की जांच है। यह दिखाता है कि हालांकि AI जैविक कार्यों के छोटे, अलग-थलग कार्यों को करने में अच्छा हो रहा है, लेकिन यह एक सच्चे वैज्ञानिक की तरह कार्य करने में अभी भी संघर्ष कर रहा है जो कच्चे डेटा को ले सके, एक लंबी और जटिल प्रक्रिया के बारे में सोच सके, और एक विश्वसनीय, साक्ष्य-आधारित निष्कर्ष पर पहुँच सके। आज का सर्वश्रेष्ठ AI एक बहुत ही प्रतिभाशाली इंटर्न की तरह है जिसे बड़ी तस्वीर को सही ढंग से समझने के लिए बहुत अधिक पर्यवेक्षण (supervision) की आवश्यकता होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →