← नवीनतम पेपर
💻 computer science

What's Missing in Autonomous Research? A Systematization of Systems, Benchmarks, and Verification

यह सर्वेक्षण 56 प्रणालियों और उनकी साक्ष्य विश्वसनीयता के लिए एक बहु-अक्षीय ढांचे को पेश करके स्वायत्त अनुसंधान के खंडित परिदृश्य को व्यवस्थित करता है, जो अनुसंधान आर्टिफ़ैक्ट्स उत्पन्न करने की क्षमता और उन्हें रिलीज़ करने से पहले उनका बचाव करने के लिए मजबूत सत्यापन तंत्रों के अभाव के बीच एक महत्वपूर्ण अंतर को प्रकट करता है।

मूल लेखक: Xingyu Ren, Youran Sun, Chugang Yi, Kejia Zhang, Jiaxuan Guo, Jianda Du, Haizhao Yang

प्रकाशित 2026-07-14
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xingyu Ren, Youran Sun, Chugang Yi, Kejia Zhang, Jiaxuan Guo, Jianda Du, Haizhao Yang

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक हलचल भरी, हाई-टेक रसोई की कल्पना करें जहाँ रोबोट शेफ (स्वायत्त अनुसंधान प्रणाली - Autonomous Research Systems) का एक दल नए वैज्ञानिक खोजों को पकाने की कोशिश कर रहा है। कुछ समय के लिए, सभी को लगा कि ये रोबोट मास्टर शेफ बन रहे हैं, जो शून्य से एक पूरा पांच-कोर्स का भोजन तैयार करने में सक्षम हैं। लेकिन यह शोध पत्र, जो 56 अलग-अलग रोबोट रसोईयों का एक व्यापक सर्वेक्षण है, पर्दे को हटाकर एक थोड़ी अधिक अस्त-व्यस्त और जटिल वास्तविकता को उजागर करता है: रोबोट खाना बनाने में तो बहुत अच्छे हो रहे हैं, लेकिन वे स्वाद लेने और किसी खराब व्यंजन को परोसे जाने से रोकने में बेहद खराब हैं।

यहाँ क्या हो रहा है, इसका विवरण दिया गया है, जिसे वास्तविकता के साथ परोसा गया है।

मुख्य निष्कर्ष: बेहतरीन रसोइये, कमजोर चखने वाले

लेखकों ने जून 2026 तक सक्रिय 56 विभिन्न "AI वैज्ञानिक" प्रणालियों का अध्ययन किया। उन्होंने पाया कि ये प्रणालियाँ अनुसंधान के "उत्पादन" (production) वाले हिस्से में शानदार हैं। वे रेसिपी लिख सकते हैं (परिकल्पना/hypothesis), सब्जियां काट सकते हैं (कोड चलाना), सामग्री मिला सकते हैं (प्रयोग चलाना), और यहाँ तक कि डिश को प्लेट में सजा भी सकते हैं (पेपर लिखना)।

हालाँकि, भोजन बनाने और उसका बचाव करने के बीच एक बड़ा अंतर है।

  • समस्या: अधिकांश रोबोट एक पूर्ण पांडुलिपि (एक पूरा पेपर) उत्पन्न कर सकते हैं, लेकिन उनमें से लगभग किसी के पास भी ऐसा "स्टॉप बटन" नहीं है जो कह सके, "हे, यह दावा कमजोर है, इसे अभी प्रकाशित न करें।"
  • प्रमाण: लेखकों ने पाया कि 56 सार्वजनिक प्रणालियों में से शून्य के पास "पूर्ण-पांडुलिपि रिलीज गेट" (full-manuscript release gate) है। इसका मतलब है कि कोई भी प्रणाली स्वचालित रूप से पेपर के हर एक दावे की जांच नहीं कर सकती, कमजोर दावों को ढूंढ सकती है और पेपर को जारी करने से रोक सकती है।
  • "आंशिक" सफलता: केवल चार प्रणालियाँ कुछ विशिष्ट दावों (जैसे गलत संख्या या छूटे हुए संदर्भ) को रोक सकती हैं, लेकिन वे पूरे पेपर को भी नहीं रोक सकतीं यदि मुख्य विचार ही संदिग्ध हो।

रोबोट व्यवहार के "सात अक्ष" (Seven Axes)

रोबोट वैज्ञानिक को रोकने में क्यों विफल हो रहे हैं, इसे समझने के लिए लेखकों ने उन्हें सात अलग-अलग गुणों के ग्रिड पर मैप किया है। इन्हें रोबोट के "कौशल आँकड़े" (skill stats) समझें:

  1. लूप टोपोलॉजी (L): क्या रोबोट सुधार के लिए खुद से बात करता है?
    • वास्तविकता: अधिकांश रोबोट (56 में से 33) बस एक बार प्रयास करते हैं और काम खत्म कर देते हैं। उनके पास एक अलग "समीक्षक" रोबोट नहीं है जो काम को देखे और कहे, "फिर से कोशिश करो।"
  2. वेरिफायर गेट स्कोप (G): क्या रोबोट "ना" कह सकता है?
    • वास्तविकता: यह सबसे बड़ा गायब हिस्सा है। रोबोट यह जांच सकते हैं कि कोड चलता है या नहीं (G-code) या गणित की समस्या हल हुई है या नहीं (G-task), लेकिन वे यह जांच नहीं सकते कि कहानी समझ में आती है या नहीं या खोज वास्तव में नई है या नहीं। उनके पास एक पूर्ण पेपर को ब्लॉक करने का अधिकार नहीं है।
  3. ऑर्केस्ट्रेशन मोड (O): बॉस कौन है?
    • वास्तविकता: वर्तमान में, यह ज्यादातर स्क्रिप्ट या इंसान हैं जो डोर थामे हुए हैं। कोई भी प्रणाली पूरी तरह से स्वायत्त "डिस्पैचर" रोबोट नहीं है जो मानवीय मदद के बिना पूरे वर्कफ़्लो का प्रबंधन करे।
  4. पोर्टफोलियो पैरेललिज्म (P): क्या रोबोट कई प्रोजेक्ट्स को संभाल सकता है?
    • वास्तविकता: अधिकांश रोबोट एक समय में एक ही प्रोजेक्ट पर काम करते हैं। कोई भी एक साथ विभिन्न शोध दिशाओं के पूरे पोर्टफोलियो का प्रबंधन नहीं कर रहा है।
  5. आर्टिफैक्ट सबस्ट्रेट (A): साक्ष्य कहाँ संग्रहीत हैं?
    • वास्तविकता: कुछ रोबोट अपने "रसीदें" (लॉग, कोड, डेटा) व्यवस्थित फोल्डरों (A2) में सहेजने में बेहतर हो रहे हैं, लेकिन रसीदें होने का मतलब यह नहीं है कि रोबोट उन्हें एक खराब दावे को रोकने के लिए उपयोग करना जानता है।
  6. अनुशासनात्मक कवरेज (DC): यह कितने क्षेत्रों को संभाल सकता है?
    • वास्तविकता: कई रोबोटों का दावा है कि वे जीव विज्ञान, भौतिकी और रसायन विज्ञान (DC3) कर सकते हैं, लेकिन प्रमाण केवल उन्हें एक क्षेत्र (आमतौर पर कंप्यूटर साइंस/ML) में काम करते हुए दिखाते हैं। किसी भी रोबलेट ने सार्वजनिक रूप से वास्तविक साक्ष्य के साथ क्रॉस-डिसिप्लिनरी रिसर्च करने का प्रदर्शन नहीं किया है।
  7. लाइफसाइकिल कवरेज (LC): यह कितनी दूर तक जाता है?
    • वास्तविकता: कुछ रोबोट पूरा पेपर लिख सकते हैं (LC3), लेकिन बहुत कम "प्रकाशन" को संभाल सकते हैं, जिसमें समीक्षकों के साथ निपटना और पेपर को आधिकारिक रूप से बाहर आने से पहले ठीक करना शामिल है (LC4)।

"चखने" की समस्या: रोबोट खराब विज्ञान को क्यों नहीं रोक पाते

लेखक तर्क देते हैं कि वर्तमान में हम रोबोट विज्ञान को कैसे जांचते हैं, वह तरीका टूटा हुआ है। यहाँ चार तरीके दिए गए जिनसे हम भोजन को चखने की कोशिश करते हैं, और वे क्यों विफल होते हैं:

  1. पुनर्निर्माण (क्या वे इसकी नकल कर सकते हैं?): हम रोबोट को पुराने पेपर्स की नकल करने के लिए कहते हैं। वे अक्सर कोड चला सकते हैं, लेकिन वे फिर भी भ्रम (hallucinations) पैदा करते हैं (दावे बना लेते हैं)। एक परीक्षण में, "स्वीकृत" की गई नकल की गई पेपर्स में से 59% में unsupported दावे थे जिन्हें इंसानों ने पकड़ा लेकिन रोबोट चूक गए।
  2. अनुकूलन (क्या वे जीत सकते हैं?): हम उन्हें एक स्कोर देते हैं (जैसे गेम का हाई स्कोर) और उन्हें इसे अधिकतम करने के लिए कहते हैं। वे खेल में अच्छे हो जाते हैं, लेकिन इसका मतलब यह नहीं है कि उनकी वैज्ञानिक कहानी सच है।
  3. प्रक्रिया की गुणवत्ता (क्या उन्होंने नियमों का पालन किया?): हम जांचते हैं कि क्या उन्होंने चरणों का पालन किया। लेकिन चरणों का पालन करने का मतलब यह नहीं है कि निष्कर्ष सही है।
  4. ठोसता (क्या यह तर्कसंगत है?): यही सबसे बड़ी विफलता है। जब हम रोबोट से पूछते हैं कि क्या कोई दावा "ठोस" (तार्किक और समर्थित) है, तो वे बुरी तरह विफल होते हैं।
    • एक बेंचमार्क ने पाया कि मानक जांच केवल 26% निम्न-गुणवत्ता वाले प्रस्तावों को पकड़ पाई।
    • एक अन्य परीक्षण ने दिखाया कि जब इंसानों ने पेपर्स में त्रुटियों की पुष्टि की, तो रोबोट समीक्षकों ने उनमें से केवल 21% को ही पकड़ा।
    • इससे भी बुरा यह है कि यदि कोई फैंसी फॉर्मेटिंग के साथ रोबोट को धोखा देने की कोशिश करता है, तो यह 82% बार खराब विज्ञान को स्वीकार कर सकता है।

"LLM जज" का जाल

रोबोट एक-दूसरे की जांच करने के लिए सबसे आम तरीका एक दूसरे रोबोट (एक LLM) का उपयोग करना है जो एक जज के रूप में कार्य करता है। लेख तर्क देते हैं कि यह एक शेफ को बिना किसी बाहरी सामग्री के अपने स्वयं के खाना चखने के लिए कहने जैसा है।

  • सीमा (Ceiling): क्योंकि "जज" और "रसोइया" समान हैं, इसलिए वे एक ही तरह की कमियों (blind spots) को साझा करते हैं। यदि रसोइया गलती करता है, तो जज भी उसे मिस कर देता है।
  • परिणाम: अधिक जजों को जोड़ना या अधिक नियम जोड़ने से यह ठीक नहीं होता है। पेपर सुझाव देता है कि बिना बाहरी साक्ष्य (जैसे प्रयोग को फिर से चलाना या उस डेटाबेस के विरुद्ध जांचना जिसे रोबोट नियंत्रित नहीं कर सकता) के, रोबोट खराब विज्ञान को निकलने से नहीं रोक पाएंगे।

क्या गायब है? "रिलीज गेट"

लेख का निष्कर्ष है कि हमें ऐसे बेहतर रोबोटों की आवश्यकता नहीं है जो तेजी से खाना पका सकें; हमें एक रिलीज गेट की आवश्यकता है।
कल्पना कीजिए कि एक रेस्टोरेंट के दरवाजे पर एक सुरक्षा गार्ड है जिसके पास एक चेकलिस्ट है।

  • वर्तमान गार्ड: वे देखते हैं कि प्लेट साफ है (कोड चलता है) और खाना गर्म है (डेटा मौजूद है)।
  • गायब गार्ड: हमें एक गार्ड चाहिए जो जांचे: "क्या यह नया है? क्या यह वास्तव में काम करता है? क्या हमने विपरीत परिणाम की जांच की? क्या कहानी सच है?"

लेखक इस गार्ड को बनाने के लिए चार चरणों का सुझाव देते हैं:

  1. दावा निष्कर्षण (Claim Extraction): एक उपकरण जो एक पेपर में प्रत्येक विशिष्ट दावे को ढूंढता है।
  2. प्रति-साक्ष्य खोज (Counter-Evidence Search): एक उपकरण जो बाहर जाता है और सबूत ढूंढता है कि दावा गलत हो सकता है।
  3. क्लेम ग्राफ (Claim Graph): एक मानचित्र जो हर वाक्य को उसके विशिष्ट साक्ष्य से जोड़ता है।
  4. समाधान नियम (Reconciliation Rule): एक नियम जो कहता है, "यदि साक्ष्य गायब है या विरोधाभासी है, तो रोकें (STOP)।"

निचोड़ (The Bottom Line)

स्वायत्त अनुसंधान का क्षेत्र तेजी से आगे बढ़ रहा है। रोबोट पेपर लिख सकते हैं और प्रयोग चला सकते हैं। लेकिन अभी, उत्पादन (production) सत्यापन (verification) से आगे निकल गया है। हमारे पास ऐसी मशीनें हैं जो वैज्ञानिक कार्यों का पहाड़ बना सकती हैं, लेकिन हमारे पास अभी तक ऐसी मशीन नहीं है जो विश्वसनीय रूप से कह सके, "यह कचरा है, इसे प्रकाशित न करें।"

पेपर यह नहीं कहता कि यह असंभव है; यह सिर्फ कहता है कि ऐसा अभी तक किया नहीं गया है। "लुप्त आर्किटेक्चर" वह क्षमता है जो एक कमजोर परिणाम को उसके जारी होने से पहले रोकने की है। जब तक हम इसे नहीं बनाते, रोबोट बेहतरीन लेखक तो हैं, लेकिन हमें "ना" कहने के लिए भारी काम करने हेतु अभी भी इंसानों की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →