← नवीनतम पेपर
🤖 AI

Auto-Discovery-Bench: Diagnosing Structured State Tracking in Oracle-Guided Discovery

यह शोध पत्र Auto-Discovery-Bench को प्रस्तुत करता है, जो एक नियतात्मक ओरेकल-निर्देशित नैदानिक बेंचमार्क (deterministic oracle-guided diagnostic benchmark) है, जिसे इंटरैक्टिव डिस्कवरी प्रक्रियाओं के दौरान संरचित विश्वासों (structured beliefs) को बनाए रखने और उन्हें अपडेट करने की एजेंटों की क्षमता को अलग करने और मूल्यांकन करने के लिए डिज़ाइन किया गया है।

मूल लेखक: Tingting Chen, Beibei Lin, Srinivas Anumasa, Vedant Shah, Zifeng Yuan, Qiran Zou, Anirudh Goyal, Dianbo Liu

प्रकाशित 2026-06-01
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tingting Chen, Beibei Lin, Srinivas Anumasa, Vedant Shah, Zifeng Yuan, Qiran Zou, Anirudh Goyal, Dianbo Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जासूस हैं जो एक रहस्य को सुलझाने की कोशिश कर रहे हैं, लेकिन अपराध स्थल की तस्वीरों को देखने के बजाय, आपको एक बहुत ही सख्त, ईमानदार गवाह (ओरेकल/Oracle) से एक-एक करके सवाल पूछने होंगे। गवाह कभी झूठ नहीं बोलेगा, लेकिन वह केवल आपके द्वारा पूछे गए विशिष्ट प्रश्न का ही उत्तर देगा। आपका काम सही सवाल पूछकर, जवाबों को सुनकर और अपने सिद्धांत को अपडेट करके दुनिया के छिपे हुए नियमों को समझना है।

यह शोध पत्र Auto-Discovery-Bench प्रस्तुत करता है, जो अनिवार्य रूप से AI मॉडल्स के लिए एक "ड्राइविंग टेस्ट" है ताकि यह देखा जा सके कि क्या वे अच्छे जासूस हैं।

मुख्य समस्या

हम जानते हैं कि AI मॉडल्स (जैसे कि वे जो ईमेल या कोड लिखते हैं) एकल प्रश्न का उत्तर देने में स्मार्ट होते हैं। लेकिन वास्तविक विज्ञान केवल एक प्रश्न के बारे में नहीं है; यह एक लूप (चक्र) है:

  1. अनुमान लगाना कि क्या हो रहा है।
  2. प्रयोग करके इसकी जांच करना
  3. परिणाम से सीखना
  4. अपने अनुमान को अपडेट करना
  5. इसे दोहराना।

लेखकों जानना चाहते थे: क्या AI वास्तव में कई राउंड के दौरान इस पूरी जानकारी को बिना भ्रमित हुए ट्रैक रख सकता है? अधिकांश मौजूदा परीक्षण या तो बहुत सरल हैं (केवल एक प्रश्न) या बहुत अव्यवजित (वास्तविक दुनिया का शोर यह समझने में कठिन बना देता है कि AI क्यों विफल हुआ)। यह नया बेंचमार्क साफ और नियंत्रित बनाया गया है, जैसे कि एक भौतिकी प्रयोगशाला (physics lab), ताकि हम सटीक रूप से पता लगा सकें कि AI कहाँ संघर्ष कर रहा है।

तीन "रहस्यमय कमरे" (The Three "Mystery Rooms")

यह बेंचमार्क AI को उसके "स्ट्रक्चर्ड मेमोरी" (संरचित स्मृति) का परीक्षण करने के लिए तीन अलग-अलग प्रकार की पहेलियों में डालता है:

  1. निर्देशित ग्राफ (The Directed Graph - "कारण और प्रभाव" की पहेली):

    • उपमा: कल्पना कीजिए कि डोमिनोज़ की एक पंक्ति है, लेकिन आप नहीं जानते कि कौन से आपस में जुड़े हुए हैं। आप एक डोमिनो को धक्का देते हैं, और देखते हैं कि अन्य कौन से गिरते हैं।
    • कार्य: AI को हस्तक्षेप (धक्का देकर) और परिणाम देखकर वस्तुओं (जिन्हें "मॉलिक्यूल्स" कहा जाता है) के बीच छिपे हुए संबंधों को समझना होता है। यह एक पारिवारिक वंशावली या आपूर्ति श्रृंखला (supply chain) का मानचित्र बनाने जैसा है, जिसे केवल यह देखकर बनाया जाता है कि एक हिस्से को बदलने पर क्या होता है।
  2. अनिर्देशित संबंध (The Undirected Relation - "सोशल नेटवर्क" की पहेली):

    • उपमा: गेम ऑफ थ्रोन्स के घरों के बारे में सोचें। यदि हाउस स्टार्क क्रोधित होता है, तो उनके सहयोगी (जैसे हाउस टली) भी क्रोधित हो जाते हैं। लेकिन आप नहीं जानते कि कौन से सहयोगी हैं।
    • कार्य: AI एक घर पर "हमला" करता है और देखता है कि "क्रोध का स्तर" पड़ोसियों में कैसे फैलता है। उसे बदलाव की इन लहरों को ट्रैक करके मित्रता के नेटवर्क का मानचित्र बनाना होता है।
  3. प्रतीकात्मक समीकरण (The Symbolic Equation - "छिपे हुए फॉर्मूला" की पहेली):

    • उपमा: एक ब्लैक बॉक्स की कल्पना करें जो नंबरों (जैसे द्रव्यमान, गति, तापमान) को लेता है और एक परिणाम (जैसे बल) बाहर निकालता है। आप इसके अंदर का फॉर्मूला नहीं जानते।
    • कार्य: AI अलग-अलग नंबर डालता है, आउटपुट देखता है, और गणितीय समीकरण (जैसे F=M×AF = M \times A) का अनुमान लगाने की कोशिश करता है। इसे "डिस्ट्रैक्टर" वेरिएबल्स को भी अनदेखा करना होता है जिनका परिणाम पर कोई प्रभाव नहीं पड़ता, जैसे केक की रेसिपी खोजने के दौरान रसोई की दीवारों के रंग को अनदेखा करना।

उन्होंने क्या पाया: "गोल्डफिश मेमोरी" की समस्या

शोधकर्ताओं ने कई शीर्ष-स्तरीय AI मॉडल्स (जैसे GPT-4o, Claude, Gemini, आदि) का परीक्षण किया। यहाँ क्या हुआ:

  • छोटी पहेलियाँ आसान हैं: जब पहेलियाँ छोटी थीं (उदाहरण के लिए, केवल 3 आइटम), तो सर्वश्रेष्ठ AI उन्हें जल्दी और पूरी तरह से हल कर लेते थे।
  • बड़ी पहेलियाँ कठिन हैं: जैसे ही पहेलियाँ बड़ी हुईं (उदाहरण के लिए, 10 आइटम या अधिक वेरिएबल्स), अधिकांश AI पूरी तरह से विफल हो गए। वे अनुमत प्रयासों के भीतर पैटर्न को समझने में सक्षम नहीं थे।
  • असली बाधा: यह समझने के लिए कि वे क्यों विफल हुए, शोधकर्ताओं ने एक सरल परीक्षण बनाया जिसे ट्रैजेक्टरी ट्रैकिंग (Trajectory Tracking) कहा गया। उन्होंने बस AI को परिवर्तनों की एक लंबी सूची दिखाई (जैसे डोमिनोज़ के गिरने का वीडियो) और पूछा, "क्या यह हिस्सा स्टेप 1 और स्टेप 2 के बीच बदला है?"
    • परिणाम: बिना अनुमान लगाने या योजना बनाने के भी, AI ने लंबी सूची होने पर गलतियाँ करना शुरू कर दिया। यह एक "टेम्पोरल अटेंशन डिके" (समय के साथ ध्यान कम होना) की तरह है—बातचीत के अंत तक पहुँचते-पहुँचते AI शुरुआत में हुई घटनाओं को भूल जाता है।

निर्णय (The Verdict)

शोध पत्र निष्कर्ष निकालता है कि लंबे समय तक संरचित जानकारी को ट्रैक रखना वर्तमान AI मॉडल्स के लिए एक बड़ी कमजोरी है।

इसे इस तरह सोचें: AI एक ऐसे प्रतिभाशाली छात्र की तरह है जो गणित के सवाल को हल कर सकता है यदि आप उसे कागज थमा दें। लेकिन यदि आप उसे एक सप्ताह लंबे अन्वेषण के दौरान नोट्स लेने के माध्यम से एक रहस्य सुलझाने के लिए कहते हैं, तो वह अपने नोट्स खोने लगता है, सुरागों को मिलाने लगता है, और शुरुआती विवरणों को भूलने लगता है।

Auto-Discovery-Bench का उद्देश्य वास्तविक वैज्ञानिक खोज (जो जटिल और अव्यवस्थित है) को बदलना नहीं है। इसके बजाय, यह एक डायग्नोस्टिक टूल (नैदानिक उपकरण) है। यह एक इंजन के मैकेनिक टेस्ट की तरह है: ऑफ-रोड जाने से पहले, आप चेक करते हैं कि क्या इंजन एक स्थिर ट्रेडमिल पर शक्ति बनाए रख सकता है। यह बेंचमार्क दिखाता है कि हालांकि AI स्मार्ट हो रहा है, लेकिन लंबे, इंटरैक्टिव सत्रों के दौरान एक "मानसिक मानचित्र" बनाए रखने की उसकी क्षमता अभी भी एक महत्वपूर्ण बाधा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →