← नवीनतम पेपर
💬 NLP

Benchmarking Real-Time Question Answering via Executable Code Workflows

यह शोध पत्र RT-QA प्रस्तुत करता है, जो वास्तविक समय में प्रश्न उत्तर (real-time question answering) का आकलन करने के लिए निष्पादन योग्य कोड वर्कफ़्लो (executable code workflows) का उपयोग करने वाला एक गतिशील मूल्यांकन ढांचा है, जो यह प्रकट करता है कि स्टेट-ऑफ-द-आर्ट मॉडल भी आलसी पुनर्प्राप्ति (lazy retrieval) और सामयिक भ्रम (temporal confusion) के कारण अस्थायी अनुकूलन क्षमता (temporal adaptability) के साथ संघर्ष करते हैं, और केवल 46% सटीकता प्राप्त करते हैं।

मूल लेखक: Wenjie Zhou, Yuan Gao, Xin Zhou, Hao Fu, Zhongjian Miao, Wei Chen, Bo Chen, Xiaobing Zhao

प्रकाशित 2026-04-21
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wenjie Zhou, Yuan Gao, Xin Zhou, Hao Fu, Zhongjian Miao, Wei Chen, Bo Chen, Xiaobing Zhao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

🕵️‍♂️ बड़ी समस्या: "कल के अखबार" का जाल

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लाइब्रेरियन (एक AI) से एक सवाल पूछते हैं: "कल अखबार की हेडलाइन क्या थी?"

अधिकांश वर्तमान AI मॉडल उन लाइब्रेरियन की तरह हैं जिन्होंने लाइब्रेरी की हर किताब को एक निश्चित तारीख तक तो याद कर लिया है, लेकिन उसके बाद वे बाहर कदम नहीं रख पाए हैं। यदि आप उनसे कल के बारे में पूछते हैं, तो वे ऐसा कर सकते हैं:

  1. अंदाजा लगाना (Hallucination/भ्रम): पुराने पैटर्न के आधार पर अनुमान लगाना।
  2. याद करना (Knowledge Obsolescence/ज्ञान की अप्रचलनता): पिछले साल की हेडलाइन को याद करना क्योंकि उन्हें लगता है कि "कल" एक स्थिर स्मृति है।
  3. जवाब देने से मना करना क्योंकि उनके पास न्यूज़स्टैंड से जुड़ने के लिए कोई "लाइव" कनेक्शन नहीं है।

इन AI के लिए मौजूदा परीक्षण पुराने, स्थिर (static) सवालों वाले पॉप क्विज़ की तरह हैं। वे हमें यह नहीं बताते कि क्या AI वास्तव में बाहर जा सकता है, वर्तमान न्यूज़स्टैंड को देख सकता है, और आज के लिए असली जवाब ला सकता है।

🚀 समाधान: RT-QA (द "लाइव एजेंट" टेस्ट)

लेखकों ने RT-QA नामक एक नया टेस्ट बनाया। AI को एक स्थिर प्रश्न और पहले से लिखा गया उत्तर देने के बजाय, उन्होंने उसे एक मिशन दिया।

उपमा: "मैजिक रेसिपी" बनाम "पहले से बना हुआ भोजन"

  • पुराना तरीका (Static QA): टेस्ट AI को एक पहले से बना हुआ भोजन (उत्तर) देता है और पूछता है, "क्या यह स्वादिष्ट है?" AI को बस "हाँ" या "नहीं" कहना होता है। उसे कुछ भी पकाने की ज़रूरत नहीं है।
  • नया तरीका (RT-QA): टेस्ट AI को एक मैजिक रेसिपी (एग्जीक्यूटेबल कोड) देता है। रेसिपी कहती है: "नेशनल स्टेडियम की वेबसाइट पर जाओ, कल के शेड्यूल को देखो, और मुझे बताओ कि कौन खेल रहा है।"
    • AI को उस रेसिपी को चलाना (कोड निष्पादित करना) होगा।
    • वह अभी वेबसाइट पर जाएगा।
    • वह अभी शेड्यूल को पढ़ेगा।
    • वह वर्तमान वास्तविकता के आधार पर उत्तर तैयार करेगा।

यदि वेबसाइट अपना लेआउट बदल देती है (जैसे किसी रेस्टोरेंट का मेनू फॉन्ट बदलना), तो AI की "मैजिक रेसिपी" टूट सकती है। RT-QA सिस्टम में एक सेल्फ-रिपेयर मैकेनिज्म शामिल है—जैसे एक रोबोट शेफ जो देखता है कि ओवन खराब है, फिर वायरिंग ठीक करता है और खाना बनाना जारी रखता है।

📊 उन्होंने क्या पाया: "आलसी छात्र" और "समय-यात्री"

शोधकर्ताओं ने इस नए टेस्ट पर शीर्ष-स्तरीय AI मॉडल (जैसे GPT-5.2, Claude, और अन्य) का परीक्षण किया। परिणाम आश्चर्यजनक और AI के लिए थोड़े शर्मनाक थे।

1. स्कोर कम था
सबसे स्मार्ट मॉडल भी केवल 46% सही हो पाए। यह हाई स्कूल की परीक्षा पास करने जैसा भी नहीं है। इसका मतलब है कि वर्तमान AI "लाइव" जानकारी को संभालने में बहुत खराब हैं।

2. विफलता मोड #1: "आलसी छात्र" (Lazy Retrieval)

  • परिदृश्य: सवाल किसी कंपनी के स्टॉक प्राइस के बारे में पूछता है।
  • गलती: AI सर्च इंजन के सारांश (Google के ऊपर दिखने वाला "स्निपेट") को देखता है और स्टॉक एक्सचेंज के लिंक पर क्लिक किए बिना ही उत्तर का अनुमान लगा लेता है।
  • उपमा: यह उस छात्र की तरह है जो पूरी कहानी पढ़ने के बजाय केवल पाठ्यपुस्तक की विषय सूची पढ़ता है और सोचता है कि उसे सब पता है। वे शॉर्टकट पर भरोसा करते हैं और विवरणों को छोड़ देते हैं।

3. विफलता मोड #2: "समय-यात्री" (Temporal Confusion)

  • परिदृश्य: सवाल पूछता है, "कल नेशनल स्टेडियम में कौन सा कॉन्सर्ट हुआ था?"
  • गलती: AI "National Stadium concert" खोजता है और 2024 में हुए एक बड़े कॉन्सर्ट का लेख ढूंढ लेता है। वह उत्साहित हो जाता है, उस तारीख को पकड़ लेता है, और यह भूल जाता है कि आज क्या तारीख है। वह 2024 के विजेता के साथ उत्तर दे देता है।
  • उपमा: कल्पना कीजिए कि एक समय-यात्री (time traveler) 2026 में उतरता है लेकिन अपनी घड़ी 2024 की ही देखता रहता है। वह "आज" का अर्थ समझने में भ्रमित हो जाता है।
  • ट्विस्ट: शोधकर्ताओं ने पाया कि कठिन सवाल (लेवल 3) कभी-कभी मध्यम सवालों (लेवल 2) की तुलना में बेहतर तरीके से हल किए गए। क्यों? क्योंकि कठिन सवालों ने AI को इतना गहराई से सोचने और योजना बनाने के लिए मजबूर किया कि उसने अनजाने में अपने समय के भ्रम को ठीक कर लिया। मध्यम सवाल इतने "चालाक" थे कि वे AI को बेवकूफ बना सके, लेकिन इतने कठिन नहीं थे कि उसे धीमा होने और तारीख को दोबारा चेक करने के लिए मजबूर करें।

🛠️ उन्होंने इसे कैसे बनाया (द "एजेंट-इन-द-लूप")

इस टेस्ट को बनाने के लिए, उन्होंने 320 सवाल हाथ से नहीं लिखे। उन्होंने एक रोबोट बिल्डर (RT Agent) बनाया।

  1. बिल्डर एक वेबसाइट (जैसे मौसम की साइट या स्पोर्ट्स शेड्यूल) को देखता है।
  2. वह डेटा निकालने के लिए एक पायथन स्क्रिप्ट (एक छोटा कंप्यूटर प्रोग्राम) लिखता है।
  3. वह स्क्रिप्ट का परीक्षण करता है। यदि वेबसाइट बदलने के कारण स्क्रिप्ट टूट जाती है, तो बिल्डर स्वचालित रूप से कोड को ठीक करता है
  4. यह उन्हें 12 अलग-अलग विषयों (फाइनेंस, स्पोर्ट्स, वेदर, आदि) को कवर करने वाला एक विशाल, हमेशा अपडेट होने वाला टेस्ट बैंक बनाने की अनुमति देता है।

💡 मुख्य निष्कर्ष: आगे क्या है?

पेपर यह निष्कर्ष निकालता है कि केवल AI को बेहतर सर्च टूल्स देना काफी नहीं है। हमें उन्हें टाइम मैनेजमेंट सिखाने की आवश्यकता है।

  • वर्तमान AI: "मुझे 2024 के बारे में एक तथ्य मिला। यही उत्तर होना चाहिए।"
  • भविष्य का AI: "मुझे 2024 के बारे में एक तथ्य मिला। रुकिए, यूजर ने कल के बारे में पूछा था। मुझे उस पुराने तथ्य को हटाना होगा, वर्तमान तारीख ढूंढनी होगी और नए तथ्य की तलाश करनी होगी।"

संक्षेप में: इंटरनेट एक जीवित, सांस लेती चीज़ है जो हर सेकंड बदलती है। हमारे AI असिस्टेंट वर्तमान में 1990 के मानचित्र वाले पर्यटकों की तरह हैं। RT-QA पहला ऐसा टेस्ट है जो उन्हें GPS का उपयोग करना और वास्तविक दुनिया में अभी नेविगेट करना सीखने के लिए मजबूर करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →