← नवीनतम पेपर
💬 NLP

Harnessing Temporal Databases for Systematic Evaluation of Factual Time-Sensitive Question-Answering in Large Language Models

यह शोध पत्र TDBench प्रस्तुत करता है, जो एक स्केलेबल बेंचमार्क है जो बड़े भाषा मॉडलों (Large Language Models) के समय-संवेदनशील तथ्यात्मक तर्क का व्यवस्थित रूप से मूल्यांकन करने के लिए टेम्पोरल डेटाबेस और तकनीकों का लाभ उठाता है, जो एक नवीन "टाइम एक्यूरेसी" मीट्रिक और एप्लिकेशन-विशिष्ट डेटा के साथ मौजूदा दृष्टिकोणों का पूरक बनता है।

मूल लेखक: Soyeon Kim, Jindong Wang, Xing Xie, Steven Euijong Whang

प्रकाशित 2026-03-03
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Soyeon Kim, Jindong Wang, Xing Xie, Steven Euijong Whang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपका एक बहुत ही बुद्धिमान, विद्वान रोबोट मित्र (एक लार्ज लैंग्वेज मॉडल, या LLM) है जो दुनिया के बारे में बहुत कुछ जानता है। लेकिन इसमें एक पेच है: इस रोबोट की याददाश्त एक ऐसी लाइब्रेरी की तरह है जहाँ किताबें अलग-अलग समय पर अपडेट होती हैं, और कभी-कभी रोबोट नवीनतम संस्करण को चेक करना भूल जाता है। यदि आप उससे पूछते हैं, "अमेरिका का राष्ट्रपति कौन है?", तो वह आत्मविश्वास से 2010 के किसी राष्ट्रपति का नाम बता सकता है, यह जाने बिना कि दुनिया आगे बढ़ चुकी है।

यह पेपर इन रोबोट्स को टेस्ट करने का एक नया तरीका पेश करता है ताकि यह सुनिश्चित किया जा सके कि वे केवल अनुमान नहीं लगा रहे हैं या अतीत में अटके हुए नहीं हैं। लेखक इस नए परीक्षण मैदान को TDBench कहते हैं।

यहाँ इसका सरल विवरण दिया गया है, जिसमें कुछ रोजमर्रा के उपमाओं (analogies) का उपयोग किया गया है:

1. समस्या: "मैनुअल" बाधा (The "Manual" Bottleneck)

पहले, यह परीक्षण करने के लिए कि क्या किसी रोबोट को वर्तमान तथ्यों का ज्ञान है, शोधकर्ताओं को मानवीय संपादकों (human editors) की तरह काम करना पड़ता था। वे खुद बैठकर हजारों प्रश्न लिखते थे जैसे, "1995 में राष्ट्रपति कौन था?" या "अभी वर्तमान में राष्ट्रपति कौन है?"

  • समस्या: यह धीमा, महंगा और तालमेल बिठाने में कठिन है। जैसे ही कोई नया राष्ट्रपति चुना जाता है, शोधकर्ताओं को अपने सभी टेस्ट प्रश्न फिर से लिखने पड़ते हैं। यह एक छपी हुई विश्वकोश (encyclopedia) को हर बार कोई नई खबर आने पर अपडेट करने की कोशिश करने जैसा है।

2. समाधान: TDBench (एक "जीवंत डेटाबेस" दृष्टिकोण)

प्रश्न लिखने के लिए इंसानों को काम पर रखने के बजाय, लेखकों ने एक ऐसा सिस्टम बनाया है जो टेम्पोरल डेटाबेस (Temporal Databases) का उपयोग करता है।

  • उपमा: एक मानक डेटाबेस को एक फोटो एलबम की तरह समझें। यह आपको किसी व्यक्ति की तस्वीर दिखाता है। एक टेम्पोरल डेटाबेस एक टाइम-लैप्स वीडियो (time-lapse video) की तरह है। यह आपको केवल यह नहीं दिखाता कि वह व्यक्ति कौन है; यह आपको दिखाता है कि वह व्यक्ति उस समय कब था, उनका कार्यकाल कब शुरू हुआ, और कब समाप्त हुआ।
  • TDBench कैसे काम करता है:
    1. ब्लूप्रिंट (TFDs): सिस्टम डेटाबेस को देखता है और नियम ढूंढता है। उदाहरण के लिए, "किसी भी दिए गए समय में, एक देश का केवल एक ही राष्ट्रपति हो सकता है।" यह एक नियम है जिस पर सिस्टम भरोसा करता है।
    2. टाइम मशीन (Temporal SQL): सिस्टम स्वचालित रूप से "समय-यात्रा" (time-travel) क्वेरी लिखता है। केवल "राष्ट्रपति कौन है?" पूछने के बजाय, यह पूछता है, "5वें शीतकालीन ओलंपिक के दौरान राष्ट्रपति कौन था?" या "अभी राष्ट्रपति कौन है?" यह एक विशेष भाषा (SQL) का उपयोग करता है जो तारीखों और समय को संभालने में माहिर है।
    3. अनुवादक (LLM): अंत में, एक स्मार्ट AI इन सख्त, गणितीय समय-क्वेरीज़ को प्राकृतिक अंग्रेजी प्रश्नों में अनुवादित करता है जिन्हें रोबोट को हल करना होता है।

जादू: यदि डेटाबेस अपडेट होता है (जैसे, एक नया राष्ट्रपति चुना जाता है), तो TDBench सिस्टम स्वचालित रूप से नए टेस्ट प्रश्न तैयार कर देता है। किसी मानवीय संपादक की आवश्यकता नहीं है! यह एक ऐसे बगीचे की तरह है जो मौसम बदलने पर अपने स्वयं के टेस्ट प्रश्न उगाता है।

3. नया मीट्रिक: "समय सटीकता" (Time Accuracy)

यह इस पेपर का सबसे बड़ा नवाचार है।

  • पुराना तरीका: यदि किसी रोबोट ने उत्तर दिया "वर्तमान राष्ट्रपति जो बाइडन हैं," तो उसे एक गोल्ड स्टार मिलता था। भले ही रोबोट ने एक गलत स्पष्टीकरण जोड़ा हो, जैसे "उन्होंने 1990 में अपना कार्यकाल शुरू किया था" (जो कि गलत है), पुराने टेस्ट अक्सर उस झूठ को अनदेखा कर देते थे क्योंकि अंतिम नाम सही था।
  • नया तरीका (Time Accuracy): TDBench उत्तर और टाइमलाइन दोनों की जांच करता है।
    • उपमा: कल्पना कीजिए कि एक जासूस एक संदिग्ध से पूछता है, "आप मंगलवार को कहाँ थे?"
      • पुराना टेस्ट: यदि संदिग्ध कहता है "मैं पार्क में था," और वे वास्तव में पार्क में ही थे, तो वे पास हो जाते हैं।
      • TDBench टेस्ट: यदि संदिग्ध कहता है "मैं पार्क में था," लेकिन फिर जोड़ता है, "मैं वहां 1995 में पहुँचा था," तो टेस्ट झूठ को पकड़ लेता है। भले ही स्थान सही था, लेकिन समय गलत था।
    • परिणाम: पेपर ने पाया कि कई रोबोट नाम तो सही बताते हैं लेकिन तारीखों के बारे में भ्रम (hallucinate) पैदा करते हैं। वे "कौन" को तो जान लेते हैं लेकिन "कब" में विफल हो जाते हैं। TDBench इसे पकड़ लेता है, जिससे पता चलता है कि रोबोट अक्सर हमारी सोच से कम विश्वसनीय होते हैं।

4. "मल्टी-हॉप" चुनौती (The "Multi-Hop" Challenge)

शोधकर्ताओं ने दो अलग-अलग घटनाओं को जोड़ने वाले प्रश्न पूछकर परीक्षणों को और कठिन बना दिया है।

  • उपमा: केवल "1990 में अमेरिका के राष्ट्रपति कौन थे?" पूछने के बजाय, वे पूछते हैं, "जब जुरासिक पार्क फिल्म रिलीज हुई थी, तब अमेरिका के राष्ट्रपति कौन थे?"
  • रोबोट को यह करना होगा:
    1. जानना होगा कि जुरासिक पार्क कब रिलीज हुई थी (1993)।
    2. देखना होगा कि 1993 में राष्ट्रपति कौन था।
    3. सही उत्तर देना होगा।
  • TDBench अलग-अलग टाइम-लैप्स वीडियो (डेटाबेस) को आपस में "जोड़कर" (stitching) इन जटिल प्रश्नों को स्वचालित रूप से बना सकता है।

यह क्यों महत्वपूर्ण है?

  • स्केलेबिलिटी (Scalability): अब हम बिना किसी मानव लेखक की टीम के विशिष्ट विषयों (जैसे चिकित्सा कानून या कार्बन टैक्स) पर रोबोट्स का परीक्षण कर सकते हैं।
  • विश्वसनीयता (Reliability): यह "टाइम हैलुसिनेशन" (time hallucinations) को उजागर करता है जहाँ रोबोट आत्मविश्वास से भरी बातें करते हैं लेकिन इस बारे में तथ्यात्मक रूप से गलत होते हैं कि चीजें कब हुईं।
  • भविष्य के लिए तैयार (Future-Proofing): जैसे-जैसे दुनिया बदलती है, TDBेंच खुद को अपडेट करता रहता है, जिससे यह सुनिश्चित होता है कि हमारे पास हमेशा हमारे AI मित्रों को टेस्ट करने के लिए ताज़ा और सटीक तरीके हों।

संक्षेप में: लेखकों ने AI के लिए एक स्व-अपडेट होने वाला, समय-यात्रा करने वाला टेस्ट ट्रैक बनाया है। केवल यह जांचने के बजाय कि AI को उत्तर पता है, वे यह भी जांचते हैं कि क्या AI को समय पता है, जिससे यह सुनिश्चित होता है कि हमारे डिजिटल सहायक अतीत में अटके नहीं रह जाते।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →