← नवीनतम पेपर
💬 NLP

TraceBack: Multi-Agent Decomposition for Fine-Grained Table Attribution

यह शोध पत्र TraceBack प्रस्तुत करता है, जो एक मल्टी-एजेंट फ्रेमवर्क है जो उत्तरों के लिए सूक्ष्म, सेल-स्तरीय एट्रिब्यूशन प्रदान करके टेबल-आधारित प्रश्न उत्तर देने में पारदर्शिता को बढ़ाता है, जिसके साथ व्यवस्थित मूल्यांकन के लिए CITEBench बेंचमार्क और संदर्भ-रहित FairScore मेट्रिक भी दिया गया है।

मूल लेखक: Tejas Anvekar, Junha Park, Rajat Jha, Devanshu Gupta, Poojah Ganesan, Puneeth Mathur, Vivek Gupta

प्रकाशित 2026-02-16
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tejas Anvekar, Junha Park, Rajat Jha, Devanshu Gupta, Poojah Ganesan, Puneeth Mathur, Vivek Gupta

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन कभी-कभी ज़रूरत से ज़्यादा आत्मविश्वासी, लाइब्रेरियन (एक AI) से स्प्रेडशीट के एक विशाल पुस्तकालय के बारे में सवाल पूछते हैं। लाइब्रेरियन आपको एक सटीक उत्तर देता है। लेकिन फिर आप उससे पूछते हैं, "आपको कैसे पता कि यह सच है? आपने कौन सी विशिष्ट पुस्तक या पृष्ठ पढ़ा?"

अक्सर, लाइब्रेरियन बस कंधे उचका देता है या पूरी शेल्फ की ओर अस्पष्ट रूप से इशारा कर देता है। यह एक समस्या है। उच्च-दांव वाली स्थितियों में (जैसे चिकित्सा सलाह या वित्तीय रिपोर्ट में), आपको यह जानने की आवश्यकता होती है कि तालिका में कौन से विशिष्ट सेल (cells) ने उस उत्तर का समर्थन किया।

यह पेपर इस समस्या को हल करने के लिए TRACEBACK नामक एक नई प्रणाली पेश करता है, साथ ही इसे टेस्ट करने का एक नया तरीका CITEBENCH और एक नया "स्कोरकार्ड" FAIRSCORE भी पेश करता है।

सरल उपमाओं का उपयोग करते हुए इसका विवरण यहाँ दिया गया है:

1. समस्या: "ब्लैक बॉक्स" लाइब्रेरियन

वर्तमान AI सिस्टम जादूगरों की तरह हैं। वे टोपी से सही उत्तर निकालते हैं, लेकिन आप उनके पीछे की ट्रिक नहीं देख सकते।

  • समस्या: यदि कोई AI कहता है, "सौर ऊर्जा सबसे कुशल है," तो हो सकता है कि वह सही हो, लेकिन हो सकता है कि उसने केवल अनुमान लगाया हो। हमें चाहिए कि वह तालिका की ठीक उसी पंक्ति और कॉलम की ओर इशारा करे जहाँ लिखा है "सोलर: 30-50% दक्षता।"
  • पुराना तरीका: पिछले उपकरण धुंधले कैमरे की तरह थे। वे आपको बता सकते थे कि उत्तर किस पंक्ति में था, लेकिन वे यह नहीं बता सकते थे कि उस पंक्ति में कौन सा विशिष्ट शब्द मुख्य था। वे "मध्यवर्ती चरणों" (जैसे कि कैसे AI ने स्टार्ट टाइम और एंड टाइम देखकर अवधि की गणना की) को भी छोड़ देते थे।

2. समाधान: TRACEBACK (जासूसी टीम)

लेखकों ने TRACEBACK बनाया है, जो केवल एक AI नहीं है, बल्कि विशेष रूप से प्रशिक्षित AI एजेंटों की एक टीम है जो एक जासूसी दल की तरह मिलकर काम करती है। एक ही बड़े कदम में उत्तर का अनुमान लगाने के बजाय, वे मामले को छोटे हिस्सों में तोड़ देते हैं:

  • एजेंट 1 (द फिल्टर): "ठीक है, हम 'सोलर पावर' की तलाश कर रहे हैं। आइए तालिका की उन सभी पंक्तियों को हटा दें जो सोलर के बारे में नहीं हैं।" (तालिका को छाँटना/Pruning)।
  • एजेंट 2 (द डिकंपोजर): "सवाल जटिल है। आइए इसे छोटे सुरागों में तोड़ें। पहले, लागत खोजें। फिर, स्केलेबिलिटी खोजें। अंत में, दक्षता खोजें।"
  • एजेंट 3 (द एविडेंस हंटर): "अब, 'लागत' के सुराग के लिए, उस सटीक सेल की ओर इशारा करें जिसमें '$30-50' लिखा है।"
  • एजेंट 4 (द कनेक्टर): "ठीक है, हमारे पास लागत वाला सेल, स्केलेबिलिटी वाला सेल और दक्षता वाला सेल है। आइए अंतिम उत्तर को सिद्ध करने के लिए उन्हें आपस में जोड़ दें।"

परिणाम: TRACEBACK आपको केवल उत्तर नहीं देता; यह आपको रसीद देता है। यह आपको दिखाता है कि तर्क के हर चरण के लिए किन विशिष्ट सेल्स का उपयोग किया गया था, यहाँ तक कि छिपे हुए चरणों के लिए भी।

3. नया टेस्ट: CITEBENCH (गोल्ड स्टैंडर्ड एग्जाम)

यह देखने के लिए कि क्या TRACEBACK वास्तव में काम करता है, लेखकों को एक टेस्ट की आवश्यकता थी। उन्होंने महसूस किया कि मौजूदा टेस्ट त्रुटिपूर्ण थे:

  • त्रुटि: पुराने टेस्ट किसी छात्र के निबंध को केवल यह देखकर ग्रेड करने जैसे थे कि अंतिम वाक्य सही है या नहीं, और यह अनदेखा कर देते थे कि वहां तक पहुँचने के लिए उन्होंने क्या गणित किया। इसके अलावा, कुछ पुराने टेस्ट में "शोर वाले" (noisy) उत्तर थे (अप्रासंगिक सेल्स को महत्वपूर्ण के रूप में चिह्नित करना)।
  • सुधार: उन्होंने CITEBENCH बनाया। कल्पना कीजिए कि एक शिक्षक मैन्युअल रूप से 1,500 परीक्षा पत्रों को ग्रेड कर रहा है। प्रत्येक उत्तर के लिए, शिक्षक उस सटीक सेल के चारों ओर लाल घेरा बनाता है जो साबित करता है कि उत्तर सही है। यह एक "गोल्ड स्टैंडर्ड" बनाता है जिससे यह मापा जा सके कि AI सत्य खोजने में कितना अच्छा है।

4. स्कोरकार्ड: FAIRSCORE (द "नो-आंसर-की" ग्रेडर)

यहाँ पेचीदा हिस्सा है: 1,500 पत्रों को मैन्युअल रूप से ग्रेड करना महंगा और धीमा है। क्या होगा यदि आप AI को 1,00,000 सवालों पर टेस्ट करना चाहते हैं? आप उसके लिए मानव को काम पर नहीं रख सकते।

पेश है FAIRSCORE

  • उपमा: कल्पना कीजिए कि आपके पास उत्तर कुंजी (answer key) नहीं है, लेकिन आपके पास छात्र का उत्तर और पाठ्यपुस्तक है।
  • यह कैसे काम करता है: FAIRSCORE, AI के उत्तर को लेता है और उसे छोटे "परमाणु तथ्यों" (atomic facts) में तोड़ देता है (जैसे, "सोलर की लागत $30 है")। फिर यह उन सेल्स को भी लेता है जिनकी ओर AI ने इशारा किया था और उन्हें भी तथ्यों में बदल देता है ("तालिका कहती है कि सोलर की लागत $30 है")।
  • मिलान: यह दोनों सूचियों की तुलना करता है।
    • यदि AI के तथ्य उन सेल्स से मेल खाते हैं जिनकी ओर उसने इशारा किया था, तो उसे प्रिसिजन (Precision) के लिए अंक मिलते हैं (उसने झूठ नहीं बोला)।
    • यदि AI के तथ्य उत्तर में शामिल सभी चीजों को कवर करते हैं, तो उसे रिकॉल (Recall) के लिए अंक मिलते हैं (उसने कुछ छोड़ा नहीं)।
  • यह क्यों शानदार है: यह बिना किसी मानव द्वारा उत्तर कुंजी की जांच किए, AI के काम को ग्रेड कर सकता है। यह एक स्व-सुधार करने वाले होमवर्क हेल्पर की तरह है।

5. परिणाम

जब उन्होंने टेस्ट चलाए:

  • TRACEBACK ने प्रतियोगिता को पछाड़ दिया। यह पिछले तरीकों की तुलना में सटीक सेल्स खोजने में बहुत बेहतर था।
  • FAIRSCORE एक विश्वसनीय जज साबित हुआ। बिना किसी मानवीय मदद के भी, इसने सही ढंग से पहचान लिया कि कौन सा AI बेहतर काम कर रहा था।

सारांश

इस पेपर को एक पारदर्शी रसोई (transparent kitchen) के रूप में सोचें।

  • पुराना AI: आपको एक स्वादिष्ट स्टू (stew) परोसता है लेकिन यह नहीं बताता कि इसमें क्या है।
  • TRACEBACK: आपको स्टू परोसता है और साथ में एक विस्तृत रसीद भी देता है, जो दिखाता है कि कौन सी गाजर, आलू और मसाले इस्तेमाल किए गए थे, और उन्हें कैसे काटा गया था।
  • CITEBENCH: एक मास्टर शेफ जो यह सुनिश्चित करने के लिए रसीद की जांच करता है कि वह सटीक है।
  • FAIRSCORE: एक स्मार्ट रोबोट जो स्टू का स्वाद ले सकता है और रसीद की जांच कर सकता है कि क्या वे मेल खाते हैं, भले ही मास्टर शेफ कमरे में न हो।

यह AI को फिर से भरोसेमंद बनाता है, खासकर जब आपको यह जानने की आवश्यकता हो कि उसने आपको उत्तर क्यों दिया, न कि केवल यह कि उत्तर क्या है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →