← नवीनतम पेपर
💬 NLP

SPARTA: Scalable and Principled Benchmark of Tree-Structured Multi-hop QA over Text and Tables

यह शोध पत्र SPARTA को प्रस्तुत करता है, जो एक स्केलेबल और सिद्धांतवादी ढांचा है जो गहरे मल्टी-हॉप रीजनिंग और जटिल एग्रीगेशन के साथ बड़े पैमाने पर, उच्च-निष्ठा वाले टेबल-टेक्स्ट प्रश्न उत्तर बेंचमार्क को स्वचालित रूप से उत्पन्न करता है, जो मौजूदा बेंचमार्क की तुलना में वर्तमान अत्याधुनिक मॉडलों के प्रदर्शन में महत्वपूर्ण अंतराल को प्रकट करता है।

मूल लेखक: Sungho Park, Jueun Kim, Wook-Shin Han

प्रकाशित 2026-02-27
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sungho Park, Jueun Kim, Wook-Shin Han

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जटिल रहस्य सुलझाने की कोशिश कर रहे हैं। आपके पास एक विशाल, बिखरा हुआ नोटबुक है जिसमें हाथ से लिखे नोट्स (असंरचित टेक्स्ट) और व्यवस्थित स्प्रेडशीट्स का एक ढेर है जिसमें नंबर और नाम हैं (संरचित टेबल्स)।

इस रहस्य को सुलझाने के लिए, आपको नोटबुक में एक नाम को स्प्रेडशीट में एक वेतन (salary) के साथ क्रॉस-रेफरेंस करना होगा, फिर तीसरे दस्तावेज़ में जन्म तिथि की जाँच करनी होगी, और अंत में एक औसत (average) की गणना करनी होगी। टेबल-टेक्स्ट क्वेश्चन अनswering (QA) बिल्कुल यही है।

हालाँकि, AI मॉडल इस कौशल को सीखने के लिए वर्तमान "प्रशिक्षण मैदान" बच्चों के खेल के मैदानों जैसे हैं: वे बहुत छोटे, बहुत सरल और गलतियों से भरे हुए हैं। पेपर SPARTA एक विशाल, वास्तविक और पूरी तरह से निर्मित "ट्रेनिंग जिम" पेश करता है ताकि AI को इन जटिल वास्तविक दुनिया की पहेलियों को संभालने के लिए प्रशिक्षित किया जा सके।

यहाँ सरल उपमाओं (analogies) का उपयोग करके पेपर का विवरण दिया गया है:

1. समस्या: "खिलौने" वाले बेंचमार्क

मौजूदा AI बेंचमार्क (जैसे HybridQA या OTT-QA) को केवल 10 ईंटों वाले LEGO सेट के रूप में सोचें।

  • बहुत सरल: प्रश्न उथले हैं। वे पूछते हैं, "सबसे लंबा खिलाड़ी कौन है?" (एक हॉप/एक कदम)। वे शायद ही कभी पूछते हैं, "वह सबसे लंबा खिलाड़ी कौन है जिसने उस ड्राफ्ट क्लास की औसत टीम से अधिक गेम जीतने वाली टीम के लिए खेला था?" (मल्टी-हॉप/कई कदम)।
  • गलतियों से भरा: क्योंकि मनुष्यों ने इन डेटासेट्स को मैन्युअल रूप से बनाया है, वे अव्यवस्थित हैं। लेखकों ने पाया कि पुराने डेटासेट्स में लगभग 20-20% प्रश्न टूटे हुए थे, गलत उत्तर थे, या अनावश्यक थे। यह एक छात्र को गणित का टेस्ट देने जैसा है जहाँ शिक्षक ने प्रश्नों में टाइपिंग की गलतियाँ कर दी हों।
  • बहुत छोटा: उपयोग किए गए टेबल्स बहुत छोटे हैं (जैसे 15 पंक्तियाँ)। वास्तविक दुनिया के डेटाबेस में हजारों या लाखों पंक्तियाँ होती हैं।

2. समाधान: SPARTA (द "रियल-वर्ल्ड जिम")

लेखकों ने SPARTA (Scalable and Principled Benchmark of Tree-Structured Multi-Hop QA) बनाया है। एक खिलौना सेट हाथ से बनाने के बजाय, उन्होंने लाखों वास्तविक पहेलियाँ स्वचालित रूप से उत्पन्न करने वाला एक फैक्ट्री बनाया है।

SPARTA फैक्ट्री कैसे काम करती है:

  • चरण 1: "फैक्ट डेटाबेस" (लाइब्रेरी)
    कल्पना कीजिए कि आप NBA गेम रिपोर्ट की एक अव्यवस्थित नोटबुक को लेकर हर एक वाक्य को एक साफ, खोजने योग्य पंक्ति में एक स्प्रेडशीट में बदल देते हैं। वे इसे ग्राउंडिंग टेबल कहते हैं। अब, उनके पास एक विशाल लाइब्रेरी है जहाँ हर तथ्य (चाहे वह टेक्स्ट के पैराग्राफ से आया हो या टेबल से) एक ही स्थान पर रहता है, जो क्वेरी करने के लिए तैयार है।

  • चरण 2: "क्वेरी आर्किटेक्ट" (LLM)
    वे जटिल SQL प्रश्न (वह भाषा जिसका उपयोग कंप्यूटर डेटाबेस से प्रश्न पूछने के लिए करते हैं) लिखने के लिए एक शक्तिशाली AI (एक लार्ज लैंग्वेज मॉडल) का उपयोग करते हैं।

    • "ट्री" संरचना: केवल तर्क की एक सीधी रेखा (A से B से C तक) के बजाय, SPARTA ट्री-स्ट्रक्चर्ड (वृक्ष-संरचित) प्रश्न बनाता है। एक फैमिली ट्री की कल्पना करें: आपको माता-पिता, दादा-दादी और चचेरे भाई-बहनों को एक साथ चेक करने की आवश्यकता है। SPARTA AI को ये जटिल, शाखाओं वाले पेड़ बनाने के लिए मजबूर करता है।
    • "सेफ्टी नेट" (प्रोवेनेंस-आधारित रिफाइनमेंट): कभी-कभी AI एक ऐसा प्रश्न लिखता है जो "कोई परिणाम नहीं" (जैसे कि ऐसे खिलाड़ी के लिए पूछना जिसकी ऊंचाई 10 फीट हो) लौटाता है। हार मानने के बजाय, SPARTA एक "डिटेक्टिव टूल" (प्रोवेनेंस) का उपयोग करता है और पूछता है: "यह क्यों विफल हुआ?" यह AI को बताता है, "आपने सबको बाहर कर दिया क्योंकि वेतन बहुत अधिक था। वेतन सीमा को कम करने का प्रयास करें।" AI फिर स्वचालित रूप से प्रश्न को ठीक करता है। यह सुनिश्चित करता है कि प्रत्येक प्रश्न का एक वास्तविक उत्तर हो।
  • चरण 3: "ट्रांसलेटर" (क्वेश्चन वर्बलाइजेशन)
    एक बार जब AI के पास एक सटीक, निष्पादनीय SQL प्रश्न होता है, तो दूसरा AI उसे प्राकृतिक मानवीय भाषा में अनुवादित करता है।

    • SQL: SELECT name FROM players WHERE height > (SELECT AVG(height)...)
    • मानवीय भाषा: "कौन से खिलाड़ी 1990 के बाद ड्राफ्ट किए गए पॉइंट गार्ड्स की औसत ऊंचाई से अधिक लंबे हैं?"

3. परिणाम: "रियलिटी चेक"

लेखकों ने उपलब्ध सबसे स्मार्ट AI मॉडल्स (जो पुराने टेस्ट पर 70%+ अंक प्राप्त करते हैं) का इस नए SPARTA जिम पर परीक्षण किया।

परिणाम? वे क्रैश हो गए।

  • जो मॉडल पुराने, आसान टेस्ट पर "चैंपियन" थे, वे इस नए टेस्ट पर 30 अंक या उससे अधिक गिर गए।
  • क्यों? क्योंकि पुराने टेस्ट खाली पार्किंग लॉट में ड्राइविंग टेस्ट की तरह थे। SPARTA भीड़भाड़ वाले समय में गड्ढों, डायवर्जन और जटिल चौराहों के साथ ड्राइविंग टेस्ट है।
  • मॉडल इन चीजों के लिए संघर्ष कर रहे थे:
    • गहरा तर्क (Deep Reasoning): तर्क की लंबी श्रृंखलाओं का पालन करना।
    • जटिल गणित: जैसे कि "टीम के आधार पर ग्रुप करें, फिर औसत निकालें, फिर फ़िल्टर करें।"
    • स्रोतों को मिलाना (Mixing Sources): बिना भ्रमित हुए टेक्स्ट पैराग्राफ और टेबल से जानकारी को सही ढंग से संयोजित करना।

4. यह क्यों मायने रखता है

SPARTA केवल एक नया डेटासेट नहीं है; यह एक रियलिटी चेक है। यह हमें दिखाता है कि हालांकि AI सरल कार्यों में अच्छा हो रहा है, लेकिन यह अभी भी बहुत नाजुक है जब इसे जटिल, वास्तविक दुनिया के डेटा का सामना करना पड़ता है जिसके लिए गहरे चिंतन और सावधानीपूर्वक क्रॉस-रेफरेंसिंग की आवश्यकता होती है।

संक्षेप में:

  • पुराने बेंचमार्क: 5 टुकड़ों वाला एक बच्चे का पहेली (puzzle), जिनमें से कुछ गायब हैं।
  • SPARTA: 10,000 टुकड़ों वाली एक विशाल, जटिल पहेली, जहाँ हर टुकड़ा पूरी तरह से फिट बैठता है, और चित्र एक वास्तविक शहर का दृश्य है।
  • सबक: यदि हम चाहते हैं कि AI वास्तविक दुनिया की समस्याओं को हल करे, तो हमें उन्हें बच्चों की पहेलियों पर प्रशिक्षित करना बंद करना होगा।

पेपर इस निष्कर्ष पर पहुँचता है कि वास्तव में मजबूत AI बनाने के लिए, हमें ऐसे बेंचमार्क की आवश्यकता है जो बड़े, साफ और जटिल हों, ठीक वैसे ही जैसे वास्तविक दुनिया में उपयोग किया जाने वाला डेटा होता है। SPARTA बिल्कुल वही प्रदान करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →