← नवीनतम पेपर
🤖 AI

SciEGQA: A Dataset for Scientific Evidence-Grounded Question Answering and Reasoning

यह शोध पत्र SciEGQA प्रस्तुत करता है, जिसमें एक मानव-एनोटेटेड सूक्ष्म-स्तरीय बेंचमार्क और सिमेंटिक रूप से ग्राउंडेड एविडेंस रीजन के साथ एक बड़े पैमाने पर स्वचालित प्रशिक्षण सेट की विशेषता वाला एक नया डेटासेट है, जिसे डॉक्यूमेंट विजुअल क्वेश्चन अनस्वियरिंग में विजन-लैंग्वेज मॉडल्स की एविडेंस लोकलाइजेशन और वैज्ञानिक तर्क क्षमताओं को बढ़ाने के लिए डिज़ाइन किया गया है।

मूल लेखक: Wenhan Yu, Zhaoxi Zhang, Wang Chen, Guanqiang Qi, Weikang Li, Lei Sha, Deguo Xia, Jizhou Huang

प्रकाशित 2026-03-31
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Wenhan Yu, Zhaoxi Zhang, Wang Chen, Guanqiang Qi, Weikang Li, Lei Sha, Deguo Xia, Jizhou Huang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जासूस हैं जो एक रहस्य को सुलझाने की कोशिश कर रहे हैं, लेकिन आपका "दृश्य" कोई अपराध स्थल नहीं, बल्कि घने टेक्स्ट, जटिल चार्ट और भ्रमित करने वाले आरेखों से भरा एक विशाल, 50 पन्नों का वैज्ञानिक शोध पत्र है।

समस्या: "पेज-लेवल" जासूस
वर्तमान में, अधिकांश AI जासूस (विज़न-लैंग्वेज मॉडल्स) पूरे पेज को देखने और उत्तर का अनुमान लगाने के लिए प्रशिक्षित होते हैं। यह ऐसा ही है जैसे आपसे पूछा जाए, "संदिग्ध कहाँ है?" और AI पूरे शहर के ब्लॉक की ओर इशारा कर दे। यह तकनीकी रूप से सही हो सकता है कि संदिग्ध उस ब्लॉक में कहीं है, लेकिन यह बहुत मददगार नहीं है। AI किस्मत से सही उत्तर दे सकता है, लेकिन उसे वास्तव में पता नहीं होता कि प्रमाण कहाँ है। यह AI पर भरोसा करना कठिन बनाता है या यह समझना मुश्किल बनाता है कि वह अपने निष्कर्ष तक कैसे पहुँचा।

अन्य AI मॉडल बहुत छोटे, व्यक्तिगत शब्दों (जैसे कि एक पेज पर एक अकेला अक्षर) को देखने के लिए प्रशिक्षित होते हैं। यह बहुत अधिक ज़ूम-इन है। यह एक फिल्म को समझने जैसा है जैसे कि आप स्क्रीन पर एक सिंगल पिक्सल को देख रहे हों। आप कहानी खो देंगे।

समाधान: SciEGQA (द "हाइलाइटर" डिटेक्टिव)
लेखकों ने इस पेपर में एक नया डेटासेट पेश किया है जिसे SciEGQA कहा जाता है। इसे एक प्रशिक्षण पाठ्यक्रम के रूप में सोचें जो AI जासूसों को केवल इशारा करने या ज़ूम करने के बजाय एक हाइलाइटर का उपयोग करना सिखाता है।

SciEGQA में, जब एक AI उत्तर देता है, तो उसे उस सटीक पैराग्राफ, चार्ट या वाक्य के चारों ओर एक बॉक्स भी बनाना चाहिए जो उसके उत्तर को सिद्ध करता है।

  • उपमा: कल्पना कीजिए कि आप एक पाठ्यपुस्तक पढ़ रहे हैं। केवल यह कहने के बजाय कि "उत्तर पेज 10 पर है," AI कहता है, "उत्तर पेज 10 पर तीसरे पैराग्राफ में है, विशेष रूप से 'गुरुत्वाकर्षण' के बारे में वह वाक्य।" वह सटीक प्रमाण को हाइलाइट करता है।

उन्होंने इसे कैसे बनाया

  1. "गोल्ड स्टैंडर्ड" (द बेंचमार्क): टीम ने मानव विशेषज्ञों को 80 वास्तविक वैज्ञानिक शोध पत्र पढ़ने और इन "हाइलाइट बॉक्स" को प्रमाण के चारों ओर मैन्युअल रूप से खींचने के लिए काम पर रखा। उन्होंने 1,600+ उच्च-गुणवत्ता वाले प्रश्न बनाए जहाँ उत्तर का उस हाइलाइट किए गए क्षेत्र से आना अनिवार्य है। यह AI के लिए "फाइनल एग्जाम" है।
  2. "प्रैक्टिस जिम" (द ट्रेनिंग सेट): चूंकि इंसान लाखों शोध पत्र नहीं पढ़ सकते, इसलिए उन्होंने स्वचालित रूप से 30,000+ अभ्यास प्रश्न उत्पन्न करने के लिए एक रोबोटिक पाइपलाइन बनाई। उन्होंने रोबोट को टेक्स्ट के टुकड़ों को खोजने, उन पर प्रश्न पूछने और उत्तरों को सत्यापित करने के लिए प्रशिक्षित किया। इसने AI को अभ्यास समस्याओं का एक विशाल पुस्तकालय दिया।

कठिनाई के तीन स्तर
यह डेटासेट AI को वीडियो गेम के स्तरों की तरह जटिलता के तीन स्तरों पर परखता है:

  • स्तर 1 (एकल पेज, एकल स्थान): "इस एक चार्ट में उत्तर खोजें।" (आसान)
  • स्तर 2 (एकल पेज, कई स्थान): "इस चार्ट और इसी पेज के इस पैराग्राफ दोनों से उत्तर जोड़ें।" (मध्यम)
  • स्तर 3 (कई पेज, कई स्थान): "प्रस्तावना में एक संख्या, बीच में एक ग्राफ और अंत में एक निष्कर्ष खोजें, फिर उन्हें एक साथ जोड़ें।" (कठिन)

उन्होंने क्या पाया
जब उन्होंने आज के सबसे स्मार्ट AI मॉडल्स को इस नए "हाइलाइटर" टेस्ट पर परखा, तो परिणाम आश्चर्यजनक थे:

  • AI प्रमाण खोजने में बुरा है। सबसे अच्छे मॉडल्स भी सही जगह के चारों ओर बॉक्स बनाने में संघर्ष करते हैं। वे अक्सर अनुमान लगाकर सही उत्तर पा लेते हैं, लेकिन वे सबूत की ओर इशारा नहीं कर पाते।
  • संदर्भ मायने रखता है। जब AI को पूरा दस्तावेज़ दिया गया, तो वह भ्रमित हो गया। लेकिन जब उन्हें केवल विशिष्ट हाइलाइट किया गया पैराग्राफ (प्रमाण क्षेत्र) दिया गया, तो उनकी सटीकता बहुत बढ़ गई। यह साबित करता है कि AI की मुख्य कमजोरी उत्तर जानना नहीं है; बल्कि यह जानना है कि कहाँ देखना है
  • प्रशिक्षण काम करता है। जब उन्होंने एक AI मॉडल को उनके नए "प्रैक्टिस जिम" (30k डेटासेट) का उपयोग करके प्रशिक्षित किया, तो मॉडल प्रमाण खोजने और प्रश्नों के उत्तर देने, दोनों में बेहतर हो गया।

बड़ी तस्वीर
यह पेपर मूल रूप से यह कह रहा है: "हम अब केवल AI से उत्तर नहीं मांग सकते। विज्ञान में, हमें जानने की आवश्यकता है कि उत्तर क्यों और कहाँ से आया।"

SciEGQA एक ऐसा उपकरण है जो AI को अनुमान लगाना बंद करने और अपना काम दिखाने के लिए मजबूर करता है, ठीक उसी तरह जैसे एक अच्छा छात्र निबंध लिखने से पहले पाठ्यपुस्तक में मुख्य वाक्यों को रेखांकित करता है। यह गंभीर वैज्ञानिक अनुसंधान के लिए AI को भरोसेमंद बनाने की दिशा में एक महत्वपूर्ण कदम है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →