SciEGQA: A Dataset for Scientific Evidence-Grounded Question Answering and Reasoning
यह शोध पत्र SciEGQA प्रस्तुत करता है, जिसमें एक मानव-एनोटेटेड सूक्ष्म-स्तरीय बेंचमार्क और सिमेंटिक रूप से ग्राउंडेड एविडेंस रीजन के साथ एक बड़े पैमाने पर स्वचालित प्रशिक्षण सेट की विशेषता वाला एक नया डेटासेट है, जिसे डॉक्यूमेंट विजुअल क्वेश्चन अनस्वियरिंग में विजन-लैंग्वेज मॉडल्स की एविडेंस लोकलाइजेशन और वैज्ञानिक तर्क क्षमताओं को बढ़ाने के लिए डिज़ाइन किया गया है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक जासूस हैं जो एक रहस्य को सुलझाने की कोशिश कर रहे हैं, लेकिन आपका "दृश्य" कोई अपराध स्थल नहीं, बल्कि घने टेक्स्ट, जटिल चार्ट और भ्रमित करने वाले आरेखों से भरा एक विशाल, 50 पन्नों का वैज्ञानिक शोध पत्र है।
समस्या: "पेज-लेवल" जासूस
वर्तमान में, अधिकांश AI जासूस (विज़न-लैंग्वेज मॉडल्स) पूरे पेज को देखने और उत्तर का अनुमान लगाने के लिए प्रशिक्षित होते हैं। यह ऐसा ही है जैसे आपसे पूछा जाए, "संदिग्ध कहाँ है?" और AI पूरे शहर के ब्लॉक की ओर इशारा कर दे। यह तकनीकी रूप से सही हो सकता है कि संदिग्ध उस ब्लॉक में कहीं है, लेकिन यह बहुत मददगार नहीं है। AI किस्मत से सही उत्तर दे सकता है, लेकिन उसे वास्तव में पता नहीं होता कि प्रमाण कहाँ है। यह AI पर भरोसा करना कठिन बनाता है या यह समझना मुश्किल बनाता है कि वह अपने निष्कर्ष तक कैसे पहुँचा।
अन्य AI मॉडल बहुत छोटे, व्यक्तिगत शब्दों (जैसे कि एक पेज पर एक अकेला अक्षर) को देखने के लिए प्रशिक्षित होते हैं। यह बहुत अधिक ज़ूम-इन है। यह एक फिल्म को समझने जैसा है जैसे कि आप स्क्रीन पर एक सिंगल पिक्सल को देख रहे हों। आप कहानी खो देंगे।
समाधान: SciEGQA (द "हाइलाइटर" डिटेक्टिव)
लेखकों ने इस पेपर में एक नया डेटासेट पेश किया है जिसे SciEGQA कहा जाता है। इसे एक प्रशिक्षण पाठ्यक्रम के रूप में सोचें जो AI जासूसों को केवल इशारा करने या ज़ूम करने के बजाय एक हाइलाइटर का उपयोग करना सिखाता है।
SciEGQA में, जब एक AI उत्तर देता है, तो उसे उस सटीक पैराग्राफ, चार्ट या वाक्य के चारों ओर एक बॉक्स भी बनाना चाहिए जो उसके उत्तर को सिद्ध करता है।
- उपमा: कल्पना कीजिए कि आप एक पाठ्यपुस्तक पढ़ रहे हैं। केवल यह कहने के बजाय कि "उत्तर पेज 10 पर है," AI कहता है, "उत्तर पेज 10 पर तीसरे पैराग्राफ में है, विशेष रूप से 'गुरुत्वाकर्षण' के बारे में वह वाक्य।" वह सटीक प्रमाण को हाइलाइट करता है।
उन्होंने इसे कैसे बनाया
- "गोल्ड स्टैंडर्ड" (द बेंचमार्क): टीम ने मानव विशेषज्ञों को 80 वास्तविक वैज्ञानिक शोध पत्र पढ़ने और इन "हाइलाइट बॉक्स" को प्रमाण के चारों ओर मैन्युअल रूप से खींचने के लिए काम पर रखा। उन्होंने 1,600+ उच्च-गुणवत्ता वाले प्रश्न बनाए जहाँ उत्तर का उस हाइलाइट किए गए क्षेत्र से आना अनिवार्य है। यह AI के लिए "फाइनल एग्जाम" है।
- "प्रैक्टिस जिम" (द ट्रेनिंग सेट): चूंकि इंसान लाखों शोध पत्र नहीं पढ़ सकते, इसलिए उन्होंने स्वचालित रूप से 30,000+ अभ्यास प्रश्न उत्पन्न करने के लिए एक रोबोटिक पाइपलाइन बनाई। उन्होंने रोबोट को टेक्स्ट के टुकड़ों को खोजने, उन पर प्रश्न पूछने और उत्तरों को सत्यापित करने के लिए प्रशिक्षित किया। इसने AI को अभ्यास समस्याओं का एक विशाल पुस्तकालय दिया।
कठिनाई के तीन स्तर
यह डेटासेट AI को वीडियो गेम के स्तरों की तरह जटिलता के तीन स्तरों पर परखता है:
- स्तर 1 (एकल पेज, एकल स्थान): "इस एक चार्ट में उत्तर खोजें।" (आसान)
- स्तर 2 (एकल पेज, कई स्थान): "इस चार्ट और इसी पेज के इस पैराग्राफ दोनों से उत्तर जोड़ें।" (मध्यम)
- स्तर 3 (कई पेज, कई स्थान): "प्रस्तावना में एक संख्या, बीच में एक ग्राफ और अंत में एक निष्कर्ष खोजें, फिर उन्हें एक साथ जोड़ें।" (कठिन)
उन्होंने क्या पाया
जब उन्होंने आज के सबसे स्मार्ट AI मॉडल्स को इस नए "हाइलाइटर" टेस्ट पर परखा, तो परिणाम आश्चर्यजनक थे:
- AI प्रमाण खोजने में बुरा है। सबसे अच्छे मॉडल्स भी सही जगह के चारों ओर बॉक्स बनाने में संघर्ष करते हैं। वे अक्सर अनुमान लगाकर सही उत्तर पा लेते हैं, लेकिन वे सबूत की ओर इशारा नहीं कर पाते।
- संदर्भ मायने रखता है। जब AI को पूरा दस्तावेज़ दिया गया, तो वह भ्रमित हो गया। लेकिन जब उन्हें केवल विशिष्ट हाइलाइट किया गया पैराग्राफ (प्रमाण क्षेत्र) दिया गया, तो उनकी सटीकता बहुत बढ़ गई। यह साबित करता है कि AI की मुख्य कमजोरी उत्तर जानना नहीं है; बल्कि यह जानना है कि कहाँ देखना है।
- प्रशिक्षण काम करता है। जब उन्होंने एक AI मॉडल को उनके नए "प्रैक्टिस जिम" (30k डेटासेट) का उपयोग करके प्रशिक्षित किया, तो मॉडल प्रमाण खोजने और प्रश्नों के उत्तर देने, दोनों में बेहतर हो गया।
बड़ी तस्वीर
यह पेपर मूल रूप से यह कह रहा है: "हम अब केवल AI से उत्तर नहीं मांग सकते। विज्ञान में, हमें जानने की आवश्यकता है कि उत्तर क्यों और कहाँ से आया।"
SciEGQA एक ऐसा उपकरण है जो AI को अनुमान लगाना बंद करने और अपना काम दिखाने के लिए मजबूर करता है, ठीक उसी तरह जैसे एक अच्छा छात्र निबंध लिखने से पहले पाठ्यपुस्तक में मुख्य वाक्यों को रेखांकित करता है। यह गंभीर वैज्ञानिक अनुसंधान के लिए AI को भरोसेमंद बनाने की दिशा में एक महत्वपूर्ण कदम है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।