← नवीनतम पेपर
💻 computer science

GDP.pdf: Benchmarking Grounded Multimodal Reasoning over Professional PDF Documents

यह शोध पत्र GDP.pdf को प्रस्तुत करता है, जो दस क्षेत्रों में पेशेवर रूप से तैयार किए गए 100 प्रश्न-दस्तावेज़ युग्मों वाला एक नया बेंचमार्क है, जो वर्तमान अत्याधुनिक मल्टीमॉडल मॉडलों की महत्वपूर्ण सीमाओं को उजागर करता है, जहाँ सबसे अच्छा प्रदर्शन करने वाला मॉडल तालिका/चार्ट की व्याख्या, क्रॉस-रेफरेंसिंग और दस्तावेज़ संशोधनों को संभालने में होने वाली बार-बार की त्रुटियों के कारण केवल 15% पास दर प्राप्त कर सका।

मूल लेखक: Suhaas Garre, Emily Ritchie, Sushant Mehta, Edwin Chen

प्रकाशित 2026-07-14
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Suhaas Garre, Emily Ritchie, Sushant Mehta, Edwin Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, बिखरी हुई लाइब्रेरी के अंदर "सुराग खोजो" (Find the Clue) नामक एक हाई-स्टेक्स गेम खेल रहे हैं। लेकिन किताबों के बजाय, यह लाइब्रेरी PDF से भरी है: बीमा पॉलिसियाँ, निर्माण ब्लूप्रिंट, चिकित्सा दिशानिर्देश और कर्मचारी हैंडबुक। आपके पास सुपर-स्मार्ट रोबोट जासूसों (AI मॉडल्स) की एक टीम तैयार है जो इस रहस्य को सुलझाने के लिए तैयार है। आप सोचेंगे, "इतनी शक्ति के साथ, वे इसे आसानी से जीत लेंगे!"

लेकिन यहाँ एक ट्विस्ट है: जब Surge AI के शोधकर्ताओं ने इन रोबोटों को परखने के लिए उन्हें टेस्ट किया, तो परिणाम चौंका देने वाले थे।

बड़ा खुलासा: रोबोट रास्ता भटक रहे हैं
यह पेपर एक नई चुनौती पेश करता है जिसे GDP.pdf कहा जाता है। इसे AI के लिए एक "फाइनल बॉस" लेवल की तरह समझें, जिसे विशेष रूप से यह देखने के लिए डिज़ाइन किया गया है कि क्या रोबोट वास्तव में वह उबाऊ और पेचीदा कागजी काम कर सकते हैं जो वास्तविक इंसान हर दिन करते हैं। शोधकर्ताओं ने 10 अलग-अलग नौकरियों (जैसे वित्त, स्वास्थ्य सेवा और निर्माण) से 100 वास्तविक दुनिया के दस्तावेज़ एकत्र किए और रोबोटों से वे सवाल पूछे जो एक वास्तविक इंसान पूछता।

परिणाम? दुनिया के सबसे स्मार्ट रोबोट जासूस भी बुरी तरह विफल रहे। सबसे बेहतरीन मॉडल ने भी केवल 15% सवालों के सही जवाब दिए। सबसे खराब मॉडल ने तो केवल 1% पास किया। इसका मतलब है कि यदि आप सबसे अच्छे रोबोट से एक 10-पेज की बीमा पॉलिसी पढ़ने और एक विशिष्ट नियम खोजने के लिए कहें, तो वह 100 में से 85 बार गलत उत्तर देगा।

वे क्यों विफल हुए? ("गोटचास" या जाल)
पेपर का तर्क है कि पिछले टेस्ट ऐसे थे जैसे रोबोट को एक साफ, आसानी से पढ़े जाने वाली पाठ्यपुस्तक दी गई हो। लेकिन वास्तविक PDF अव्यवस्थित होते हैं। वे उन जालों से भरे होते जिन्हें रोबोट संभाल नहीं सके। यहाँ वे विशिष्ट तरीके दिए गए हैं जिनसे वे उलझ गए:

  • "फुटनोट" का जाल: कल्पना कीजिए कि एक नियम मुख्य टेक्स्ट में लिखा है, लेकिन तीन पेज बाद एक छोटा सा फुटनोट कहता है, "वास्तव में, इस विशिष्ट मामले के लिए उस नियम को अनदेखा करें।" रोबोटों ने मुख्य टेक्स्ट को पढ़ा, एक आत्मविश्वास भरा उत्तर दिया, और उस फुटनोट को पूरी तरह से मिस कर दिया। यह एक नक्शा पढ़ने जैसा है, जहाँ आप सड़क देखते हैं, और उस छोटे से साइन को अनदेखा कर देते हैं जिस पर लिखा है "सड़क बंद है।"
  • "संशोधन" (Amendment) की गड़बड़ी: कभी-कभी, एक दस्तावेज़ में एक नया पेज जुड़ा होता है जो पुराने नियम को बदल देता है। रोबलेट पुराने नियम को ऐसे उद्धृत करते थे जैसे वह अभी भी सच हो, भले ही नए पेज ने उसे आधिकारिक तौर पर मिटा दिया हो।
  • "टेबल" का उलझाव: जब नंबर मर्ज किए गए सेल्स या पेजों के बीच क्रॉस करने वाली लाइनों वाले ग्रिड में होते हैं, तो रोबोट भ्रमित हो जाते हैं। वे सही पंक्ति (row) तो देखते हैं लेकिन गलत कॉलम (column) देख लेते हैं, या हेडर को मिला देते हैं। यह एक मेनू पढ़ने जैसा है जहाँ कीमतें खाने के बगल में होने के बजाय हवा में तैर रही हों।
  • "मुझे बेहतर पता है" वाली समस्या: यह सबसे मजेदार लेकिन सबसे खतरनाक विफलता है। यदि रोबोट के ट्रेनिंग डेटा ने बताया कि "ड्रिल बिट्स इस तरह काम करते हैं," लेकिन विशिष्ट PDF कहता है "इन ड्रिल बिट्स का उपयोग इस धातु के लिए न करें," तो रोबोट उस PDF को अनदेखा कर देता है और वह उत्तर दे देता है जो वह अपने ट्रेनिंग से "जानता" था। उसने दस्तावेज़ के बजाय अपनी याददाश्त पर भरोसा किया।

पेपर क्या कहता है कि हम अभी क्या नहीं कर सकते
लेखक इस बारे में बहुत स्पष्ट हैं कि इसका क्या अर्थ है। वे स्पष्ट रूप से इस विचार को खारिज करते हैं कि ये मॉडल पेशेवर दस्तावेजों पर अकेले काम करने के लिए तैयार हैं। सिर्फ इसलिए कि एक रोबोट एक मानक, शैक्षणिक टेस्ट (जैसे किसी तस्वीर में बिल्ली की पहचान करना या सरल गणित का प्रश्न हल करना) में उच्च स्कोर करता है, इसका मतलब यह नहीं है कि वह एक वास्तविक लीज़ एग्रीमेंट को संभाल सकता है।

पेपर सुझाव देता है कि केवल रोबोट की "याददाश्त" (context windows) को बड़ा बनाना इस समस्या को ठीक नहीं करेगा। समस्या यह नहीं है कि वे पूरा दस्तावेज़ देख नहीं सकते; समस्या यह है कि वे दस्तावेज़ की अव्यवस्थित संरचना, छोटे फुटनोट्स और चार्ट या फ्लोर प्लान जैसे दृश्य संकेतों को समझ नहीं सकते।

हम कितने आश्वस्त हैं?
शोधकर्ताओं ने केवल अनुमान नहीं लगाया; उन्होंने इसे मापा। उन्होंने एक सख्त स्कोरिंग सिस्टम बनाया जहाँ एक रोबोट को पास होने के लिए उत्तर के हर एक हिस्से को सही करना होता है। उन्होंने अप्रैल 2026 तक उपलब्ध सात सबसे उन्नत मॉडलों का परीक्षण किया। परिणाम सुसंगत थे: रोबोट वर्तमान में इन दस्तावेजों पर बिना किसी निगरानी के काम करने के लिए भरोसेमंद नहीं हैं।

निष्कर्ष (Takeaway)
GDP.pdf को एक वास्तविकता की जाँच (reality check) के रूप में देखें। यह एक बेंचमार्क है जो कहता है, "हे, इससे पहले कि हम AI को हमारे कानूनी अनुबंधों या मेडिकल रिकॉर्ड को संभालने दें, हमें इसे केवल बड़ी सुर्खियों को नहीं, बल्कि बारीक अक्षरों (fine print) को पढ़ना भी सिखाना होगा।" जब तक रोबोट उन छोटे फुटनोट्स को अनदेखा करना बंद नहीं कर देते और दस्तावेज़ के विपरीत होने पर अनुमान लगाना बंद नहीं कर देते, तब तक वे पेशेवर कागजी कार्रवाई के बड़े लीग के लिए तैयार नहीं हैं। इन मॉडलों के बीच जो वे क्लासरूम में कर सकते हैं और जो वे वास्तविक दुनिया में कर सकते हैं, उसके बीच का अंतर अभी भी बहुत बड़ा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →