← नवीनतम पेपर
💻 computer science

ShredBench: Evaluating the Semantic Reasoning Capabilities of Multimodal LLMs in Document Reconstruction

यह शोधपत्र ShredBench प्रस्तुत करता है, जो कि फटे हुए दस्तावेज़ों के पुनर्निर्माण के चुनौतीपूर्ण कार्य पर मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (Multimodal Large Language Models) के मूल्यांकन के लिए एक स्वचालित पीढ़ी पाइपलाइन वाला एक नवीन बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान मॉडल अखंड दस्तावेज़ों पर अपने प्रदर्शन की तुलना में दृश्य विच्छेदन (visual discontinuities) को जोड़ने के लिए आवश्यक सूक्ष्म-स्तरीय क्रॉस-मोडल तर्क करने में काफी संघर्ष करते हैं।

मूल लेखक: Zichun Guo, Yuling Shi, Wenhao Zeng, Chao Hu, Haotian Lin, Terry Yue Zhuo, Jiawei Chen, Xiaodong Gu, Wenping Ma

प्रकाशित 2026-04-28
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zichun Guo, Yuling Shi, Wenhao Zeng, Chao Hu, Haotian Lin, Terry Yue Zhuo, Jiawei Chen, Xiaodong Gu, Wenping Ma

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक समाचार पत्र, एक कोड का टुकड़ा, या एक वित्तीय स्प्रेडशीट है। अब, कल्पना कीजिए कि कोई कैंची लेकर उस दस्तावेज़ को 8, 12, या यहाँ तक कि 16 यादृच्छिक (random), टेढ़े-मेढ़े टुकड़ों में फाड़ देता है। फिर वे उन टुकड़ों को एक ढेर में फेंक देते हैं, उन्हें आपस में मिला देते हैं, और शायद उन्हें थोड़ा मरोड़ भी देते हैं।

आपका काम? उस कागज़ के बिखरे हुए टुकड़ों के ढेर को देखना और कंप्यूटर को ठीक-ठीक बताना कि उस मूल दस्तावेज़ में क्या लिखा था और उसका सही क्रम क्या था।

यह ShredBench नामक एक नए अध्ययन की मुख्य चुनौती है। शोधकर्ताओं ने यह देखना चाहा कि क्या नवीनतम, सबसे स्मार्ट AI मॉडल (जिन्हें मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स या MLLMs कहा जाता है) नष्ट हो चुके दस्तावेज़ों के सामने एक मानव जासूस की तरह कार्य कर सकते हैं।

यहाँ उनके द्वारा किए गए कार्यों और प्राप्त निष्कर्षों का एक सरल विवरण दिया गया है:

1. "श्रेड किया हुआ पहेली" बनाम "जिग्सॉ पहेली"

आमतौर पर, जब हम AI को पहेलियों पर परखते हैं, तो हम मानक जिग्सॉ पहेलियों का उपयोग करते हैं जहाँ आप एक टुकड़े के किनारे को दूसरे टुकड़े के किनारे से मिलाने के लिए देखते हैं। यह एक दृश्य (visual) खेल है।

लेकिन ShredBench अलग है। यह एक सिमेंटिक (semantic/अर्थ संबंधी) खेल है।

  • उपमा: कल्पना कीजिए कि आपके पास एक वाक्य है: एक टुकड़े पर लिखा है "The algorithm optimiz-" और दूसरे पर लिखा है "-es the loss function"। किनारे पूरी तरह से मेल नहीं खाते क्योंकि कट टेढ़ा-मेढ़ा है। एक इंसान को सटीक पिक्सेल मिलान देखने की आवश्यकता नहीं होती; वे अपने मस्तिष्क का उपयोग यह जानने के लिए करते हैं कि "optimizes" वह शब्द है जो वहां फिट बैठता है।
  • लक्षतः शोधकर्ता यह देखना चाहते थे कि क्या AI अपने "मस्तिष्क" (भाषा के ज्ञान) का उपयोग करके अर्थ को जोड़ने में सक्षम है, न कि केवल अपनी "आंखों" (पिक्सेल मिलाने) का।

2. उन्होंने परीक्षण कैसे बनाया (द "श्रेडर")

एक निष्पक्ष परीक्षण बनाने के लिए, शोधकर्ताओं ने वास्तविक फटे हुए कागज़ की तस्वीरें नहीं लीं। इसके बजाय, उन्होंने एक डिजिटल "श्रेडर" पाइपलाइन बनाई:

  1. स्रोत (The Source): उन्होंने वास्तविक समाचार लेख (अंग्रेजी और चीनी में), कंप्यूटर कोड (Python, Java, C++) और जटिल तालिकाएं (tables) लीं।
  2. कट (The Cut): उन्होंने डिजिटल दस्तावेज़ों को अनियमित, टेढ़े-मेढ़े आकारों में काटने के लिए एक गणितीय विधि (Voronoi tessellation) का उपयोग किया, जैसा कि एक वास्तविक श्रेडर करता है।
  3. 3D प्रभाव: उन्होंने गहराई, छाया और सिलवटें जोड़ने के लिए एक 3D प्रोग्राम में भौतिकी (physics) का अनुकरण किया, जिससे डिजिटल टुकड़े वास्तविक, बिखरे हुए कागज़ के टुकड़ों जैसे दिखने लगे।
  4. मिश्रण (The Mix): उन्होंने टुकड़ों को इस तरह से मिला दिया कि AI को क्रम को शून्य से समझना पड़े।

3. परिणाम: "स्मार्ट" लेकिन "नाजुक"

शोधकर्ताओं ने GPT-5, Gemini 3 और Qwen जैसे बड़े नामों सहित दुनिया के 14 सबसे उन्नत AI मॉडलों का परीक्षण किया।

  • अच्छी खबर: जब दस्तावेज़ पूरे और साफ थे, तो लगभग सभी मॉडलों ने मानव विशेषज्ञों की तरह प्रदर्शन किया। वे टेक्स्ट को पूरी तरह से पढ़ और समझ सकते थे।
  • बुरी खबर: जैसे ही दस्तावेज़ों को श्रेडर किया गया, अधिकांश मॉडलों का प्रदर्शन ध्वस्त (collapse) हो गया।
    • इसे ऐसे समझें जैसे एक छात्र जो गणित के टेस्ट में उत्कृष्ट प्रदर्शन करता है यदि प्रश्न स्पष्ट रूप से छपे हों, लेकिन बुरी तरह विफल हो जाता है यदि टेस्ट पेपर को कागज के छोटे टुकड़ों में फाड़ दिया जाए।
    • जैसे-जैसे टुकड़ों की संख्या बढ़ी (8 से 16 तक), AI की टेक्स्ट को पुनर्गठित करने की क्षमता तेजी से गिरी।
    • कई मॉडलों ने "हैलुसिनेशन" (hallucinating) करना शुरू कर दिया—यानी वे ऐसे शब्द बनाने लगे जो वहां नहीं थे या वाक्यों को गलत क्रम में रख दिया।

4. विजेता और हारने वाले

  • चैंपियन: Gemini 3 Pro स्पष्ट विजेता था। यह सबसे अधिक लचीला (resilient) था, जो अन्य सभी की तुलना में श्रेडर किए गए टुकड़ों को बेहतर ढंग से संभाल सका। यह बिखरे हुए दृश्य संकेतों के बावजूद टेक्स्ट को "पढ़" सकता था।
  • संघर्ष करने वाले:
    • चीनी टेक्स्ट: मॉडल अंग्रेजी की तुलना में चीनी भाषा के साथ अधिक संघर्ष करते दिखे। शोधकर्ता बताते हैं कि अंग्रेजी में, एक फटा हुआ हिस्सा किसी शब्द को काट सकता है, लेकिन आप अक्सर बाकी हिस्से का अनुमान लगा सकते हैं। चीनी में, एक एकल अक्षर अर्थ की एक पूरी इकाई है; यदि आप एक अक्षर को आधा काट देते हैं, तो अर्थ अक्सर पूरी तरह से खो जाता है, जिससे AI के लिए अनुमान लगाना बहुत कठिन हो जाता है।
    • कोड (Code): कंप्यूटर कोड बहुत कठिन था। कोड सख्त नियमों (जैसे इंडेंटेशन और ब्रैकेट) पर निर्भर करता है। जब कागज को श्रेडर किया जाता है, तो वे दृश्य नियम टूट जाते हैं, और AI भ्रमित हो जाता है कि कोड की अगली लाइन कौन सी है।
    • तालिकाएं (Tables): तालिकाएं ग्रिड की तरह होती हैं। जब आप एक ग्रिड को श्रेडर करते हैं, तो पंक्तियाँ और कॉलम आपस में मिल जाते हैं। सबसे अच्छे मॉडलों को भी सेल को सही 2D व्यवस्था में रखने में कठिनाई हुई।

5. AI ने वास्तव में क्या किया (सफलताएं और विफलताएं)

  • सफलता: कुछ मामलों में, AI अद्भुत था। यदि "school" जैसा शब्द "sch" और "ool" के बीच कटा हुआ था, तो AI ने केवल टुकड़ों को नहीं पढ़ा; इसने भाषा के अपने ज्ञान का उपयोग करके "गैप को भरने" और यह समझने के लिए किया कि शब्द "school" है।
  • विफलता: AI अक्सर क्रम (ordering) में विफल रहा। एक कहानी में, संदर्भ बताता है कि आगे क्या आता है। कोड में, तर्क (logic) बताता है। AI ने कोड की लाइनों को गलत तरीके से व्यवस्थित किया, जैसे कि प्रोग्राम के "अंत" को उसके "शुरुआत" से पहले रख देना, क्योंकि वह दृश्य अराजकता के माध्यम से तार्किक प्रवाह को नहीं देख सका।

निष्कर्ष

पेपर यह निष्कर्ष निकालता है कि हालांकि AI साफ दस्तावेज़ों को पढ़ने में महान है, लेकिन वर्तमान में इसमें भौतिक रूप से टूटी हुई जानकारी को पुनर्गठित करने के लिए आवश्यक सूक्ष्म तर्क (fine-grained reasoning) की कमी है। यह कागज़ के टुकड़ों को एक एकल, सुसंगत कहानी के हिस्सों के रूप में देखने के बजाय, उन्हें अलग-थलग द्वीपों के रूप में देखता है।

शोधकर्ताओं ने यह बेंचमार्क (ShredBench) किसी उत्पाद को बेचने के लिए नहीं, बल्कि वैज्ञानिक समुदाय को यह दिखाने के लिए बनाया है: "हे, हमारा AI स्मार्ट है, लेकिन यह अभी भी संघर्ष करता है जब दुनिया अव्यवस्थित और टूटी हुई होती है।" यह इस बात पर प्रकाश डालता है कि ये मॉडल जो वे देखते हैं और जो वे जानते हैं, उनके बीच संबंध बनाने में कहाँ चूक जाते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →