← नवीनतम पेपर
💻 computer science

UniPPTBench: A Unified Benchmark for Presentation Generation Across Diverse Input Settings

यह शोध पत्र UniPPTBench प्रस्तुत करता है, जो एक एकीकृत बेंचमार्क और परिदृश्य-जागरूक मूल्यांकन ढांचा है जिसे विविध वास्तविक दुनिया के इनपुट सेटिंग्स में प्रेजेंटेशन जनरेशन सिस्टम का आकलन करने के लिए डिज़ाइन किया गया है, जो मौजूदा पृथक मूल्यांकनों और सामान्य गुणवत्ता मेट्रिक्स की सीमाओं को संबोधित करता है।

मूल लेखक: Bo Zhao, Maosheng Pang, Chen Zhang, Huan Yang, Yixin Cao, Wei Ji

प्रकाशित 2026-05-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bo Zhao, Maosheng Pang, Chen Zhang, Huan Yang, Yixin Cao, Wei Ji

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक मैनेजर हैं जो एक असिस्टेंट से पावरपॉइंट प्रेजेंटेशन बनाने के लिए कह रहे हैं। कभी-कभी आप बस कहते हैं, "हमारी नई रणनीति के बारे में एक डेक बनाओ," जिसमें कोई विवरण नहीं होता। अन्य समय में, आप उन्हें एक 200 पन्नों की वित्तीय रिपोर्ट, चार्ट और ग्राफों से भरा एक फोल्डर, या अलग-अलग विभागों के तीन ऐसे दस्तावेज़ देते हैं जो एक-दूसरे का खंडन करते हैं।

अब तक, AI शोधकर्ताओं ने मुख्य रूप से इन प्रेजेंटेशन बनाने वाले रोबोटों को एक शून्य (vacuum) में टेस्ट किया है। वे एक ऐसे रोबोट का परीक्षण करते थे जो केवल छोटे निर्देशों को संभालता है, या एक अलग रोबोट जो केवल एक विशिष्ट दस्तावेज़ को संभालता है। उनके पास यह देखने का कोई एक साझा, निष्पक्ष तरीका नहीं था कि क्या एक रोबोट इन सभी अव्यवस्थित, वास्तविक दुनिया की स्थितियों को संभाल सकता है।

यह पेपर UniPPTBench पेश करता है, जो इन AI प्रेजेंटेशन जनरेटरों को टेस्ट करने के लिए एक नया "जिम" है, और UniPPTEval, जो उन्हें ग्रेड देने के लिए एक नया "स्कोरकार्ड" है।

यहाँ उनके काम का सरल उपमाओं (analogies) के माध्यम से विवरण दिया गया है:

1. समस्या: "एक-औज़ार" वाला जाल (The "One-Tool" Trap)

कल्पना कीजिए कि एक बढ़ई है जो कील ठोकने में बहुत अच्छा है लेकिन लकड़ी काटने में बहुत खराब। यदि आप केवल उन्हें कील ठोकने के लिए टेस्ट करते हैं, तो वे एक मास्टर शिल्पकार दिखेंगे। लेकिन यदि आप उनसे पूरा घर बनाने के लिए कहते हैं, तो वे विफल हो जाते हैं।

वर्तमान AI प्रेजेंटेशन टूल्स उसी बढ़ई की तरह हैं।

  • कुछ टूल्स एक छोटे वाक्य को स्लाइड डेक में बदलने में माहिर हैं (जैसे कि एक "प्रॉम्प्ट-ओनली" टूल)।
  • कुछ एक सिंगल PDF का सारांश बनाने में माहिर हैं (जैसे कि एक "डॉक्यूमेंट-टू-स्लाइड" टूल)।
  • लेकिन किसी के पास यह देखने के लिए कोई एकीकृत (unified) टेस्ट नहीं था कि क्या एक टूल अस्पष्ट विचारों, लंबे दस्तावेज़ों, इमेज/चार्ट्स, या एक साथ कई विरोधाभासी स्रोतों को संभाल सकता है।

2. समाधान: "यूनिवर्सल जिम" (UniPPTBench)

लेखकों ने UniPPTBench नामक एक विशाल टेस्टिंग ग्राउंड बनाया है। इसे एक जिम के रूप में सोचें जिसमें चार अलग-अलग बाधा दौड़ (obstacle courses) हैं, जिनमें से प्रत्येक एक विशिष्ट कौशल का परीक्षण करने के लिए डिज़ाइन किया गया है:

  • "अस्पष्ट प्रॉम्प्ट" कोर्स: आप AI को "जलवायु परिवर्तन के बारे में कुछ बनाओ" जैसा एक धुंधला विचार देते हैं। AI को पूरी कहानी शून्य से बनानी होती है।
  • "लंबे दस्तावेज़" कोर्स: आप AI को 100 पन्नों की रिपोर्ट देते हैं। AI को एक कुशल संपादक की तरह कार्य करना होगा, अनावश्यक बातों को हटाकर केवल सबसे महत्वपूर्ण तथ्यों को बिना अर्थ खोए रखना होगा।
  • "मल्टीमॉडल" कोर्स: आप AI को टेक्स्ट और जटिल चार्ट वाला एक दस्तावेज़ देते हैं। AI को न केवल टेक्स्ट को पढ़ना होगा बल्कि चार्ट को भी समझना होगा और यह सुनिश्चित करना होगा कि टेक्स्ट चित्र से मेल खाता हो (उदाहरण के लिए, यह न कहना कि "बिक्री बढ़ी" जब चार्ट दिखा रहा हो कि वह कम हुई है)।
  • "मल्टी-सोर्स" कोर्स: आप AI को तीन अलग-अलग रिपोर्ट देते हैं जो अलग-अलग बातें कह सकती हैं। AI को एक राजनयिक (diplomat) की तरह कार्य करना होगा, जो उन्हें बिना दोहराव या भ्रम के एक सुचारू कहानी में मिला सके।

3. नया स्कोरकार्ड: "क्या उन्होंने झूठ बोला?" (UniPPTEval)

पहले, इन AI को ग्रेड करना जादू के शो को केवल उनके चमकदार कपड़ों के आधार पर जज करने जैसा था। यदि स्लाइड्स सुंदर दिखती थीं और उनमें अच्छे फोंट थे, तो AI को 'A' ग्रेड मिल जाता था।

लेखक महसूस करते हैं कि यह अनुचित था। एक स्लाइड डेक सुंदर दिख सकता है लेकिन वह झूठ या मुख्य तथ्यों की कमी से भरा हो सकता है। उन्होंने UniPPTEval बनाया, जो एक नया ग्रेडिंग सिस्टम है जिसके दो भाग हैं:

  • "सामान्य वाइब" चेक: क्या यह अच्छा दिखता है? क्या यह पठनीय है? क्या लेआउट अच्छा है? (यह पुराना तरीका है)।
  • "सत्यता और प्रासंगिकता" चेक: यह नया हिस्सा है।
    • क्या उन्होंने मुख्य बिंदुओं को कवर किया? (यदि आपने उन्हें 50 पन्नों की रिपोर्ट दी थी, तो क्या वे सबसे महत्वपूर्ण पैराग्राफ को छोड़ गए?)
    • क्या उन्होंने कल्पनाएँ (hallucinations) कीं? (क्या उन्होंने ऐसे तथ्य गढ़े जो स्रोत में नहीं थे?)
    • क्या वे चित्रों से मेल खाते थे? (यदि स्रोत में एक ग्राफ था, तो क्या AI ने उसका सही वर्णन किया?)
    • क्या उन्होंने स्रोतों को मिलाया? (यदि आपने उन्हें तीन दस्तावेज़ दिए, तो क्या उन्होंने उन्हें मिलाया या बस उन्हें अगल-बगल कॉपी-पेस्ट कर दिया?)

4. "मास्टर बिल्डर" (UniPPTAgent)

यह साबित करने के लिए कि उनका नया टेस्ट काम करता है, लेखकों ने अपना खुद का AI असिस्टेंट UniPPTAgent बनाया। एक विशाल दिमाग के बजाय सब कुछ करने के बजाय, उन्होंने तीन विशेषज्ञ एजेंटों की एक टीम बनाई:

  1. रिसर्चर (The Researcher): अव्यवस्थित इनपुट को पढ़ता है और एक ठोस रूपरेखा (outline) बनाता है।
  2. स्टाइलिस्ट (The Stylist): पूरे डेक में निरंतरता बनाए रखने के लिए कलर स्कीम और फोंट तय करता है।
  3. डिज़ाइनर (The Designer): वास्तविक स्लाइड्स बनाता है और फिर त्रुटियों (जैसे इमेज के ऊपर टेक्स्ट का ओवरलैप होना) के लिए उनकी जाँच करता है और उन्हें स्वचालित रूप से ठीक करता है।

5. उन्होंने क्या पाया

जब उन्होंने परीक्षण किए, तो उन्हें कुछ आश्चर्यजनक बातें पता चलीं:

  • सुंदर दिखना पर्याप्त नहीं है: कई AI सिस्टम "अच्छा दिखने" के लिए उच्च स्कोर प्राप्त करते थे लेकिन "स्रोत के प्रति सच्चे रहने" में बुरी तरह विफल रहे। वे सुंदर स्लाइड्स बनाते थे जिनमें मनगढ़ंत तथ्य होते थे।
  • "सत्यता" कठिन है: AI के लिए सबसे कठिन काम स्लाइड्स को सुंदर बनाना नहीं था; बल्कि लंबे दस्तावेज़ों का सटीक सारांश बनाना या भ्रमित हुए बिना कई स्रोतों को जोड़ना था।
  • ओपन सोर्स पीछे है: जबकि कुछ कमर्शियल टूल्स (जैसे NotebookLM या Manus) अच्छा प्रदर्शन करते थे, कई ओपन-सोर्स टूल्स साधारण, सिंगल-डॉक्यूमेंट कार्यों के अलावा कुछ भी संभालने में संघर्ष करते थे।

निचोड़ (The Bottom Line)

यह पेपर कहता है: "प्रेजेंटेशन AI को केवल इस आधार पर आंकना बंद करें कि वे कितने सुंदर दिखते हैं। हमें एक नए मानक की आवश्यकता है जो यह जांचे कि क्या उन्होंने वास्तव में असाइनमेंट को समझा, उन्होंने चीजें नहीं बनाईं, और क्या वे हमारे वास्तविक दुनिया के अव्यवस्थित डेटा को संभाल सकते हैं।" उन्होंने अंततः उन्हें निष्पक्ष रूप से टेस्ट करने के लिए उपकरण (बेंचमार्क और स्कोरकार्ड) प्रदान किए हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →