← नवीनतम पेपर
💻 computer science

X+Slides: Benchmarking Audience-Conditioned Slide Generation

यह शोध पत्र X+Slides को प्रस्तुत करता है, जो एक नवीन बेंचमार्क है जिसमें एक गतिशील, श्रोता-आधारित मूल्यांकन ढांचा है, जिसमें चार पूरक मेट्रिक्स शामिल हैं जो यह आकलन करते हैं कि बड़े भाषा मॉडल (LLMs) स्रोत-आधारित शुद्धता और विविध लक्षित दर्शकों की विशिष्ट सूचनात्मक आवश्यकताओं के बीच संतुलन बनाते हुए स्लाइड डेक कितनी अच्छी तरह तैयार करते हैं।

मूल लेखक: Haodong Chen, Xuanhe Zhou, Wei Zhou, Xinyue Shao, Yanbing Zhu, Bo Wang, Jiawei Hong, Anya Jia, Fan Wu

प्रकाशित 2026-06-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Haodong Chen, Xuanhe Zhou, Wei Zhou, Xinyue Shao, Yanbing Zhu, Bo Wang, Jiawei Hong, Anya Jia, Fan Wu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास किसी विशिष्ट विषय पर एक विशाल, सघन विश्वकोश (encyclopedia) है। अब, कल्पना कीजिए कि आपको उस विश्वकोश को एक छोटी, प्रभावशाली स्लाइड प्रस्तुति (presentation) में बदलना है।

समस्या यह है कि प्रस्तुति कौन देख रहा है, यह सब कुछ बदल देता है।

  • यदि आप एक वैज्ञानिक को प्रस्तुत कर रहे हैं, तो वे बारीकी से विवरण, गणितीय प्रमाण और सूक्ष्म अपवाद चाहते हैं।
  • यदि आप एक CEO को प्रस्तुत कर रहे हैं, तो उन्हें केवल अंतिम परिणाम (bottom line), जोखिम और "आगे क्या करना है?" की परवाह है।
  • यदि आप एक छात्र को प्रस्तुत कर रहे हैं, तो उन्हें बस एक बड़ी तस्वीर और एक सरल कहानी चाहिए।

लंबे समय तक, स्लाइड बनाने की कोशिश करने वाले कंप्यूटर एक खराब वेटर की तरह रहे हैं जो हर किसी को बिल्कुल एक जैसा भोजन परोसता है: एक बड़ा, बिना कटा हुआ स्टेक। यह "सही" हो सकता है (स्टेक असली है), लेकिन यह शाकाहारी, बच्चे या उस व्यक्ति के लिए बेकार है जो बस एक हल्का नाश्ता चाहता है।

यह पेपर X+Slides पेश करता है, जो यह जांचने का एक नया तरीका है कि क्या AI एक बेहतर वेटर बन सकता है।

मुख्य विचार: "यूनिवर्सल क्वेश्चन बैंक" (Universal Question Bank)

AI से यह अनुमान लगाने के लिए कहने के बजाय कि दर्शक क्या चाहता है, शोधकर्ताओं ने मूल दस्तावेज़ के आधार पर एक विशाल, तटस्थ "प्रश्न बैंक" बनाया है। इसे इस तरह समझें जैसे कि यह विश्वकोश के हर संभावित तथ्य की एक मास्टर सूची है।

  1. तटस्थ सूची (The Neutral List): सबसे पहले, वे दस्तावेज़ के बारे में हजारों प्रश्न उत्पन्न करते हैं (जैसे, "प्रयोग की विधि क्या थी?" या "मुख्य निष्कर्ष क्या है?")। ये प्रश्न तटस्थ हैं; वे अभी नहीं जानते कि कौन देख रहा है।
  2. दर्शक फ़िल्टर (The Audience Filter): फिर, वे दर्शक के आधार पर एक "फ़िल्टर" लागू करते हैं।
    • वैज्ञानिक के लिए, फ़िल्टर कहता है: "मेथड वाले प्रश्न का मूल्य 100 अंक है। 'बड़ी तस्वीर' वाले प्रश्न का मूल्य 10 अंक है।"
    • CEO के लिए, फ़िल्टर इसे उलट देता है: "'बड़ी तस्वीर' वाले प्रश्न का मूल्य 100 अंक है। मेथड वाले प्रश्न का मूल्य 0 अंक है।"
  3. स्कोर (The Score): AI एक स्लाइड डेक बनाता है। शोधकर्ता फिर जाँचते हैं: "क्या AI ने इस विशिष्ट दर्शक के लिए उच्च-मूल्य वाले प्रश्नों को शामिल किया?"

चार स्कोरकार्ड (The Four Scorecards)

X+Slides केवल एक स्कोर नहीं देता। यह प्रस्तुति को ग्रेड करने के लिए चार अलग-अलग तरीकों का उपयोग करता है, जैसे एक शिक्षक रूब्रिक (rubric) का उपयोग करता है:

  1. ऑडियंस कवरेज (क्या उन्होंने सही चीज़ें दीं?): यह मापता है कि दर्शक जिन चीज़ों को महत्व देते थे, उनमें से कितने "उच्च-मूल्य" वाले प्रश्नों के उत्तर वास्तव में स्लाइड्स में दिए गए थे। यदि CEO को जोखिमों की जानकारी चाहिए थी और AI ने केवल इतिहास दिया, तो यह स्कोर गिर जाता है।
  2. डोमेन कवरेज (क्या उन्होंने सही प्रकार की चीज़ें चुनीं?): यह इसे और विस्तार से बताता है। क्या AI ने "इम्प्लिकेशन्स" (प्रभावों) के बजाय "मेथड्स" (विधियों) पर बहुत अधिक ध्यान केंद्रित किया? यह यह जाँचने जैसा है कि क्या एक शेफ ने मुख्य व्यंजन के बजाय बहुत अधिक सजावट (garnish) परोसी है।
  3. दक्षता (Efficiency - क्या यह बहुत लंबा था?): यह पूछता है, "मुझे अपने समय के प्रति मिनट में कितनी उपयोगी जानकारी मिली?" यदि स्लाइड्स 50 पेज लंबी हैं लेकिन उनमें वही कहा गया है जो 5 पेज में कहा जा सकता था, तो दक्षता स्कोर कम है।
  4. सत्यता (Correctness - क्या उन्होंने झूठ बोला?): यह सुरक्षा कवच (safety guardrail) है। यह जाँचता है कि क्या स्लाइड पर किया गया प्रत्येक दावा मूल दस्तावेज़ द्वारा समर्थित है। यह AI को ऐसे शानदार दिखने वाले तथ्य बनाने से रोकता है जो सच नहीं हैं।

उन्हें क्या मिला (परिणाम)

शोधकर्ताओं ने इस नए सिस्टम का उपयोग करके तीन लोकप्रिय AI स्लाइड जनरेटरों (DeepPresenter, SlideTailor, और NotebookLM) का परीक्षण किया।

  • अच्छी खबर: AI बुरा नहीं है। यह बहुत सारी महत्वपूर्ण जानकारी निकाल सकता है।
  • बुरी खबर: यह अभी भी इस बात पर चूक रहा है कि वह किससे बात कर रहा है।
    • जब वैज्ञानिक से बात करने के लिए कहा गया, तो AI अक्सर गहरे तकनीकी विवरण (लेवल 3 और 4 के तथ्य) भूल गया।
    • जब CEO से बात करने के लिए कहा गया, तो AI कभी-कभी बहुत अधिक तकनीकी शब्दावली में उलझ गया।
    • NotebookLM (एक Google टूल) ने CEO और छात्रों के लिए सही जानकारी चुनने में आश्चर्यजनक रूप से अच्छा प्रदर्शन किया, लेकिन वैज्ञानिकों के लिए गहरे तकनीकी विवरणों के साथ उसे थोड़ा संघर्ष करना पड़ा।

बड़ा निष्कर्ष (The Big Takeaway)

यह पेपर तर्क देता है कि हम अब केवल यह कहकर नहीं कह सकते कि, "देखो यह स्लाइड डेक कितना सुंदर और लंबा है!" कि AI को जज किया जाए। एक सुंदर डेक जो CEO को 50 पेज का गणित का लेक्चर दे रहा है, वह एक विफलता है, भले ही गणित 100% सही हो।

X+Slides यह सिद्ध करता है कि एक वास्तविक उपयोगी प्रेजेंटेशन के लिए AI बनाने के लिए, हमें सभी तथ्यों को समान मानना बंद करना होगा। हमें AI को यह सिखाना होगा कि जो एक वैज्ञानिक के लिए महत्वपूर्ण है, वह एक CEO के लिए बेकार है, और इसके विपरीत भी। यह पेपर उस पैमाने (ruler) को प्रदान करता है जिससे यह मापा जा सके कि क्या AI अंततः इस सबक को सीख रहा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →