← नवीनतम पेपर
🤖 machine learning

PPT-Eval: A Benchmark for Computer-Use Agents on PowerPoint Tasks

यह शोध पत्र PPT-Eval प्रस्तुत करता है, जो कंप्यूटर-उपयोग एजेंटों के मूल्यांकन के लिए डिज़ाइन किए गए 120 पावरपॉइंट कार्यों का एक बेंचमार्क है, जिसमें एक नवीन रूब्रिक-आधारित ढांचा शामिल है जो आंशिक प्रगति को कैप्चर करता है और मानव निर्णय के साथ दृढ़ता से सह-संबंधित है ताकि यह प्रकट किया जा सके कि वर्तमान फ्रंटियर मॉडल अभी भी जटिल प्रेजेंटेशन संपादन में संघर्ष कर रहे हैं।

मूल लेखक: Apurva Gandhi, Vishwas Suryanarayanan, Raja Hasnain Anwar, Firoz Shaik, Shubhang Desai, Thong Q. Nguyen, Muhammad Taqi Raza, Vishal Chowdhary, Graham Neubig

प्रकाशित 2026-07-01
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Apurva Gandhi, Vishwas Suryanarayanan, Raja Hasnain Anwar, Firoz Shaik, Shubhang Desai, Thong Q. Nguyen, Muhammad Taqi Raza, Vishal Chowdhary, Graham Neubig

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को माइक्रोसॉफ्ट पावरपॉइंट (Microsoft PowerPoint) का उपयोग करना सिखाने की कोशिश कर रहे हैं। आप देखना चाहते हैं कि क्या रोबोट वास्तव में एक स्लाइड को देख सकता है, "यहाँ एक नीला गोला जोड़ें" जैसे अनुरोध को समझ सकता है, और फिर इसे करने के लिए सही बटनों पर क्लिक कर सकता है।

"PPT-EVAL" पेपर मूल रूप से एक विशाल, कठिन परीक्षा है जिसे यह देखने के लिए बनाया गया है कि "कंप्यूटर-उपयोग" करने वाले रोबोट वास्तविक दुनिया के प्रेजेंटेशन कार्य करने में कितने अच्छे हैं।

यहाँ सरल उपमाओं (analogies) का उपयोग करके पेपर का विवरण दिया गया है:

1. समस्या: रोबोट बनाम वास्तविक दुनिया

रोबोट के लिए अधिकांश पिछले परीक्षण एक वीडियो गेम कंट्रोलर देने की तरह थे जिसमें बटनों का एक सीमित सेट था। रोबोट केवल वही कर सकता था जो गेम उसे करने की अनुमति देता था (जैसे कोड कमांड के माध्यम से "टेक्स्ट जोड़ना" या "रंग बदलना")।

लेकिन वास्तविक दुनिया में, इंसान कोड का उपयोग नहीं करते; वे माउस, कीबोर्ड और स्क्रीन का उपयोग करते हैं। वे मेनू पर क्लिक करते हैं, आकृतियों (shapes) को खींचते हैं, और डिज़ाइन टूल्स का उपयोग करते जिनमें सरल कोड बटन नहीं होते।

  • पेपर का दावा: मौजूदा परीक्षणों ने यह जाँच नहीं की कि क्या रोबोट वास्तव में पावरपॉइंट में माउस का उपयोग कर सकते हैं। उन्होंने केवल यह जाँच की कि क्या रोबोट "चीट कोड" (API) का उपयोग कर सकते हैं। PPT-EVAL पहला परीक्षण है जो रोबोट को ठीक उसी तरह वास्तविक पावरपॉइंट इंटरफेस (GUI) का उपयोग करने के लिए मजबूर करता है जैसे एक इंसान करता है।

2. परीक्षण: "पावरपॉइंट जिम"

शोधकर्ताओं ने 120 अलग-अलग व्यायामों (कार्यों) वाला एक जिम बनाया जो 12 विभिन्न पावरपॉइंट फाइलों में फैले हुए हैं।

  • फाइलें: ये एक लाइब्रेरी में मिलने वाले वास्तविक दुनिया के डेक की तरह हैं—कुछ चिकित्सा के बारे में हैं, कुछ इतिहास के बारे में, और कुछ अकाउंटिंग के बारे में। इनमें चार्ट, अजीब लेआउट और एनिमेशन हैं।
  • कठिनाई का स्तर: अभ्यासों को एक वीडियो गेम की तरह ग्रेड किया जाता है:
    • आसान (Easy): "बैकग्राउंड का रंग बदलकर नीला कर दें।" (सरल)
    • मध्यम (Medium): "सूची में एक नया टीम सदस्य जोड़ें और उनका फॉन्ट बदलें।" (कुछ चरण)
    • कठिन (Hard): "इस जटिल आरेख (diagram) को पुनर्व्यवस्थित करें, एक नया अनुभाग जोड़ें, और सुनिश्चित करें कि एनिमेशन सही ढंग से चलता है।" (सोचने और कई चरणों की आवश्यकता होती है)।

3. स्कोरिंग: "रूब्रिक" (सबसे महत्वपूर्ण हिस्सा)

यह इस पेपर का सबसे बड़ा नवाचार है। अतीत में, परीक्षण पास/फेल परीक्षा की तरह थे। यदि रोबोट 90% सही होता लेकिन एक छोटी सी चीज़ चूक जाता, तो उसे शून्य मिलता। यह अनुचित था क्योंकि रोबोट ने प्रयास किया था और अधिकांश काम किया था।

शोधकर्ताओं ने एक रूब्रिक (एक विस्तृत ग्रेडिंग शीट) बनाया, जो एक सख्त शिक्षक के बजाय एक टैलेंट शो जज की तरह है।

  • आंशिक क्रेडिट (Partial Credit): यदि रोबत गोला जोड़ता है लेकिन उसे गलत जगह पर रखता है, तो जज उसे गोला जोड़ने के लिए अंक देता है लेकिन स्थान (placement) के लिए अंक काट लेता है।
  • जुर्माना (Penalties): यदि रोबोट गलती से एक स्लाइड हटा देता है या कोई अजीब एनिमेशन जोड़ देता है जिसकी उसे आवश्यकता नहीं थी, तो जज अंक काट लेता है।
  • "मानवीय स्पर्श": स्कोरिंग सिस्टम प्राकृतिक भाषा में स्पष्टीकरण लिखने के लिए AI का उपयोग करता है, जैसे: "आपने गोला तो प्राप्त किया, लेकिन यह टेक्स्ट को ब्लॉक कर रहा है। रंग के लिए अच्छा काम, लेकिन स्थिति (position) में सुधार की आवश्यकता है।"

परिणाम: यह "टैलेंट शो जज" प्रणाली वास्तविक मनुष्यों द्वारा किए गए मूल्यांकन के साथ 77% संरेखित (aligned) थी। इसका मतलब है कि यह परीक्षण निष्पक्ष और सटीक है।

4. परिणाम: रोबोट अभी भी सीख रहे हैं

शोधकर्ताओं ने दुनिया के सबसे स्मार्ट AI रोबोट्स (जैसे Claude-4.5 और OpenAI के मॉडल्स) को इस परीक्षण के माध्यम से गुजारा।

  • स्कोर: यहाँ तक कि सर्वश्रेष्ठ रोबोट भी केवल लगभग 45% कार्यों को "परफेक्ट" करने में सफल रहे।
  • औसत: जब आप उनकी आंशिक प्रगति (partial progress) को गिनते हैं, तो वे औसतन लगभग 57% अंक प्राप्त करते हैं।
  • तुलना: एक मानव विशेषज्ञ को, समान परीक्षण दिए जाने पर, लगभग 80% स्कोर करना होगा।
  • API बनाम GUI अंतर: दिलचस्प बात यह है कि जब रोबोटों को माउस के बजाय "चीट कोड" (APIs) का उपयोग करने की अनुमति दी गई, तो वे बहुत बेहतर प्रदर्शन कर रहे थे (62% सफलता)। यह साबित करता है कि हालांकि रोबोट स्मार्ट हैं, लेकिन वे कोड संभालने की तुलना में माउस और कीबोर्ड के साथ काफी अनाड़ी हैं।

सारांश

PPT-EVAL को रोबोट के लिए ड्राइविंग टेस्ट की तरह समझें।

  • पुराने परीक्षण: रोबोट से पूछते थे, "क्या आप कार की गति की गणना कर सकते हैं?" (कोड/API)।
  • PPT-EVAL: रोबोट को ड्राइवर की सीट पर बिठाता है, उसे स्टीयरिंग व्हील थमाता है, और कहता है, "दुकान तक जाओ, पार्किंग स्पॉट में पार्क करो, और फुटपाथ से न टकराओ।" (GUI/माउस)।

पेपर निष्कर्ष निकालता है कि हालांकि हमारे वर्तमान रोबोट बेहतर हो रहे हैं, वे अभी भी पावरपॉइंट का उपयोग करने के लिए आवश्यक सूक्ष्म मोटर कौशल (fine motor skills) और दृश्य तर्क (visual reasoning) के लिए संघर्ष कर रहे हैं। इससे पहले कि वे हमारे प्रेजेंटेशन के कामों को पूरी तरह से संभाल सकें, अभी एक लंबा रास्ता तय करना बाकी है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →