PPT-Eval: A Benchmark for Computer-Use Agents on PowerPoint Tasks
यह शोध पत्र PPT-Eval प्रस्तुत करता है, जो कंप्यूटर-उपयोग एजेंटों के मूल्यांकन के लिए डिज़ाइन किए गए 120 पावरपॉइंट कार्यों का एक बेंचमार्क है, जिसमें एक नवीन रूब्रिक-आधारित ढांचा शामिल है जो आंशिक प्रगति को कैप्चर करता है और मानव निर्णय के साथ दृढ़ता से सह-संबंधित है ताकि यह प्रकट किया जा सके कि वर्तमान फ्रंटियर मॉडल अभी भी जटिल प्रेजेंटेशन संपादन में संघर्ष कर रहे हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को माइक्रोसॉफ्ट पावरपॉइंट (Microsoft PowerPoint) का उपयोग करना सिखाने की कोशिश कर रहे हैं। आप देखना चाहते हैं कि क्या रोबोट वास्तव में एक स्लाइड को देख सकता है, "यहाँ एक नीला गोला जोड़ें" जैसे अनुरोध को समझ सकता है, और फिर इसे करने के लिए सही बटनों पर क्लिक कर सकता है।
"PPT-EVAL" पेपर मूल रूप से एक विशाल, कठिन परीक्षा है जिसे यह देखने के लिए बनाया गया है कि "कंप्यूटर-उपयोग" करने वाले रोबोट वास्तविक दुनिया के प्रेजेंटेशन कार्य करने में कितने अच्छे हैं।
यहाँ सरल उपमाओं (analogies) का उपयोग करके पेपर का विवरण दिया गया है:
1. समस्या: रोबोट बनाम वास्तविक दुनिया
रोबोट के लिए अधिकांश पिछले परीक्षण एक वीडियो गेम कंट्रोलर देने की तरह थे जिसमें बटनों का एक सीमित सेट था। रोबोट केवल वही कर सकता था जो गेम उसे करने की अनुमति देता था (जैसे कोड कमांड के माध्यम से "टेक्स्ट जोड़ना" या "रंग बदलना")।
लेकिन वास्तविक दुनिया में, इंसान कोड का उपयोग नहीं करते; वे माउस, कीबोर्ड और स्क्रीन का उपयोग करते हैं। वे मेनू पर क्लिक करते हैं, आकृतियों (shapes) को खींचते हैं, और डिज़ाइन टूल्स का उपयोग करते जिनमें सरल कोड बटन नहीं होते।
- पेपर का दावा: मौजूदा परीक्षणों ने यह जाँच नहीं की कि क्या रोबोट वास्तव में पावरपॉइंट में माउस का उपयोग कर सकते हैं। उन्होंने केवल यह जाँच की कि क्या रोबोट "चीट कोड" (API) का उपयोग कर सकते हैं। PPT-EVAL पहला परीक्षण है जो रोबोट को ठीक उसी तरह वास्तविक पावरपॉइंट इंटरफेस (GUI) का उपयोग करने के लिए मजबूर करता है जैसे एक इंसान करता है।
2. परीक्षण: "पावरपॉइंट जिम"
शोधकर्ताओं ने 120 अलग-अलग व्यायामों (कार्यों) वाला एक जिम बनाया जो 12 विभिन्न पावरपॉइंट फाइलों में फैले हुए हैं।
- फाइलें: ये एक लाइब्रेरी में मिलने वाले वास्तविक दुनिया के डेक की तरह हैं—कुछ चिकित्सा के बारे में हैं, कुछ इतिहास के बारे में, और कुछ अकाउंटिंग के बारे में। इनमें चार्ट, अजीब लेआउट और एनिमेशन हैं।
- कठिनाई का स्तर: अभ्यासों को एक वीडियो गेम की तरह ग्रेड किया जाता है:
- आसान (Easy): "बैकग्राउंड का रंग बदलकर नीला कर दें।" (सरल)
- मध्यम (Medium): "सूची में एक नया टीम सदस्य जोड़ें और उनका फॉन्ट बदलें।" (कुछ चरण)
- कठिन (Hard): "इस जटिल आरेख (diagram) को पुनर्व्यवस्थित करें, एक नया अनुभाग जोड़ें, और सुनिश्चित करें कि एनिमेशन सही ढंग से चलता है।" (सोचने और कई चरणों की आवश्यकता होती है)।
3. स्कोरिंग: "रूब्रिक" (सबसे महत्वपूर्ण हिस्सा)
यह इस पेपर का सबसे बड़ा नवाचार है। अतीत में, परीक्षण पास/फेल परीक्षा की तरह थे। यदि रोबोट 90% सही होता लेकिन एक छोटी सी चीज़ चूक जाता, तो उसे शून्य मिलता। यह अनुचित था क्योंकि रोबोट ने प्रयास किया था और अधिकांश काम किया था।
शोधकर्ताओं ने एक रूब्रिक (एक विस्तृत ग्रेडिंग शीट) बनाया, जो एक सख्त शिक्षक के बजाय एक टैलेंट शो जज की तरह है।
- आंशिक क्रेडिट (Partial Credit): यदि रोबत गोला जोड़ता है लेकिन उसे गलत जगह पर रखता है, तो जज उसे गोला जोड़ने के लिए अंक देता है लेकिन स्थान (placement) के लिए अंक काट लेता है।
- जुर्माना (Penalties): यदि रोबोट गलती से एक स्लाइड हटा देता है या कोई अजीब एनिमेशन जोड़ देता है जिसकी उसे आवश्यकता नहीं थी, तो जज अंक काट लेता है।
- "मानवीय स्पर्श": स्कोरिंग सिस्टम प्राकृतिक भाषा में स्पष्टीकरण लिखने के लिए AI का उपयोग करता है, जैसे: "आपने गोला तो प्राप्त किया, लेकिन यह टेक्स्ट को ब्लॉक कर रहा है। रंग के लिए अच्छा काम, लेकिन स्थिति (position) में सुधार की आवश्यकता है।"
परिणाम: यह "टैलेंट शो जज" प्रणाली वास्तविक मनुष्यों द्वारा किए गए मूल्यांकन के साथ 77% संरेखित (aligned) थी। इसका मतलब है कि यह परीक्षण निष्पक्ष और सटीक है।
4. परिणाम: रोबोट अभी भी सीख रहे हैं
शोधकर्ताओं ने दुनिया के सबसे स्मार्ट AI रोबोट्स (जैसे Claude-4.5 और OpenAI के मॉडल्स) को इस परीक्षण के माध्यम से गुजारा।
- स्कोर: यहाँ तक कि सर्वश्रेष्ठ रोबोट भी केवल लगभग 45% कार्यों को "परफेक्ट" करने में सफल रहे।
- औसत: जब आप उनकी आंशिक प्रगति (partial progress) को गिनते हैं, तो वे औसतन लगभग 57% अंक प्राप्त करते हैं।
- तुलना: एक मानव विशेषज्ञ को, समान परीक्षण दिए जाने पर, लगभग 80% स्कोर करना होगा।
- API बनाम GUI अंतर: दिलचस्प बात यह है कि जब रोबोटों को माउस के बजाय "चीट कोड" (APIs) का उपयोग करने की अनुमति दी गई, तो वे बहुत बेहतर प्रदर्शन कर रहे थे (62% सफलता)। यह साबित करता है कि हालांकि रोबोट स्मार्ट हैं, लेकिन वे कोड संभालने की तुलना में माउस और कीबोर्ड के साथ काफी अनाड़ी हैं।
सारांश
PPT-EVAL को रोबोट के लिए ड्राइविंग टेस्ट की तरह समझें।
- पुराने परीक्षण: रोबोट से पूछते थे, "क्या आप कार की गति की गणना कर सकते हैं?" (कोड/API)।
- PPT-EVAL: रोबोट को ड्राइवर की सीट पर बिठाता है, उसे स्टीयरिंग व्हील थमाता है, और कहता है, "दुकान तक जाओ, पार्किंग स्पॉट में पार्क करो, और फुटपाथ से न टकराओ।" (GUI/माउस)।
पेपर निष्कर्ष निकालता है कि हालांकि हमारे वर्तमान रोबोट बेहतर हो रहे हैं, वे अभी भी पावरपॉइंट का उपयोग करने के लिए आवश्यक सूक्ष्म मोटर कौशल (fine motor skills) और दृश्य तर्क (visual reasoning) के लिए संघर्ष कर रहे हैं। इससे पहले कि वे हमारे प्रेजेंटेशन के कामों को पूरी तरह से संभाल सकें, अभी एक लंबा रास्ता तय करना बाकी है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।