Perception Test 2025: Challenge Summary and a Unified VQA Extension
यह शोध पत्र परसेप्शन टेस्ट 2025 चुनौती के परिणामों का सारांश प्रस्तुत करता है, जिसने एक एकीकृत बेंचमार्क पर अत्याधुनिक मल्टीमॉडल वीडियो मॉडल का मूल्यांकन किया जिसमें यूनिफाइड वीडियो QA और ट्रैकिंग जैसे समेकित ट्रैक शामिल थे ताकि यह उजागर किया जा सके कि वर्तमान मॉडल एक एकल इंटरफेस के माध्यम से विविध धारणा कार्यों को संबोधित करते समय किन महत्वपूर्ण कठिनाइयों का सामना करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि कंप्यूटर विज़न के लिए एक विशाल, हाई-स्टेक्स टैलेंट शो चल रहा है, लेकिन यहाँ गाने या नाचने के बजाय, प्रतियोगी आर्टिफिशियल इंटेलिजेंस मॉडल हैं जो दुनिया को "देखने" और समझने की कोशिश कर रहे हैं। यह पेपर इस शो के 2025 संस्करण का रिपोर्ट कार्ड है, जिसे एक प्रमुख कंप्यूटर साइंस कॉन्फ्रेंस के साथ आयोजित किया गया था, जिसे परसेप्शन टेस्ट (Perception Test) कहा जाता है।
यहाँ बताया गया है कि क्या हुआ, सरल उपमाओं (analogies) का उपयोग करते हुए।
मुख्य विचार: विशिष्ट उपकरणों से लेकर स्विस आर्मी नाइफ तक
अतीत में, AI मॉडल विशिष्ट उपकरणों की तरह थे: एक मॉडल भीड़ में किसी विशिष्ट व्यक्ति को खोजने में माहिर था (ट्रैकिंग), दूसरा कार दुर्घटना होने का पता लगाने में माहिर था (एक्शन डिटेक्शन), और तीसरा वीडियो के बारे में सवालों के जवाब देने में अच्छा था।
इस वर्ष की चुनौती के लिए, आयोजकों ने इन "विशिष्ट उपकरणों" का परीक्षण करना बंद करने का निर्णय लिया। इसके बजाय, उन्होंने एक स्विस आर्मी नाइफ (Swiss Army Knife) की मांग की। वे यह देखना चाहते थे कि क्या एक ही AI मॉडल बिना अपनी भूमिका बदले एक साथ सब कुछ कर सकता है। उन्होंने पूछा: "क्या एक ही मस्तिष्क एक साथ एक गेंद को ट्रैक करने, एक आवाज़ सुनने और दृश्य के बारे में एक प्रश्न का उत्तर देने को संभाल सकता है?"
पांच मुख्य कार्यक्रम (ट्रैक्स)
प्रतियोगिता में पांच मुख्य कार्यक्रम थे, जिनमें से प्रत्येक AI की एक अलग "मांसपेशी" का परीक्षण करता था:
यूनिफाइड वीडियो क्विज़ (द "मैजिक आई" टेस्ट):
- पुराना तरीका: यह परीक्षण करने के लिए कि क्या एक AI एक चलते हुए बिंदु को ट्रैक कर सकता है, आपको एक विशिष्ट ट्रैकर बनाना पड़ता था।
- नया तरीका: आयोजकों ने इन कठिन कार्यों को बहुविकल्पीय प्रश्नों में बदल दिया। कल्पना कीजिए कि एक वीडियो है जहाँ मेज पर एक विशिष्ट स्थान हरा चमकता है। AI से पूछा जाता है, "इन पाँच बिंदुओं में से कौन सा वह था जो चमका था?"
- ट्विस्ट: उन्होंने इसमें पेचीदा सवाल भी जोड़े जैसे "इन क्रियाओं का क्रम क्या था?" या "कौन सी वस्तु कुछ और होने का ढोंग कर रही थी?" इसने AI को विजुअल पजल्स को हल करने के लिए भाषा का उपयोग करने के लिए मजबूर किया।
डबल-ट्रैकिंग चैलेंज:
- AI को एक साथ दो चीजों का पीछा करना था: एक पूरी वस्तु (जैसे एक उछलती हुई गेंद) और उस वस्तु पर एक विशिष्ट बिंदु (जैसे गेंद पर लगा एक लाल स्टिकर), भले ही गेंद किसी दीवार के पीछे चली जाए (occlusion)।
साउंड-एंड-एक्शन डिटेक्टिव:
- AI को एक वीडियो देखना था और कहना था, "ठीक 10 सेकंड पर, किसी ने गेंद को किक मारी, और आपने एक धप की आवाज़ सुनी।" इसे विजुअल एक्शन और साउंड दोनों के लिए 'कब' और 'क्या' को एक साथ खोजना था।
"पॉइंट-एंड-क्लिक" डिटेक्टिव:
- AI से पूछा गया जैसे, "कौन सा कुत्ता बिल्ली का पीछा कर रहा है?" और उसे न केवल यह कहना था कि "वह भूरा वाला है", बल्कि वास्तव में उस विशिष्ट कुत्ते के चारों ओर एक बॉक्स बनाना था और पूरे वीडियो में उसका पीछा करना था।
मैराथन रनर (एक घंटे के वीडियो):
- अधिकांश AI मॉडल 30 सेकंड की क्लिप देखने के बाद थक जाते हैं। इस इवेंट में उनके सामने 1 घंटे के वीडियो फेंके गए। AI को अंत में एक प्रश्न का उत्तर देने के लिए शुरुआत के विवरणों को याद रखना था।
परिणाम: दो अलग गतियों की कहानी
पेपर एक दिलचस्प विभाजन की रिपोर्ट करता है कि AI ने कितनी अच्छी तरह प्रदर्शन किया:
- भाषा के विजेता: जब AI भाषा का उपयोग कर सकता था (सवालों के जवाब देना, दृश्यों का वर्णन करना), तो यह पिछले साल की तुलना में काफी बेहतर हो गया। वास्तव में, "पॉइंट-एंड-क्लिक" और "एक घंटे लंबे" परीक्षणों के लिए, स्कोर लगभग दोगुना हो गया। ऐसा लग रहा है जैसे AI ने अचानक एक मैनुअल पढ़ना और उसे विजुअल दुनिया पर लागू करना सीख लिया है।
- "मौन" संघर्ष: जब AI को भाषा के बिना (जैसे केवल एक बिंदु को ट्रैक करना या एक आवाज़ खोजना) काम करना था, तो उसमें बहुत अधिक सुधार नहीं हुआ। इस साल के सर्वश्रेष्ठ "स्विस आर्मी नाइफ" मॉडल वास्तव में पिछले साल के विशिष्ट "सिंगल-टास्क" मॉडलों की तुलना में धीमे थे।
निष्कर्ष: पेपर यह निष्कर्ष निकालता है कि हालांकि AI जो देखता है उसके बारे में बात करने में अद्भुत होता जा रहा है, लेकिन यह अभी भी एक एकल, एकीकृत मस्तिष्क बनने के लिए संघर्ष कर रहा है जो एक साथ सब कुछ पूरी तरह से कर सके। "जनरल परसेप्शन" मॉडल क्षितिज पर है, लेकिन यह अभी पूरी तरह से वहां नहीं पहुँचा है।
विजेता
- कुल सबमिशन: 100 से अधिक टीमों ने 450 प्रयास भेजे।
- इनाम: विजेताओं ने कुल $47,000 जीते।
- शीर्ष प्रदर्शन करने वाले: टीम "NJUST_KMG" एक बारंबार विजेता रही, जिसने ट्रैकिंग, साउंड और एक घंटे लंबे वीडियो श्रेणियों में शीर्ष स्थान प्राप्त किया। एक अन्य टीम, "SGVR@KAIST" ने "पॉइंट-एंड-क्लिक" श्रेणी में जीत हासिल की।
संक्षेप में
2025 के परसेप्शन टेस्ट ने हमें दिखाया कि AI तेजी से जो वह देखता है उसके बारे में बोलना सीख रहा है, लेकिन वह अभी भी एक साथ सब कुछ बिना भ्रमित हुए करने के लिए सीख रहा है। "विशेषज्ञ रोबोटों" और "सामान्य मानव जैसी धारणा" के बीच का अंतर कम हो रहा है, लेकिन फिनिश लाइन अभी भी थोड़ी दूर है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।