← नवीनतम पेपर
💻 computer science

Perception Test 2025: Challenge Summary and a Unified VQA Extension

यह शोध पत्र परसेप्शन टेस्ट 2025 चुनौती के परिणामों का सारांश प्रस्तुत करता है, जिसने एक एकीकृत बेंचमार्क पर अत्याधुनिक मल्टीमॉडल वीडियो मॉडल का मूल्यांकन किया जिसमें यूनिफाइड वीडियो QA और ट्रैकिंग जैसे समेकित ट्रैक शामिल थे ताकि यह उजागर किया जा सके कि वर्तमान मॉडल एक एकल इंटरफेस के माध्यम से विविध धारणा कार्यों को संबोधित करते समय किन महत्वपूर्ण कठिनाइयों का सामना करते हैं।

मूल लेखक: Joseph Heyward, Nikhil Parthasarathy, Tyler Zhu, Aravindh Mahendran, João Carreira, Dima Damen, Andrew Zisserman, Viorica Pătrăucean

प्रकाशित 2026-04-30
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Joseph Heyward, Nikhil Parthasarathy, Tyler Zhu, Aravindh Mahendran, João Carreira, Dima Damen, Andrew Zisserman, Viorica Pătrăucean

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि कंप्यूटर विज़न के लिए एक विशाल, हाई-स्टेक्स टैलेंट शो चल रहा है, लेकिन यहाँ गाने या नाचने के बजाय, प्रतियोगी आर्टिफिशियल इंटेलिजेंस मॉडल हैं जो दुनिया को "देखने" और समझने की कोशिश कर रहे हैं। यह पेपर इस शो के 2025 संस्करण का रिपोर्ट कार्ड है, जिसे एक प्रमुख कंप्यूटर साइंस कॉन्फ्रेंस के साथ आयोजित किया गया था, जिसे परसेप्शन टेस्ट (Perception Test) कहा जाता है।

यहाँ बताया गया है कि क्या हुआ, सरल उपमाओं (analogies) का उपयोग करते हुए।

मुख्य विचार: विशिष्ट उपकरणों से लेकर स्विस आर्मी नाइफ तक

अतीत में, AI मॉडल विशिष्ट उपकरणों की तरह थे: एक मॉडल भीड़ में किसी विशिष्ट व्यक्ति को खोजने में माहिर था (ट्रैकिंग), दूसरा कार दुर्घटना होने का पता लगाने में माहिर था (एक्शन डिटेक्शन), और तीसरा वीडियो के बारे में सवालों के जवाब देने में अच्छा था।

इस वर्ष की चुनौती के लिए, आयोजकों ने इन "विशिष्ट उपकरणों" का परीक्षण करना बंद करने का निर्णय लिया। इसके बजाय, उन्होंने एक स्विस आर्मी नाइफ (Swiss Army Knife) की मांग की। वे यह देखना चाहते थे कि क्या एक ही AI मॉडल बिना अपनी भूमिका बदले एक साथ सब कुछ कर सकता है। उन्होंने पूछा: "क्या एक ही मस्तिष्क एक साथ एक गेंद को ट्रैक करने, एक आवाज़ सुनने और दृश्य के बारे में एक प्रश्न का उत्तर देने को संभाल सकता है?"

पांच मुख्य कार्यक्रम (ट्रैक्स)

प्रतियोगिता में पांच मुख्य कार्यक्रम थे, जिनमें से प्रत्येक AI की एक अलग "मांसपेशी" का परीक्षण करता था:

  1. यूनिफाइड वीडियो क्विज़ (द "मैजिक आई" टेस्ट):

    • पुराना तरीका: यह परीक्षण करने के लिए कि क्या एक AI एक चलते हुए बिंदु को ट्रैक कर सकता है, आपको एक विशिष्ट ट्रैकर बनाना पड़ता था।
    • नया तरीका: आयोजकों ने इन कठिन कार्यों को बहुविकल्पीय प्रश्नों में बदल दिया। कल्पना कीजिए कि एक वीडियो है जहाँ मेज पर एक विशिष्ट स्थान हरा चमकता है। AI से पूछा जाता है, "इन पाँच बिंदुओं में से कौन सा वह था जो चमका था?"
    • ट्विस्ट: उन्होंने इसमें पेचीदा सवाल भी जोड़े जैसे "इन क्रियाओं का क्रम क्या था?" या "कौन सी वस्तु कुछ और होने का ढोंग कर रही थी?" इसने AI को विजुअल पजल्स को हल करने के लिए भाषा का उपयोग करने के लिए मजबूर किया।
  2. डबल-ट्रैकिंग चैलेंज:

    • AI को एक साथ दो चीजों का पीछा करना था: एक पूरी वस्तु (जैसे एक उछलती हुई गेंद) और उस वस्तु पर एक विशिष्ट बिंदु (जैसे गेंद पर लगा एक लाल स्टिकर), भले ही गेंद किसी दीवार के पीछे चली जाए (occlusion)।
  3. साउंड-एंड-एक्शन डिटेक्टिव:

    • AI को एक वीडियो देखना था और कहना था, "ठीक 10 सेकंड पर, किसी ने गेंद को किक मारी, और आपने एक धप की आवाज़ सुनी।" इसे विजुअल एक्शन और साउंड दोनों के लिए 'कब' और 'क्या' को एक साथ खोजना था।
  4. "पॉइंट-एंड-क्लिक" डिटेक्टिव:

    • AI से पूछा गया जैसे, "कौन सा कुत्ता बिल्ली का पीछा कर रहा है?" और उसे न केवल यह कहना था कि "वह भूरा वाला है", बल्कि वास्तव में उस विशिष्ट कुत्ते के चारों ओर एक बॉक्स बनाना था और पूरे वीडियो में उसका पीछा करना था।
  5. मैराथन रनर (एक घंटे के वीडियो):

    • अधिकांश AI मॉडल 30 सेकंड की क्लिप देखने के बाद थक जाते हैं। इस इवेंट में उनके सामने 1 घंटे के वीडियो फेंके गए। AI को अंत में एक प्रश्न का उत्तर देने के लिए शुरुआत के विवरणों को याद रखना था।

परिणाम: दो अलग गतियों की कहानी

पेपर एक दिलचस्प विभाजन की रिपोर्ट करता है कि AI ने कितनी अच्छी तरह प्रदर्शन किया:

  • भाषा के विजेता: जब AI भाषा का उपयोग कर सकता था (सवालों के जवाब देना, दृश्यों का वर्णन करना), तो यह पिछले साल की तुलना में काफी बेहतर हो गया। वास्तव में, "पॉइंट-एंड-क्लिक" और "एक घंटे लंबे" परीक्षणों के लिए, स्कोर लगभग दोगुना हो गया। ऐसा लग रहा है जैसे AI ने अचानक एक मैनुअल पढ़ना और उसे विजुअल दुनिया पर लागू करना सीख लिया है।
  • "मौन" संघर्ष: जब AI को भाषा के बिना (जैसे केवल एक बिंदु को ट्रैक करना या एक आवाज़ खोजना) काम करना था, तो उसमें बहुत अधिक सुधार नहीं हुआ। इस साल के सर्वश्रेष्ठ "स्विस आर्मी नाइफ" मॉडल वास्तव में पिछले साल के विशिष्ट "सिंगल-टास्क" मॉडलों की तुलना में धीमे थे।

निष्कर्ष: पेपर यह निष्कर्ष निकालता है कि हालांकि AI जो देखता है उसके बारे में बात करने में अद्भुत होता जा रहा है, लेकिन यह अभी भी एक एकल, एकीकृत मस्तिष्क बनने के लिए संघर्ष कर रहा है जो एक साथ सब कुछ पूरी तरह से कर सके। "जनरल परसेप्शन" मॉडल क्षितिज पर है, लेकिन यह अभी पूरी तरह से वहां नहीं पहुँचा है।

विजेता

  • कुल सबमिशन: 100 से अधिक टीमों ने 450 प्रयास भेजे।
  • इनाम: विजेताओं ने कुल $47,000 जीते।
  • शीर्ष प्रदर्शन करने वाले: टीम "NJUST_KMG" एक बारंबार विजेता रही, जिसने ट्रैकिंग, साउंड और एक घंटे लंबे वीडियो श्रेणियों में शीर्ष स्थान प्राप्त किया। एक अन्य टीम, "SGVR@KAIST" ने "पॉइंट-एंड-क्लिक" श्रेणी में जीत हासिल की।

संक्षेप में

2025 के परसेप्शन टेस्ट ने हमें दिखाया कि AI तेजी से जो वह देखता है उसके बारे में बोलना सीख रहा है, लेकिन वह अभी भी एक साथ सब कुछ बिना भ्रमित हुए करने के लिए सीख रहा है। "विशेषज्ञ रोबोटों" और "सामान्य मानव जैसी धारणा" के बीच का अंतर कम हो रहा है, लेकिन फिनिश लाइन अभी भी थोड़ी दूर है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →