← नवीनतम पेपर
💻 computer science

A Unified Benchmark for HOI Evaluation across Vision-Language Models and HOI-Specific Methods

यह शोधपत्र CrossHOI-Bench को प्रस्तुत करता है, जो एक एकीकृत बहु-विकल्प बेंचमार्क है जिसे मौजूदा HOI मूल्यांकन विधियों की सीमाओं को दूर करने के लिए डिज़ाइन किया गया है, यह प्रकट करते हुए कि जबकि बड़े विजन-लैंग्वेज मॉडल प्रतिस्पर्धी ज़ीरो-शॉट प्रदर्शन प्राप्त करते हैं, उनमें विशिष्ट HOI विधियों की तरह बहु-क्रिया तर्क (multi-action reasoning) और सटीक व्यक्ति-क्रिया असाइनमेंट क्षमताओं का अभाव है।

मूल लेखक: Qinqian Lei, Bo Wang, Robby T. Tan

प्रकाशित 2026-03-18
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Qinqian Lei, Bo Wang, Robby T. Tan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को यह सिखाने की कोशिश कर रहे हैं कि फोटो में लोग क्या कर रहे हैं, इसे कैसे समझा जाए। विशेष रूप से, आप चाहते हैं कि वह Human-Object Interactions (HOI) को पहचान सके—जैसे कोई व्यक्ति साइकिल चला रहा है, केक काट रहा है, या किसी कुत्ते को गले लगा रहा है।

वर्षों से, हमारे पास इस काम के लिए दो प्रकार के "रोबोट" (AI मॉडल्स) रहे हैं:

  1. विशेषज्ञ (The Specialists): वे मॉडल्स जो विशेष रूप से इसी एक काम के लिए बनाए गए हैं। वे एक मास्टर शेफ की तरह हैं जो केवल पास्ता बनाना जानते हैं। वे अपने विशिष्ट कार्य में तेज़ और कुशल हैं, लेकिन यदि आप उनसे सुशी के बारे में पूछेंगे, तो वे भ्रमित हो सकते हैं।
  2. सामान्यज्ञ (The Generalists - VLMs): विशाल, "सर्वज्ञ" विज़न-लैंग्वेज मॉडल्स (जैसे उन्नत चैटबॉट्स के पीछे का दिमाग)। वे एक स्विस आर्मी नाइफ की तरह हैं। वे कविता लिख सकते हैं, गणित हल कर सकते हैं और सूर्यास्त का वर्णन कर सकते हैं। बड़ा सवाल यह था: क्या एक स्विस आर्मी नाइफ वास्तव में एक मास्टर शेफ से बेहतर पास्ता बना सकता है?

समस्या यह थी कि हमारे पास उन्हें परखने का कोई निष्पक्ष तरीका नहीं था।

समस्या: "अनुचित परीक्षा" (The "Unfair Test")

पुराने तरीके से मॉडल्स का परीक्षण करना एक बहुविकल्पीय प्रश्नोत्तरी (multiple-choice quiz) जैसा था जहाँ शिक्षक केवल एक सही उत्तर लिख देता था, भले ही चित्र को वर्णित करने के दो या तीन वैध तरीके मौजूद हों।

  • परिदृश्य: एक फोटो जिसमें एक व्यक्ति हवाई जहाज के पास खड़ा है।
  • वास्तविकता: वह व्यक्ति हवाई जहाज में चढ़ (boarding) रहा हो सकता है, हवाई जहाज से उतर (exiting) रहा हो सकता है, या बस उसके लिए प्रतीक्षा (waiting) कर रहा हो सकता है। दृश्य रूप से "चढ़ना" और "उतरना" दोनों ही तर्कसंगत हैं।
  • पुराना टेस्ट: शिक्षक के उत्तर कुंजी (answer key) में केवल "चढ़ना" (Boarding) लिखा था।
  • परिणाम: यदि जनरललिस्ट रोबोट ने "उतरना" (Exiting) कहा, तो उसे गलत माना गया। यदि स्पेशलिस्ट रोबोट ने "चढ़ना" का अनुमान लगाया, तो उसे सही माना गया।

यह जनरललिस्ट्स के लिए अनुचित था क्योंकि वे लचीले और रचनात्मक होने के लिए डिज़ाइन किए गए हैं। वे स्वाभाविक रूप से कई संभावनाओं को देखते हैं। पुराने टेस्ट ने उन्हें स्मार्ट और लचीला होने के लिए दंडित किया, जिससे वे वास्तव में जितने सक्षम थे, उससे कमतर दिखाई दिए।

समाधान: CrossHOI-Bench (नया, निष्पक्ष एग्जाम)

लेखकों ने CrossHOX-Bench नामक एक नया परीक्षण मैदान बनाया। इसे एक निष्पक्ष परीक्षा के रूप में सोचें जो विशेषज्ञ और सामान्यज्ञ दोनों के लिए समान रूप से न्यायपूर्ण हो।

यह पूछने के बजाय कि, "वहाँ क्या एक चीज़ हो रही है?", यह पूछता है:

"यहाँ एक चित्र है। यहाँ चार विकल्प हैं: A, B, C, और D। इनमें से कौन सी क्रियाएं हो रही हैं?"

  • विकल्प:
    • (A) हवाई जहाज में चढ़ना (Boarding)
    • (B) हवाई जहाज से उतरना (Exiting)
    • (C) सैंडविच खाना (Eating)
    • (D) हवाई जहाज उड़ाना (Flying)
  • नया नियम: यदि व्यक्ति चढ़ने और उतरने (दोनों) की प्रक्रिया में है (या यदि चित्र अस्पष्ट है), तो मॉडल को A और B दोनों चुनने के लिए श्रेय दिया जाएगा।

उन्होंने टेस्ट को कठिन भी बनाया। उन्होंने "आसान" चित्रों को हटा दिया (जैसे सफेद कमरे में एक कप पकड़े हुए एक अकेला व्यक्ति) और ध्यान केंद्रित किया वास्तविक, जटिल दुनिया पर:

  • भीड़भाड़ वाले दृश्य जहाँ 5 लोग अलग-अलग चीजें कर रहे हैं।
  • पेचीदा क्षण जहाँ यह बताना मुश्किल है कि कोई फोन पकड़े हुए है या उस पर टेक्स्टिंग कर रहा है।
  • भ्रमित करने वाली स्थितियाँ जहाँ व्यक्ति A एक गेंद पकड़े हुए है, लेकिन व्यक्ति B उसे फेंक रहा है, और रोबट को पता होना चाहिए कि कौन क्या कर रहा है।

हमने क्या पाया (द प्लॉट ट्विस्ट)

जब उन्होंने इस नए, निष्फे टेस्ट को चलाया, तो परिणाम आश्चर्यजनक थे:

  1. सामान्यज्ञ (VLMs) आश्चर्यजनक रूप से मजबूत हैं:
    "स्विस आर्मी नाइफ" (जैसे Qwen2.5 और InternVL) कई क्षेत्रों में स्पेशलिस्ट से बेहतर प्रदर्शन करते हैं, यहाँ तक कि बिना किसी विशेष प्रशिक्षण के भी! वे चित्र के संदर्भ (context) और कहानी को समझने में माहिर हैं। वे तर्क कर सकते हैं, "ओह, वह व्यक्ति केक की ओर देख रहा है, इसलिए वह शायद उसे काट रहा है।"

  2. लेकिन उनकी एक विशिष्ट कमजोरी है:
    जनरललिस्ट्स भीड़ में भ्रमित हो जाते हैं। यदि दो लोग एक-दूसरे के पास खड़े हैं, तो जनरललिस्ट उन्हें आपस में मिला सकता है। वह कह सकता है, "बाएं वाला आदमी घोड़े की सवारी कर रहा है," जबकि वास्तव में, दाएं वाला व्यक्ति सवारी कर रहा होता है। वे यह ट्रैक रखने में संघर्ष करते हैं कि कौन क्या कर रहा है जब सब लोग बहुत करीब होते हैं।

  3. स्पेशलिस्ट का काम अभी भी बाकी है:
    "मास्टर शेफ" (स्पेशलिस्ट मॉडल्स) तकनीकी चीजों में अभी भी बहुत अच्छे हैं। वे ठीक से यह पहचानने में बेहतर हैं कि कौन सा व्यक्ति किस क्रिया को कर रहा है और एक साथ होने वाली कई क्रियाओं (जैसे घोड़े की सवारी करना और उसे गले लगाना) को संभालने में वे बेहतर हैं।

मुख्य निष्कर्ष

यह पेपर हमें बताता है कि हमें "स्पेशलिस्ट" और "जनरललिस्ट" के बीच चयन करने की आवश्यकता नहीं है।

  • जनरललिस्ट्स बड़े चित्र (big picture) को समझने और जटिल दृश्यों के माध्यम से तर्क करने में अद्भुत हैं।
  • स्पेशलिस्ट्स अभी भी सटीक स्थानीयकरण (localization) और भीड़भाड़ वाले, बहु-क्रिया वाले दृश्यों को संभालने के राजा हैं।

लेखकों ने एक नया "निष्पक्ष एग्जाम" (CrossHOI-Bench) बनाया जो अंततः हमें दोनों प्रकार के AI की वास्तविक ताकत और कमजोरियों को देखने की अनुमति देता है। यह स्पष्ट है कि दुनिया को देखने और समझने का भविष्य केवल एक रोबोट द्वारा सब कुछ करने के बारे में नहीं है; यह जनरललिस्ट की रचनात्मकता को स्पेशलिस्ट की सटीकता के साथ जोड़ने के बारे में है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →