← नवीनतम पेपर
🤖 AI

HOI-R1: Exploring the Potential of Multimodal Large Language Models for Human-Object Interaction Detection

यह शोध पत्र HOI-R1 प्रस्तुत करता है, जो एक नवीन दृष्टिकोण है जो शुद्ध टेक्स्ट जनरेशन का उपयोग करके अत्याधुनिक ह्यूमन-ऑब्जेक्ट इंटरैक्शन डिटेक्शन प्राप्त करने के लिए सुदृढीकरण सीखने (रिनफोर्समेंट लर्निंग) के साथ प्रशिक्षित मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स की अंतर्निहित तर्क क्षमताओं का लाभ उठाता है, जिससे जटिल अतिरिक्त डिटेक्शन मॉड्यूल की आवश्यकता समाप्त हो जाती है।

मूल लेखक: Junwen Chen, Peilin Xiong, Keiji Yanai

प्रकाशित 2026-02-03
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Junwen Chen, Peilin Xiong, Keiji Yanai

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक तस्वीर में एक व्यस्त सड़क के दृश्य को देख रहे हैं। आपका लक्ष्य एक जासूस की तरह काम करना और बिल्कुल सटीक रूप से लिखना है कि क्या हो रहा है: "एक व्यक्ति साइकिल चला रहा है," या "एक बच्चा एक खिलौना पकड़े हुए है।"

कंप्यूटर विज़न की दुनिया में, इस कार्य को ह्यूमन-ऑब्जेक्ट इंटरैक्शन डिटेक्शन (HOID) कहा जाता है। लंबे समय तक, कंप्यूटर इसमें खराब थे। उन्हें इसे सही ढंग से करने के लिए एक बहुत ही जटिल, बहु-चरणीय असेंबली लाइन की आवश्यकता होती थी।

यहाँ एक सरल विवरण दिया गया है कि HOI-R1 क्या प्रस्तावित करता है, रोज़मर्रा के उपमाओं (analogies) का उपयोग करते हुए।

पुराना तरीका: अत्यधिक इंजीनियर की गई फैक्ट्री

पारंपरिक रूप से, कंप्यूटर को इन इंटरैक्शन को पहचानने के लिए सिखाने के लिए, शोधकर्ताओं ने एक जटिल फैक्ट्री बनाई:

  1. स्कैनर: पहले, एक "डिटेक्टर" को फोटो को स्कैन करना पड़ता था ताकि हर व्यक्ति और हर वस्तु को खोजा जा सके (जैसे टोकरी में सभी सेबों को खोजना)।
  2. पेयरिंग मशीन: फिर, एक अलग मशीन को यह अनुमान लगाना होता था कि कौन सा व्यक्ति किस वस्तु को छू रहा है।
  3. लेबलर: अंत में, तीसरी मशीन को क्रिया का अनुमान लगाना होता था (जैसे "खा रहा है" बनाम "पकड़े हुए है")।

समस्या क्या थी? यह फैक्ट्री बहुत बड़ी, महंगी और बनाने में कठिन थी। यदि आप इसे बदलना चाहते थे, तो आपको पूरी चीज़ को फिर से बनाना पड़ता था। यह "पूर्व ज्ञान" (पहले से प्रोग्राम किए गए नियमों) पर निर्भर था जिसने सिस्टम को कठोर और जटिल बना दिया था।

नया तरीका: "तर्क करने वाला" जासूस (HOI-R1)

लेखकों ने एक साहसिक प्रश्न पूछा: क्या होगा अगर हम पूरी फैक्ट्री को छोड़ दें और बस एक सुपर-इंटेलिजेंट जासूस से तस्वीर देखने और साधारण अंग्रेजी में रिपोर्ट लिखने के लिए कहें?

उन्होंने मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (MLLMs) का उपयोग किया। इन मॉडल्स को ऐसे सुपर-इंटेलिजेंट छात्रों के रूप में सोचें जिन्होंने लाखों किताबें पढ़ी हैं और लाखों तस्वीरें देखी हैं। वे संदर्भ (context) को समझने और तर्क करने में माहिर हैं, लेकिन वे आमतौर पर केवल वही बताते हैं जो वे देखते हैं। वे सटीक "जासूस" बनने के लिए प्रशिक्षित नहीं हैं जिन्हें सटीक निर्देशांक (coordinates) खोजने होते हैं।

HOI-R1 एक नया प्रशिक्षण तरीका है जो इन बातूनी जासूसों को सटीक इंटरैक्शन डिटेक्टर में बदल देता है, इसके लिए पुराने "फैक्ट्री" (ऑब्जेक्ट डिटेक्टर्स) की आवश्यकता नहीं होती है।

उन्होंने जासूस को कैसे प्रशिक्षित किया: एक दो-चरणीय प्रक्रिया

पेपर में इस काम को पूरी तरह से करने के लिए मॉडल को प्रशिक्षित करने के लिए एक चतुर दो-चरणीय प्रशिक्षण शिविर का वर्णन किया गया है।

चरण 1: "ज़ोर से सोचने" का पाठ (सुपरवाइज्ड फाइन-ट्यूनिंग)

कल्पना कीजिए कि आप एक छात्र को गणित की समस्या हल करना सिखा रहे हैं। आप उन्हें केवल उत्तर नहीं देते; आप उन्हें अपनी सोचने की प्रक्रिया दिखाते हैं।

  • शिक्षक: शोधकर्ताओं ने एक शक्तिशाली AI (GPT-4o-mini) का उपयोग किया जो प्रशिक्षण तस्वीरों को देखता है और एक चरण-दर-चरण "सोचने का लॉग" लिखता है।
    • उदाहरण: "सबसे पहले, मैं बाईं ओर एक व्यक्ति देखता हूँ। इसके बाद, मैं एक कुत्ता देखता हूँ। व्यक्ति झुक रहा है। इसलिए, क्रिया 'सहलाना' (petting) है।"
  • छात्र: जिस मॉडल को वे प्रशिक्षित कर रहे हैं (जैसे Qwen-VL), वह इन लॉग्स को पढ़ता है और अंतिम उत्तर देने से पहले सोचने की प्रक्रिया की नकल करना सीखता है।
  • परिणाम: मॉडल यह सीखता है कि दृश्य के बारे में कैसे तर्क किया जाए, न कि केवल उत्तरों को रटा जाए। यह सीखता है कि कहना, "मैं एक इंसान देखता हूँ, मैं एक वस्तु देखता हूँ, मैं उन्हें जोड़ता हूँ, और यह रही क्रिया।"

चरण 2: "गेम शो" (रीइन्फोर्समेंट लर्निंग)

एक बार जब छात्र को सोचना आ जाता है, तो उन्हें सटीक होने की आवश्यकता होती है। यहीं पर वे सख्त नियमों के साथ एक खेल (Reinforcement Learning) खेलते हैं।

  • नियम (पुरस्कार/Rewards): मॉडल को सही काम करने के लिए अंक (पुरस्कार) मिलते हैं और गलतियों के लिए अंक कटते हैं।
    • फॉर्मेट पॉइंट्स: क्या आपने सही JSON फॉर्मेट में उत्तर लिखा? (जैसे किसी फॉर्म को सही ढंग से भरना)।
    • लेबल पॉइंट्स: क्या आपने सही शब्दों का अनुमान लगाया? (जैसे "ड्राइविंग" के बजाय "राइडिंग")।
    • लोकेशन पॉइंट्स: क्या आपने व्यक्ति और वस्तु के चारों ओर बॉक्स को बिल्कुल सही जगह पर बनाया?
  • रणनीति: मॉडल अलग-अलग उत्तरों का प्रयास करता है। यदि वह बॉक्स को थोड़ा भी गलत बनाता है, तो उसे कम अंक मिलते हैं। यदि वह बॉक्स को एकदम सटीक बनाता है, तो उसे बड़ा बोनस मिलता है। वह जल्दी सीख जाता है कि अस्पष्ट होना फायदेमंद नहीं है।

परिणाम: तेज़ और मजबूत

पेपर ने इसे HICO-DET नामक एक मानक डेटासेट (मानवीय वस्तुओं के बीच इंटरैक्शन के विशाल संग्रह) पर परखा।

  • जादू: उन्होंने एक अपेक्षाकृत छोटे मॉडल (Qwen2.5-VL-3B) को लिया और उसे केवल एक दिन (1 epoch) के "सोचने के पाठों" और 40 चरणों के "गेम शो" अभ्यास के लिए प्रशिक्षित किया।
  • बढ़ावा: इस मामूली मात्रा में प्रशिक्षण ने मॉडल की सटीकता को उसकी मूल स्थिति की तुलना में दोगुना कर दिया।
  • तुलना: उनके नए तरीके, HOI-R1 ने कई पारंपरिक, विशाल "फैक्ट्री" सिस्टम को पछाड़ दिया, जिन्हें महीनों तक प्रशिक्षित किया गया था। इससे भी बेहतर, यह दुर्लभ इंटरैक्शन (जैसे पाइप को "वेल्डिंग" करता हुआ व्यक्ति) पर भी अच्छा काम करता है जो आमतौर पर कंप्यूटर को भ्रमित कर देते हैं।

यह क्यों मायने रखता है (पेपर के अनुसार)

लेखक दावा करते हैं कि यह एक क्रांतिकारी बदलाव है। इंटरैक्शन का पता लगाने के लिए जटिल, भारी मशीनरी बनाने के बजाय, उन्होंने दिखाया कि एक स्मार्ट लैंग्वेज मॉडल, यदि उसे "सोचना" और "नियमों का पालन करना" सिखाया जाए, तो वह अपने आप डिटेक्टर का काम कर सकता है।

  • कोई अतिरिक्त हार्डवेयर नहीं: आपको अलग ऑब्जेक्ट डिटेक्टर की आवश्यकता नहीं है।
  • शुद्ध तर्क: मॉडल भाषा और तर्क का उपयोग करके समस्या को हल करता है।
  • गति: यह पारंपरिक तरीकों की तुलना में बहुत तेज़ी से सीखता (converge) है।

संक्षेप में, HOI-R1 साबित करता है कि यदि आप एक स्मार्ट AI को सही निर्देश और स्पष्ट नियम देते हैं, तो वह बिना किसी विशाल, जटिल असेंबली लाइन की मदद के, फोटो में वास्तव में क्या हो रहा है, इसका सटीक पता लगा सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →