← नवीनतम पेपर
💻 computer science

HOI-aware Adaptive Network for Weakly-supervised Action Segmentation

यह शोध पत्र AdaAct का प्रस्ताव करता है, जो एक कमजोर-पर्यवेक्षित (weakly-supervised) एक्शन सेगमेंटेशन नेटवर्क है जो एक हाइपरनेटवर्क (HyperNetwork) के माध्यम से वीडियो-स्तरीय मानव-वस्तु इंटरेक्शन पूर्ववृत्त (priors) का लाभ उठाकर अपने टेम्पोरल एनकोडर मापदंडों को गतिशील रूप से अनुकूलित करता है, जिससे समान क्रियाओं के बीच की अस्पष्टताओं को प्रभावी ढंग से हल किया जा सके।

मूल लेखक: Runzhong Zhang, Suchen Wang, Yueqi Duan, Yansong Tang, Yue Zhang, Yap-Peng Tan

प्रकाशित 2026-04-30
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Runzhong Zhang, Suchen Wang, Yueqi Duan, Yansong Tang, Yue Zhang, Yap-Peng Tan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कुकिंग शो देखना सिखाने की कोशिश कर रहे हैं और उसे हर सेकंड में शेफ द्वारा उठाए गए कदमों को ठीक-ठीक लिखने के लिए कह रहे हैं। रोबोट सामग्री और चरणों की सूची जानता है (जैसे "जूस डालना," "संतरा काटना," "निचोड़ना"), लेकिन वह यह नहीं जानता कि प्रत्येक चरण कब शुरू होता है या समाप्त होता है। यह वीकली-सुपरवाइज्ड एक्शन सेगमेंटेशन (Weakly-Supervised Action Segmentation) की चुनौती है।

समस्या यह है कि कई कुकिंग स्टेप्स लगभग एक जैसे दिखते हैं। कॉफी डालना, संतरे का जूस डालने जैसा ही लग सकता है। यदि रोबोट केवल अपने सामने के कुछ सेकंड देखता है, तो वह भ्रमित हो सकता है और कह सकता है, "ओह, यह कॉफी है!" जबकि शेफ वास्तव में जूस बना रहा होता है।

यह पेपर इस भ्रम को दूर करने के लिए एक नया सिस्टम AdaAct पेश करता है। यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग किया गया है:

1. "संदर्भ सुराग" वाला जासूस (The "Context Clue" Detective)

अधिकांश पुराने तरीके उस जासूस की तरह हैं जो केवल अपने सामने मौजूद अपराध स्थल को देखता है। वे देखते हैं कि एक हाथ कप पकड़े हुए है और तरल पदार्थ डाल रहा है। अधिक जानकारी के बिना, वे केवल अनुमान लगाते हैं।

AdaAct एक ऐसे जासूस की तरह है जो अनुमान लगाने से पहले पूरे वीडियो को देखता है। वह पूछता है: "वीडियो में कौन सी वस्तुएं हैं?"

  • यदि वीडियो में एक चाकू, एक संतरा, और एक निचोड़ने वाला यंत्र (squeezer) है, तो रोबोट जानता है, "आह, यह निश्चित रूप से जूस है!"
  • यदि वीडियो में एक कॉफी पॉट और बीन्स हैं, तो वह जानता है, "यह कॉफी है!"

पेपर इन वस्तुओं और उनकी अंतःक्रियाओं को HOI (Human-Object Interactions) कहता है। केवल क्रिया को देखने के बजाय, सिस्टम पूरे वीडियो को स्कैन करता है ताकि इन "सुरागों" (जैसे संतरा या कॉफी पॉट) को खोजा जा सके और अपनी समझ को निर्देशित करने के लिए उनका उपयोग किया जा सके।

2. "आकार बदलने वाला" मस्तिष्क (The "Shape-Shifting" Brain)

यही वह चतुर हिस्सा है। आमतौर पर, एक कंप्यूटर प्रोग्राम का "निश्चित मस्तिष्क" (fixed brain) होता है। एक बार प्रशिक्षित होने के बाद, उसकी सेटिंग्स नहीं बदलतीं। यह एक ऐसे शेफ की तरह है जो सामग्री की परवाह किए बिना हमेशा एक ही तरह से खाना बनाता है।

AdaAct के पास एक आकार बदलने वाला मस्तिष्क (तकनीकी रूपв से जिसे "एडेप्टिव नेटवर्क" कहा जाता है) है।

  • इसे रसोई में मौजूद सामग्रियों के आधार पर अपना खाना बनाने का तरीका बदलने वाले एक स्मार्ट शेफ की तरह समझें।
  • जब सिस्टम "संतरे" का सुराग देखता है, तो वह तुरंत अपनी आंतरिक सेटिंग्स को बदलकर "जूस बनाने" का विशेषज्ञ बन जाता है।
  • जब वह "कॉफी पॉट" का सुराग देखता है, तो वह तुरंत अपनी सेटिंग्स को बदलकर "कॉफी बनाने" का विशेषज्ञ बन जाता है।

यह एक विशेष "निर्देश पुस्तिका" (HyperNetwork) का उपयोग करके ऐसा करता है जो वीडियो में मिले सुरागों के आधार पर रोबोट के अपने नियमों को तुरंत फिर से लिख देती है।

3. यह कैसे सीखता है (दो-चरणीय प्रक्रिया)

यह सिस्टम दो तरीकों से सीखता है, जैसे कोई छात्र परीक्षा के लिए पढ़ाई करता है:

  1. सामान्य ज्ञान (HOI-स्वतंत्र): यह कुकिंग वीडियो के बारे में सामान्य नियम सीखता है जो सब पर लागू होते हैं (जैसे, "कुकिंग वीडियो में आमतौर पर बहुत सारा काटना शामिल होता है")।
  2. विशिष्ट सुराग (HOI-निर्भर): यह अभी देखे जा रहे विशिष्ट वीडियो में अद्वितीय सुराग खोजने के लिए उसे देखता है (जैसे, "इस विशिष्ट वीडियो में एक निचोड़ने वाला यंत्र है")।

यह अपने अंतिम निर्णय लेने के लिए इन दोनों प्रकार के ज्ञान को आपस में मिलाता है।

परिणाम

शोधकर्ताओं ने दो लोकप्रिय कुकिंग वीडियो डेटासेट्स पर इसका परीक्षण किया: Breakfast (सुबह का नाश्ता बनाना) और 50Salads (सलाद बनाना)।

  • हल की गई समस्या: सिस्टम समान क्रियाओं के बीच अंतर करने में बहुत बेहतर हो गया, जैसे कॉफी डालना बनाम जूस डालना।
  • परिणाम: इसने इस विशिष्ट प्रकार के कार्य के लिए अब तक के सर्वश्रेष्ठ परिणाम प्राप्त किए। इसने केवल अनुमान नहीं लगाया; इसने यह जानने के लिए कि वास्तव में क्या हो रहा है, वीडियो में मौजूद "सुरागों" का उपयोग किया।

संक्षेप में: AdaAct एक वीडियो देखने वाला सिस्टम है जो केवल क्रिया को नहीं देखता; यह यह समझने के लिए कि क्रिया क्या है, इस्तेमाल किए जा रहे औजारों को भी देखता है, और यह अपने मस्तिष्क की सेटिंग्स को उन औजारों के अनुसार बदल लेता है जिन्हें वह देखता है। यह इसे तब भ्रमित होने से रोकता है जब दो क्रियाएं एक जैसी दिखती हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →