← नवीनतम पेपर
💬 NLP

Decomposing Queries into Tool Calls for Long-Video Keyframe Retrieval

यह शोध पत्र ToolMerge को प्रस्तुत करता है, जो एक नवीन कीफ्रेम रिट्रीवल विधि है जो क्वेरीज़ को विशिष्ट टूल कॉल्स में विभाजित करने और उनके परिणामों को बूलियन ऑपरेटर्स के माध्यम से मर्ज करने के लिए एक LLM का लाभ उठाती है, जो नए प्रस्तावित Molmo-2 Moments बेंचमार्क पर प्रतिस्पर्धी प्रदर्शन प्रदर्शित करती है।

मूल लेखक: Michal Shlapentokh-Rothman, Prachi Garg, Yu-Xiong Wang, Derek Hoiem

प्रकाशित 2026-05-25
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Michal Shlapentokh-Rothman, Prachi Garg, Yu-Xiong Wang, Derek Hoiem

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास 4 घंटे लंबी एक फिल्म है, और कोई आपसे उसके बारे में बहुत विशिष्ट प्रश्न पूछता है, जैसे, "पीली जैकेट वाले आदमी ने नदी पार करने से ठीक पहले क्या किया था?"

यदि आप पूरी फिल्म को शुरू से अंत तक देखकर इसका उत्तर देने का प्रयास करेंगे, तो इसमें बहुत समय लगेगा। यदि आप केवल कुछ यादृच्छिक (random) फ्रेम चुनते हैं (जैसे कि फोटो एल्बम के पन्ने पलट रहे हों), तो संभावना है कि आप उस सटीक क्षण को चूक जाएंगे। यही वह समस्या है जिसे यह शोध पत्र संबोधित करता है: हम एक लंबे वीडियो के उन सटीक कुछ सेकंडों को कैसे खोजें जिनमें उत्तर छिपा है, बिना पूरे वीडियो को देखे?

लेखक एक नया सिस्टम प्रस्तावित करते हैं जिसे ToolMerge कहा जाता है। यह कैसे काम करता है, इसे सरल उपमाओं (analogies) के माध्यम से यहाँ समझाया गया है।

1. पुराने तरीकों के साथ समस्या

पिछले सिस्टमों ने इसे दो तरीकों से हल करने की कोशिश की, दोनों में ही कमियां थीं:

  • "एक ही आकार सबके लिए" (One-Size-Fits-All) दृष्टिकोण: उन्होंने पूरे प्रश्न को एक विशाल खोज शब्द (search term) के रूप में माना। यह एक लाइब्रेरियन से पूछने जैसा है, "मुझे वह पेज ढूंढ कर दें जहाँ पीली जैकेट वाला आदमी नदी पार कर रहा है।" लाइब्रेरियन को नदी वाला कोई पेज मिल सकता है, या आदमी वाला कोई पेज मिल सकता है, लेकिन जरूरी नहीं कि वह सही संयोजन (combination) ही हो।
  • "कठोर चेकलिस्ट" (Rigid Checklist) दृष्टिकोण: उन्होंने प्रश्न को वस्तुओं की एक निश्चित सूची में तोड़ने की कोशिश की (जैसे, "आदमी खोजें," "जैकेट खोजें," "नदी खोजें")। लेकिन वास्तविक जीवन अव्यवस्थित है। कभी आपको किसी क्रिया (action) को खोजने की आवश्यकता होती है, कभी किसी वस्तु को, और कभी किसी विशिष्ट रंग को। एक कठोर चेकलिस्ट बारीकियों को पकड़ने में विफल रहती है।

2. समाधान: ToolMerge (स्मार्ट जासूस)

ToolMerge एक स्मार्ट जासूस की तरह कार्य करता है जिसे केस सुलझाने के लिए विभिन्न उपकरणों (tools) का उपयोग करना आता है। एक बड़ी छलांग लगाने के बजाय, जासूस काम को छोटे हिस्सों में बांट देता है।

चरण 1: योजनाकार (The Planner - मस्तिष्क)
सबसे पहले, एक "योजनाकार" (एक AI मस्तिष्क) प्रश्न को पढ़ता है। केवल पूरे वाक्य को खोजने के बजाय, यह प्रश्न को छोटे, विशिष्ट कार्यों में तोड़ देता है।

  • उपमा: यदि प्रश्न है "पीली जैकेट वाले आदमी ने क्या किया?", तो योजनाकार केवल "पीली जैकेट!" चिल्लाकर खाली स्थान में नहीं खोजता। वह कहता है, "ठीक है, मुझे तीन चीजें चाहिए: 1. एक दृश्य खोजें जिसमें नदी हो। 2. एक आदमी खोजें जिसने पीला पहना हो। 3. कोई पानी पार कर रहा हो, उसे खोजें।"

चरण 2: उपकरण (The Tools - विशेषज्ञ)
योजनाकार इन छोटे कार्यों को विभिन्न "विशेषज्ञ" उपकरणों को भेजता है।

  • टूल A (SigLIP): यह दृश्य विशेषज्ञ (Scene Specialist) है। यह सामान्य माहौल (जैसे, "एक नदी," "एक घाटी") खोजने के लिए पूरी तस्वीर को देखता है।
  • टूल B (T-REN): यह वस्तु विशेषज्ञ (Object Specialist) है। यह विशिष्ट चीजों (जैसे, "एक आदमी," "एक पीली जैकेट") को खोजने के लिए ज़ूम करता है।
  • टूल C (OCR): यह टेक्स्ट रीडर (Text Reader) है। यह वीडियो में लिखे किसी भी शब्द या साइन बोर्ड को पढ़ता है।

चरण 3: विलय (The Merge - न्यायाधीश)
अब, प्रत्येक उपकरण ने अपने विशिष्ट कार्य के आधार पर वीडियो के हर एक फ्रेम को रैंक किया है। "मर्ज" चरण इन रैंकिंग्स को जोड़ता है।

  • "AND" का नियम: यदि प्रश्न के लिए नदी और आदमी दोनों की आवश्यकता है, तो सिस्टम उन फ्रेमों को देखता है जहाँ दोनों उपकरणों ने उच्च स्कोर दिया हो। यह एक वेन आरेख (Venn diagram) की तरह है; उत्तर उस बीच के हिस्से में होना चाहिए जहाँ दोनों वृत्त आपस में मिलते हैं।
  • "OR" का नियम: यदि प्रश्न पूछता है "क्या उसने नदी पार की या पुल?", तो सिस्टम उन फ्रेमों को देखता है जो इनमें से किसी भी स्थिति को संतुष्ट करते हैं।

अंत में, सिस्टम उन शीर्ष 3 से 8 फ्रेमों को चुनता है जिन्होंने सभी संयुक्त नियमों के तहत सबसे अच्छा स्कोर किया है और वास्तविक उत्तर देने के लिए उन्हें एक अंतिम "उत्तर देने वाले" (Answerer) AI को सौंप देता है।

3. नया परीक्षण: Molmo-2 Moments (M2M)

यह सिद्ध करने के लिए कि उनका सिस्टम काम करता है, लेखकों ने महसूस किया कि मौजूदा परीक्षण अनुचित थे। पुराने परीक्षणों में ऐसे प्रश्न थे जिनका उत्तर अनुमान लगाकर या वीडियो के यादृच्छिक हिस्सों को देखकर दिया जा सकता था।

उन्होंने Molmo-2 Moments (M2M) नामक एक नया परीक्षण बनाया।

  • उपमा: कल्पना कीजिए कि एक शिक्षक एक फिल्म के केवल एक विशिष्ट 10-सेकंड के क्लिप के आधार पर परीक्षा लिखता है। शिक्षक जानता है कि उन 10 सेकंड में वास्तव में क्या हुआ। यदि छात्र सही उत्तर देता है, तो इसका मतलब है कि उसने वास्तव में वे विशिष्ट 10 सेकंड देखे हैं। वह पूरी फिल्म से अनुमान नहीं लगा सकता था।
  • यह सुनिश्चित करता है कि यदि सिस्टम सही उत्तर देता है, तो उसने वास्तव में सही फ्रेम खोजे हैं।

4. परिणाम

जब उन्होंने ToolMerge का परीक्षण किया:

  • यह पिछले तरीकों की तुलना में सही फ्रेम खोजने में बेहतर था, विशेष रूप से कई वस्तुओं या क्रियाओं वाले जटिल प्रश्नों के लिए।
  • इसने कैप्शन रिट्रीवल (caption retrieval) पर विशेष रूप से अच्छा प्रदर्शन किया। यदि आप सिस्टम को किसी दृश्य का विस्तृत विवरण (जैसे कैप्शन) देते हैं, तो ToolMerge पुराने तरीकों की तुलना में उस सटीक वीडियो क्लिप को खोजने में बहुत बेहतर है जो उस विवरण से मेल खाता है।
  • उन्होंने यह भी दिखाया कि यदि आप योजनाकार (Planner) को एक विशिष्ट रिवॉर्ड सिस्टम (GRPO) का उपयोग करके थोड़ा "प्रशिक्षित" करते हैं, तो वह यह जानने में और भी बेहतर हो जाता है कि किन उपकरणों का उपयोग करना है।

सारांश

ToolMerge एक ऐसा सिस्टम है जो लंबे वीडियो प्रश्न का उत्तर एक ही बार में अनुमान लगाने की कोशिश नहीं करता है। इसके बजाय, यह एक प्रोजेक्ट मैनेजर की तरह कार्य करता है: यह प्रश्न को छोटे, विशिष्ट कार्यों में तोड़ता है, उन कार्यों को विभिन्न विशेषज्ञ उपकरणों को भेजता है, और फिर परिणामों को जोड़कर वीडियो के उन सटीक कुछ सेकंडों को खोज लेता है जिनमें सच्चाई छिपी है। उन्होंने इसे एक नए, अधिक सख्त परीक्षण के माध्यम से सिद्ध किया जहाँ उत्तर समय के एक विशिष्ट क्षण से बंधा हुआ है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →