← नवीनतम पेपर
💻 computer science

EagleVision: A Dual-Stage Framework with BEV-grounding-based Chain-of-Thought for Spatial Intelligence

EagleVision एक द्वि-चरणीय ढांचा (dual-stage framework) है जो एक ज्यामिति-जागरूक कीफ्रेम चयन तंत्र (geometry-aware keyframe selection mechanism) को एक सक्रिय, बर्ड्स-आई-व्यू-आधारित चेन-ऑफ-थॉट प्रक्रिया के साथ जोड़कर वीडियो-आधारित स्थानिक तर्क (spatial reasoning) को बढ़ाता है, जो परिकल्पनाओं को सत्यापित करने के लिए नए दृष्टिकोणों को पुनरावृत्ति से प्राप्त करता है, और मानव-एनोटेटेड रीजनिंग ट्रेसेस की आवश्यकता के बिना अत्याधुनिक प्रदर्शन प्राप्त करता है।

मूल लेखक: Jiaxu Wan, Xu Wang, Mengwei Xie, Hang Zhang, Mu Xu, Yang Han, Hong Zhang, Ding Yuan, Yifan Yang

प्रकाशित 2026-03-23
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiaxu Wan, Xu Wang, Mengwei Xie, Hang Zhang, Mu Xu, Yang Han, Hong Zhang, Ding Yuan, Yifan Yang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, अंधेरे गोदाम में एक रहस्य सुलझाने की कोशिश कर रहे हैं। आपके पास एक सुरक्षा कैमरा फीड है, लेकिन यह एक लंबा वीडियो है जिसमें कैमरा बस बेतरतीब ढंग से घूम रहा है। आपको एक कठिन प्रश्न का उत्तर देना है: "बिस्तर के करीब कौन सी वस्तु है: कुर्सी या सोफा?"

यदि आप एक मानक AI (एक "मल्टीमॉडल लार्ज लैंग्वेज मॉडल") से यह प्रश्न पूछते हैं, तो वह आमतौर पर दो में से एक गलती करता है:

  1. अनुमान लगाने का खेल (The Guessing Game): वह कुछ यादृच्छिक (random) फ्रेम देखता है, "सोफा" का अनुमान लगाता है, और आगे बढ़ जाता है। वह वास्तव में यह भी नहीं देखता कि कमरे में कुर्सी है भी या नहीं।
  2. केवल टेक्स्ट सोचने वाला (The Text-Only Thinker): वह अपने दिमाग में तर्क लगाने की कोशिश करता है, जैसे, "हूँ, मुझे अपने पास मौजूद तस्वीरों में कुर्सी नहीं मिल रही है, लेकिन मैं फिर भी सोफे का अनुमान लगा लेता हूँ।" उसमें गायब सबूतों को खोजने की क्षमता नहीं है।

EagleVision एक सुपर-स्मार्ट जासूस की तरह है जो तब तक अनुमान नहीं लगाता जब तक कि उसके पास सभी तथ्य न हों। यह स्थानिक पहेलियों (spatial puzzles) को हल करने के लिए वीडियो में दो-चरणीय प्रक्रिया का उपयोग करता है, और यह "स्थान के साथ सोचकर" (thinking with space) ऐसा करता है।

यहाँ EagleVision कैसे काम करता है, सरल उपमाओं के साथ समझाया गया है:

चरण 1: "स्मार्ट स्नैपशॉट" (मैक्रो परसेप्शन)

कल्पना कीजिए कि आपके पास एक कमरे का 10 मिनट का वीडियो है, लेकिन आप केवल 5 स्नैपशॉट देख सकते हैं क्योंकि आपके मस्तिष्क (या कंप्यूटर मेमोरी) की एक सीमा है कि वह एक बार में कितनी जानकारी प्रोसेस कर सकता है।

  • समस्या: यदि आप केवल 5 यादृच्छिक स्नैपशॉट लेते हैं, तो आपको एक ही दीवार के 5 चित्र मिल सकते हैं। आप बिस्तर, कुर्सी और सोफे को पूरी तरह से मिस कर देंगे।
  • EagleVision का समाधान: EagleVision एक विशेष एल्गोरिदम का उपयोग करता है जिसे SPF-DPK कहा जाता है। इसे एक "स्मार्ट कैमरा ऑपरेटर" के रूप में समझें।
    • यह पूरे वीडियो को देखता है और प्रत्येक फ्रेम के लिए दो प्रश्न पूछता है:
      1. क्या यह चित्र प्रासंगिक है? (सिमेंटिक रेलेवेंस: "क्या मुझे बिस्तर दिख रहा है?")
      2. क्या यह एक अलग कोण से है? (जियोमेट्रिक डायवर्सिटी: "क्या मैंने पहले ही यह कोण देख लिया है?")
    • यह उन परफेक्ट 5 स्नैपशॉट्स को चुनता है जो आपको कमरे के सबसे अलग-अलग हिस्सों को दिखाते हैं, जबकि वे आपके प्रश्न के लिए प्रासंगिक भी हों। यह सुनिश्चित करता है कि सोचने से पहले आपके दिमाग में कमरे का एक "3D मैप" तैयार हो जाए।

चरण 2: "सक्रिय जासूस" (माइक्रो वेरिफिकेशन)

अब जब आपके पास अपने 5 स्नैपशॉट हैं, तो आप सोचना शुरू करते हैं। लेकिन क्या होगा यदि आप अभी भी सुनिश्चित नहीं हैं? शायद कुर्सी आपके स्नैपशॉट में पर्दे के पीछे छिपी हुई है।

  • समस्या: सामान्य AI अपने पास मौजूद 5 स्नैपशॉट के साथ ही अटक जाते हैं। वे और अधिक देखने के लिए नहीं कह सकते।
  • EagleVision का समाधान: EagleVision के पास एक बर्ड्स-आई व्यू (BEV) मैप है। कल्पना कीजिए कि कमरे का एक सपाट, 2D नक्शा वीडियो के ऊपर तैर रहा है, जो दिखा रहा है कि हर फ्रेम के लिए कैमरा कहाँ था।
    • "परिकल्पना-देखो-सत्यापित करो" (Hypothesize-Look-Verify) लूप:
      1. सोचें: AI कहता है, "मुझे लगता है कि कुर्सी खिड़की के पास है, लेकिन मैं अपनी वर्तमान तस्वीरों में उसे नहीं देख पा रहा हूँ।"
      2. पूछें: अनुमान लगाने के बजाय, यह BEV मैप की ओर इशारा करता है और कहता है, "मुझे मैप के इस विशिष्ट स्थान से दृश्य देखने की आवश्यकता है।"
      3. देखें: सिस्टम तुरंत वास्तविक वीडियो फ्रेम पर कूद जाता है जो मैप के उस स्थान से मेल खाता है और उसे AI को दिखाता है।
      4. सत्यापित करें: AI उस नई तस्वीर को देखता है, अपने सिद्धांत को अपडेट करता है, और प्रक्रिया को तब तक दोहराता है जब तक कि वह 100% सुनिश्चित न हो जाए।

यह कैसे सीखता है? ("नो-टीचर" ट्रेनिंग)

आमतौर पर, एक AI को अच्छा जासूस बनने के लिए सिखाने के लिए, आपको एक मानव शिक्षक की आवश्यकता होती है जो चरण-दर-चरण निर्देश लिखे, जैसे: "पहले बिस्तर को देखो, फिर बाईं ओर देखो, फिर दाईं ओर देखो।" यह महंगा और कठिन है।

EagleVision अलग तरह से सीखता है। यह रीइन्फोर्समेंट लर्निंग (जैसे कुत्ते को ट्रीट देकर प्रशिक्षित करना) का उपयोग करता है।

  • AI पहेली सुलझाने की कोशिश करता है।
  • यदि वह सही उत्तर का अनुमान लगाता है, तो उसे एक "ट्रीट" (पुरस्कार) मिलता है।
  • यदि वह एक ऐसा दृश्य मांगता है जो मौजूद नहीं है (जैसे कैमरे को उस दीवार की ओर दिखाना जहाँ कोई वीडियो नहीं लिया गया था), तो उसे "डाँट" (दंड) मिलती है।
  • समय के साथ, AI खुद सीख जाता है: "ओह, मुझे केवल उन दृश्यों के लिए पूछना चाहिए जो वास्तव में वीडियो में मौजूद हैं, और मुझे तब तक देखते रहना चाहिए जब तक कि मैं निश्चित न हो जाऊं।" वह बिना किसी मानवीय स्क्रिप्ट के, खोजने की रणनीति सीख जाता है।

यह एक बड़ी बात क्यों है?

  • यह कुशल है: यह बेकार के फ्रेम देखने में ऊर्जा बर्बाद नहीं करता। यह पहले सबसे अच्छे फ्रेम चुनता है।
  • यह सक्रिय है: यह केवल जो दिया गया है उसे घूरता नहीं है; यह पहेली के लापता टुकड़ों को सक्रिय रूप से खोजता है।
  • यह सटीक है: परीक्षणों में, EagleVision ने 3D स्पेस, दूरी और लेआउट को समझने में लगभग हर अन्य ओपन-सोर्स AI को पीछे छोड़ दिया।

संक्षेप में: EagleVision उस छात्र के बीच का अंतर है जो पढ़ाई न करने के कारण उत्तर का अनुमान लगाता है, और उस छात्र के बीच का अंतर जो अपनी किताब खोलता है, ठीक उसी पेज पर जाता जिसकी उसे आवश्यकता है, आरेख (diagram) की जांच करता है, और फिर आत्मविश्वास के साथ सही उत्तर लिखता है। यह "अनुमान लगाने" को "जांच करने" में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →