← नवीनतम पेपर
🤖 AI

ARGOS: Who, Where, and When in Agentic Multi-Camera Person Search

यह शोध पत्र ARGOS को प्रस्तुत करता है, जो एक नवीन बेंचमार्क और फ्रेमवर्क है जो मल्टी-कैमरा पर्सन सर्च को एक इंटरैक्टिव एजेंटिक रीजनिंग टास्क के रूप में पुनर्गठित करता है जहाँ एक एजेंट को 2,691 वास्तविक दुनिया के परिदृश्यों में अस्पष्ट गवाह विवरणों के आधार पर व्यक्तियों की पहचान करने के लिए क्वेरीज़ की योजना बनानी होती है और स्थानिक-कालिक (स्पैटियो-टेम्पोरल) उपकरणों का उपयोग करना होता है।

मूल लेखक: Myungchul Kim, Kwanyong Park, Junmo Kim, In So Kweon

प्रकाशित 2026-04-15
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Myungchul Kim, Kwanyong Park, Junmo Kim, In So Kweon

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जासूस हैं जो सुरक्षा कैमरों से भरी एक विशाल, बहु-मंजिला इमारत में किसी विशिष्ट व्यक्ति को खोजने की कोशिश कर रहे हैं। लेकिन यहाँ एक पेच है: आप उस व्यक्ति को अभी देख नहीं सकते, और आप केवल एक फोटो देखकर यह नहीं कह सकते कि, "वही है।"

इसके बजाय, आपको एक गवाह से बात करनी होगी जिसने उस व्यक्ति को पहले देखा था। समस्या यह है कि गवाह भूलक्कड़, अस्पष्ट और शायद सब कुछ पूरी तरह से याद न रख पाने वाला हो सकता है। वे कह सकते हैं, "मैंने एक महिला को काली शर्ट में देखा," लेकिन वे इस बारे में अनिश्चित हो सकते हैं कि वह जैकेट थी या टी-शर्ट, या वह ठीक किस कमरे में थी।

यह ARGOS का संसार है, जो एक नया कंप्यूटर सिस्टम है जिसे ठीक इसी समस्या को हल करने के लिए डिज़ाइन किया गया है। ARGOS को केवल एक कैमरा सिस्टम के रूप में नहीं, बल्कि एक सुपर-स्मार्ट डिटेक्टिव एजेंट के रूप रूप में सोचें जो सही सवाल पूछना जानता है, एक नक्शे का उपयोग करना जानता है, और अपराधी को खोजने के लिए घड़ी की जांच करना जानता है।

यहाँ यह कैसे काम करता है, इसे सरल अवधारणाओं में विभाजित किया गया है:

1. जासूस का टूलकिट (द "एजेंट")

अतीत में, कंप्यूटर सिस्टम लोगों को केवल एक फोटो को दूसरी फोटो से मिलाकर खोजने की कोशिश करते थे। यदि फोटो धुंधली थी या व्यक्ति ने कपड़े बदल लिए थे, तो सिस्टम विफल हो जाता था।

ARGOS अलग है। यह एक इंटरैक्टिव डिटेक्टिव है। यह गवाह के साथ एक बातचीत करता है (कंप्यूटर गवाह का अनुकरण करता है)।

  • गवाह: "मैंने मास्क पहनी हुई एक महिला देखी।"
  • ARGOS: "ठीक है, क्या उसने मास्क अपनी ठुड्डी पर पहना था या पूरे चेहरे को ढका हुआ था?"
  • गवाह: "चेहरे को ढका हुआ था।"
  • ARGOS: "समझ गया। अब, वह कहाँ थी? वेयरहाउस में या लॉबी में?"

ARGOS केवल अनुमान नहीं लगाता; यह योजना बनाता है। यह तय करता है: क्या मुझे आगे उनके कपड़ों के बारे में पूछना चाहिए? या क्या मुझे पूछना चाहिए कि वे कहाँ थे? यह कम से कम सवालों के साथ सबसे उपयोगी जानकारी प्राप्त करने की कोशिश करता है।

2. जादुई नक्शा (द "स्पैटियो-टेम्पोरल ग्राफ")

यह सबसे शानदार हिस्सा है। ARGOS के पास उसके दिमाग में एक विशेष नक्शा है जिसे STTG (स्पैटियो-टेम्पोरल टोपोलॉजी ग्राफ) कहा जाता है।

कल्पना कीजिए कि यह नक्शा केवल कमरों का चित्र नहीं है; यह एक जीवित टाइमलाइन है।

  • स्थानिक (कहाँ): यह जानता है कि कैमरा A और कैमरा B एक-दूसरे के बगल में हैं, लेकिन कैमरा A और कैमरा C इमारत के विपरीत दिशाओं में हैं।
  • कालिक (कब): यह चलने के भौतिक विज्ञान (physics of walking) को जानता है। यह जानता है कि यदि कोई "वेयरहाउस" (कैमरा A) से निकलता है और "लॉबी" (कैमरा B) में दिखाई देता है, तो वहां तक चलने में उन्हें कम से कम 10 सेकंड लगते हैं।

सुपरपावर:
यदि गवाह कहता है, "मैंने उसे वेयरहाउस में देखा, और फिर 5 सेकंड बाद मैंने उसे लॉबी में देखा," तो ARGOS अपने नक्शे को देखता है और कहता है, "यह असंभव है! कोई इंसान इतनी तेज़ी से नहीं चल सकता।"
यह तुरंत उन सभी लोगों को बाहर कर देता जो उस छलांग को लगाने में सक्षम नहीं थे। यह एक जासूस की तरह है जो कहता है, "संदिग्ध एक ही समय में दोनों जगहों पर नहीं हो सकता था; या तो वह झूठ बोल रहा है या वह गलत है।"

3. खेल के तीन स्तर

शोधकर्ताओं ने इस AI के लिए एक "ट्रेनिंग जिम" बनाया है जिसमें कठिनाई के तीन स्तर हैं, जैसे कि एक वीडियो गेम:

  • स्तर 1: "कौन?" (मेमोरी टेस्ट)
    AI को बस गवाह को व्यक्ति का वर्णन सुनते हुए (जैसे, "काली शर्ट, छोटे बाल") सुनना होता है और डेटाबेस में मिलान करने वाली फोटो को ढूंढना होता है। यह परीक्षण करता है कि क्या AI भाषा को समझ सकता है।
  • स्तर 2: "कहाँ?" (भूलभुलैया)
    गवाह कहता है, "मैंने उन्हें वेयरहाउस में देखा।" लेकिन वेयरहाउस बहुत बड़ा है! AI को ऐसे फॉलो-अप सवाल पूछने होंगे जैसे, "क्या वह पिछले दरवाजे के पास था या सामने के दरवाजे के पास?" ताकि स्थान को सीमित किया जा सके।
  • स्तर 3: "कब?" (टाइम ट्रैवलर)
    गवाह कहता है, "मैंने उन्हें वेयरहाउस में देखा, और फिर 2 मिनट बाद लॉबी में देखा।" AI अपने जादुई नक्शे का उपयोग करके जाँच करता है: "कौन वेयरहाउस से लॉबी तक 2 मिनट में चल सकता था?" यह उन सभी को बाहर कर देता जो बहुत धीमे या बहुत तेज़ थे।

4. यह कठिन क्यों है? (द "ह्यूमन" प्रॉब्लम)

पेपर में पाया गया कि यहाँ तक कि उन्नत चैटबॉट्स को चलाने वाले स्मार्ट AI मॉडल भी संघर्ष करते हैं। क्यों?

  • "अनिश्चितता" का जाल: वास्तविक गवाह ऐसी बातें कहते हैं जैसे, "मुझे लगता है कि वह नीला था, शायद बैंगनी?" या "मैं पक्का नहीं हूँ।" AI को अनुमान लगाना पड़ता है कि गवाह का क्या मतलब है।
  • "रणनीति" की समस्या: यदि AI पहले गलत सवाल पूछता है (जैसे, जूतों के रंग के बारे में पूछना जब गवाह को जूतों की याद ही नहीं है), तो वह समय बर्बाद करता है। सर्वश्रेष्ठ AI एजेंट सबसे महत्वपूर्ण सवाल पहले पूछना सीखते हैं।
  • "नक्शे" की आवश्यकता: पेपर ने दिखाया कि यदि आप "जादुई नक्शे" (चलने के समय की जाँच करने वाला टूल) को हटा देते हैं, तो AI का प्रदर्शन गिर जाता है। यह साबित करता है कि तर्क और भौतिक विज्ञान उतने ही महत्वपूर्ण हैं जितना कि चेहरों को पहचानना।

बड़ी तस्वीर

ARGOS एक बड़ी उपलब्धि है क्योंकि यह निगरानी को केवल "एक फोटो लेने और उसे मिलाने" के रूप में नहीं, बल्कि एक बातचीत और पहेली के रूप में देखता है।

यह कंप्यूटर को सिखाता है:

  1. सुराग प्राप्त करने के लिए मनुष्यों से बात करना
  2. स्थान (चीजें कहाँ हैं) के बारे में सोचना
  3. समय (चीजों में कितना समय लगता है) के बारे में सोचना

यह एक सुरक्षा गार्ड को अपग्रेड करने जैसा है जो केवल मॉनिटर को घूरता रहता है, बजाय एक ऐसे शरलॉक होम्स के जो इमारत के लेआउट को समझता है, मानव व्यवहार को समझता है, और भले ही गवाह विवरणों के बारे में अस्पष्ट हो, सत्य का निष्कर्ष निकाल सकता है।

मुख्य बात: सिस्टम अभी सीख रहा है (यह अभी भी पूर्ण नहीं है!), लेकिन यह साबित करता है कि सुरक्षा और खोज के भविष्य के लिए, हमें ऐसे AI की आवश्यकता है जो तर्क (reason) कर सके, न कि केवल पहचान (recognize)

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →