← नवीनतम पेपर
💬 NLP

InterLV-Search: Benchmarking Interleaved Multimodal Agentic Search

यह शोध पत्र InterLV-Search प्रस्तुत करता है, जो इंटरलीव्ड मल्टीमॉडल एजेंटिक सर्च के लिए एक व्यापक बेंचमार्क और मूल्यांकन ढांचा है, जो सक्रिय खोज (active seeking), नियंत्रित ऑफलाइन (controlled offline), और ओपन-वेब सर्च परिदृश्यों में टेक्स्टुअल और विजुअल साक्ष्यों को गतिशील रूप से एकीकृत करने की प्रणालियों की क्षमता में महत्वपूर्ण वर्तमान सीमाओं को उजागर करता है।

मूल लेखक: Bohan Hou, Jiuning Gu, Jiayan Guo, Ronghao Dang, Sicong Leng, Xin Li, Xuemeng Song, Jianfei Yang

प्रकाशित 2026-05-11
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bohan Hou, Jiuning Gu, Jiayan Guo, Ronghao Dang, Sicong Leng, Xin Li, Xuemeng Song, Jianfei Yang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जटिल रहस्य को सुलझाने की कोशिश कर रहे हैं, जैसे कि सुरागों की एक श्रृंखला के आधार पर किसी विशिष्ट व्यक्ति को ढूंढना।

पुराना तरीका (पिछले बेंचमार्क):
वर्तमान में अधिकांश AI "जासूस" इस तरह प्रशिक्षित होते हैं: आप उन्हें संदिग्ध की एक फोटो देते हैं और पूछते हैं, "यह कौन है?" या "इसकी टोपी का रंग क्या है?" AI उस फोटो को देखता है और उत्तर देता है। यदि फोटो पर्याप्त नहीं है, तो AI उस व्यक्ति के बारे में टेक्स्ट खोजने के लिए इंटरनेट का उपयोग कर सकता है, लेकिन वह फोटो को केवल एक शुरुआती बिंदु या अंतिम उत्तर के रूप में मानता है। वह शायद ही कभी अपनी जांच के बीच में मिली किसी फोटो का उपयोग अपनी दिशा बदलने के लिए करता है। यह एक ऐसे जासूस की तरह है जो अपराध स्थल की फोटो देखता है, फिर बस अखबार का लेख पढ़ता है, और कभी यह महसूस नहीं कर पाता कि अखबार के तीसरे पन्ने पर मिली एक नई फोटो वास्तव में उसे एक पूरी तरह से अलग शहर की ओर इशारा करती है।

नया तरीका (InterLV-Search):
इस शोध पत्र के लेखकों ने एक नया प्रशिक्षण मैदान (एक बेंचमार्क) बनाया है ताकि यह परीक्षण किया जा सके कि क्या AI कुछ बहुत कठिन कार्य कर सकता है: इंटरलीव्ड मल्टीमॉडल एजेंटिक सर्च (Interleaved Multimodal Agentic Search)।

इसे एक ऐसे जासूस के रूप में सोचें जिसे केस सुलझाने के लिए लगातार मानचित्रों (टेक्स्ट) और तस्वीरों (इमेज) को देखने के बीच स्विच करना पड़ता है।

  • ट्विस्ट: AI को एक फोटो मिलती है, वह उसे देखता है, और उसे एहसास होता है, "ओह! इस इमारत में बने इस लोगो से मुझे पता चलता है कि मुझे एक विशिष्ट ब्रांड नाम के लिए खोजना चाहिए।" वह उस ब्रांड को खोजता है, एक कार की नई फोटो पाता है, एक लाइसेंस प्लेट देखता है, और वह प्लेट उसे एक विशिष्ट शहर खोजने के लिए कहती है।
  • लक्ष्य: फोटो केवल उत्तर नहीं है; फोटो एक स्टीयरिंग व्हील है। यह AI को बताता है कि आगे कहाँ जाना है।

कठिनाई के तीन स्तर

यह पेपर AI का तीन स्तरों पर परीक्षण करता है, जैसे कि एक वीडियो गेम में बढ़ती कठिनाई होती है:

  1. स्तर 1: "तस्वीर खोजो" चुनौती।

    • कार्य: AI को एक टेक्स्ट विवरण दिया जाता है जैसे, "उस खेल को खोजें जिसमें यह समुद्री डाकू वाला जहाज (pirate ship) है।" उसे यह पता लगाना होगा कि वह जहाज क्या है, उसे खोजना होगा, इमेज ढूंढनी होगी, और फिर इमेज के बारे में एक प्रश्न का उत्तर देना होगा (जैसे, "वह जहाज किस इंजन का उपयोग करता है?")।
    • रूपक: आपको एक छिपी हुई वस्तु के बारे में एक पहेली दी गई है। आपको पहेली का उत्तर देने से पहले उस वस्तु को खोजना होगा।
  2. स्तर 2: "नियंत्रित भूलभुलैया" चुनौती।

    • कार्य: AI एक बंद कमरे (एक नियंत्रित ऑफलाइन डेटाबेस) में एक मानचित्र के साथ है। वह एक टेक्स्ट सुराग से शुरू करता है, एक तस्वीर पाता है, तस्वीर एक नया सुराग देती है, वह एक और तस्वीर पाता है, और इसी तरह चलता रहता है।
    • रूपक: एक स्कैवेंजर हंट (खजाने की खोज) की कल्पना करें जहाँ लाल दरवाजे की तस्वीर मिलने से आपको नीली कार के बारे में टेक्स्ट सुराग मिलता है, जो आपको एक पीले पक्षी की तस्वीर तक ले जाता है। AI को कार को खोजने के लिए दरवाजे की तस्वीर का उपयोग करने के लिए मजबूर होना चाहिए। यदि वह फोटो को अनदेखा करता है और केवल टेक्स्ट पढ़ना जारी रखता है, तो वह भटक जाएगा।
  3. स्तर 3: "वाइल्ड इंटरनेट" चुनौती।

    • कार्य: अब AI वास्तविक, अस्त-व्यस्त इंटरनेट में है। उसे सुराग खोजने होंगे, फोटो खोजने होंगे, यह समझना होगा कि कुछ फोटो नकली या अप्रासंगिक हैं, और विभिन्न रास्तों की तुलना करनी होगी (जैसे, "क्या वह फिल्म 60 मिनट की है या 90 मिनट की?") और सही रास्ता चुनना होगा।
    • रूपक: यह एक ऐसे जासूस की तरह है जो इंटरनेट का उपयोग करके केस सुलझाने की कोशिश कर रहा है। उसे लाखों वेबसाइटों को छानना होगा, जिनमें खराब फोटो या गलत तारीखें हो सकती हैं, और यह तय करना होगा कि वे क्या देखें और किस रास्ते का अनुसरण करें।

उन्होंने क्या पाया?

लेखकों ने कई स्मार्ट AI मॉडल्स (जैसे GPT-5, Gemini, और Claude) का इस नए टेस्ट पर परीक्षण किया।

  • परिणाम: AI मॉडल्स वर्तमान में इस काम में बहुत खराब हैं। सबसे अच्छे मॉडल्स को भी 50% से कम उत्तर सही मिले।
  • समस्या: AI मॉडल्स टेक्स्ट पढ़ने में और एक एकल इमेज को देखने में बहुत अच्छे हैं। लेकिन वे कड़ियों को जोड़ने में संघर्ष करते हैं जब खोज के बीच में मिली एक तस्वीर को पूरे खोज प्लान को बदलने की आवश्यकता होती है। वे अक्सर टेक्स्ट खोजने में फंस जाते हैं जब उन्हें फोटो देखना चाहिए था, या वे फोटो को केवल एक "अंतिम जांच" के रूप में देखते हैं बजाय एक "नए सुराग" के।

टूलकिट (InterLV-Agent)

यह सुनिश्चित करने के लिए कि सभी एक ही नियमों के तहत खेल रहे हैं, लेखकों ने एक मानक "गेम कंट्रोलर" बनाया है जिसे InterLV-Agent कहा जाता है। यह टूल AI को वेब ब्राउज़र का उपयोग करने, इमेज खोजने, इमेज को क्रॉप करने और अब तक मिली चीजों का एक "नोटबुक" (मेमोरी) रखने की अनुमति देता है। यह सुनिश्चित करता है कि जब हम कहते हैं कि एक AI विफल रहा, तो वह इसलिए क्योंकि वह पहेली हल नहीं कर सका, न कि इसलिए कि उसके पास सही उपकरण नहीं थे।

सारांश

सरल शब्दों में, यह शोध पत्र कहता है: "हमने AI जासूसों के लिए एक नया, कठिन टेस्ट बनाया है। हमने पाया है कि हालांकि AI स्मार्ट हो रहा है, फिर भी यह खोज के दौरान मिली तस्वीरों का प्रभावी ढंग से उपयोग करके अपना निर्णय बदलने और अगला सुराग खोजने में सक्षम नहीं है। यह एक ऐसे जासूस की तरह है जो नक्शा पढ़ सकता है और फोटो देख सकता है, लेकिन यह नहीं समझ पाता कि फोटो वास्तव में उसे एक अलग रास्ता लेने के लिए कह रही है।"

लेखकों ने इस टेस्ट और टूल्स को जारी कर दिया है ताकि अन्य शोधकर्ता इस "इंटरलीव्ड" प्रकार की सोच वाले बेहतर AI बनाने का प्रयास कर सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →