← नवीनतम पेपर
💬 NLP

Autofocus Retrieval: An Effective Pipeline for Multi-Hop Question Answering With Semi-Structured Knowledge

यह शोध पत्र ऑटोफोकस-रिट्रीवर (AF-Retriever) को प्रस्तुत करता है, जो एक मॉड्यूलर फ्रेमवर्क है जो एक नवीन हाइब्रिड रिट्रीवल और रीरैंकिंग पाइपलाइन के माध्यम से संरचित और असंरचित ज्ञान को प्रभावी ढंग से जोड़ता है, और लार्ज लैंग्वेज मॉडल्स तथा इंक्रीमेंटल स्कोप एक्सपेंशन का लाभ उठाकर मल्टी-हॉप क्वेश्चन आंसरिंग बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करता है।

मूल लेखक: Derian Boer, Stephen Roth, Stefan Kramer

प्रकाशित 2026-05-15
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Derian Boer, Stephen Roth, Stefan Kramer

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल पुस्तकालय में बहुत ही विशिष्ट जानकारी खोजने की कोशिश कर रहे हैं। लेकिन यह एक सामान्य पुस्तकालय नहीं है। यह एक हाइब्रिड (मिश्रित) पुस्तकालय है: इसका आधा हिस्सा एक विशाल, व्यवस्थित फाइलिंग कैबिनेट है जिसमें सख्त नियम हैं (जैसे कि एक डेटाबेस), और दूसरा आधा हिस्सा बिना व्यवस्थित किताबों, लेखों और नोट्स का एक अराजक ढेर है (जैसे कि इंटरनेट)।

अधिकांश कंप्यूटर प्रोग्राम इसमें खराब होते हैं। वे या तो फाइलिंग कैबिनेट खोजने में बहुत अच्छे होते हैं लेकिन किताबों को छोड़ देते हैं, या वे किताबें पढ़ने में बहुत अच्छे होते हैं लेकिन फाइलिंग कैबिनेट में खो जाते हैं।

यह पेपर एक नई प्रणाली पेश करता है जिसे AF-Retriever (ऑटोफोकस-रिट्रीवर) कहा जाता है। इस लाइब्रेरियन (पुस्तकालयाध्यक्ष) के बारे में सोचें जिसके पास एक विशेष कैमरा लेंस है जो "ऑटोफोकस" को पूरी तरह से सेट कर सकता है, चाहे आपका सुराग फाइलिंग कैबिनेट की ओर इशारा करता हो या किताबों के ढेर की ओर।

यह लाइब्रेरियन कैसे काम करता है, यहाँ सरल उपमाओं (analogies) का उपयोग करके चरण-दर-चरण बताया गया है:

1. "हम क्या खोज रहे हैं?" का अनुमान (टारगेट टाइप प्रेडिक्शन)

सबसे पहले, आप एक प्रश्न पूछते हैं जैसे, "2015 में RNA के बारे में पेपर किसने लिखा था?"
लाइब्रेरियन बिना किसी अंधेरे में तीर चलाए खोजना शुरू नहीं करता है। पहले, वह उत्तर की श्रेणी (category) का अनुमान लगाता है। वह सोचता है, "आह, उत्तर एक पेपर होना चाहिए, न कि कोई व्यक्ति या विश्वविद्यालय।" यह खोज को तुरंत सीमित कर देता है, जैसे कि आप वास्तव में अंदर जाने से पहले दरवाजे पर "केवल किताबें" का साइन बोर्ड लगा दें।

2. आपके प्रश्न को "फाइलिंग कैबिनेट की भाषा" में अनुवाद करना (साइफर एक्सट्रैक्शन)

आपका प्रश्न स्वाभाविक अंग्रेजी में है। फाइलिंग कैबिनेट एक सख्त कोड बोलता है जिसे "साइफर" (Cypher) कहा जाता है।
लाइब्रेरियन आपके अंग्रेजी प्रश्न को इस सख्त कोड में अनुवाद करने के लिए एक लार्ज लैंग्वेज मॉडल (एक बहुत ही स्मार्ट AI) का उपयोग करता है। यह एक अनौपचारिक अनुरोध ("मुझे एक लाल कार ढूंढ कर दो") को एक सटीक डेटाबेस कमांड (SELECT * FROM cars WHERE color = 'red') में अनुवाद करने जैसा है।

  • खास बात: पेपर का दावा है कि यह AI इतना अच्छा है कि इसे इस कार्य के लिए विशेष रूप से सिखाने (ट्रेन करने) की आवश्यकता नहीं है। यह बस इसे "समझ" जाता है।

3. "ऑटोफोकस" ज़ूम (इन्क्रीमेंटल स्कोप एक्सपेंशन)

यह इस पेपर की सबसे अनूठी तकनीक है।
कल्पना कीजिए कि आप "मियामी यूनिवर्सिटी" की तलाश कर रहे हैं। आप इसे टाइप करते हैं, लेकिन सिस्टम तीन चीजें पाता है: "यूनिवर्सिटी ऑफ मियामी," "मियामी यूनिवर्सिटी," और "मियामी डैड कॉलेज।"

  • पुराना तरीका: सिस्टम शायद इनमें से एक को चुन लेगा और उम्मीद करेगा कि वह सही हो, या तीनों को चुन लेगा और भ्रमित हो जाएगा।
  • AF-Retriever का तरीका: यह केवल एक उम्मीदवार (candidate) के साथ शुरू करता है। यह जाँचता है कि क्या वह उम्मीदवार सभी नियमों (जैसे, "क्या उन्होंने 2015 में एक पेपर लिखा था?") में फिट बैठता है। यदि नहीं, तो यह अगले उम्मीदवार को शामिल करने के लिए थोड़ा ज़ूम आउट करता है। यह सही संख्या में उत्तरों को खोजने के लिए अपने फोकस को तब तक बढ़ाता रहता है जो सभी नियमों के अनुकूल हों। यह बहुत अधिक सख्त होने (उत्तर चूक जाने) और बहुत अधिक ढीला होने (गलत उत्तर बहुत अधिक मिलने) के बीच संतुलन बनाता है।

4. दो-ट्रैक खोज (हाइब्रिड रिट्रीवल)

लाइब्रेरियन एक ही समय में दो खोजें चलाता है:

  • ट्रैक A (लॉजिक ट्रैक): तार्किक नियमों (जैसे, "पेपर होना चाहिए, 2015 का होना चाहिए") के अनुसार उत्तर खोजने के लिए सख्त "साइफर" कोड का उपयोग करता है।
  • ट्रैक B (इंट्यूशन ट्रैक): "वेक्टर सिमिलैरिटी" का उपयोग करता है। यह ऐसा है जैसे लाइब्रेरियन से पूछना, "मुझे वे चीजें दिखाएं जो शब्दों के आधार पर उत्तर की तरह महसूस होती हैं।" यह शब्दों की समानता का उपयोग करके किताबों के ढेर और डेटाबेस दोनों में खोज करता है।
  • मर्ज (विलय): यह दोनों ट्रैक्स से सर्वोत्तम परिणाम लेता है और उन्हें जोड़ता है। यदि लॉजिक ट्रैक को एक पेपर मिलता है लेकिन इंट्यूशन ट्रैक को एक अलग पेपर मिलता है, तो सिस्टम सुरक्षित रहने के लिए दोनों को रखता है।

5. अंतिम समीक्षा (LLM रेंकिंग)

अब लाइब्रेरियन के पास 20 संभावित उत्तरों की एक सूची है। वे अभी तक सही क्रम में नहीं हैं।
लाइब्रेरियन (फिर से AI का उपयोग करके) प्रश्न और 20 उत्तरों को अगल-बगल से पढ़ता है। यह एक जज की तरह कार्य करता है, जो कहता है, "ठीक है, उत्तर #3 वास्तव में सबसे अच्छा फिट है, भले ही वह सूची में #15 पर था। आइए इसे शीर्ष पर ले चलें।"
इस निर्णय लेने के लिए पेपर ने तीन तरीकों का परीक्षण किया:

  • पॉइंटवाइज (Pointwise): प्रत्येक उत्तर का एक-एक करके न्याय करना।
  • पेयरवाइज (Pairwise): एक समय में दो उत्तरों की तुलना करना ("A बेहतर है या B?")।
  • लिस्टवाइज (Listwise): सभी 20 को एक साथ देखना और उन्हें क्रमबद्ध करना।
    उन्होंने पाया कि उन्हें जोड़ों (Pairs) में तुलना करने से आमतौर पर सबसे अच्छे परिणाम मिलते हैं, हालांकि इसमें थोड़ा अधिक समय लगता है।

यह पेपर क्यों महत्वपूर्ण है?

लेखकों ने इस प्रणाली का परीक्षण तीन अलग-अलग वास्तविक "लाइब्रेरी" (मेडिकल डेटा, शैक्षणिक पेपर और अमेज़न उत्पाद समीक्षा) पर किया।

  • परिणाम: AF-Retriever ने हर अन्य "जीरो-शॉट" सिस्टम (वे सिस्टम जिन्हें पहले से किसी विशिष्ट डेटा पर प्रशिक्षित नहीं किया गया था) को पछाड़ दिया। इसने अन्य किसी भी सिस्टम की तुलना में पहली बार में ही सही उत्तर खोजने में बहुत अधिक सफलता प्राप्त की।
  • "जीरो-शॉट" का जादू: अधिकांश प्रणालियों को उस विशिष्ट विषय पर काम करने के लिए हजारों उदाहरणों के साथ सिखाने की आवश्यकता होती है। AF-Retriever बिना किसी अतिरिक्त प्रशिक्षण के सीधे काम करता है। यह एक ऐसे लाइब्रेरियन की तरह है जो एक नए पुस्तकालय में जा सकता है और बिना किसी ट्रेनिंग मैनुअल के तुरंत सही किताबें ढूंढना शुरू कर सकता है।

कमी (सीमाएं)

पेपर स्वीकार करता है कि जबकि यह सामान्य कार्यों के लिए अद्भुत है, यह अभी भी अत्यंत जटिल, विशिष्ट चिकित्सा डेटा के साथ संघर्ष करता है जहाँ "नियम" बहुत भ्रमित करने वाले होते हैं। उन विशिष्ट मामलों में, एक प्रणाली जिसे विशेष रूप से उस चिकित्सा डेटा पर प्रशिक्षित किया गया है (जैसे कि एक विशेषज्ञ रेजिडेंट), अभी भी थोड़ा बेहतर प्रदर्शन करती है।

संक्षेप में: AF-Retriever एक स्मार्ट, मॉड्यूलर पाइपलाइन है जो सख्त तर्क (फाइलिंग कैबिनेट) को लचीली अंतर्दृष्टि (किताबें पढ़ना) के साथ जोड़ती है। यह सही उत्तरों को खोजने के लिए "ऑटोफोकस" रणनीति का उपयोग करता है और फिर उन्हें रैंक करने के लिए एक अंतिम "जज" का उपयोग करता है, और यह सब बिना किसी नए विषय के लिए विशेष रूप से सीखे बिना किया जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →