← नवीनतम पेपर
🤖 AI

OBLIQ-Bench: Exposing Overlooked Bottlenecks in Modern Retrievers with Latent and Implicit Queries

यह शोधपत्र OBLIQ-Bench प्रस्तुत करता है, जो एक बेंचमार्क सुइट है जिसे आधुनिक प्रणालियों की पुनर्प्राप्ति (retrieval) और सत्यापन (verification) क्षमताओं के बीच के महत्वपूर्ण अंतर को उजागर करने के लिए डिज़ाइन किया गया है, जो उन "तिरछी" (oblique) क्वेरीज़ पर उनके प्रदर्शन का मूल्यांकन करता है जिनमें अंतर्निहित पैटर्न या निहित संकेतों से मेल खाने वाले दस्तावेज़ों की पहचान करने की आवश्यकता होती है।

मूल लेखक: Diane Tchuindjo, Devavrat Shah, Omar Khattab

प्रकाशित 2026-06-01
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Diane Tchuindjo, Devavrat Shah, Omar Khattab

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप घास के एक विशाल ढेर में एक विशिष्ट सुई की तलाश कर रहे हैं। लेकिन यहाँ एक ट्विस्ट है: आप यह नहीं जानते कि वह सुई कैसी दिखती है, आप केवल यह जानते हैं कि वह "कैसा महसूस" करती है, या उसका उपयोग किसी विशिष्ट, अजीब स्थिति में किया गया था।

यह शोध पत्र, OBLIQ-Bench, तर्क देता है कि जबकि आधुनिक खोज इंजन (search engines) उन सुइयों को खोजने में अविश्वसनीय रूप से कुशल हो रहे हैं जो आपके दिए गए विवरण से बिल्कुल मेल खाती हैं, वे उन सुइयों को खोजने में बेहद खराब हैं जिन्हें खोजने के लिए आपको उसके पीछे की स्थिति को समझने की आवश्यकता होती है।

यहाँ सरल उपमाओं का उपयोग करके इसका विवरण दिया गया है:

1. समस्या: "तिरछी" (Oblique) खोज

लेखक एक अवधारणा पेश करते हैं जिसे वे "Oblique Queries" कहते हैं।

  • सामान्य खोज: आप पूछते हैं, "मुझे एक लाल कार ढूंढ कर दो।" खोज इंजन "लाल" और "कार" शब्दों को खोजता है। आसान है।
  • तिरछी (Oblique) खोज: आप पूछते हैं, "मुझे एक ऐसा ट्वीट ढूंढ कर दें जहाँ कोई इस बात पर कटाक्ष (sarcasm) कर रहा हो कि लोग युद्ध को एक वीडियो गेम की तरह कैसे देखते हैं।"
    • वह ट्वीट कभी भी "युद्ध," "वीडियो गेम," या "कटाक्ष" जैसे शब्दों का उपयोग नहीं करेगा। वह केवल यह कह सकता है, "वाह, खबरों में इन शानदार विस्फोटों को देखो, बिल्कुल नए गेम अपडेट की तरह!"
    • एक इंसान इसे पढ़कर तुरंत मजाक समझ जाएगा। लेकिन एक कंप्यूटर सर्च इंजन, जो कीवर्ड्स (keywords) को खोज रहा है, इसे पूरी तरह से मिस कर सकता है क्योंकि शब्द मेल नहीं खाते।

शोध पत्र इसे "Latent" (छिपी हुई) प्रासंगिकता कहता है। उत्तर वहीं है, लेकिन वह अर्थ, विडंबना (irony), या व्यवहार के एक विशिष्ट पैटर्न की एक परत के पीछे छिपा हुआ है जिसे सर्च इंजन केवल शब्दों को स्कैन करके नहीं देख सकता।

2. नया परीक्षण: OBLIQ-Bench

शोधकर्ताओं ने एक नया टेस्ट सूट बनाया जिसे OBLIQ-Bench कहा जाता है ताकि यह साबित किया जा सके कि वर्तमान खोज इंजन इन "छिपे हुए अर्थ" वाले कार्यों में विफल हो रहे हैं। उन्होंने पांच कठिन परिदृश्य बनाए:

  • "सूक्ष्म दृष्टिकोण" (ट्विटर): ऐसे ट्वीट्स ढूंढना जो बिना स्पष्ट रूप से कहे किसी स्थिति का मजाक उड़ाते हैं।
  • "ग्लिच हंटर" (चैट लॉग्स): ऐसी बातचीत ढूंढना जहाँ एक AI ने एक नियम (जैसे फॉर्मेटिंग त्रुटि) तोड़ा और उसे ठीक नहीं किया, भले ही चैट लॉग में "मैंने गलती की" न लिखा हो।
  • "मैथ ट्विन" (गणित की समस्याएं): एक ऐसी गणितीय समस्या ढूंढना जो आपके प्रश्न के समान ही लॉजिक ट्रिक (तर्क युक्ति) का उपयोग करती है, भले ही एक ज्यामिति (geometry) के बारे में हो और दूसरा संख्याओं के बारे में।
  • "स्टाइल डिटेक्टिव" (लेखन): उसी लेखक द्वारा लिखा गया पैराग्राफ ढूंढना जिसका नमूना आपके पास है, भले ही वे पूरी तरह से अलग विषयों पर लिख रहे हों (जैसे एक कोडिंग के बारे में और दूसरा बागवानी के बारे में)।
  • "धुंधली याददाश्त" (कांग्रेस): आपको सरकारी सुनवाई का एक अजीब क्षण याद है (जैसे एक सीनेटर ने एक मजाक किया जो पूछताछ में बदल गया), लेकिन आपको नाम या तारीखें याद नहीं हैं। आप बस उस वाइब (vibe) को याद करते हैं। क्या सर्च इंजन उस सटीक क्लिप को ढूंढ सकता है?

3. बड़ी खोज: "रिट्रीवल बनाम वेरिफिकेशन" का अंतर

यह इस शोध पत्र की सबसे महत्वपूर्ण खोज है। शोधकर्ताओं ने दो-भाग वाला प्रयोग चलाया:

  1. खोज (Retrieval): उन्होंने मानक खोज इंजनों (और उन्नत AI एजेंटों तक) से सही दस्तावेज़ खोजने के लिए कहा। परिणाम: वे बुरी तरह विफल रहे। उन्हें अक्सर 0% सही उत्तर मिले।
  2. जांच (Verification): उन्होंने दस्तावेजों का एक बड़ा ढेर लिया (जिसमें हजारों गलत दस्तावेजों के बीच सही दस्तावेज़ भी मिले हुए थे) और एक सुपर-स्मार्ट AI ("रीजनिंग मॉडल") से उन्हें बस पढ़ने और सही वाले चुनने के लिए कहा। परिणाम: सुपर-स्मार्ट AI ने लगभग सब कुछ सही पहचाना।

उपमा:
कल्पना कीजिए कि एक लाइब्रेरियन है जो एक अस्पष्ट विवरण के आधार पर शेल्फ से किताबें खोजने में बहुत बुरा है (खोज/Search)। लेकिन यदि आप उसी लाइब्रेरियन को 1,000 किताबों का ढेर थमा दें और कहें, "इनमें से वही है जिसके बारे में मैं सोच रहा हूँ," तो वह उनके कवर को पढ़कर तुरंत सही किताब चुन सकता है (सत्यापन/Verification)।

शोध पत्र इसे "Retrieval-Verification Asymmetry" कहता है। समस्या यह नहीं है कि उत्तर मौजूद नहीं है या यह समझना बहुत कठिन है; समस्या यह है कि सर्च इंजन उस उत्तर को सबसे ऊपर की सूची में लाने में ही विफल रहता है।

4. वर्तमान तकनीक क्यों विफल होती है

शोध पत्र ने कई अलग-अलग प्रकार के खोज सिस्टम का परीक्षण किया:

  • कीवर्ड सर्च (BM25): विफल रहा क्योंकि शब्द मेल नहीं खाते थे।
  • स्मार्ट एम्बेडिंग्स (Dense Retrievers): विफल रहे क्योंकि वे "वाइब" या छिपे हुए तर्क को नहीं समझ सके।
  • AI एजेंट्स (Multi-hop search): ये AI बॉट्स हैं जो उत्तर खोजने के लिए फॉलो-अप प्रश्न पूछने की कोशिश करते हैं। उन्होंने कुछ कार्यों (जैसे धुंधली याददाश्त) पर थोड़ी मदद की, लेकिन अन्य कार्यों (जैसे लेखन शैली ढूंढना) पर वास्तव में चीजें और खराब कर दीं, क्योंकि वे विषय (topic) से विचलित हो गए बजाय शैली (style) के।

5. निष्कर्ष

लेखक यह नहीं कह रहे हैं कि खोज हमेशा के लिए टूट गई है। वे कह रहे हैं कि हमने वर्तमान तरीकों के साथ एक दीवार से टकरा लिया है।

हमने ऐसे सर्च इंजन बनाए हैं जो शब्दों और सतही अर्थों को मिलाने में बेहतरीन हैं। लेकिन उन चीजों को खोजने के लिए जो छिपे हुए पैटर्न, विडंबना, अमूर्त तर्क, या विशिष्ट व्यवहार संबंधी ग्लिच पर निर्भर करती हैं, हमें एक नए प्रकार के सर्च आर्किटेक्चर की आवश्यकता है। हमें ऐसे सिस्टम की आवश्यकता है जो दस्तावेज़ और क्वेरी को एक साथ "पढ़" सकें ताकि छिपे हुए संबंध को समझा जा सके, न कि केवल कीवर्ड्स को मिला सकें।

संक्षेप में: वर्तमान खोज इंजन ऐसे व्यक्ति की तरह हैं जो केवल बॉक्स पर लगे लेबल को पढ़कर चीजें ढूंढ सकते हैं। OBLIQ-Bench दिखाता है कि कभी-कभी, आप जिस चीज़ की तलाश कर रहे हैं वह पूरी तरह से अलग लेबल वाले बॉक्स के अंदर होती है, और आपको बॉक्स को हिलाकर उसके अंदर की आवाज़ सुनने की ज़रूरत होती है। वर्तमान सर्च इंजन अभी ऐसा नहीं कर सकते।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →