← नवीनतम पेपर
💬 NLP

How important is Recall for Measuring Retrieval Quality?

यह शोध पत्र उन वास्तविक सेटिंग्स में रिट्रीवल गुणवत्ता को मापने की चुनौती को संबोधित करता है जहाँ प्रासंगिक दस्तावेजों की कुल संख्या अज्ञात होती है, जिसमें मौजूदा रणनीतियों का LLM-आधारित प्रतिक्रिया निर्णयों के विरुद्ध मूल्यांकन किया गया है और एक नए, प्रभावी मीट्रिक का प्रस्ताव दिया गया है जिसके लिए पूर्ण रिकॉल सेट के ज्ञान की आवश्यकता नहीं है।

मूल लेखक: Shelly Schwartz, Oleg Vasilyev, Randy Sawaya

प्रकाशित 2026-05-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shelly Schwartz, Oleg Vasilyev, Randy Sawaya

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शेफ हैं जो ग्राहक के लिए एक बेहतरीन भोजन (LLM रिस्पॉन्स) बनाने की कोशिश कर रहे हैं। ऐसा करने के लिए, आप अपने 'सू-शेफ' (रिट्रीवल सिस्टम) को 'पेंट्री' (नॉलेज बेस) में भेजते हैं ताकि वह उन विशिष्ट सामग्रियों (डॉक्यूमेंट्स) की एक सूची ला सके जो ग्राहक के प्रश्न का उत्तर देने में मदद करेंगी।

समस्या क्या है? आपको यह नहीं पता कि पूरी पेंट्री में कुल कितने उपयोगी सामग्रियाँ मौजूद हो सकती हैं। आप केवल उतना ही जानते हैं जितना आपका सू-शेफ टोकरी में वापस लेकर आया है।

यह शोध पत्र एक सरल प्रश्न पूछता है: हम यह कैसे जानें कि सू-शेफ ने अच्छा काम किया या नहीं, यदि हमें यह नहीं पता कि उपलब्ध कुल अच्छी सामग्रियों की संख्या कितनी है?

पुराना तरीका बनाम नया तरीका

पुराना तरीका (द "F-मेजर"):
पारंपरिक रूप से, सू-शेफ को ग्रेड देने के लिए, आपको पूरी पेंट्री में मौजूद सभी उत्तम सामग्रियों की कुल संख्या (NpN_p) जानने की आवश्यकता थी।

  • प्रिसिजन (Precision): क्या शेफ ने ज्यादातर अच्छी चीजें चुनीं?
  • रिकॉल (Recall): क्या शेफ ने उपलब्ध सभी अच्छी चीजों को इकट्ठा कर लिया?
  • समस्या: एक वास्तविक, अव्यवस्थित पेंट्री में, आप पूरी पेंट्री की हर एक अच्छी सामग्री को गिन नहीं सकते। आपको कुल संख्या का पता नहीं होता। इसलिए, आप "रिकॉल" की गणना नहीं कर सकते, और बिना इसके, पारंपरिक ग्रेड (F-मेजर) को सटीक रूप से कंप्यूट करना असंभव है।

नया तरीका (द "T-मेजर"):
लेखक एक नया, सरल ग्रेडिंग सिस्टम प्रस्तावित करते हैं जिसे T कहा जाता है।

  • यह पूछने के बजाय कि, "क्या आपने सब कुछ ढूंढ लिया?" (जिसे आप जान नहीं सकते), T पूछता है, "क्या आप उपयोगी चीजों और बेकार कचरे का एक अच्छा मिश्रण वापस लाए हैं?"
  • यह केवल उस टोकरी को देखता है जो शेफ वापस लाया है (शीर्ष KK डॉक्यूमेंट्स)। यह देखता है कि उसमें कितनी अच्छी चीजें हैं बनाम कितनी खराब चीजें हैं।
  • उपमा: कल्पना कीजिए कि आप एक छात्र को परीक्षा के लिए ग्रेड दे रहे हैं। पुराने तरीके के लिए आपको यह जानने की आवश्यकता है कि पूरी परीक्षा में कुल कितने प्रश्न थे ताकि आप उनका स्कोर निकाल सकें। नया तरीका (T) केवल उनके द्वारा दिए गए उत्तरों को देखता है और उन्हें सही बनाम गलत के आधार पर ग्रेड देता है, बिना यह जाने कि कुल परीक्षा का आकार क्या था।

उन्होंने क्या किया

शोधकर्ताओं ने एक विशाल प्रयोग आयोजित किया:

  1. टेस्ट किचन: उन्होंने विभिन्न प्रकार की "पेंट्रीज़" (ArXiv वैज्ञानिक पेपर, HotpotQA और MSMARCO जैसे डेटासेट) का उपयोग किया।
  2. सू-शेफ: उन्होंने सामग्रियों को चुनने के लिए अलग-अलग AI टूल्स (एम्बेडिंग मॉडल्स) का उपयोग किया।
  3. हेड शेफ: उन्होंने वास्तव में भोजन पकाने के लिए (उत्तर उत्पन्न करने के लिए) एक शक्तिशाली AI (LLM) का उपयोग किया, जिसमें सू-शेफ द्वारा लाई गई सामग्रियों का उपयोग किया गया।
  4. टेस्ट ऑफ टेस्ट (स्वाद परीक्षण): उन्होंने पके हुए भोजन की तुलना एक "परफेक्ट मील" (जो सभी संभावित अच्छी सामग्रियों का उपयोग करके बनाया गया था) से की और उसे 1 से 5 तक का स्कोर दिया।

फिर, उन्होंने जांच की: क्या नया "T" ग्रेड, पुराने "F" ग्रेड या अन्य ग्रेड की तुलना में "टेस्ट ऑफ टेस्ट" स्कोर के साथ बेहतर मेल खाता है?

निष्कर्ष (द "टेस्ट ऑफ टेस्ट" परिणाम)

  1. "T" स्कोर एक बेहतरीन विकल्प है:
    नया "T" मेजर, पुराने "F" मेजर की तरह लगभग उतना ही अच्छा काम करता है, भले ही "T" को पेंट्री में कुल सामग्रियों की संख्या जानने की आवश्यकता नहीं है। यह वास्तविक दुनिया की स्थितियों के लिए एक व्यावहारिक, उपयोग में आसान उपकरण है जहाँ आपके पास पेंट्री का पूरा नक्शा नहीं होता।

  2. क्रम मायने रखता है (एक "nDCG" सरप्राइज):
    वहाँ एक अन्य मीट्रिक था जिसे nDCG कहा जाता है, जो सामग्रियों के क्रम (जैसे, क्या शेफ ने सबसे अच्छे मसाले ऊपर रखे?) पर ध्यान देता है।

  • परिणाम: सरल सामग्रियों (जैसे छोटे वाक्य) के लिए, क्रम ज्यादा मायने नहीं रखता था। लेकिन जटिल, कठिन सामग्रियों (जैसे घने वैज्ञानिक पेपर) के लिए, क्रम बहुत महत्वपूर्ण हो गया। यदि शेफ ने सबसे अच्छी चीजें ऊपर रखीं, तो AI शेफ ने बेहतर भोजन पकाया। इन विशिष्ट, कठिन मामलों में, nDCG कभी-कभी अन्य मीट्रिक्स से बेहतर था।
  1. "एस्टिमेट" (अनुमान) का तरीका:
    उन्होंने एक बीच का रास्ता अपनाया: शेफ द्वारा लाई गई पहली 2 टोकरियों को देखकर कुल सामग्रियों का अनुमान लगाना। आश्चर्यजनक रूप से, यह "अनुमान" कभी-कभी सटीक कुल संख्या जानने से भी बेहतर काम करता था।
  • क्यों? जो सामग्रियाँ शेफ ने सबसे पहले पाईं (शीर्ष 2 टोकरियों में), वे AI शेफ के लिए सबसे महत्वपूर्ण होने की संभावना थी। सूची में नीचे की सामग्रियाँ कम महत्वपूर्ण थीं। इसलिए, "कुल" को गिनने के बजाय "सर्वश्रेष्ठ" को गिनना वास्तव में अधिक उपयोगी था।
  1. अनुपात (Ratio) ही कुंजी है:
    सबसे महत्वपूर्ण कारक यह नहीं था कि सू-शेफ ने किस टूल का उपयोग किया, बल्कि टोकरी के आकार और कुल अच्छी सामग्रियों के बीच का अनुपात था।
  • यदि टोकरी बहुत छोटी है, तो AI शेफ महत्वपूर्ण जानकारी मिस कर देता है।
  • यदि टोकरी में बहुत अधिक कचरा है, तो AI शेफ भ्रमित हो जाता है।
  • एक "स्वीट स्पॉट" (सही बिंदु) होता है जहाँ टोकरी का आकार कार्य की जटिलता से मेल खाता है।

मुख्य निष्कर्ष

एक ऐसी दुनिया में जहाँ हम एक विशाल डेटाबेस में हर एक प्रासंगिक डॉक्यूमेंट की गिनती नहीं कर सकते, रिट्रीवल की गुणवत्ता को आंकने के लिए आपको कुल संख्या जानने की आवश्यकता नहीं है।

लेखक सरल "T" मेजर का उपयोग करने का सुझाव देते हैं। यह अज्ञात कुल संख्या को अनदेखा करता है, प्राप्त किए गए विशिष्ट डॉक्यूमेंट्स के बैच की गुणवत्ता पर ध्यान केंद्रित करता है, और इस बात के साथ बहुत अच्छा तालमेल रखता है कि एक AI वास्तव में प्रश्न का उत्तर कितनी अच्छी तरह देता है। यह एक अव्यवस्थित, वास्तविक दुनिया की रसोई के लिए एक व्यावहारिक, "काफी अच्छा" पैमाना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →