← नवीनतम पेपर
💬 NLP

RARE: Redundancy-Aware Retrieval Evaluation Framework for High-Similarity Corpora

यह शोध पत्र RARE प्रस्तुत करता है, जो एक रेडंडेंसी-अवेयर (redundancy-aware) रिट्रीवल इवैल्यूएशन फ्रेमवर्क है जो दस्तावेजों को परमाणु तथ्यों (atomic facts) में विघटित करके और CRRF के साथ LLM-आधारित डेटा जनरेशन को उन्नत करके अत्यधिक समान कॉर्पोरा में मौजूदा QA बेंचमार्क की सीमाओं को संबोधित करता है, जो अंततः वित्तीय, कानूनी और पेटेंट डोमेन में नए RedQA बेंचमार्क के माध्यम से वर्तमान रिट्रीवर्स में महत्वपूर्ण मजबूती के अंतराल (robustness gaps) को प्रकट करता है।

मूल लेखक: Hanjun Cho, Jay-Yoon Lee

प्रकाशित 2026-04-22
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hanjun Cho, Jay-Yoon Lee

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक लाइब्रेरी में किसी विशिष्ट तथ्य को खोजने की कोशिश कर रहे हैं।

पुराना तरीका (मानक बेंचमार्क):
वर्तमान में AI सर्च इंजन के लिए अधिकांश परीक्षण एक ऐसी लाइब्रेरी की तरह हैं जहाँ हर किताब पूरी तरह से अलग विषय पर है। यदि आप पूछते हैं, "हैमलेट किसने लिखा था?", तो AI शेक्सपियर की किताब ढूँढ लेता है। यदि आप पूछते हैं, "फ्रांस की राजधानी क्या है?", तो वह फ्रांस की किताब ढूँढ लेता है। यहाँ कोई भ्रम नहीं है क्योंकि किताबें एक-दूसरे से बिल्कुल अलग दिखती हैं। AI को A+ मिलता है क्योंकि सही किताब चुनना बहुत आसान है।

वास्तविक दुनिया (समस्या):
लेकिन वास्तविक दुनिया में—जैसे कि एक लॉ फर्म, एक बैंक, या पेटेंट कार्यालय में—यह "लाइब्रेरी" एक दुःस्वप्न की तरह है। कल्पना कीजिए कि "बैटरी" के बारे में 1,000 किताबों वाला एक कमरा है। वे सभी लगभग एक जैसी दिखती हैं। वे सभी लगभग एक जैसी बातें कहती हैं, बस उनके शब्द थोड़े अलग हैं।

  • किताब A कहती है: "बैटरी 10 घंटे चलती है।"
  • किताब B कहती है: "बैटरी का जीवन लगभग 10 घंटे है।"
  • किताब C कहती है: "आप 10 घंटे के रनटाइम की उम्मीद कर सकते हैं।"
    यदि आप AI से पूछते हैं, "बैटरी कितनी देर तक चलती है?", और वह किताब B उठा लेता है, तो वह तकनीकी रूप से सही है! लेकिन पुराने परीक्षणों में, सिस्टम कह सकता है, "गलत! 'गोल्ड स्टैंडर्ड' उत्तर किताब A में था।" AI को गलत जानकारी मिलने के लिए दंडित किया जाता है, भले ही उसने सही जानकारी किसी दूसरी, लेकिन समान किताब में ढूँढ ली हो। यह AI को बुरा दिखाता है, भले ही वह बहुत अच्छा काम कर रहा हो।

समाधान: RARE
इस पेपर के लेखकों ने RARE (Redundancy-Aware Retrieval Evaluation) नामक एक नया फ्रेमवर्क बनाया है। RARE को एक नए तरीके के रूप में समझें जो AI को ग्रेड देता है और "मेसी लाइब्रेरी" (अव्यवस्थित लाइब्रेरी) की वास्तविकता को समझता है।

यहाँ बताया गया है कि RARE कैसे काम करता है, सरल उपमाओं का उपयोग करके:

1. "एटॉमिक फैक्ट" (परमाणु तथ्य) का विभाजन

पूरे दस्तावेज़ों (किताबों) को देखने के बजाय, RARE हर दस्तावेज़ को उसके सबसे छोटे, अविभाज्य लेगो ब्रिक्स (एटॉमिक फैक्ट्स) में तोड़ने के लिए एक जादुई सूक्ष्मदर्शी का उपयोग करता है।

  • पुराना तरीका: "यहाँ बैटरी के बारे में पूरा पैराग्राफ है।"
  • RARE का तरीका: "यहाँ वह विशिष्ट ईंट (ब्रिक) है जो कहती है '10 घंटे'।"
    इन नन्ही ईंटों को देखकर, RARE देख सकता है कि किताब A, किताब B और किताब C में बिल्कुल एक ही ईंट मौजूद है। यह AI को किसी दूसरी, लेकिन समान ईंट में सही ईंट ढूँढने के लिए अनुचित रूप से दंडित होने से रोकता है।

2. "CRRF" जज (विशेषज्ञों का पैनल)

इन परीक्षणों को बनाने के लिए, लेखकों ने प्रश्न उत्पन्न करने के लिए AI का उपयोग किया। लेकिन AI आलसी है; यह अक्सर उबाऊ या भ्रमित करने वाले प्रश्न लिखता है।
इसे ठीक करने के लिए, उन्होंने CRRF का आविष्कार किया। कल्पना कीजिए कि आप एक शेफ को काम पर रख रहे हैं।

  • आलसी तरीका: आप एक जज से पूछते हैं, "क्या यह व्यंजन अच्छा है?" और वह एक अस्पष्ट स्कोर 7/10 देता है।
  • CRRF का तरीका: आप पाँच अलग-अलग विशेषज्ञों को अलग-अलग व्यंजन का न्याय करने के लिए कहते:
    1. विशेषज्ञ A: "क्या इसमें पर्याप्त नमक है?"
    2. विशेषज्ञ B: "क्या मांस पका हुआ है?"
    3. विशेषज्ञ C: "क्या प्रस्तुति अच्छी है?"
    4. विशेषज्ञ D: "क्या यह ताज़ा है?"
    5. विशेषज्ञ E: "क्या यह मसालेदार है?"
      फिर, स्कोर का औसत निकालने के बजाय, आप उन्हें रैंक करते हैं। यदि विशेषज्ञ A कहता है "टॉप 1" और विशेषज्ञ B कहता है "टॉप 1", तो वह व्यंजन विजेता है। यह विधि एक व्यक्ति से सब कुछ एक साथ पूछने की तुलना में बहुत अधिक स्थिर और विश्वसनीय है।

3. नया परीक्षण: RedQA

RARE का उपयोग करके, उन्होंने RedQA (Redundancy QA) नामक एक नया परीक्षण बनाया। उन्होंने तीन कठिन क्षेत्रों पर इसका परीक्षण किया: फाइनेंस (बैंक रिपोर्ट), लीगल (कानून), और पेटेंट्स (आविष्कार)।

चौंका देने वाला परिणाम:
जब उन्होंने परीक्षण चलाया, तो AI का प्रदर्शन गिर गया।

  • आसान "स्टैंडर्ड लाइब्रेरी" परीक्षणों पर, AI 66% सही था।
  • नए "RedQA" परीक्षणों (मेसी, रेडंडेंट लाइब्रेरी) पर, AI का प्रदर्शन गिरकर केवल 5% से 27% रह गया।

क्यों?
क्योंकि वास्तविक दुनिया में, AI उन सभी समान दिखने वाली किताबों से भ्रमित हो जाता है। वह गलत किताब उठा लेता है, या वह तीन किताबें उठा लेता है जो एक ही बात कहती हैं, लेकिन जटिल प्रश्न का उत्तर देने के लिए आवश्यक एक अतिरिक्त जानकारी को मिस कर देता है।

मुख्य निष्कर्ष

यह पेपर तर्क देता है कि हम खुद से झूठ बोल रहे हैं। हमें लगा कि हमारे AI सर्च इंजन स्मार्ट हैं क्योंकि वे अलग-अलग किताबों वाले आसान परीक्षण पास कर लेते हैं। लेकिन वास्तविक दुनिया में, जहाँ जानकारी दोहराव वाली और अव्यवस्थित है, वही इंजन बुरी तरह विफल हो रहे हैं।

RARE वह नया पैमाना है जो अंततः यह मापता है कि एक AI भीड़भाड़ वाली, भ्रमित करने वाली और दोहराव वाली लाइब्रेरी में बिना खोए कितनी अच्छी तरह नेविगेट कर सकता है। यह हमें बताता है: "हे, आपका AI उतना स्मार्ट नहीं है जितना आप सोचते थे, और यहाँ बताया गया है कि इसे ठीक कैसे करना है।"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →