← नवीनतम पेपर
💬 NLP

Knowing When Not to Answer: Lightweight KB-Aligned OOD Detection for Safe RAG

यह शोध पत्र एक हल्के, नॉलेज-बेस-अलाइन्ड (knowledge-base-aligned), आउट-ऑफ-डोमेन डिटेक्शन पद्धति को प्रस्तावित और मूल्यांकित करता है जो असुरक्षित या अप्रासंगिक प्रश्नों के विरुद्ध RAG सिस्टम को प्रभावी ढंग से गेट करने के लिए PCA-आधारित सबस्पेस स्कोरिंग का उपयोग करता है, यह प्रदर्शित करते हुए कि ये कुशल ज्यामितीय या क्लासिफायर-आधारित दृष्टिकोण महंगे LLM जजों की तुलना में बेहतर प्रदर्शन करते हैं और उच्च-जोखिम वाले डोमेन में मजबूती बनाए रखते हैं।

मूल लेखक: Ilias Triantafyllopoulos, Renyi Qu, Salvatore Giorgi, Brenda Curtis, Lyle H. Ungar, João Sedoc

प्रकाशित 2026-07-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ilias Triantafyllopoulos, Renyi Qu, Salvatore Giorgi, Brenda Curtis, Lyle H. Ungar, João Sedoc

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

बड़ी समस्या: "अति-उत्साही" लाइब्रेरियन

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान और तेज़ लाइब्रेरियन (एक AI) है, जिसने केवल कोविड-19 टीकों के बारे में एक विशिष्ट, मोटी विश्वकोश (encyclopedia) को रट लिया है।

यदि आप पूछते हैं, "टीके के दुष्प्रभाव क्या हैं?" तो लाइब्रेरियन तुरंत उत्तर ढूंढ लेता है और आपको बता देता है। बहुत बढ़िया!

लेकिन क्या होगा अगर आप चलते हुए आए और पूछा, "मैं अपने रसोई के बहते सिंक को कैसे ठीक करूँ?" या "क्या मैं सिरदर्द ठीक करने के लिए टीके का उपयोग कर सकता हूँ?"

  • पुराना तरीका: लाइब्रेरियन, खुश करने के लिए अति-उत्साही होकर, घबरा सकता है। वे पूरे विश्वकोश को स्कैन कर सकते हैं, एक ऐसा वाक्य ढूंढ सकते हैं जो अस्पष्ट रूप से "तरल पदार्थ" (fluids) या "दर्द" का उल्लेख करता हो, और आत्मविश्वास से कह सकते हैं, "हाँ, टीका तरल पदार्थों में मदद करता है!" यह एक हैलुसिनेशन (hallucination) है। यह सुनने में सुचारू और आत्मविश्वासी लगता है, लेकिन यह गलत और संभावित रूप से खतरनाक है।
  • लक्ष्य: हमें लाइब्रेरियन को बताने का एक तरीका चाहिए, "रुको! यह सवाल तुम्हारी किताब में नहीं है। इसे जवाब देने की कोशिश भी मत करो।"

समाधान: एक हल्का "गेटकीपर" (Gatekeeper)

लेखकों ने इस लाइब्रेरियन के सामने खड़े होने के लिए एक सरल, तेज़ और सस्ता "गेटकीपर" सिस्टम बनाया है। इसका एकमात्र काम आपके सवाल को देखना और यह तय करना है: "क्या यह सवाल हमारे ज्ञान के आधार (knowledge base) के अंदर है, या बाहर है?"

यदि सवाल बाहर (Out-of-Domain) का है, तो गेटकीपर कहता है, "मैं इसका उत्तर नहीं दे सकता," और लाइब्रेरियन को कोशिश करने से रोक देता है।

गेटकीपर कैसे काम करता है ("मैप" की उपमा)

आमतौर पर, यह जांचने के लिए कि क्या कोई सवाल किसी विशिष्ट विषय से संबंधित है, एक सुपर-कंप्यूटर (एक विशाल AI मॉडल) को उस पर गहराई से सोचने की आवश्यकता होती है। यह धीमा और महंगा है।

लेखकों ने PCA (प्रिंसिपल कंपोनेंट एनालिसिस) नामक तकनीक का उपयोग करके एक स्मार्ट और हल्का तरीका खोजा है। यहाँ इसकी उपमा दी गई है:

  1. बड़ा अस्त-व्यस्त कमरा: कल्पना करें कि लाइब्रेरियन का ज्ञान आधार हजारों किताबों से भरा एक विशाल, अस्त-व्यट्यरा कमरा है। प्रत्येक पुस्तक ज्ञान के एक टुकड़े का प्रतिनिधित्व करती है।
  2. मैप (नक्शा): हर एक किताब को देखने के बजाय, गेटकीपर इस कमरे का एक 2D मैप बनाता है। यह 3D कमरे को एक सपाट कागज पर समेट देता है।
    • इस मैप पर, सभी "कोविड-19" की किताबें एक कोने में एक साथ क्लस्टर (समूह) में हैं।
    • "रसोई का सिंक" या "राजनीति" की किताबें खाली स्थान में बहुत दूर होंगी।
  3. शॉर्टकट: जब आप कोई सवाल पूछते हैं, तो गेटकीपर पूरी किताब नहीं पढ़ता। वह बस आपके सवाल को इस सपाट मैप पर एक बिंदु (dot) के रूप में अंकित करता है।
    • यदि बिंदु "कोविड क्लस्टर" में पड़ता है: तो उत्तर देना सुरक्षित है।
    • यदि बिंदु खाली स्थान में पड़ता है: तो यह विषय से बाहर (Out-of-Domain) है। रुकिए!

मैप बनाने के दो तरीके

लेखकों ने यह सुनिश्चित करने के लिए कि यह मैप "अच्छे" सवालों को "बुरे" सवालों से अलग करता है, मैप बनाने के दो तरीकों का परीक्षण किया:

  1. "सबसे बड़े बदलाव" वाला तरीका (EVR): यह मैप को देखता है और कहता है, "आइए हम उन दिशाओं को रखें जहाँ किताबें सबसे अधिक फैली हुई हैं।" यह सबसे स्पष्ट पैटर्न को बनाए रखता है।
  2. "सर्वश्रेष्ठ पृथक्करण" वाला तरीका (p-values): यह मैप को देखता है और कहता है, "आइए हम उन दिशाओं को रखें जहाँ 'कोविड' के सवाल 'गैर-कोविड' सवालों से सबसे दूर हैं।" यह विशेष रूप से दो समूहों को अलग रखने के लिए एक रेखा खींचने जैसा है।

निष्कर्ष: "सर्वश्रेष्ठ पृथक्करण" वाला तरीका सरल ज्यामितीय नियमों के लिए थोड़ा बेहतर काम कर गया, जिससे AI जो जानता है और जो नहीं जानता है, उनके बीच एक बहुत ही स्पष्ट सीमा बन गई।

यह एक बड़ी बात क्यों है?

लेखकों ने अपने सरल गेटकीपर की तुलना "बड़े दिमागों" (सवाल की जांच करने के लिए GPT-4 जैसे विशाल AI का उपयोग करना) से की।

  • गति: उनका गेटकीपर तत्काल है। यह माइक्रोसेकंड में काम करता है। बड़ा दिमाग सेकंडों का समय लेता है।
  • लागत: उनका गेटकीपर एक सामान्य कंप्यूटर पर मुफ्त में चलता है। हर बार सवाल पूछने पर बड़े दिमाग की लागत आती है।
  • सटीकता: आश्चर्यजनक रूप से, उनका सरल गेटकीपर "विषय से बाहर" के सवालों को पहचानने में महंगे बड़े दिमाग के लगभग बराबर ही था।
  • सुरक्षा: जब उन्होंने वास्तविक दुनिया के हमलों (जैसे लोगों द्वारा 4chan या AI-जनित बकवास से AI को समझाने की कोशिश) पर इसका परीक्षण किया, तो गेटकीपर ने अपना पक्ष मजबूती से रखा।

परिणाम: एक सुरक्षित बातचीत

यह पेपर सिद्ध करता है कि जब आप इस सिस्टम में यह गेटकीपर जोड़ते हैं:

  1. AI उन सवालों के जवाब देने की कोशिश करना बंद कर देता है जिन्हें वह नहीं जानता।
  2. इसके द्वारा दिए गए उत्तर विषय के प्रति बहुत अधिक प्रासंगिक होते हैं।
  3. यह AI को उन चीजों के बारे में आत्मविश्वास से तथ्य गढ़ने से रोकता है जिनके बारे में उसने पढ़ा ही नहीं है।

सारांश

इस पेपर को एक VIP क्लब (ज्ञान आधार) के लिए एक बाउंसर बनाने के रूप में देखें।

  • पहले: बाउंसर एक विशाल, धीमा, महंगा रोबोट था जो कभी-कभी थक जाता था और गलत लोगों को अंदर आने देता था।
  • अब: बाउंसर एक त्वरित, सस्ता, स्मार्ट इंसान है जिसके पास एक साधारण चेकलिस्ट है। वे आपकी आईडी (सवाल) देखते हैं, एक सरल मैप देखते हैं, और तुरंत जान जाते हैं कि आप क्लब में शामिल होने के योग्य हैं या नहीं। यदि आप नहीं हैं, तो आपको प्रवेश नहीं मिलता, और क्लब के अंदर के VIP सुरक्षित रहते हैं।

यह पेपर दिखाता है कि AI को सुरक्षित रखने के लिए आपको सुपर-कंप्यूटर की आवश्यकता नहीं है; कभी-कभी, एक सरल, अच्छी तरह से बनाया गया मैप ही काफी होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →