← नवीनतम पेपर
💬 NLP

WebFAQ 2.0: A Multilingual QA Dataset with Mined Hard Negatives for Dense Retrieval

यह शोध पत्र WebFAQ 2.0 प्रस्तुत करता है, जो 108 भाषाओं में 198 मिलियन FAQ युग्मों का एक महत्वपूर्ण रूप से विस्तारित बहुभाषी डेटासेट है, जिसमें माइन किए गए हार्ड नेगेटिव्स (hard negatives) शामिल हैं और जो बहुभाषी एवं क्रॉस-लिंगुअल सूचना पुनर्प्राप्ति (information retrieval) अनुसंधान को आगे बढ़ाने के लिए उन्नत डेंस रिट्रीवल प्रशिक्षण रणनीतियों का समर्थन करता है।

मूल लेखक: Michael Dinzinger, Laura Caspari, Ali Salman, Irvin Topi, Jelena Mitrović, Michael Granitzer

प्रकाशित 2026-02-20
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Michael Dinzinger, Laura Caspari, Ali Salman, Irvin Topi, Jelena Mitrović, Michael Granitzer

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सुपर-स्मार्ट लाइब्रेरियन (पुस्तकालयाध्यक्ष) बनाने की कोशिश कर रहे हैं जो किसी भी व्यक्ति द्वारा पूछे गए सवाल का जवाब दे सके, चाहे वह कोई भी भाषा बोलता हो। इस लाइब्रेरियन को सिखाने के लिए, आपको "प्रश्न और उत्तर" वाले कार्डों के एक विशाल पुस्तकालय की आवश्यकता है।

यह शोध पत्र WebFAQ 2.0 पेश करता है, जो अनिवार्य रूप से इस AI लाइब्रेरियन के लिए एक विशाल, अपग्रेड किया गया पुस्तकालय है। यहाँ बताया गया है कि उन्होंने क्या बनाया, जिसे सरल रूप में समझाया गया है:

1. पुराना पुस्तकालय बनाम नया मेगा-लाइब्रेरी

समस्या: इस लाइब्रेरी का पहला संस्करण (WebFAQ 1.0) अच्छा था, लेकिन यह एक छोटे शहर के पुस्तकालय जैसा था। इसमें केवल कुछ विशिष्ट स्रोतों से किताबें थीं, और उनमें से अधिकांश अंग्रेजी में थीं। यदि आप कम प्रचलित भाषा में प्रश्न पूछते, तो लाइब्रेरियन अक्सर उत्तर नहीं जानता था।

अपग्रेड (WebFAQ 2.0): शोधकर्ताओं ने बाहर जाकर एक विशाल, वैश्विक पुस्तकालय बनाया।

  • आकार: उन्होंने केवल कुछ अलमारियाँ ही नहीं जोड़ीं; उन्होंने 198 मिलियन प्रश्न-और-उत्तर जोड़े। यह पुराने पुस्तकालय के आकार से दोगुने से भी अधिक है।
  • भाषाएँ: अब उनके पास 108 विभिन्न भाषाओं में किताबें हैं, न कि केवल अंग्रेजी। यह एक ऐसे लाइब्रेरियन जैसा है जो पृथ्वी की लगभग हर भाषा बोल सकता है।
  • उन्होंने यह कैसे किया: किसी के द्वारा उन्हें किताबों की सूची सौंपने का इंतज़ार करने के बजाय (पुराने तरीके की तरह), उन्होंने डिजिटल रोबोटों (क्रॉलर्स) का एक बेड़ा भेजा ताकि वे पूरे इंटरनेट को छान सकें, FAQ वाली वेबसाइटों को खोज सकें और सामग्री को सीधे डाउनलोड कर सकें। इससे उन्हें समृद्ध संदर्भ मिला, जैसे कि यह जानना कि प्रश्न किस पेज के शीर्षक से आया है, जो AI को कठिन प्रश्नों को समझने में मदद करता है।

2. "हार्ड नेगेटिव" ट्रेनिंग जिम

यह इस शोध पत्र का सबसे रोमांचक हिस्सा है।

कल्पना कीजिए कि आप एक कुत्ते को गेंद लाने का प्रशिक्षण दे रहे हैं।

  • आसान प्रशिक्षण: आप एक लाल गेंद फेंकते हैं, और कुत्ता उसे लाता है। आप कहते हैं "गुड बॉय!"
  • कठिन प्रशिक्षण: आप एक लाल गेंद फेंकते हैं, लेकिन आप पास में एक लाल खिलौना कार और एक लाल सेब भी फेंक देते हैं। कुत्ते को यह समझना होगा, "रुको, मुझे गेंद चाहिए, न कि कार या सेब।"

AI के संदर्भ में:

  • प्रश्न एक कमांड है।
  • सही उत्तर लाल गेंद है।
  • "हार्ड नेगेटिव्स" लाल कार और लाल सेब हैं। वे उत्तर के बहुत समान दिखते हैं (वे विषय के लिए प्रासंगिक हैं) लेकिन वास्तव में गलत हैं।

यह क्यों महत्वपूर्ण है?
पहले संस्करण में, AI को केवल "आसान" गलत उत्तरों के साथ प्रशिक्षित किया गया था (जैसे कि लाल गेंद के बारे में प्रश्न होने पर नीली गेंद)। इसने उसे बहुत समान चीजों के बीच अंतर करना नहीं सिखाया।

WebFAQ 2.0 में, शोधकर्ताओं ने 1.25 मिलियन "हार्ड नेगेटिव्स" का एक विशेष डेटासेट बनाया। उन्होंने दो-चरणीय प्रक्रिया का उपयोग किया:

  1. द स्काउट (BM25): उन 200 उत्तरों को खोजता है जो दिखने में सही लग सकते हैं।
  2. द एक्सपर्ट (BGE-m3): एक सुपर-स्मार्ट AI एक जज के रूप में कार्य करता है और उन्हें स्कोर देता है। यह कहता है, "यह 90% मैच है लेकिन गलत है," और "यह 10% मैच है।"

यह AI को एक कठोर जिम वर्कआउट देता है, जिससे उसे एक सही उत्तर और एक चालाकी भरे, लगभग-सही उत्तर के बीच सूक्ष्म अंतरों को पहचानना सीखने के लिए मजबूर किया जाता है।

3. AI कैसे सीखता है (दो रणनीतियाँ)

यह पेपर इस नए "हार्ड नेगेटिव" जिम का उपयोग करने के दो तरीकों का परीक्षण करता है:

  • रणनीति A: "अंतर पहचानो" खेल (कॉन्ट्रास्टिव लर्निंग)
    AI को प्रश्न, सही उत्तर, और गलत उत्तर दिखाए जाते हैं। इसे सही उत्तर को प्रश्न के करीब धकेलना और गलत उत्तरों को दूर धकेलना सीखना होता है।

    • चुनौती: कभी-कभी "गलत" उत्तर जिन्हें शोधकर्ताओं ने पाया था, वे वास्तव में बहुत अच्छे थे (फॉल्स नेगेटिव)। यदि AI एक गलत उत्तर को सही मान लेता है, तो वह भ्रमित हो जाता है। शोध पत्र में पाया गया कि कभी-कभी, इस पद्धति के लिए यादृच्छिक, आसान गलत उत्तरों पर टिके रहना वास्तव में अधिक सुरक्षित था।
  • रणनीति B: "नकल करना" खेल (नॉलेज डिस्टिलेशन)
    केवल "सही बनाम गलत" कहने के बजाय, AI एक्सपर्ट जज के स्कोर की नकल करने की कोशिश करता है। यदि एक्सपर्ट कहता है, "यह उत्तर 85% अच्छा है," तो AI भी उसी 85% स्कोर को देने का सीखने का प्रयास करता है।

    • परिणाम: यह गैर-अंग्रेजी भाषाओं के लिए अद्भुत रूप से काम कर गया, जिससे AI इन क्षेत्रों में बहुत स्मार्ट हो गया। हालाँकि, क्योंकि AI पहले से ही अंग्रेजी में बहुत अच्छा था, इस नए प्रशिक्षण ने वास्तव में इसे अंग्रेजी में थोड़ा खराब बना दिया जबकि अन्य सभी चीजों में इसे बहुत बेहतर बना दिया।

4. भविष्य: एक जीवित पुस्तकालय

लेखक इस बात पर जोर देते हैं कि यह एक बार का प्रोजेक्ट नहीं है। वे एक बड़े अभियान का हिस्सा हैं जिसे ओपन वेब इंडेक्स कहा जाता है। इसे एक ऐसे पुस्तकालय के रूप में सोचें जो कभी बंद नहीं होता; नई किताबें (FAQ) हर दिन जोड़ी जाती हैं। इसका मतलब है कि डेटासेट बढ़ता रहेगा और अपडेटेड रहेगा, जिससे यह सुनिश्चित होगा कि AI लाइब्रेरियन कभी भी पुराना न हो।

सारांश

WebFAQ 2.0 एक विशाल, बहुभाषी डेटासेट है जो AI को लगभग किसी भी भाषा में प्रश्न समझने में मदद करता है। इसका सबसे बड़ा नवाचार एक विशेष "प्रशिक्षण मैनुअल" है जिसमें चालाकी भरे, लगभग-सही उत्तर शामिल हैं (हार्ड नेगेटिव्स) जो AI को एक अधिक सटीक विचारक बनने के लिए मजबूर करते हैं, विशेष रूप से अंग्रेजी के अलावा अन्य भाषाओं के लिए। यह एक ऐसे AI की ओर एक कदम है जो दुनिया के केवल अंग्रेजी के सवालों को ही नहीं, बल्कि वास्तव में दुनिया के हर सवाल को समझ सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →