← नवीनतम पेपर
💬 NLP

FactNet: A Billion-Scale Knowledge Graph for Multilingual Factual Grounding

यह शोधपत्र FactNet को प्रस्तुत करता है, जो एक बिलियन-स्केल बहुभाषी नॉलेज ग्राफ है जो 1.7 बिलियन विकीडेटा एसेर्शन (assertions) को बाइट-लेवल सटीकता के साथ 3 बिलियन से अधिक मूल-भाषा विकिपीडिया साक्ष्य पॉइंटर्स से जोड़ता है, और इसके साथ ही FactNet-Bench इवैल्यूएशन सुइट भी दिया गया है जिसे विभिन्न भाषाओं में तथ्यात्मक ग्राउंडिंग और ज्ञान हस्तांतरण का आकलन करने और सुधारने के लिए डिज़ाइन किया गया है।

मूल लेखक: Yingli Shen, Wen Lai, Jie Zhou, Xueren Zhang, Yudong Wang, Kangyang Luo, Shuo Wang, Ge Gao, Alexander Fraser, Maosong Sun

प्रकाशित 2026-05-15
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yingli Shen, Wen Lai, Jie Zhou, Xueren Zhang, Yudong Wang, Kangyang Luo, Shuo Wang, Ge Gao, Alexander Fraser, Maosong Sun

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन कभी-कभी ज़रूरत से ज़्यादा आत्मविश्वासी रोबोट को सच बोलना सिखाने की कोशिश कर रहे हैं। वह रोबोट (एक लार्ज लैंग्वेज मॉडल) सुंदर कहानियाँ लिख सकता है और सवालों के जवाब धाराप्रवाह दे सकता है, लेकिन वह अक्सर "हैलुसिनेट" (भ्रमित होना) करता है—यानी तथ्य गढ़ लेता है या विवरणों को मिला देता है, खासकर जब वह अंग्रेजी के अलावा अन्य भाषाओं में बात कर रहा हो।

समस्या यह है कि हमारे पास संरचित तथ्यों (जैसे कि डेटा का एक विशाल स्प्रेडशीट) के विशाल पुस्तकालय हैं और टेक्स्ट के विशाल पुस्तकालय (जैसे कि लाखों विकिपीडिया लेख) भी हैं, लेकिन वे एक-दूसरे से ठीक से संवाद नहीं कर पाते। स्प्रेडशीट जानती है कि क्या हुआ, लेकिन यह नहीं जानती कि टेक्स्ट में प्रमाण कहाँ मिलेगा। टेक्स्ट में प्रमाण तो है, लेकिन इसे किसी विशिष्ट तथ्य से जोड़ना कठिन है।

FactNet एक नया, विशाल प्रोजेक्ट है जिसे इस समस्या को हल करने के लिए बनाया गया है—इन दोनों के बीच एक विशाल, द्विभाषी (वास्तव में 316 भाषाओं वाला) पुल बनाकर।

यह कैसे काम करता है, इसके लिए कुछ सरल उपमाओं का उपयोग किया गया है:

1. "FactNet" लाइब्रेरी

FactNet को एक विशाल, अत्यंत व्यवस्थित लाइब्रेरी के रूप में सोचें जिसमें 1.7 बिलियन तथ्य कार्ड (fact cards) हैं।

  • तथ्य कार्ड (FactStatement): यह मूल तथ्य है, जैसे "नील आर्मस्ट्रांग चंद्रमा पर उतरे।" यह एक तटस्थ, संरचित तरीके से लिखा गया है जो भाषा की परवाह नहीं करता।
  • प्रमाण पृष्ठ (FactSense): हर कार्ड के साथ एक विशिष्ट "प्रमाण पृष्ठ" जुड़ा है जो एक विशिष्ट भाषा की 316 भाषाओं में से किसी एक के विकिपीडिया लेख से काटकर निकाला गया है। महत्वपूर्ण बात यह है कि यह केवल एक अस्पष्ट संदर्भ नहीं है; यह एक लेज़र-पॉइंटर है। यह उस सटीक वाक्य, तालिका सेल (table cell), या बॉक्स की ओर इशारा करता है जहाँ वह तथ्य मूल लेख में लिखा है।
  • संबंध (FactSynset): यदि आपके पास तथ्य कार्ड अंग्रेजी, फ्रेंच और चीनी में है, तो FactNet उन सभी को एक एकल "परिवार" (Synset) में जोड़ देता है। यह रोबोट को यह सीखने में मदद करता है कि अंग्रेजी में "Neil Armstrong" वही व्यक्ति है जो फ्रेंच में "Neil Armstrong" है, भले ही टेक्स्ट अलग दिखता हो।

पैमाना: यह बहुत बड़ा है। यह 316 भाषाओं को कवर करता है और 1.7 बिलियन तथ्यों को 3 बिलियन से अधिक साक्ष्यों से जोड़ता है। इस स्तर की सटीकता के साथ इतना बड़ा संसाधन बनाने वाला यह पहला अवसर है।

2. उन्होंने इसे कैसे बनाया: "डिटरमिनिस्टिक" फैक्ट्री

आमतौर पर, जब लोग ये डेटासेट बनाते हैं, तो वे चीजों का अनुमान लगाने या अनुवाद करने के लिए AI का उपयोग करते हैं, जिससे त्रुटियां या ऐसे "भूतिया" तथ्य पैदा हो सकते हैं जो वास्तव में स्रोत टेक्स्ट में मौजूद नहीं होते।

FactNet एक डिटरमिनिस्टिक कंस्ट्रक्शन पाइपलाइन का उपयोग करता है। एक फैक्ट्री असेंबली लाइन की कल्पना करें जहाँ हर कदम एक कठोर, अपरिवर्तनीय नियम है।

  • कोई अनुमान नहीं: सिस्टम कनेक्शन बनाने के लिए "अनुमान" नहीं लगाता है। यह किसी तथ्य को टेक्स्ट से तभी जोड़ता है जब टेक्स्ट में वह तथ्य स्पष्ट रूप से एक विशिष्ट, सत्यापन योग्य तरीके से मौजूद हो।
  • ट्रेसिबिलिटी (पता लगाने की क्षमता): प्रत्येक लिंक के पास एक "रसीद" होती है। यदि आप प्रमाण की जांच करना चाहते हैं, तो आप एक विशिष्ट तिथि के मूल विकिपीडिया स्नैपशॉट पर वापस जा सकते हैं और साक्ष्य के सटीक कैरेक्टर-दर-कैरेक्टर स्थान को पा सकते हैं। यह हर तथ्य के लिए GPS निर्देशांक रखने जैसा है।

3. "FactNet-Bench" टेस्ट

यह साबित करने के लिए कि यह लाइब्रेरी उपयोगी है, लेखकों ने एक टेस्ट सूट बनाया है जिसे FactNet-Bench कहा जाता है। इसे रोबोट के लिए एक मानकीकृत परीक्षा के रूप में समझें।

  • टेस्ट: रोबोट को एक तथ्य पूरा करने, एक प्रश्न का उत्तर देने, या यह जांचने के लिए कहा जाता है कि कोई दावा सत्य है या नहीं।
  • चुनौती: टेस्ट को चीटिंग रोकने के लिए तैयार किया गया है। रोबोट केवल उत्तर याद नहीं कर सकता; उसे अंक पाने के लिए विशिष्ट "प्रमाण पृष्ठ" (FactSense) को खोजना होगा।
  • परिणाम: परीक्षणों ने दिखाया कि जो रोबोट इस संरचित लाइब्रेरी का उपयोग कर सकते हैं, वे केवल अनुमान लगाने वाले रोबोट की तुलना में बहुत बेहतर प्रदर्शन करते हैं। इसने यह भी खुलासा किया कि सबसे स्मार्ट रोबोट भी अक्सर तथ्य गढ़ते हैं (हैलुसिनेट करते हैं), विशेष रूप से अंग्रेजी के अलावा अन्य भाषाओं में।

4. यह क्यों मायने रखता है (पेपर के अनुसार)

पेपर का दावा है कि FactNet उस विशिष्ट "तीन-तरफा ट्रेड-ऑफ" को हल करता जिसे पिछले उपकरण नहीं कर सके थे:

  1. पैमाना (Scale): यह आधुनिक AI को प्रशिक्षित करने के लिए पर्याप्त बड़ा है (अरबों तथ्य)।
  2. ग्राउंडिंग (Grounding): यह तथ्यों को पिनपॉइंट सटीकता के साथ वास्तविक, मानव-लिखित टेक्स्ट से जोड़ता है (बाइट-लेवल प्रिसिजन)।
  3. बहुभाषी (Multilingual): यह अंग्रेजी के बजाय 316 भाषाओं में काम करता है।

पेपर क्या दावा नहीं करता है:

  • यह दावा नहीं करता है कि इसने AI के भ्रम (hallucinations) को हमेशा के लिए "ठीक" कर दिया है। यह शोधकर्ताओं को बेहतर सिस्टम बनाने के लिए उपकरण (लाइब्रेरी और टेस्ट) प्रदान करता है।
  • यह दावा नहीं करता है कि यह एक चिकित्सा या कानूनी प्राधिकरण है। यह AI प्रशिक्षण और परीक्षण के लिए एक शोध डेटासेट है।
  • यह दावा नहीं करता है कि यह पूर्ण है। लेखक स्वीकार करते हैं कि कुछ दुर्लभ भाषाओं या जटिल तथ्यों के लिए, सिस्टम कुछ कनेक्शन चूक जाता है (यह हर संभावित तथ्य खोजने के बजाय 100% सुनिश्चित होने को प्राथमिकता देता है)।

सारांश में:
FactNet एक विशाल, बहुभाषी "तथ्य-जांच मानचित्र" (Fact-Checking Map) बनाने जैसा है। यह उन तथ्यों को लेता है जिन्हें हम सच जानते हैं और उन्हें विकिपीडिया लेख के उस सटीक पैराग्राफ से जोड़ता है जो उसे प्रमाणित करता है। यह AI को चीजें बनाना बंद करने और सबूत की ओर इशारा करना सीखने में मदद करता है, चाहे उपयोगकर्ता कोई भी भाषा बोलता हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →