← أحدث الأبحاث
💬 NLP

FactNet: A Billion-Scale Knowledge Graph for Multilingual Factual Grounding

تقدم الورقة البحثية FactNet، وهو رسم بياني معرفي متعدد اللغات بمقياس المليارات يربط 1.7 مليار توكيد من Wikidata بأكثر من 3 مليارات مؤشر دليل بلغة أصلية من ويكيبيديا بدقة على مستوى البايت، إلى جانب مجموعة تقييم FactNet-Bench المصممة لتقييم وتحسين التأسيس الواقعي ونقل المعرفة عبر اللغات.

المؤلفون الأصليون: Yingli Shen, Wen Lai, Jie Zhou, Xueren Zhang, Yudong Wang, Kangyang Luo, Shuo Wang, Ge Gao, Alexander Fraser, Maosong Sun

نُشر 2026-05-15
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yingli Shen, Wen Lai, Jie Zhou, Xueren Zhang, Yudong Wang, Kangyang Luo, Shuo Wang, Ge Gao, Alexander Fraser, Maosong Sun

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم روبوت ذكي جداً، ولكنه مغرور أحياناً، كيف يقول الحقيقة. هذا الروبوت (وهو نموذج لغوي كبير) يمكنه كتابة قصص جميلة والإجابة على الأسئلة بطلاقة، ولكنه غالباً ما "يهلوس" – أي يختلق حقائق أو يخلط بين التفاصيل، خاصة عندما يتحدث عن أشياء بلغات أخرى غير الإنجليزية.

المشكلة هي أنه بينما نمتلك مكتبات ضخمة من الحقائق المنظمة (مثل جدول بيانات عملاق) ومكتبات ضخمة من النصوص (مثل ملايين المقالات من ويكيبيديا)، إلا أنها لا تتواصل مع بعضها البعض بشكل جيد. الجدول يعرف "ماذا" حدث، لكنه لا يعرف "أين" يجد الدليل في النص. والنص يحتوي على الدليل، ولكن من الصعب ربطه بحقيقة محددة.

FactNet هو مشروع ضخم جديد مصمم لإصلاح ذلك عبر بناء جسر ضخم ثنائي اللغة (في الواقع 316 لغة) بين الاثنين.

إليك كيف يعمل، باستخدام بعض التشبيهات البسيطة:

1. مكتبة "FactNet"

تخيل FactNet كمكتبة ضخمة ومنظمة للغاية تحتوي على 1.7 مليار بطاقة حقيقة.

  • بطاقة الحقيقة (FactStatement): هذه هي الحقيقة الجوهرية، مثل "نيل أرمسترونغ هبط على سطح القمر". وهي مكتوبة بطريقة محايدة ومنظمة لا تهتم باللغة.
  • صفحة الإثبات (FactSense): مرفق بكل بطاقة "صفحة إثبات" مقتطعة من مقال ويكيبيديا بلغة واحدة من 316 لغة. والأهم من ذلك، أن هذه ليست مجرد إشارة غامضة؛ بل هي بمثابة "مؤشر ليزر". فهي تشير إلى الجملة المحددة، أو خلية الجدول، أو المربع في المقال الأصلي حيث كُتبت تلك الحقيقة.
  • الرابط (FactSynset): إذا كانت لديك بطاقة الحقيقة بالإنجليزية والفرنسية والصينية، فإن FactNet يربطها جميعاً في "عائلة" واحدة (Synset). هذا يسمح للروبوت بأن يتعلم أن "Neil Armstrong" بالإنجليزية هو نفسه الشخص نفسه في الفرنسية، حتى لو بدا النص مختلفاً.

النطاق: إنه ضخم. فهو يغطي 316 لغة ويربط 1.7 مليار حقيقة بأكثر من 3 مليارات قطعة من الأدلة. هذه هي المرة الأولى التي يتم فيها بناء مورد بهذا الحجم وبهذا المستوى من الدقة.

2. كيف بنوه: مصنع "حتمي"

عادةً، عندما يبني الناس هذه المجموعات من البيانات، يستخدمون الذكاء الاصطناي للتخمين أو الترجمة، مما قد يؤدي إلى إدخال أخطاء أو "حقائق شبحية" لا وجود لها في الأصل.

يستخدم FactNet خط إنتاج بناء حتمي (Deterministic). تخيل مصنعاً يعمل بخط تجميع حيث كل خطوة هي قاعدة صارمة وغير قابلة للتغيير.

  • لا مجال للتخمين: النظام لا "يهلوس" بالروابط. هو يربط الحقيقة بالنص فقط إذا كان النص يحتوي صراحةً على تلك الحقيقة بطريقة محددة وقابلة للتحقق.
  • القابلية للتتبع: كل رابط له "إيصال". إذا أردت التحقق من الإثبات، يمكنك العودة إلى نسخة ويكيبيديا الأصلية من تاريخ محدد والعثور على الموقع الدقيق للحقيقة حرفاً بحرف. إنه يشبه امتلاك إحداثيات GPS لكل حقيقة.

3. اختبار "FactNet-Bench"

لإثبات فائدة هذه المكتبة، أنشأ المؤلفون مجموعة اختبار تسمى FactNet-Bench. اعتبر هذا الاختبار بمثابة امتحان معياري للروبوتات.

  • الاختبار: يُطلب من الروبوت إكمال حقيقة، أو الإجابة على سؤال، أو التحقق مما إذا كان ادعاء ما صحيحاً.
  • الخدعة: الاختبار مصمم لمنع الغش. لا يمكن للروبوت مجرد حفظ الإجابات؛ بل يجب عليه العثور على "صفحة الإثبات" (FactSense) المحددة للحصول على الدرجة.
  • النتائج: أظهرت الاختبارات أن الروبوتات التي يمكنها استخدام هذه المكتبة المنظمة تؤدي بشكل أفضل بكثير من تلك التي تعتمد على التخمين. كما كشفت أيضاً أن أذكى الروبوتات لا تزال تختلق الحقائق (تهلوس) كثيراً، خاصة في اللغات الأخرى غير الإنجليزية.

4. لماذا هذا مهم (وفقاً للورقة البحثية)

تدعي الورقة أن FactNet يحل "مقايضة ثلاثية الأبعاد" محددة لم تستطع الأدوات السابقة حلها:

  1. النطاق: إنه كبير بما يكفي لتدريب نماذج الذكاء الاصطناعي الحديثة (مليارات الحقائق).
  2. التأسيس (Grounding): إنه يربط الحقائق بنصوص حقيقية كتبها البشر بدقة متناهية (على مستوى البايت/الرمز).
  3. تعدد اللغات: إنه يعمل في 316 لغة، وليس الإنجليزية فقط.

ما لا تدعيه الورقة:

  • هي لا تدعي أنها "أصلحت" هلوسة الذكاء الاصطناعي للأبد. بل توفر الأدوات (المكتبة والاختبار) لمساعدة الباحثين على بناء أنظمة أفضل.
  • هي لا تدعي أنها مرجع طبي أو قانوني. إنها مجموعة بيانات بحثية للتدريب والاختبار.
  • هي لا تدعي الكمال. يعترف المؤلفون بأنه بالنسبة لبعض اللغات النادرة أو الحقائق المعقدة، قد يغفل النظام عن بعض الروابط (فهو يعطي الأولوية لكونه متأكداً بنسبة 100% على إيجاد كل حقيقة ممكنة).

باختاًصر:
إن FactNet يشبه بناء "خريطة تحقق من الحقائق" ضخمة ومتعددة اللغات. فهو يأخذ الحقائق المنظمة التي نعرف أنها صحيحة ويرسم خطاً مباشراً وغير قابل للكسر إلى الفقرة المحددة في مقال ويكيبيديا التي تثبتها. وهذا يساعد في تعليم الذكاء الاصطناعي التوقف عن اختلاق الأمور والبدء في الإشارة إلى الأدلة، بغض النظر عن اللغة التي يستخدمها المستخدم.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →