← أحدث الأبحاث
💬 NLP

QuCo-RAG: Quantifying Uncertainty from the Pre-training Corpus for Dynamic Retrieval-Augmented Generation

يقدم Co-RAG إطار عمل ديناميكي لتوليد النصوص المعزز بالاسترجاع ومستقل عن النموذج، يعمل على الحد من الهلوسة من خلال قياس عدم اليقين عبر إحصائيات متن التدريب المسبق الموضوعية (تكرار الكيانات والتواجد المشترك) عبر تقنية Infini-gram، محققاً مكاسب كبيرة في الأداء عبر نماذج ومعايير متنوعة دون الاعتماد على إشارات النموذج الداخلية غير الموثوقة.

المؤلفون الأصليون: Dehai Min, Kailin Zhang, Tongtong Wu, Lu Cheng

نُشر 2026-05-19
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Dehai Min, Kailin Zhang, Tongtong Wu, Lu Cheng

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك صديقاً ذكياً جداً ومطلعاً (ذكاء اصطناعي) يحب سرد القصص والإجابة على الأسئلة. لكن في بعض الأحيان، يبدأ هذا الصديق في الثقة المفرطة بنفسه ويبدأ في اختلاق الأمور، مثل القول بأن فيلماً ما من إخراج شخص لم يصنع أي فيلم في الواقع. يُسمى هذا "الهلوسة" (Hallucination).

لفترة طويلة، حاول الباحثون إصلاح ذلك عبر سؤال الذكاء الاصطناعي: "هل أنت متأكد؟" عندها ينظر الذكاء الاصطناعي داخل دماغه (إشاراته الداخلية) ويقول: "نعم، أنا متأكد بنسبة 99%!". لكن المشكلة هي أن الذكاء الاصطناعي سيء في تقييم مدى ثقته بنفسه؛ إذ يمكنه أن يكون متأكداً بنسبة 99% من كذبة محضة.

نقدم لكم QuCo-RAG: "المُدقق من الحقائق" من المكتبة

قرر مؤلفو هذه الورقة البحثية، QuCo-RAG، التوقف عن سؤال الذكاء الاصطناعي عما إذا كان متأكداً. بدلاً من ذلك، قاموا ببناء نظام يتحقق من حقائق الذكاء الاصطناعي مقابل مكتبة ضخمة من البيانات الموضوعية (متن بيانات التدريب المسبق) قبل أن ينهي الذكاء الاصطناعي جملته حتى.

فكر في الأمر كالتالي:

  • الطريقة القديمة (الإشارات الداخلية): تسأل الذكاء الاصطناعي: "هل تعرف هذا؟"، فيقول الذكال الاصطناعي: "أشعر بثقة كبيرة!" (حتى لو كان مخطئاً).
  • طريقة QuCo-RAG (إحصائيات المتن): تسأل الذكاء الاصطناعي: "هل هذه الحقيقة موجودة في المكتبة؟". إذا لم يكن لدى المكتبة سجل لها، يقول النظام: "توقف! ليس لدينا دليل على هذا. دعنا نبحث عن ذلك في العالم الحقيقي (استرجاع البيانات) قبل أن ننطق به".

كيف يعمل: شبكة الأمان ذات الخطوتين

يستخدم النظام عملية من خطوتين للإمساك بالأكاذيب، مستخدماً فهرساً فائق السرعة للمكتبة يسمى Infini-gram (والذي يمكنه البحث عبر 4 تريليونات كلمة في أجزاء من الثانية).

الخطوة 1: فحص "الكلمات النادرة" (قبل التحدث)
قبل أن يبدأ الذكاء الاصطناعي في الإجابة، يقوم النظام بمسح السؤال.

  • التشبيه: تخيل أنك تسأل: "من هو رئيس دولة زوبلورب (Zogblorp) الصغيرة المعزولة؟"
  • الفحص: يبحث النظام في المكتبة. إذا ظهرت كلمة "زوبلورب" 5 مرات فقط في تاريخ الكتابة البشرية بأكمله (تردد منخفض)، فإن النظام يدرك: "هذا أمر غامض. من المحتمل أن الذكاء الاصطناعي لا يعرف هذا جيداً وقد يختلقه".
  • الإجراء: يقوم فوراً بجلب كتاب (استرجاع بيانات) لمساعدة الذكاء الاصطناعي على الإجابة بشكل صحيح قبل أن يبدأ في الكلام.

الخطوة 2: فحص "هل التقيا يوماً؟" (أثناء التحدث)
بينما يقوم الذكاء الاصطناعي بتوليد إجابته جملة بجملة، يراقب النظام ما يقوله.

  • التشبيه: يقول الذكاء الاصطناعي: "الشيف الشهير غوردون رامزي والرسام الشهير فان جوخ كانا صديقين مقربين".
  • الفحص: يبحث النظام في المكتبة ليرى ما إذا كان "غوردون رامزي" و"فان جوخ" قد ظهرا يوماً معاً في نفس الجملة أو الفقرة.
  • المنطق: إذا لم يسبق لهما الظهور معاً أبداً في المكتبة بأكملها (صفر ظهور مشترك)، فهذا يعتبر علامة خطر كبيرة. الأمر يشبه قولك "القمر والمحمصة صديقان مقربان"؛ من الممكن حدوث ذلك، ولكن إذا لم يكتب أحد عن ذلك أبداً، فمن المرجح أن الذكنا الاصطناعي يهلوِس.
  • الإجراء: يوقف النظام الذكاء الاصطناعي ويقول: "انتظر، هذان الشخصان لم يتواجدا معاً أبداً في كتبنا"، ثم يجلب المعلومات الصحيحة لتصحيح الجملة.

لماذا يعد هذا أمراً هاماً

تظهر الورقة البحثية أن هذه الطريقة أفضل بكثير من سؤال الذكاء الاصطناعي عن "مشاعره".

  1. يعمل على نماذج "الصندوق الأسود": حتى لو كنت لا تعرف الكتب التي قرأها الذكاء الاصطناعي (مثل GPT-4 أو Llama-3)، فإن هذا النظام يعمل. فهو يعتمد على حقيقة أن معظم نماذج الذكاء الاصطناعي تقرأ كتباً متشابهة (الإنترنت، ويكيبيديا، إلخ). لذا، فإن التحقق من مكتبة عامة يعمل مع أي ذكاء اصطناعي ذكي تقريباً.
  2. يمسك بـ "الكاذبين الواثقين": غالباً ما تخطئ الطرق الأخرى عندما يكون الذكاء الاصطناعي مخطئاً ولكنه واثق. أما QuCo-RAG فيمسك بهم لأنه لا يهتم بما "يشعر" به الذكاء الاصطناعي؛ بل يهتم فقط بما إذا كانت الحقيقة موجودة في المكتبة.
  3. سريع وفعال: هو لا يفحص كل كلمة. إنه يفحص فقط عندما يرى كلمة "نادرة" أو مزيجاً "مريباً" من الحقائق. هذا يوفر الوقت والمال مقارنة بالطرق التي تفحص كل شيء باستمرار.

النتائج

عندما اختبروا هذا على أسئلة معلومات عامة صعبة (مثل "من أخرج هذا الفيلم وما اسم والدته؟")، حقق QuCo-RAG إجابات صحيحة أكثر بكثير من أفضل الطرق السابقة. لقد حسن الدقة بمقدار يصل إلى 14 نقطة، وهي قفزة هائلة في عالم الذكاء الاصطناعي.

باختصار: بدلاً من الوثوق بـ "أنا متأكد!" الخاصة بالذكاء الاصطناعي، يثق QuCo-RAG بالمكتبة ("أرني الدليل"). إذا لم يكن الدليل موجوداً، فإنه يمنع الذكاء الاصطناعي من اختلاق الأمور.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →