BERAG: Bayesian Ensemble Retrieval-Augmented Generation for Knowledge-based Visual Question Answering
يُعد BERAG (التوليد المعزز بالاسترجاع عبر المجموعات البايزية) إطار عمل جديداً يحسن التوليد المعزز بالاسترجاع من خلال تكييف النماذج اللغوية مع الوثائق الفردية واستخدام قاعدة بايز لتحديث أوزان الوثائق توكنًا بتوكن، مما يقلل بفعالية من تأثير "الضياع في المنتصف" ويحسن الإسناد في الإجابة على الأسئلة البصرية القائمة على المعرفة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك طالب تجلس لتأدية امتحان مفتوح المصادر ضخم. لديك كومة من 50 كتاباً مختلفاً لمساعدتك في الإجابة على سؤال واحد.
حالياً، تستخدم معظم نماذج الذكاء الاصطناعي ("الطلاب") طريقة تسمى "RAG التجميعي" (Concatenative RAG). هذه الطريقة تشبه أخذ الكتب الخمسين جميعها، وتمزيق كل صفحة منها، ثم لصقها معاً لتصبح لفافة واحدة عملاقة بطول ميل كامل. ثم يحاول الطالب قراءة تلك اللفافة العملاقة بأكملها للعثجد على الإجابة.
وهذا يخلق ثلاث مشكلات كبيرة:
- مشكلة "الضياع في المنتصف": إذا كانت الإجابة في الصفحة 250 من تلك اللفافة التي يبلغ طولها ميلاً، فغالباً ما يتشتت انتباه الطالب بالبداية والنهاية ويفقد الإجابة تماماً.
- مشكلة "فرط الذاكرة": قراءة لفافة بطول ميل أمر بطيء ومرهق للغاية؛ فهو يستنزف كمية هائلة من الطاقة والوقت.
- مشكلة "من قال ذلك؟": إذا قدم الطالب إجابة، فمن الصعب معرفة أي كتاب تحديداً هو الذي قدم تلك الحقيقة.
لقد اقترح الباحثون في جامعة كامبريدج طريقة أكثر ذكاءً للدراسة تسمى BERAG.
طريقة BERAG: نهج "لجنة الخبراء"
بدلاً من وجود طالب واحد يقرأ لفافة عملاقة واحدة، تخيل بدلاً من ذلك أن لديك 50 خبيراً صغيراً يجلسون في غرفة. يُعطى كل خبير كتاباً واحداً فقط.
عند طرح سؤال ما، ينظر جميع الخب expertos الخمسين إلى كتابهم الخاص ويهمسون بإجابتهم المحتملة. ولكن هنا يكمن السحر "البيزي" (Bayesian): الخبراء يستمعون إلى بعضهم البعض.
1. نظام "التصويت الذكي" (المجموعة البيزية - Bayesian Ensemble)
بينما يتم كتابة الإجابة كلمة بكلمة، يعقد الخبراء تصويتاً مستمراً.
- الأولوية (الانطباع الأول): قبل البدء حتى، ينظرون إلى السؤال ويخمنون: "بناءً على عنوان كتابي، أعتقد أنني قد أكون مفيداً".
- النتيماج (التحديث في الوقت الفจริง): مع نطق الكلمات القليلة الأولى من الإجابة، يقوم الخبراء بتحديث مستوى ثقتهم. إذا بدأت الإجابة بـ "عاصمة فرنسا هي..."، فإن الخبير الذي يحمل كتاب الجغرافيا يفكر: "آه! أنا بالتأكيد ذو صلة!" وتصبح قوة صوته أكبر بكثير. أما الخبير الذي يحمل كتاباً عن الطبخ فيفكر: "ليس لدي علاقة بهذا الموضوع"، فيتلاشى صوته في الخلفية.
2. خدعة "التركيز" (تقليم المستندات - Document Pruning)
بسبب قيام الخبراء بالتصويت باستمرار، يمكن للنظام أن يدرك بسرعة أن 45 من الخبراء يتحدثون بهراء. يمكنه إخبار هؤلاء الخبماء الـ 45 بأن "يصمتوا" والاستماع فقط إلى الخبراء الخمسة الذين يعرفون الإجابة بالفعل. هذا يجعل العملية أسرع من قراءة اللفافة العملاقة.
3. زر "لا أعرف" (التنصل - Deflection)
في الطريقة القديمة، إذا لم تكن الإجابة موجودة في الكتب، فقد يقوم الطالب بمجرد "الهلوسة" (اختلاق شيء ما) لأنه يشعر بالضغط لإنهاء اللفافة.
في طريقة BERAG، إذا لم يشعر أي من الخبراء بالثقة — إذا كانت جميع "أصواتهم" منخفضة للغاية — يمكن للنظام أن يقول: "انتظروا، لا أحد من هذه الكتب لديه الإجابة. لا ينبغي لي أن أخمن". وهذا يجعل الذكاء الاصطناعي أكثر صدقاً وموثوقية.
لماذا يهم هذا الأمر؟
اختبر الباحثون هذه الطريقة في "الإجابة على الأسئلة المرئية" — وهي المهام التي يتعين فيها على الذكاء الاصطناعي النظر إلى الصور والمستندات (مثل شرائح PowerPoint) للإجابة على الأسئلة.
والنتائج كانت مبهرة:
- إنها أكثر دقة: لا تقع في فخ "الضياع في المنتصف" لأنها لا تهتم بترتيب الكتب؛ بل تهتم فقط بجودة المعلومات.
- إنها أفضل في مهام "إبرة في كومة قش": يمكنها العثية على حقيقة صغيرة محددة مخبأة في كومة ضخمة من الصور والنصوص بشكل أكثر فعالية من الذكاء الاصطناعي الحالي.
- إنها أكثر كفاءة: من خلال "تقليم" الكتب غير المفيدة، يمكنها في الواقع إنهاء المهمة بشكل أسرع من طريقة "اللفافة العملاقة" القديمة والبطيئة.
باخت-القول: تحول BERAG الطالب المرتبك الذي يقرأ لفافة بطول ميل إلى فريق من المتخصصين المنسقين الذين يصوتون على الحقيقة في الوقت الفعلي.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.