← أحدث الأبحاث
💬 NLP

Source-Aware Reranking for Retrieval-Augmented Generation: A Reliability Prior Approach

تقترح هذه الورقة البحثية وتقيم طريقة لإعادة ترتيب النتائج مدركة للمصدر لعملية التوليد المعزز بالاسترجاع، والتي تعيد وزن درجات الاسترجاع باستخدام أولويات موثوقية المصدر المستندة إلى المجال، مما يظهر تحسينات كبيرة في الدقة وتقليلاً في الاسترجاع العدائي على مجموعة بيانات من المجال الصحي.

المؤلفون الأصليون: Yuktha Tata Koganti, Hugo Garrido-Lestache Belinchon

نُشر 2026-07-28
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yuktha Tata Koganti, Hugo Garrido-Lestache Belinchon

البحث الأصلي مُهدى إلى الملك العام بموجب CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تدخل إلى مكتبة ضخمة وفوضوية حيث تُعاد كتابة الكتب باستمرار بواسطة روبوت فائق الذكاء. هذا الروبوت، الذي يُسمى "نموذج لغوي كبير" (Large Language Model)، بارع للغاية في تأليف القصص والإجابة على الأسئلة، لكن لديه مشكلة: فهو يختلق بعض الأمور أحياناً لأنه لا يستطيع تذكر كل حقيقة بدقة تامة. ولإصلاح ذلك، نمنح الروبوت مساعداً يُسمى "التوليد المعزز بالاسترجاع" (Retrieval-Augmented Generation أو RAG). فكر في RAG كأنه أمين مكتبة يركض إلى الرفوف، ويجلب مجموعة من الكتب التي تبدو مطابقة لسؤالك، ثم يسلمها للروبوت ليقرأها قبل أن يجيب.

المشكلة هي أن أمين المكتبة حالياً ينظر فقط إلى "الكلمات" الموجودة في الصفحة. فإذا كان السؤال عن "كيفية علاج الزكام"، فقد يجلب أمين المكتبة كتاباً طبياً رصيناً ومراجعاً علمياً، ومدونة سخيفة ومزيفة كتبها شخص عشوائي على الإنترنت. ولأن كلا النصين يستخدمان كلمات مثل "زكام"، و"عطس"، و"دواء"، يعتقد أمين المكتبة أن كلا المصدرين جيدان بالتساوي. وفي العالم الحقيقي، هذا أمر خطير؛ فإذا قرأ الروبوت تلك المدونة المزيفة، فقد يعطيك نصيحة سيئة. تسأل هذه الورقة سؤالاً بسيطاً: ماذا لو استطاع أمين المكتبة أيضاً النظر إلى "غلاف" الكتاب ليرى من هو مؤلفه، ولا يجلب إلا الكتب من المؤلفين الموثوقين؟

تقترح هذه الورقة، التي تحمل عنوان "إعادة الترتيب المدركة للمصدر في التوليد المعزز بالاسترجاع" (Source-Aware Reranking for Retrieval-Augmented Generation)، حلاً ذكياً وبسيطاً لهذه المشكلة. فبدلاً من بناء أمين مكتبة روبوت جديد ومعقد، يقترح المؤلفون قاعدة بسيطة: عندما يجد أمين المكتبة مجموعة من الكتب المتطابقة، يجب عليه إعطاء "درجة موثوقية" لكل منها بناءً على الجهة التي نشرتها. فالكتاب الصادر عن وكالة صحية حكومية يحصل على درجة عالية، بينما الكتاب الصادر عن مدونة مولدة بالذكاء الاصطناعي يحصل على درجة منخفضة. بعد ذلك، يقوم أمين المكتبة بضرب "درجة تطابق الكلمات" في هذه "درجة الثقة".

اختبر المؤلفون هذه الفكرة على مجموعة صغيرة مكونة من 120 وثيقة متعلقة بالصحة، بما في ذلك 10 وثائق "مزيفة" مخادعة صُممت لتبدو مثل نصائح طبية حقيقية ولكنها تحتوي على أكاذيب. ووجدوا أنه عندما استخدموا هذه القاعدة القائمة على الثقة، أصبح النظام أفضل بكثير في اختيار الإجابات الصحيحة. وتحديداً، قفزت دقة أفضل 5 نتائج من 48% إلى 72%. والأهم من ذلك، بدأ النظام في اختيار عدد أقل من تلك الوثائق المزيفة والمضللة، حيث انخفض معدل الاختيارات "السيئة" من 32% إلى 28%.

ومع ذلك، فإن المؤلفين حذرون جداً من وصف هذا الحل بأنه حل سحري. فهم يعترفون بأن اختبارهم كان أشبه بتجربة علمية منضبطة في مختبر، وليس معركة حقيقية ضد مخترق ماكر في العالم الواقعي. في إعدادهم، كانت الوثائق المزيفة سهلة الكشف لأنها حملت ملصقات "مزيفة" على أغلفتها. فإذا تمكن شخص سيئ النية من تسريب وثيقة مزيفة إلى المكتبة ووضع عليها ملصق "مسؤول حكومي"، فسيتم خداع هذا النظام البسيط. تشير الورقة إلى أنه بينما تعد هذه الطريقة خطوة أولى رائعة وتعمل بشكل جيد في حالات محددة، إلا أنها ليست درعاً مثالياً بعد. وهي تقترح أننا بحاجة إلى الجمع بين فحص "الغلاف" (المصدر) وقراءة "الصفحات" (المحتوى) لجعل الروبوت آمناً وذكياً حقاً.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →