← أحدث الأبحاث
💬 NLP

No One Size Fits All: QueryBandits for Hallucination Mitigation

تقدم الورقة البحثية QueryBandits، وهو إطار عمل لـ "المناديب السياقية" (contextual bandit) غير مرتبط بنموذج محدد، يقوم باختيار استراتيجيات إعادة صياغة الاستعلام المثلى بشكل تكيفي للتخفيف من حدة الهلوسة في النماذج اللغوية الكبيرة مغلقة المصدر، مما يثبت أن السياسات الديناميكية عبر الإنترنت تتفوق بشكل كبير على أساليب إعادة الصياغة الثابتة والأساس المرجعي الذي لا يتضمن إعادة صياغة دون الحاجة إلى إعادة تدريب النموذج.

المؤلفون الأصليون: Nicole Cho, William Watson, Alec Koppel, Sumitra Ganesh, Manuela Veloso

نُشر 2026-02-25
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Nicole Cho, William Watson, Alec Koppel, Sumitra Ganesh, Manuela Veloso

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مساعداً عبقرياً ولكنه شارد الذهن أحياناً (وهو النموذج اللغوي الكبير، أو LLM). هذا المساعد ذكي للغاية ويمكنه الإجابة على أي شيء تقريباً، لكنه أحياناً، عندما يُسأل سؤالاً صعباً، يبدأ في "الهلوسة" — أي اختلاق حقائق أو تقديم إجابات واثقة ولكنها خاطئة.

لفترة طويلة، حاول الباحثون إصلاح ذلك عبر محاولة "إعادة تدريب" عقل المساعد أو التلصص على كوده الداخلي. لكن معظم المساعدين الذين تستخدمهم الشركات فعلياً (مثل تلك الموجودة خلف جدران الدفع) هي "صناديق سوداء". لا يمكنك رؤية ما بداخلها، ولا يمكنك إعادة تدريبها. يمكنك فقط التحدث إليها.

يقدم هذا البحث QueryBandits، وهي طريقة ذكية وجديدة للتحدث مع هذه المساعدات "الصندوق الأسود" لإيقافها عن الهلوسة، دون الحاجة أبداً للمس كودها الداخلي.

إليك تفصيل الشرح باستخدام تشبيهات بسيطة:

1. المشكلة: فخ "المقاس الواحد الذي يناسب الجميع"

تخيل أنك تحاول الحصول على إجابة محددة من أمين مكتبة دقيق جداً ولكنه مشتت الذهن.

  • إذا سألته: "كم عدد الأعداد الصحيحة بين 6 و 14.8؟" قد يرتبك بسبب الرقم "6" ويقول "8" (ناسياً احتساب الـ 6 نفسها).
  • إذا سألته: "ما هي عاصمة فرنسا؟" وكان أمين المكتبة متعباً، فقد يخمن "لندن".
    حاولت الحلول السابقة استخدام خدعة واحدة فقط لكل سؤال. على سبيل المثال، قد يقولون: "أعد دائماً صياغة السؤال ليكون أبسط!" أو "أضف المزيد من التفاصيل دائماً!".
  • الخلل: أحياناً يساعد تبسيط السؤال. وأحياناً، يساعد إضافة التفاصيل. وأحياناً، يكون مجرد طرح السؤال كما هو هو الأفضل. استخدام نفس الخدعة لكل سؤال يشبه ارتداء نفس الحذاء للجري في ماراثون، وتسلق جبل، والسباحة في مسبح. هذا ببساه لا يعمل جيداً لكل شيء.

2. الحل: "المتسوق الذكي" (QueryBandits)

ابتكر المؤلفون نظاماً يسمى QueryBandits. فكر فيه كأنه متسوق شخصي فائق الذكاء يقف بينك وبين أمين المكتبة.

إليك كيف يعمل هذا المتسوق:

  1. البصمة: قبل أن تسأل أمين المكتبة سؤالاً، ينظر المتسوق إلى سؤالك ويستخرج منه "بصمة لغوية". إنه يفحص 17 شيئاً مختلفاً: هل السؤال طويل جداً؟ هل يستخدم كلمات معقدة؟ هل هو غامض؟ هل يتطلب معرفة محددة؟
  2. قائمة الخدع: لدى المتسوق قائمة من 5 طرق لإعادة كتابة سؤالك:
    • إعادة الصياغة (Paraphrase): قل الأمر بطريقة مختلفة.
    • التبسيط (Simplify): اجعله أسهل في الفهم.
    • إزالة الغموض (Disambiguate): توضيح الكلمات الغامضة.
    • التوسع (Expand): إضافة التفاصيل المفقودة.
    • توضيح المصطلحات (Clarify Terms): تعريف المصطلحات التقنية.
  3. المقامرة (جزء الـ "Bandit"): لا يعرف المتسوق يقيناً أي خدعة ستعمل بشكل أفضل لـ هذا السؤال تحديداً. لذا، يستخدم استراتيجية تسمى Contextual Bandits.
    • تخيل آلة قمار بـ 5 أذرع (الخدع الخمس).
    • ينظر المتسوق إلى "بصمة" سؤالك ويقول: "بناءً على حقيقة أن هذا السؤال يتعلق بالرياضيات وبه حد أدنى مربك، سأراهن على ذراع التوسع (Expand)".
    • يعيد كتابة السؤال باستخدام تلك الخدعة ويسأل أمين المكتبة.
  4. التعلم أثناء العمل:
    • إذا أعطى أمين المكتبة الإجابة الصحيحة، يحصل المتسوق على "مكافأة" ويتذكر: "مهلاً، التوسع في الأسئلة من هذا النوع يعمل!"
    • إذا أعطى أمين المكتبة إجابة خاطئة، يحصل المتسوق على "عقوبة" ويتعلم: "حسناً، لا تستخدم التوسع لهذا النوع من الأسئلة في المرة القادمة".
    • بمرور الوقت، يصبح المتسوق ماهراً للغاية في مطابقة خدعة إعادة الكتابة الصحيحة مع نوع السؤال المناسب.

3. النتائج: لماذا هذا مهم؟

اختبر الباحثون هذا النظام على GPT-4o (وهو نموذج من الطراز الرفيع ومغلق المصدر) عبر 16 نوعاً مختلفاً من الأسئلة (من الرياضيات إلى المعلومات العامة إلى الحقائق القانونية).

  • خط الأساس "بدون إعادة كتابة": مجرد طرح السؤال كما هو.
  • النهج "الثابت" (Static): استخدام نفس إعادة الكتابة دائماً (مثل التبسيط دائماً).
  • نهج QueryBandit: المتسوق الذكي الذي يختار أفضل إعادة كتابة في كل مرة.

النتيجة:

  • كان QueryBandit هو الفائز الواضح. لقد تفوق على نهج "بدون إعادة كتابة" بنسبة 87.5% من المرات.
  • تفوق على نهج "التبسيط الدائم" بفارق هائل (بنسبة 42% أفضل).
  • والأهم من ذلك، وجدوا أن إعادة الكتابة قد تجعل الأمور أسوأ أحياناً. إذا فرضت إعادة كتابة "تبسيط" على سؤال قانوني معقد، فقد يصبح المساعد أكثر ارتباكاً. لقد تعلم نظام الـ Bandit متى لا يعيد الكتابة، أو أي إعادة كتابة محددة يجب استخدامها.

4. الخلاصة الكبرى: "لا يوجد مقاس واحد يناسب الجميع"

عنوان البحث هو الدرس الأكثر أهمية: "لا يوجد مقاس واحد يناسب الجميع".

لا توجد جملة سحرية واحدة يمكنك إضافتها إلى "الأمر" (Prompt) لإصلاح الهلوسة. أفضل طريقة لطرح السؤال تعتمد كلياً على شكل السؤال نفسه.

  • إذا كان السؤال غامضاً، فقم بـ التوسع (Expand) فيه.
  • إذا كان السؤال معقداً للغاية، فقم بـ تبسيطه (Simplify).
  • إذا كان السؤال واضحاً بالفعل، فـ اتركه كما هو.

لماذا يعد هذا أمراً هاماً؟

تتطلب معظم أدوات سلامة الذكاء الاصطناعي الحالية الوصول إلى "عقل" الذكاء الاصطناعي (كوده وأوزانه) لإصلاحه. لكن أقوى نماذج الذكاء الاصطناعي المستخدمة في البنوك والمستشفيات والحكومات هي "صناديق سوداء" (لا يمكنك رؤية ما بداخلها).

يعمل QueryBandits حصرياً على المدخلات. إنه يشبه "فلتر" جاهز للتشغيل. لست بحاجة لتوظيف شركة الذكاء الاصطناعي لإعادة تدريب نموذجهم. أنت فقط تضع هذا "المتسوق الذكي" أمام الذكاء الاصطناعي، وهو يتعلم أثناء العمل كيفية طرح الأسئلة بطريقة تؤدي للحصول على الإجابات الصحيحة.

باختصار: بدلاً من محاولة إصلاح عقل الذكاء الاصطناعي، قمنا بإصلاح طريقة التحدث إليه، باستخدام نظام ذكي يتعلم أي أسلوب حوار هو الأفضل لكل سؤال على حدة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →