← أحدث الأبحاث
💬 NLP

PQR: A Framework to Generate Diverse and Realistic User Queries that Elicit QA Agent Failures

تقدم الورقة البحثية إطار عمل PQR، وهو إطار تكراري يجمع بين تحسين الاستعلام وتحسين التلقين لتوليد استعلامات مستخدم متنوعة وواقعية تلقائياً تعمل بفعالية على استثارة وكشف الإخفاقات في وكلاء الأسئلة والأجوبة القائمين على النماذج اللغوية الكبيرة، متفوقاً بشكل كبير على الطرق السابقة في اكتشاف الاستجابات غير المفيدة.

المؤلفون الأصليون: Yunan Lu, Luigi Liu, Omar Yahia, Arpit Sharma, Zhou Yu

نُشر 2026-05-19
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yunan Lu, Luigi Liu, Omar Yahia, Arpit Sharma, Zhou Yu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك مدير مراقبة الجودة لروبوت مساعد تسوق جديد فائق الذكاء. مهمتك هي معرفة أين يرتكب هذا الروبوت الأخطاء. لكن هناك عقبة: الروبوت بارع جداً في الإجابة على الأسئلة البسيطة مثل، "ما لون هذا القميص؟". ولإيجاد نقاط ضعفه، ستحتاج إلى طرح أسئلة مخادعة، أو مربكة، أو غريبة.

المشكلة هي أنه إذا طرحت على الروبوت أسئلة غريبة لن يطرحها أي بشر أبداً (مثل "ما هو لون الرقم 5؟")، فسيقول الروبوت ببساطة: "أنا لا أفهم". وهذا لا يخبرك بالكثير عن كيفية تعامله مع العملاء الحقيقيين. أنت بحاجة إلى أسئلة تبدو تماماً مثل شيء قد يكتبه شخص حقيقي، ولكنها تظل قادرة على خداع الروبوت ودفعه لتقديم إجابة سيئة.

تقدم هذه الورقة أداة جديدة تسمى PQR (الترقية عبر التلقين والاستعلام - Prompt-Query-Refinement) لحل هذه المشكلة. فكر في PQR كفريق "ريد تيم" (Red Team) مكون من شخصين يعملان معاً لكسر الروبوت، ولكن بطريقة محددة للغاية.

الشريكان

1. "ساحر الكلمات" (ترقية الاستعلام - Query Refinement)
تخيل ساحراً يأخذ جملة عادية ويبدأ باللعب بها. قد يقوم بـ:

  • الأخطاء الإملائية: تغيير كلمة "تفاحة" إلى "تفاخة".
  • النبرة: تحويل طلب مهذب إلى طلب فظ أو غاضب.
  • تقمص الأدوار: التظاهر بأنه أب متعب ومستعجل.

هذا الساحر ينشئ العديد من النسخ المختلفة من السؤال ليرى ما إذا كانت التغييرات الصغيرة ستؤدي إلى إرباك الروبوت. ومع ذلك، إذا تمادى الساحر في جنونه، ستبدأ الأسئلة في التحول إلى لغة غير مفهومة أو رموز برمجية، وهو أمر غير مفيد للاختبار.

2. "المخرج" (ترقية التلقين - Prompt Refinement)
تخيل مخرج أفلام يراقب محاولات الساحر. المخرج لا يكتفي بالمراقبة فحسب؛ بل يدون الملاحظات أيضاً.

  • "مهلاً، تلك النبرة الغاضبة نجحت في إرباك الروبوت!"
  • "لكن ذلك السؤال حول 'الفيزياء الكمية' كان مزيفاً للغاية. دعونا نجعل السؤال التالي يبدو أكثر واقعية كمتسوق حقيقي."

يستخدم المخرج هذه الملاحظات لكتابة مجموعة جديدة من التعليمات (التلقين/Prompt) للساحر. هو يخبر الساحر: "في المرة القادمة، حاول طرح سؤالين في وقت واحد، ولكن اجعل الأمر يبدو وكأن شخصاً حقيقياً في عجلة من أمره هو من يسأل."

كيف يعملان معاً (الحلقة التكرارية)

تضع PQR هذين الشريكين في حلقة مستمرة:

  1. يعطي المخرج للساحر مجموعة من التعليمات.
  2. يقوم الساحر بإنشاء مجموعة من الأسئلة بناءً على تلك التعليمات.
  3. يتم اختبار هذه الأسئلة على روبوت التسوق.
  4. إذا فشل الروبوت، يحتفلون بذلك! وإذا نجح، يقومون بتحليل لماذا نجح.
  5. يقوم المخرج بتحديث التعليمات بناءً على ما تعلموه، مما يجعل جولة الأسئلة التالية أكثر واقعية ومراوغة.

لماذا هذا أفضل مما سبق

قبل PQR، حاول الباحثون طريقتين رئيسيتين لإيجاد أخطاء الروبوت:

  • نهج "الهكر" (المخترق): حاولوا إجبار الروبوت على الفشل باستخدام هجمات عدوانية وغير طبيعية. وجدت هذه الطريقة الأخطاء، لكن الأسئلة بدت وكأنها برنامج كمبيوتر، وليس بشراً.
  • نهج "المُحسِّن" (Optimizer): حاولوا جعل الأسئلة تبدو مثالية، لكنهم استمروا في طرح نفس نوع الأسئلة مراراً وتكراراً، مما جعلهم يفقدون طرقاً أخرى يمكن للروبوت أن يفشل بها.

PQR هي مثل نظام هجين. فهي تجمع بين قدرة "الهكر" على إيجاد نقاط الضعف وقدرة "المُحسِّن" على الظهور بمظهر بشري.

النتائج

اختبر المؤلفون PQR على بوت تسوق إلكتروني. ووجدوا أن PBR أفضل بكثير في إيجاد الإجابات "غير المفيدة" مقارنة بالطرق الأخرى.

  • اكتشاف المزيد من الأخطاء: وجدت PQR ما بين 23% و78% أكثر من الإجابات السيئة مقارنة بالطرق الأخرى.
  • أكثر واقعية: الأسئلة التي أنشأتها بدت أكثر شبهاً بما قد يكتبه المتسوقون الحقيقيون بالفعل.
  • أكثر تنوعاً: لم تكتفِ بإيجاد نوع واحد من الأخطاء؛ بل وجدت أنواعاً مختلفة من الارتباك.

الخلاصة

PQR هي نظام ذكي ومؤتمت يتعلم كيفية طرح الأسئلة الماكرة المثالية. هي لا تحاول فقط كسر الروبوت؛ بل تحاول كسر الروبوت بطريقة تشبه التفاعل البشري الحقيقي. وهذا يساعد المطورين على إصلاح وكلاء الذكاء الاصطناعي الخاص بهم ليكونوا أكثر موثوقية عندما يستخدمهم الناس الحقيقيون.

ملاحظة: اختبرت الورقة البحثية PQR تحديداً على مساعد تسوق للعثور على الإجابات "غير المفيدة". كما نظرت باختصار في مسألة "السلامة" (منع المحتوى السيئ)، لكن التركيز الرئيسي كان على جعل الذكاء الاصطناعي مفيداً وواقعياً.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →