← أحدث الأبحاث
💻 computer science

The CitizenQuery Benchmark: A Novel Dataset and Evaluation Pipeline for Measuring LLM Performance in Citizen Query Tasks

تقدم هذه الورقة CitizenQuery-UK، وهي مجموعة بيانات مرجعية جديدة تتكون من 22,000 استعلام اصطناعي تم إنشاؤها بناءً على معلومات حكومية بريطانية، وتقيم 11 نموذجاً لغوياً كبيراً من حيث الواقعية، والامتناع عن الإجابة، والإسهاب لتسليط الضوء على تحديات الموثوقية الحرجة والحاجة إلى الإقرار بقابلية الذكاء الاصطناًعي للخطأ في تطبيقات القطاع العام.

المؤلفون الأصليون: Neil Majithia, Rajat Shinde, Zo Chapman, Prajun Trital, Jordan Decker, Manil Maskey, Elena Simperl, Nigel Shadbolt

نُشر 2026-02-05
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Neil Majithia, Rajat Shinde, Zo Chapman, Prajun Trital, Jordan Decker, Manil Maskey, Elena Simperl, Nigel Shadbolt

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك شخص عادي يحاول فهم قاعدة حكومية مربكة، مثل كيفية المطالبة بميزة معينة أو ملء نموذج ضريبي. في الماضي، ربما كنت ستتصل بخدمة المساعدة أو تبحث في موقع حكومي. أما اليوم، فقد تسأل روبوت دردشة ذكي للغاية.

هذه الورقة البحثية تدور حول بناء "تقرير درجات" ضخم لاختبار مدى قدرة روبوتات الدردشة هذه على التعامل مع تلك الأسئلة المحددة المتعلقة بالقواعد الحكومية البريطانية. ويطلق المؤلفون على تقرير الدرجات هذا اسم CitizenQuery-UK.

إليك تفصيل لما قاموا به وما وجدوه، باستخدام تشبيهات بسيطة:

١. المشكلة: فخ "ثق بي"

تخيل أنك تسأل روبوت ذكاء اصطناعي واثق وسريع التحدث عن نصيحة بشأن ضرائبك. يعطيك إجابة طويلة ومفصلة. ولكن ماذا لو اخترع قاعدة غير موجودة؟ في الدردشة العادية، قد يكون ذلك مجرد خطأ مضحك. ولكن مع القواعد الحكومية، فإن حقيقة مختلقة قد تكلفك مالاً، أو تضعك في مشكلة مع القانون، أو تدمر حياتك.

يقول المؤلفون: "لا يمكننا فقط الوثوق بالذكاء الاصطعي لأنه يبدو ذكياً. نحن بحاجة إلى دليل على أنه يقول الحقيقة".

٢. الحل: بناء "الامتحان" (مجموعة البيانات)

لاختبار الذكاء الاصطناعي، أنت بحاجة إلى اختبار. لكن لا يمكنك مجرد تأليف أسئلة؛ يجب أن تكون حقيقية.

  • المصدر: أخذوا آلاف الصفحات من gov.uk (الموقع الرسمي للحكومة البريطانية)، والذي يعد بمثابة "الإنجيل" للقواعد الحكومية.
  • الأسئلة: لم يكتفوا بكتابة أسئلة آلية؛ بل استخدموا أمثلة حقيقية من أشخاص يطلبون النصيحة على موقع Reddit لجعل الأسئلة تبدو كما يتحدث البشر الحقيقيون فعلياً (بشكل فوضوي، ومحدد، وأحياناً مرتبك).
  • الشخصيات: أنشأوا "شخصيات" للأسئلة. على سبيل المثال، سؤال حول رعاية الأطفال يتم تخصيصه لشخصية "والد"، وليس "طفل". هذا يضمن اختبار الذكاء الاصطناعي فيما إذا كان يفهم السياق الخاص بالشخص الذي يسأل.
  • النتيجة: بنوا مجموعة بيانات مكونة من ٢٢,٠٠٠ زوج من الأسئلة والأجوبة. فكر في هذا كأنه امتحان نهائي ضخم مكون من ٢٢,٠٠٠ سؤال حيث "الإجابات الصحيحة" مكتوبة بالفعل في النص الرسمي للحكومة.

٣. نظام التصحيح: كيف تحققوا من العمل

لم يكتفوا بسؤال "هل أصاب الذكاء الاصطناعي؟" بل استخدموا عملية تصحيح مكونة من ثلاث خطوات ليكونوا دقيقين للغاية:

  • الخطوة ١: فحص "التجاهل الصامت" (الامتناع): هل يقول الذكاء الاصطناعي "لا أعرف" عندما لا يكون متأكداً؟ أم أنه يكتفي بالتخمين؟ أراد المؤلفون معرفة ما إذا كان الذكاء الاصطناعي سيملك الشجاعة للاعتراف بأنه لا يعرف، أم أنه سيكون متلهفاً جداً للكلام.
  • الخطوة ٢: التفكيك (الذرية): تخيل أن الذكاء الاصطناعي يكتب فقرة طويلة. قام المصححون بتفكيك تلك الفقرة إلى حقائق فردية صغيرة (مثل تفكيك قلعة ليجو إلى قطع منفردة).
  • الخطوة ٣: "مطابقة الحقيقة" (التحقق): قارنوا كل "قطعة" (حقيقة) قالها الذكاء الاصطناعي مقابل "القطع" الموجودة في الإجابة الحكومية الرسمية.
    • الدرجة (F1@K): منحوا الذكاء الاصطناعي درجة بناءً على شيئين: هل تضمن الحقائق الصحيحة؟ وهل تضمن فقط الحقائق الصحيحة (دون إضافة الكثير من الحشو الزائد)؟

٤. النتائج: ماذا قال تقرير الدرجات

اختبروا ١١ نموذجاً مختلفاً من نماذج الذكاء الاصطناعي (مثل النماذج من OpenAI وGoogle وMeta وغيرها) ووجدوا بعض الأشياء المثيرة للاهتمام:

  • مشكلة "الثرثرة": تقريباً كل نماذج الذكاء الاصطناعي تحدثت أكثر من اللازم. كانوا مثل طالب يكتب مقالاً كاملاً عندما يُسأل سؤالاً بسيطاً. لقد أضافوا حقائق إضافية لم تكن موجودة في النص الحكومي الرسمي. وهذا ما يسمى بالإسهاب (verbosity).
  • مشكلة "الصمت": نادراً ما قال الذكاء الاصطناعي "لا أعرف". حتى عندما كانوا مخطئين، استمروا في الكلام. نادراً ما "امتنعوا" عن الإجابة.
  • "الذيل الطويل" للأخطاء: في معظم الأوقات، أصاب الذكاء الاصطناعي النقاط الرئيسية. ولكن عندما أخطأوا، أخطأوا بشكل جسيم جداً. الأمر يشبه طالباً يحصل على درجة (أ) في الأسئلة السهلة ولكنه يرسب تماماً في الأسئلة الصعبة. هذا يجعل النتائج غير قابلة للتنبؤ.
  • المفتوح مقابل المغلق: بعض النماذج "المفتوحة" (حيث الكود الخاص بها متاح للعامة) قدمت أداءً جيداً تماماً مثل النماذج "المغلقة" المكلفة. لست بحاجة بالضرورة إلى أغلى أنواع الذكاء الاصطناعي للحصول على نتائج جيدة.

٥. الخلاصة الكبرى

تخلص الورقة البحثية إلى أنه بينما يتحسن الذكاء الاصطناعي، إلا أنه حالياً متلهف جداً للكلام وخائف جداً من الاعتراف بأنه مخطئ بالنسبة للنصائح الحكومية عالية المخاطر.

إذا كان الذكاء الاصطناعي سيصبح دليلك لقواعد الحكومة، فعليه أن يتعلم شيئين:
١. كن موجزاً: التزم بالحقائق الموجودة في الموقع الحكومي؛ ولا تؤلف قصصاً إضافية.
٢. كن متواضعاً: إذا كنت لا تعرف الإجابة، فيجب أن تقول "لا أعرف" بدلاً من التخمين.

لقد بنى المؤلفون هذا "الامتحان" (CitizenQuery-UK) لكي تتمكن الحكومات وشركات التكنولوجيا من الاستمرار في اختبار الذكاء الاصطناعي للتأكد من أنه سيصبح آمناً وموثوقاً بما يكفي لمساعدتهم في مشاكل حياتهم الحقيقية. هم لا يقولون إن الذكاء الاصطناعي جاهز لاستبدال موظفي النصائح البشريين بعد، بل يقولون: "ها هي المسطرة التي نقيس بها مدى اقترابنا من الجاهزية".

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →