-Knowledge: Evaluating Conversational Agents over Unstructured Knowledge
تقدم هذه الورقة البحثية -Knowledge، وهو معيار مرجعي جديد يتميز بمجال -Banking لتقييم قدرة الوكلاء الحواريين على تنسيق استرجاع المعرفة غير المهيكلة مع استخدام الأدوات في سير عمل معقد وقائم على السياسات، مما يكشف أن حتى النماذج الرائدة تعاني من انخفاض معدلات النجاح والموثوقية في مثل هذه التفاعلات الواقعية طويلة الأمد.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك وظفت مساعداً شخصياً فائق الذكاء ومدرباً تدريباً عالياً لمساعدتك في إدارة حسابك البنكي. قلت له: "لقد فقدت محفظتي، يرجى تجميد بطاقاتي والتحقق من وجود أي عمليات احتيال".
في الماضي، كنا نختبر هؤلاء المساعدين عبر إعطائهم قائمة من الأدوات (مثل زر "تجميد البطاقة") وسؤالهم عن الضغط على الزر الصحيح. لكن في العالم الحقيقي، الأمور أكثر تعقيداً. مساعدك لا يحتاج فقط إلى زر؛ بل يحتاج إلى معرفة أين يوجد الزر، ومتى يضغط عليه، وما هي القواعد التي تنطبق قبل الضغط عليه. عليه أن يقرأ مكتبة ضخمة وفوضوية مكونة من 700 وثيقة مختلفة (سياسات، أسئلة شائعة، قواعد داخلية) أثناء التحدث إليك، وفي نفس الوقت يحاول حل مشكلتك.
تقدم هذه الورقة البحثية اختباراً جديداً يسمى τ-Knowledge (تاو-المعرفة) لمعرفة ما إذا كان بإمكان وكلاء الذكاء الاصطناعي التعامل فعلياً مع هذه الفوضى الواقعية.
إليك التفاصيل باستخدام تشبيهات بسيطة:
1. المشكلة: "أمين المكتبة الأعمى"
تخيل أن وكيل الذكاء الاصطناعي الخاص بك هو أمين مكتبة تم توظيفه للعثور على كتاب معين في مكتبة تحتوي على 700 كتاب.
- الاختبارات القديمة: كنا نعطي أمين المكتبة عنوان الكتاب ونسأله: "هل يمكنك العثود على هذا الكتاب؟" أو "هل يمكنك استعارة هذا الكتاب؟". كنا نختبر العثور على الكتاب واستعارته كمهام منفصلة.
- العالم الحقيقي: في الواقع، أمين المكتبة لا يعرف عناوين الكتب. عليه أن يتجول في الممرات، ويقرأ عناوين 700 كتاب، ويكتشف أي منها يحتوي على القواعد المتعلقة بـ "المحافظ المفقودة"، ويقرأ التفاصيل الدقيقة، ثم يقرر ما إذا كان سيجمد بطاقتك أم يلغيها. إذا اختار الكتاب الخطأ، فقد يجمد البطاقة الخطأ أو يخالف قاعدة ما.
2. الاختبار الجديد: "τ-Banking"
قام الباحثون ببناء بنك وهمي يسمى τ-Banking.
- المكتبة: تحتوي على 700 وثيقة حول بطاقات ائتمان وحسابات توفير وهمية وقواعد صارمة (مثلاً: "لا يمكنك إغلاق الحساب إذا كان هناك نزاع معلق").
- الأدوات: يمتلك الوكيل أدوات لتغيير قاعدة البيانات فعلياً (مثل "تجميد البطاقة" أو "إغلاق الحساب")، ولكن هم لا يعرفون بوجود هذه الأدوات بعد. عليهم أولاً العثور على اسم الأداة داخل الوثائق.
- العميل: محاكاة لبشر قد يكون غامضاً ("لقت أشياءي") أو يغير رأيه في منتصف المحادثة.
3. كيف يعمل الاختبار
يجب على وكيل الذكاء الاصطناعي أن يعمل كموظف خدمة عملاء حقيقي:
- يستمع للمستخدم.
- يبحث في المكتبة (باستخدام أدوات مثل محرك بحث أو مستعرض ملفات) للعثيد على السياسة المناسبة.
- يقرأ السياسة لفهم القواعد.
- يجد الأداة المحددة المطلوبة لحل المشكلة.
- ينفذ الحل مع اتباع القواعد.
4. النتائج: "الوكلاء الأذكياء" لا يزالون عالقين
اختبر الباحثون أذكى نماذج الذكاء الاصطناي في العالم (مثل GPT-5.2 و Claude-4.5). كانت النتائج مفاجئة ومخيفة نوعاً ما:
- معدل النجاح منخفض: حتى أفضل نماذج الذكاء الاصطناعي نجحت بنسبة 25% فقط في المحاولة الأولى. وهذا يعني أن 3 من كل 4 مرات، فشلوا في مساعدة العميل بشكل صحيح.
- "الاختبار الذهبي": حاولوا إعطاء الذكاء الاصطناعي الوثائق الصحيحة تماماً فوراً (بإزالة جزء البحث). ومع ذلك، ارتفع معدل النجاح إلى حوالي 40% فقط.
- التشبيه: الأمر يشبه إعطاء طاهٍ الوصفة والمكونات الصحيحة تماماً، لكنه لا يزال يحرق الوجبة لأنه لا يفهم تعليمات الطبخ. المشكلة ليست فقط في العثور على المعلومات؛ بل في الاستنتاج المنطقي بها.
- "فخ البحث": حاولت بعض نماذج الذكاء الاصطناعي البحث بشكل مفرط. فكانت تقرأ 20 وثيقة، ثم ترتبك، وتبحث مجدداً، وتضيع الوقت. بينما قامت نماذج أخرى بالتخمين دون قراءة ما يكفي.
5. لماذا يهم هذا؟
تجادل الورقة بأننا بحاجة للتوقف عن اختبار الذكاء الاصطناعي فقط بناءً على مدى جودة "البحث" لديهم أو مدى جودة "اتباع التعليمات". نحن بحاجة لاختبارهم على الكفاءة والموثوقية في بيئة واقعية فوضوية.
- الكفاءة: إذا استغرق الذكاء الاصطناعي 10 دقائق لحل مشكلة كان ينبغي أن تستغرق دقيقتين، فسيشعر العميل بالإحباط.
- الموثوقية: إذا قام الذكاء الاصطناعي بتجميد بطاقتك عندما لا ينبغي له ذلك، أو أغفل تنبيهاً بشأن عملية احتيال، فهذه كارثة.
الخلاصة الكبرى
فكر في وكلاء الذكاء الاصطناعي الحاليين كـ طلاب عباقرة لكنهم سيئون جداً في اتباع الخريطة. يمكنهم قراءة كتاب، ولكن إذا طلبت منهم التنقل في مدينة معقدة (قاعدة بيانات البنك) أثناء التحدث إلى سائح مرتبك (المستخدم)، فإنهم غالباً ما يضيعون الطريق، أو يركبون الحافلة الخطأ، أو ينسون قواعد المرور.
τ-Knowledge هو اختبار القيادة الجديد الذي يجبر هؤلاء الوكلاء على إثبات قدرتهم على قيادة السيارة فعلياً، وليس مجرد تسميع دليل السائق. تظهر النتائج أنه على الرغم من أن "الطلاب" أذكياء، إلا أن أمامهم طريقاً طويلاً قبل أن يمكن الوثوق بهم لقيادتنا بمفردهم.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.