← أحدث الأبحاث
🤖 AI

Do Agents Know What They Can't Do? Evaluating Feasibility Awareness in Tool-Using Agents

تقدم هذه الورقة FeasiGen، وهو مسار مؤتمت لإنشاء مهام غير قابلة للتنفيذ لوكلاء استخدام الأدوات عبر حجب أدوات حاسمة، وتستخدمه للكشف عن افتقار الوكلاء الحاليين إلى الوعي القوي بالجدوى، حيث يستمرون غالباً في التنفيذ على مهام مستحيلة بمعدلات خطأ عالية، رغم أن البنى متعددة الوكلاء تظهر أداءً محسناً.

المؤلفون الأصليون: Liang Cheng, Mingsheng Cai, Jiuming Jiang, Luo Mai

نُشر 2026-05-28
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Liang Cheng, Mingsheng Cai, Jiuming Jiang, Luo Mai

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك وظفت مساعداً ذكياً ومتحمساً لمساعدتك في مشروع معقد، مثل حجز رحلة طيران ودفع ثمنها. لقد أعطيت مساعدك قائمة بالأدوات التي يمكنه استخدامها: محرك بحث، ومحرك حجز، ومعالج بطاقات ائتمان.

الآن، تخيل أنك سحبت سراً معالج بطاقات الائتمان من صندوق أدواته قبل أن يبدأ.

المشكلة:
معظم المساعدين الذكيّين (AI) اليوم يشبهون ذلك المساعد المتحمس الذي لا يعلم أنه يفتقد أداة ما. يبدأون بالبحث عن الرحلات، ويجدون عرضاً رائعاً، ثم يحاولون الدفع. وعندما يدركون أنهم لا يستطيعون الدفع، لا يكتفون بالقول: "أوه، لا يمكنني القيام بهذا"، بل يستمرون في المحاولة. قد يحاولون الدفع مرة أخرى، أو يحاولون البحث عن وسيلة دفع مختلفة غير موجودة، أو يكتبون مقالاً طويلاً حول سبب عدم قدرتهم على الدفع. إنهم يهدرون قدراً هائلاً من الوقت والطاقة (قوة الحوسبة) في مهمة كانت مستحيلة منذ البداية.

الحل (FeasiGen):
قام الباحثون في هذه الورقة البحثية ببناء نظام يسمى FeasiGen (مولد الجدوى - Feasibility Generator). فكر فيه كآلة "فحص للواقع".

  1. تعلم القواعد: أولاً، راقبوا العديد من المساعدين الذكيّين وهم يكملون مهاماً بنجاح. نظروا إلى "آثار الأقدام" (الأدوات المستخدمة تحديداً) ليروا أي الأدوات كانت ضرورية تماماً لكل عملية نجاح. في مثال الرحلة الجوية، لاحظوا أن كل عملية حجز ناجحة استخدمت "واجهة برمجة تطبيقات الدفع" (Payment API).
  2. صنع الفخ: بعد ذلك، أخذوا نفس تلك المهام وحذفوا سراً تلك الأدوات الحيوية. لقد حولوا مهمة قابلة للحل إلى مهمة مستحيلة.
  3. الاختبار: قدموا هذه المهام "المعطلة" لتسعة نماذج مختلفة من الذكاء الاصطناعي لمعرفة ما إذا كانت النماذج ستدرك: "مهلاً، أنا أفتقد أداة رئيسية، يجب أن أتوقف الآن"، أم أنها ستستمر في الدوران في حلقات مفرغة.

ما وجدوه:
كانت النتائج مفاجئة ومثيرة للقلق قليلاً فيما يتعلق بكفاءة الذكاء الاصطناائي:

  • معظم نماذج الذكاء الاصطناعي تستمر في العمل: حتى النماذج الأكثر ذكاءً فشلت غالباً في التوقف. فقد استمرت في محاولة حل المهمة المستحيلة في حوالي 23% إلى 74% من الحالات. الأمر يشبه سائقاً يحاول القيادة عبر جدار لأنه نسي التحقق مما إذا كان الطريق قد انتهى.
  • تكلفة العناد: عندما يستمر الذكاء الاصطناعي في المحاولة في مهمة مستحيلة، فإنه يستخدم من 2 إلى 5 أضعاف قوة الحوسبة (الرموز/Tokens) عما لو توقف فوراً. إنه الفرق بين المشي إلى نهاية شارع مسدود والوعي بأنك ضللت الطريق، وبين المشي إلى هناك، ثم الالتفاف والعودة من جديد.
  • العمل الجماعي يساعد: عندما وضع الباحثون "فريقاً" من الذكاء الاصطناعي (واحد للتخطيط وآخر للعمل)، كان الفريق أفضل بكثير في اكتشاف الأدوات المفقودة. حيث يقوم "المخطط" بفحص الأدوات أولاً، ويدرك أن شيئاً ما مفقود، ويقول "توقف" قبل أن يبدأ "العامل" حتى في العمل. وقد قلل هذا من الجهد الضائع بشكل كبير.
  • التفكير بعمق يساعد (أحياناً): النماذج التي أُجبرت على "التفكير خطوة بخطوة" قبل التصرف كانت عموماً أفضل في اكتشاف الأدوات المفقودة، رغم أن هذا لم ينطبق على كل نموذج.

الخلاصة الكبرى:
في الوقت الحالي، نحن نختبر الذكاء الاصطناعي غالباً من خلال رؤية ما إذا كان بإمكانه إكمال المهمة. تقول هذه الورقة البحثية إن هذا ليس كافياً. نحن بحاجة أيضاً إلى اختبار ما إذا كانوا يعرفون متى لا يفعلون شيئاً ما. إن الذكاء الاصطناعي الذي يعرف متى يتوقف لا يقل أهمية عن الذكاء الاصطناعي الذي يعرف كيف ينهي المهمة. حالياً، معظم نماذج الذكاء الاصطناعي سيئة جداً في معرفة متى تكون عالقة في طريق مسدود، مما يؤدي إلى الكثير من الطاقة والمال المهدورين.

ملاحظة حول الحدود:
يعترف الباحثون بأن اختبارهم يعمل فقط في البيئات "المغلقة" حيث تكون قائمة الأدوات ثابتة ومعروفة. إذا كان بإمكان الذكاء الاصطناعي ابتكار أدوات جديدة سحرياً أو العثور عليها على الإنترنت المفتوح، فلن يعمل هذا الاختبار بنفس الطريقة. ولكن بالنسبة للأنظمة التي تكون فيها الأدوات محددة بصرامة، فإن "فحص الواقع" هذا يعد طريقة جديدة وحاسمة لقياس مدى ذكاء الذكاء الاصطناعي حقاً.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →