← أحدث الأبحاث
🤖 AI

AgentFloor: How Far Up the tool use Ladder Can Small Open-Weight Models Go?

تقدم الورقة البحثية AgentFloor، وهو معيار متعدد المستويات يوضح أن النماذج الصغيرة ذات الأوزان المفتوحة يمكنها التعامل بفعالية مع غالبية مهام استخدام الأدوات الروتينية قصيرة المدى في سير عمل الوكلاء، مع حجز النماذج الرائدة الكبيرة فقط للتخطيط المعقد طويل المدى مع تحقيق أداء إجمالي مماثل بتكلفة أقل.

المؤلفون الأصليون: Ranit Karmakar, Jayita Chatterjee

نُشر 2026-05-04
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Ranit Karmakar, Jayita Chatterjee

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تدير شركة توصيل مزدحمة. في كل مرة يطلب فيها عميل طلباً، يتعين على نظامك اتخاذ عشرات القرارات الصغيرة: "تحقق من العنوان"، "ابحث عن السعر"، "اتصل بالمستودع"، "اطبع الملصق".

لفترة طويلة، كانت القاعدة هي: "استخدم مديرنا التنفيذي الأكثر تكلفة وذكاءً لكل قرار واحد". حتى للأشياء البسيطة مثل "التحقق من العنوان"، كنت ستوظف المدير التنفيذي. هذا يعمل، لكنه يكلف ثروة ويستغر وقتًا طويلاً.

يطرح بحث AgentFloor سؤالاً بسيطاً: هل نحتاج حقاً إلى المدير التنفيذي لكل مهمة؟ أم يمكننا توظيف متدرب ذكي وسريع ورخيص للوظائف الروتينية، وتوفير المدير التنفيذي فقط للمشاكل الصعبة حقاً؟

لمعرفة ذلك، بنى الباحثون مضمار عقبات عملاق مكون من 30 خطوة (اختبار معياري) مصمم لاختبار مدى قدرة "عمال" الذكاء الاصطناعي المختلفين على استخدام الأدوات. اختبروا 16 نموذجاً مختلفاً من نماذج الذكاء الاصطناعي بأحجام متفاوتة (من "المتدربين" الصغار إلى "المديرين التنفيذيين" الضخمين) مقابل أفضل ذكاء اصطنا-ي حالي (GPT-5).

إليكم ما وجدوه، مشروحاً من خلال بعض التشبيهات البسيطة:

1. "سلم" الصعوبة

نظم الباحثون المهام في سلم مكون من 6 درجات. كلما صعدت للأعلى، تصبح الوظائف أصعب:

  • الدرجتان 1 و2 (الطابق الأرضي): تعليمات بسيطة واستخدام أداة واحدة (مثل البحث عن رقم هاتف).
  • الدرجتان 3 و4 (المنتصف): ربط أداتين معاً أو اتخاذ قرار بناءً على نتيجة (مثل "إذا كان السعر مرتفعاً، اتصل بالمدير").
  • الدرجتان 5 و6 (القمة): تخطيط معقد حيث يتعين عليك تذكر القواعد لفترة طويلة وتنسيق خطوات عديدة دون أن تفقد المسار.

2. النتائج: من يستطيع التسلق؟

كشفت الدراسة عن وجود "أرضية" واضحة حيث تتوقف النماذج الصغيرة عن القدرة على أداء المهمة.

  • الطابق الأرضي (الدرجتان 1 و2): النماذج الصغيرة والرخيصة (التي تمثل "المتدربين") هي في الواقع أفضل أو مساوية في الجودة للمدير التنفيذي المكلف. يمكنهم اتباع التعليمات البسيطة واستخدام الأدوات الفردية بشكل مثالي. في الواقع، كانت النماذج الصغيرة سريعة ورخيصة لدرجة أنها استطاعت القيام بنفس القدر من العمل بتكلفة أقل بـ 15 مرة وبسرعة أكبر بـ 2.5 مرة.
  • درجات المنتصف (الدرجتان 3 و4): لا تزال النماذج الصغيرة تؤدي عملاً رائعاً. إنها قريبة جداً من أداء المدير التنفيذي. لم تستطع الدراسة القول بأنها متساوية تماماً بيقين إحصائي بنسبة 100%، لكنها كانت قريبة بما يكفي لتكون مفيدة.
  • القمة (الدرجتان 5 و6): هنا يظهر الفارق. عندما تتطلب المهمة تخطيطاً طويل الأمد وتذكر قواعد عديدة في آن واحد، تبدأ النماذج الصغيرة في التعثر. يصابون بالارتباك، أو تنفد منهم "الخطوات" (مثل العداء الذي يتعب)، أو يبدأون في ابتكار أدوات غير موجودة. لا يزال المدير التنفيذي الكبير (GPT-5) أفضل هنا، ولكن حتى المدير التنفيذي ليس مثالياً؛ فهو لا يزال يفشل كثيراً في هذه المهام الأكثر صعوبة.

3. "الحل السحري" لم ينجح

حاول الباحثون إعطاء النماذج الصغيرة "ورقة غش" (مطالبة خاصة/Prompt) لمساعدتها على تسلق الدرجات الأعلى، آملين أن يجعلها بذكاء المدير التنفيذي.

  • النتيجة: لم ينجح الأمر بشكل شامل. الحيلة التي ساعدت نموذجاً معيناً جعلت نموذجاً آخر أسوأ أحياناً. الأمر يشبه إعطاء حذاء جري محدد لعداء ماراثون؛ قد يساعد ذلك العداء، لكنه قد يعيق شخصاً آخر. لا توجد "أداة سحرية" واحدة تجعل النموذج الصغير ذكياً فوراً مثل النموذج الكبير في التخطيط المعقد.

4. الخلاصة الكبرى: استراتيجية "التوجيه الذكي"

يقترح البحث طريقة جديدة لبناء أنظمة الذكاء الاصطنا، والتي يسمونها التوجيه (Routing).

بدلاً من استخدام الذكاء الاصطناعي الضخم، البطيء، وفائق الذكاء لكل شيء، يجب عليك بناء نظام يعمل كمدير ذكي:

  1. أرسل الوظائف الروتينية السهلة (التحقق من البيانات، عمليات البحث البسيطة) إلى النماذج الصغيرة والرخيصة. فهي سريعة، رخيصة، وجيدة بما يكفي لهذا النوع من العمل.
  2. احتفظ بالذكاء الاصطناوي الكبير والمكلف فقط للوظائف النادرة والمعقدة التي تتطلب تخطيطاً عميقاً وذاكرة طويلة المدى.

الخلاصة النهائية

لا تحتاج إلى سيارة فيراري للذهاب إلى البقالة؛ فالدراجة الموثوقة أسرع وأرخص لهذه الرحلة.

يثبت البحث أنه بالنسبة للغالبية العظمى من مهام الذكاء الاصطناعي "الروتينية" (مثل التحقق من قاعدة بيانات أو استخدام أداة واحدة)، فإن النماذج الصغيرة مفتوحة المصدر جيدة بما يكفي بالفعل. أنت تحتاج فقط إلى "النماذج الرائدة" الضخمة والمكلفة في المستوى الأعلى من التخطيط المعقد، وحتى في تلك الحالة، فهي ليست مثالية بعد.

من خلال استخدام "العامل" المناسب للمهمة المناسبة، يمكن للشركات توفير مبال unamount هائل من المال وتسريع أنظمتها دون فقدان الجودة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →