← أحدث الأبحاث
🤖 AI

Learning to Configure Agentic AI Systems

تقدم الورقة البحثية ARC، وهو سياسة هرمية خفيفة الوزن تضع تهيئة العميل في إطار عملية قرار شبه ماركوف لاختيار إعدادات محددة لكل استعلام ديناميكيًا، مما يتفوق بشكل كبير على التصميمات الثابتة "التي تناسب الجميع" في معايير الاستدلال، واستخدام الأدوات، والمهام الوكيلية.

المؤلفون الأصليون: Aditya Taparia, Som Sagar, Ransalu Senanayake

نُشر 2026-05-22
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Aditya Taparia, Som Sagar, Ransalu Senanayake

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مساعداً ذكياً جداً، ولكنه جامد نوعاً ما (وكيل ذكاء اصطناعي)، يمكنه حل المشكلات، واستخدام أدوات مثل الآلات الحاسبة أو محركات البحث، وكتابة الأكواد البرمجية. حالياً، يعامل معظم الناس هذا المساعد كعامل "واحد يناسب الجميع". فإذا سألت سؤالاً بسيطاً مثل "ما هو ناتج 2+2؟"، قد يرسل المدير المساعد إلى مكتبة، ويوظف ثلاثة خبراء لمناقشة الإجابة، وينفق ثروة على البحث. وإذا طرحت سؤالاً صعباً للغاية، فقد يكتفي المدير بإرسال المساعد لتقديم تخمين سريع من جملة واحدة فقط.

تقدم هذه الورقة نظاماً جديداً يسمى ARC (المتعلم التكيفي للموارد والتكوين - Agentic Resource & Configuration learner)، والذي يعمل كمدير ذكي ومتكيف. فبدلاً من استخدام نفس العملية الثقيلة لكل سؤال، يتعلم ARC النظر إلى سؤال محدد والقرار فوراً: "هل أحتاج إلى آلة حاسبة؟ هل أحتاج للبحث في الويب؟ هل يجب أن أجيب مباشرة، أم يجب أن أفكك السؤال وأراجع عملي ثلاث مرات؟"

إليك تفصيل لكيفية عمله، باستخدام تشبيهات بسيطة:

1. المشكلة: نهج "كل شيء في المطبخ"

حالياً، تُبنى معظم أنظمة الذكاء الاصطناعي مثل مطبخ يرمي فيه الطاهي كل شيء في القدر. إنهم يستخدمون نفس الوصفة المعقدة (سير العمل) ونفس كمية المكونات (قدرة الحوسبة) سواء كانوا يصنعون شطيرة بسيطة أو مأدبة فاخرة.

  • النتيجة: بالنسبة للمهام السهلة، يهدر النظام الوقت والمال (موارد الحوسبة). وبالنسبة للمهام الصعبة، قد لا يستخدم موارد كافية للوصول إلى الإجابة الصحيحة. الأمر يشبه استخدام مطرقة ثقيلة لكسر حبة جوز، أو استخدام سكين زبدة لتقطيع قطعة لحم كبيرة.

2. الحل: ARC كـ "مراقب حركة مرور ذكي"

ابتكر المؤلفون ARC، وهو يشبه مراقب حركة المرور لعقل الذكاء الاصطناعي.

  • مساحة التصميم: تخيل غرفة تحكم ضخمة بها آلاف الروافع. يمكنك اختيار "سير عمل" مختلف (مثل شخص واحد يجيب مقابل فريق يتناظر)، و"أدوات" مختلفة (آلة حاسبة، بحث ويب)، و"ميزانيات" مختلفة (مقدار الوقت/المال الذي سيتم إنفاقه).
  • التحدي: هناك الكثير من التوليفات (الملايين منها) بحيث لا يمكنك تجربة كل واحدة منها يدوياً. الأمر يشبه محاولة العثور على الزي المثالي عبر تجربة كل قميص وكل بنطال في متجر كبير واحداً تلو الآخر.
  • الحل: يستخدم ARC نظام تعلم (التعلم التعزيزي) لمعرفة أي توليفة هي الأفضل لكل سؤال محدد.

3. كيف "يفكر" ARC (تشبيه SMDP)

تستخدم الورقة مصطلحاً رياضياً معقداً يسمى "عملية اتخاذ القرار شبه ماركوف" (Semi-Markov Decision Process - SMDP). دعونا نترجم ذلك:

  • الذكاء الاصطناعي القياسي: يفكر عادةً في خطوات: "افعل هذا، ثم افعل ذاك". ويفترض أن كل خطوة تستغرق نفس القدر من الوقت.
  • رؤية ARC: يدرك ARC أن بعض المهام تستغرق وقتاً أطول من غيرها.
    • التشبيه: تخيل طلب الطعام.
      • الخيار أ: "سآخذ وجبة خفيفة فقط". (يستغرق دقيقة واحدة، تكلفة منخفضة).
      • الخيار ب: "سأطلب وجبة كاملة من خمسة أصناف مع خبير تقديم طعام". (يستغرق ساعتين، تكلفة عالية).
    • يتعلم ARC أنه بالنسبة لنوبة جوع سريعة، الخيار (أ) هو الأفضل. وللمناسبات الخاصة، الخيار (ب) يستحق الانتظار. إنه يختار "مدة" الحل و"تكلفته" ديناميكياً بناءً على صعوبة السؤال.

4. المدير ذو المستويين (التعلم الهرمي)

بُني ARC كفريق إدارة مكون من مستويين:

  1. المدير الكبير (سياسة الهيكل): هذا الجزء ينظر إلى السؤال ويقرر الاستراتيجية. "هل نحتاج إلى آلة حاسبة؟ هل نحتاج للبحث في الإنترنت؟ هل نستخدم سير عمل 'الاستنتاج المنطقي' أم سير عمل 'التصويت'؟"
  2. الكاتب (سياسة التوجيه): بمجرد اختيار الاستراتيجية، يقوم هذا الجزء بكتابة التعليمات المحددة للذكاء الاصطناعي. إنه يصقل اللغة، مثل قول: "كن حذراً جداً في الحسابات"، أو "ابحث عن آخر الأخبار".

5. التدريب: التجربة، الخطأ، و"التدريب النخبوي"

كيف يتعلم ARC؟

  • المرحلة الأولى: التعلم التعزيزي (النادي الرياضي): يجرب ARC آلاف الاستراتيجيات المختلفة على أسئلة تدريبية. إذا حصل على الإجابة الصحيحة باستخدام طريقة رخيصة وسريعة، يحصل على درجة عالية. وإذا أضاع المال في سؤال بسيط، يحصل على عقوبة. إنه يتعلم من خلال التجربة والخطأ.
  • المرحلة الثانية: الضبط الدقيق تحت الإشراف (جلسة التدريب الشخصي): بعد جلسة النادي الرياضي، يدرس النظام "الحلقات النخبوية" — تلك التي حصل فيها ARC على الإجابة الصحيحة واستخدم الموارد بكفاءة. ثم يدرس هذه الأمثلة المثالية ليصبح أكثر اتساقاً. هذا يشبه مدرباً يظهر للاعب أفضل حركاته لتعزيز العادات الجيدة.

6. النتائج: أذكى وأرخص

اختبرت الورقة ARC على ثلاثة أنواع من التحديات:

  • الاستنتاج المنطقي: مسائل الرياضيات والألغاز المنطقية.
  • استخدام الأدوات: المهام التي تتطلب محركات بحث أو آلات حاسبة.
  • المهام الوكيلية (Agentic Tasks): عمليات محاكاة معقدة في العالم الحقيقي (مثل حجز تذكرة طيران).

النتيجة:

  • الدقة: حقق ARC إجابات صحيحة لعدد أكبر بكثير من الأسئلة مقارنة بالطرق التقليدية "التي تناسب الجميع". على سبيل المثال، في المسائل الرياضية، حسّن الدقة بأكثر من 30%. وفي مهام حجز الطيران المعقدة، ضاعف معدل النجاح.
  • الكفاءة: لم يصبح أفضل فحسب، بل أصبح أفضل دون إضاعة المال. فقد تعلم استخدام نهج "خفيف الوزن" للأسئلة السهلة، ونهج "ثقيل الوزن" فقط عند الضرورة.
  • المرونة: عمل بشكل جيد مع نماذج ذكاء اصطناعي مختلفة (سواء كانت مفتوحة المصدر أو مملوكة لشركات)، مما يثبت أنه "مدير" عام يمكنه إدارة أي مساعد ذكاء اصطناعي.

ملخص

تجادل الورقة بأنه بدلاً من بناء نظام ذكاء اصطناعي جامد ومكلف يحاول القيام بكل شيء بنفس الطريقة، يجب علينا بناء نظام مرن يتعلم كيف يتكيف. ARC هو هذا النظام: مدير ذكي ينظر إلى كل مشكلة جديدة ويقرر فوراً المزيج المثالي من الأدوات، وحجم الفريق، والجهد المطلوب لحلها بكفاءة ودقة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →