← أحدث الأبحاث
💻 computer science

Learning to Evolve: A Self-Improving Framework for Multi-Agent Systems via Textual Parameter Graph Optimization

تقدم هذه الورقة البحثية "تحسين الرسم البياني للمعلمات النصية" (TPGO)، وهو إطار عمل ذاتي التحسين ينمذج الأنظمة متعددة الوكلاء كرسوم بيانية تركيبية، ويستخدم استراتيجية تعلم تلوّي تسمى "تحسين الوكيل النسبي للمجموعة" (GRAO) لتنقيح تفاعلات الوكلاء بشكل تكراري باستخدام التغذية الراجعة باللغة الطبيعية، مما يؤدي إلى أتمتة وتعزيز تطور أنظمة الوكلاء المعقدة.

المؤلفون الأصليون: Shan He, Runze Wang, Zhuoyun Du, Huiyu Bai, Zouying Cao, Yu Cheng, Bo Zheng

نُشر 2026-04-23
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Shan He, Runze Wang, Zhuoyun Du, Huiyu Bai, Zouying Cao, Yu Cheng, Bo Zheng

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول بناء فريق من الروبوتات فائقة الذكاء لحل لغز صعب للغاية، مثل تنظيم سلسلة توريد عالمية أو كتابة برنامج برمجيات معقد. في عالم الذكاء الاصطناعي، نسمي هذا نظام الوكلاء المتعددين (Multi-Agent System - MAS). فبدلاً من روبوت واحد يقوم بكل شيء، يكون لديك فريق: روبوت يبحث، وآخر يكتب الكود، وثالث يفحص الأخطاء، وهم يتواصلون مع بعضهم البعض لإنجاز المهمة.

المشكلة؟ بناء وتدريب هذا الفريق هو كابوس.

في الوقت الحالي، إذا فشل فريق الروبوتات، يتعين على المهندسين البشر قراءة آلاف الأسطر من التعليمات (التي تسمى "المطالبات" أو Prompts) يدوياً لتخمين ما حدث خطأً. هل قدم الباحث معلومات سيئة؟ هل أساء المبرمج فهم التعليمات؟ هل تحدث أعضاء الفريق مع بعضهم كثيراً أم قلياً؟ الأمر يشبه محاولة إصلاح سيارة مكسورة عن طريق شد البراغي عشوائياً دون دليل إرشادي. يستغرق الأمر وقتاً طويلاً، وقد تجعل الأمر أسوأ.

علاوة على ذلك، فإن "أدوات الإصلاح" التي نمتلكها حالياً هي أدوات ثابتة (Static). فهي تحاول إصلاح المشكلة مرة واحدة، لكنها لا تتعلم من أخطائها. إذا فشلت في إصلاح السيارة اليوم، فمن المرجح أنها ستفشل بنفس الطريقة غداً.

مرحباً بـ TPGO: "مدرب الفريق ذاتي التطوير"

تقدم الورقة البحثية إطار عمل جديد يسمى TPGO (تحسين مخطط المعلمات النصية - Textual Parameter Graph Optimization). فكر في TPGO ليس كـ "ميكانيكي"، بل كـ مدرب ذكي للغاية وذاتي التعلم يدير فريق الروبوتات.

إليك كيف يعمل، باستخدام تشبيهات بسيطة:

1. "مخطط الليغو" (مخطط المعلمات النصية)

بدلاً من رؤية فريق الروبوتات ككتلة نصية واحدة ضخمة وفوضوية، يقوم TPGO بتفكيك التعليمات إلى مخطط ليغو (Lego blueprint).

  • العُقد (القطع): كل جزء من الفريق هو قطعة ليغو منفصلة. قطعة هي "شخصية الباحث"، وأخرى هي "قواعد المبرمج"، وأخرى هي "الأداة التي يستخدمها".
  • الحواف (التوصيلات): الخطوط التي تربط القطع توضح كيفية تواصلهم مع بعضهم البعض.
  • لماذا هذا مهم: إذا فشل الفريق، لا يحتاج المدرب إلى إعادة كتابة الكتاب بأكمله. يمكنه رؤية أي قطعة هي ذات اللون الخاطئ أو أي توصيلة هي التي أصبحت مرتخية، ويمكنه استبدال تلك القطعة فقط أو إعادة توصيل الأسلاك دون كسر الهيكل بأكمله.

2. "تقرير ما بعد الوفاة" (التدرجات النصية)

عندما يحاول فريق الروبوتات تنفيذ مهمة ويفشل، لا يكتفي TPGO بالقول "لقد فشلتم". بل يقوم بإنشاء تدرج نصي (Textual Gradient).

  • التشبيه: تخيل مدرب رياضي يشاهد مباراة. بدلاً من مجرد الصراخ "عمل جيد" أو "عمل سيء"، يكتب المدرب تقريراً مفصلاً: "المهاجم أضاع الهدف لأنه لم يمرر الكرة لخط الوسط أولاً. كما أن حارس المرمى كان واقفاً في مكان خاطئ".
  • السحر: يقوم TPGO بتحويل تقارير الفشل هذه إلى "تدرجات" (وهو مصطلح رياضي معقد يعني "الاتجاه نحو التحسين"). إنه يخبر النظام بالضبط ما الذي يجب تغييره وكيف يتم تغييره، بناءً على الخطأ المحدد.

3. "كتاب الذاكرة" (GRAO - تحسين الوكيل النسبي للمجموعة)

هذا هو الجزء الأكثر إثارة. معظم أدوات تحسين الذكاء الاصطناعي تشبه الطلاب الذين ينسون ما تعلموه بالأمس. أما TPGO فيمتلك كتاب ذاكرة.

  • كيف يعمل: في كل مرة يحاول فيها المدرب إجراء إصلاح، يكتب: "حاولنا إصلاح مشكلة 'التمرير' عن طريق تغيير القاعدة. وقد نجح ذلك بنسبة 80% من المرات".
  • جانب "المجموعة": إذا فشل الفريق مرة أخرى في مشكلة مماثلة، لا يبدأ المدرب من الصفر. بل ينظر في "كتاب الذاكرة" الخاص به، ويجد مجموعة من حالات الفشل السابقة المشابهة، ويقول: "مهلاً، في المرة الأخيرة واجهنا مشكلة 'التمرير' هذه، وكان أفضل إصلاح هو تغيير القاعدة إلى (X). لنحاول ذلك مرة أخرى، ولكن مع تعديل بسيط".
  • النتيجة: يصبح المدرب أكثر ذكاءً بمرور الوقت. إنه يتعلم كيفية التحسين. إنه يتطور من مدرب مبتدئ إلى استراتيجي محترف.

النتائج: لماذا يجب أن نهتم؟

اختبر الباحثون هذا النظام في تحديين صعبين للغاية:

  1. MCP-Universe: اختبار حيث يتعين على الروبوتات استخدام أدوات حقيقية (مثل المتصفحات والخوادم) لحل المشكلات دون وجود "إجابة صحيحة" للنسخ منها.
    • النتيجة: أصبحت الروبوتات أفضل بكثير في استخدام الأدوات وإصلاح أخطائها الخاصة، حيث تحسنت معدلات النجاح بنسبة تزيد عن 25%.
  2. GAIA: اختبار حيث يتعين على الروبوتات إيجاد إجابة محددة وصحيحة لسؤال معقد.
    • النتيجة: لم تكتفِ الروبوتات بالحصول على الإجابة الصحيحة بشكل أكثر تكراراً (من 73% إلى 81%) فحسب، بل أصبحت أيضاً أسرع بمرتين. لقد تعلم المدرب كيفية "قطع الوقت الضائع" و"الخطوات المربكة".

الخلاصة

TPGO هو نظام يعلم فرق الذكاء الاصطنا طريقة إصلاح نفسها.

بدلاً من أن يقضي مهندس بشري أسابيع في تعديل التعليمات يدوياً، يعمل TPGO كمدرب آلي ذاتي التحسين. فهو يفكك النظام إلى قطع يمكن إدارتها، ويتعلم من كل فشل، ويتذكر ما نجح في الماضي، ويقوم بتطوير استراتيجية الفريق باستمرار.

إنه الفرق بين الميكانيكي الذي يخمن أي برغي يجب شده، وبين الميكانيكي الذي يمتلك ذاكرة حاسوب خارقة لكل سيارة قام بإصلاحها سابقاً، مما يسمح له بتشخيص وإصلاح المركبة في ثوانٍ. هذه خطوة كبيرة نحو بناء أنظمة ذكاء اصطناعي يمكنها حقاً التطور والتعامل مع الوظائف المعقدة في العالم الحقيقي بمفردها.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →