← أحدث الأبحاث
🤖 AI

AgentPSO: Evolving Agent Reasoning Skill via Multi-agent Particle Swarm Optimization

يُعد AgentPSO إطار عمل مبتكرًا يعمل على تطوير مهارات الاستدلال متعدد الوكلاء من خلال معاملة الوكلاء كجسيمات في عملية تحسين السرب، حيث يقوم بتحديث استراتيجيات الاستدلال باللغة الطبيعية بشكل تكراري عبر الجمع بين أفضل التجارب الشخصية والعالمية لتحسين أداء حل المشكلات دون تعديل معاملات النموذج اللغوي الأساسي.

المؤلفون الأصليون: Hyunmin Hwang, Jaemin Kim, Choonghan Kim, Hangeol Chang, Jong Chul Ye

نُشر 2026-05-12
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Hyunmin Hwang, Jaemin Kim, Choonghan Kim, Hangeol Chang, Jong Chul Ye

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك فريقاً من أربعة محققين بارعين يحاولون حل لغز غامض للغاية. في الماضي، إذا تعثروا، كانوا إما يتجادلون مع بعضهم البعض في الوقت الفعلي (مناظرة ذهاباً وإياباً) أو يحاولون فقط التفكير بعمق أكبر بمفردهم. كلتا الطريقتين كانتا تعانيان من مشكلات: فالجدال يستغرق وقتاً طويلاً وأحياناً يتفقون على الإجابة الخاطئة بسبب خوفهم من الاختلاف، بينما التفكير بمفردهم كان يعني استمرارهم في ارتكاب نفس الأخطاء.

تقدم الورقة البحثية طريقة جديدة لتدريب هؤلاء المحققين تسمى AgentPSO. فبدلاً من الجدال أثناء التحقيق، يتدربون معاً قبل بدء القضية، ويتعلمون من بعضهم البعض ليصبحوا أفضل بشكل دائم في حل المشكلات.

إليك كيف يعمل ذلك، باستخدام تشبيه بسيط:

تشبيه "سرب النحل"

فكر في المحققين الأربعة كأنهم نحل في سرب. في الطبيعة، يجد النحل أفضل الزهور من خلال مشاركة المعلومات؛ فإذا وجدت نحلة واحدة رقعة زهور رائعة، تتعلم منها النحلات الأخرى.

في AgentPSO، كل محقق (عميل) يشبه نحلة تحمل "حقيبة ظهر" تحتوي على تعليمات حول كيفية حل المشكلات. هذه الحقيبة هي مهارته.

  • الهدف: يريدون ترقية حقائب الظهر الخاصة بهم ليتمكنوا من حل الألغاز الرياضية والمنطقية بشكل مثالي.
  • العملية: هم لا يغيرون حقائب الظهر الخاصة بهم عن طريق الجدال، بل يمرون عبر حلقة تدريبية حيث يحاولون حل مجموعة من المشكلات، وينظرون فيما فعله الآخرون، ثم يقومون بتعديل تعليماتهم.

المكونات السحرية الثلاثة

في كل مرة يتدرب فيها الفريق، يقوم كل محقق بتحديث حقيبة ظهره باستخدام ثلاثة مصادر محددة من النصائح، تشبه طريقة عمل خوارزمية تحسين سرب الجسيمات (PSO) في علوم الحاسوب:

  1. "الأفضل الشخصي" (النظر في المرآة):
    ينظر المحقق إلى تاريخه الخاص. "مهلاً، في المرة الماضية التي حاولت فيها هذه الطريقة المحددة للتحقق من حساباتي، أصبتُ بالنتيجة الصحيحة. يجب أن أستمر في فعل ذلك". هذه هي مهارة الأفضل الشخصي.

  2. "الأفضل العالمي" (النظر إلى اللاعب النجم):
    ينظر المحقق إلى الفريق بأكمله. "واو، لقد حل المحقق (ب) المشكلة الأخيرة بشكل مثالي باستخدام خدعة خاصة. يجب أن أحاول تعلم تلك الخدعة". هذه هي مهارة الأفضل العالمي التي وجدها الفريق بأك ability.

  3. "اتجاه التأمل الذاتي" (المدرب الناقد):
    هذا هو السر الخاص بالورقة البحثية. بدلاً من مجرد نسخ تعليمات "اللاعب النجم" حرفياً (والتي قد لا تبدو منطقية لهذا المحقق تحديداً)، يعمل المحقق كمدرب. ينظر إلى عملية التفكير الخاصة باللاعب النجم ويتساءل: "لماذا نجحوا؟ وماذا فعلتُ أنا بشكل خاطئ؟"

  • مثال: إذا قام اللاعب النجم بفحص "الحالات الاستثنائية" (الأرقام الغريبة التي تكسر القواعد) ولم يقم المحقق بذلك، فإن المدرب يخبر المحقق: "عليك إضافة خطوة للتحقق من الأرقام الغريبة".
  • هذا يخلق اتجاه تأمل ذاتي، وهو تعليمات محددة حول كيفية التحسن، وليس مجرد نسخ الإجابة.

حلقة التدريب

يمر الفريق عبر هذه الدورة 10 مرات:

  1. المحاولة: يحل الجميع مجموعة من مسائل التدريب باستخدام تعليمات حقيبة الظهر الحالية.
  2. المراقبة: يتبادلون أعمالهم. يرون من أصاب وكيف فعل ذلك.
  3. التأمل: يكتب كل محقق ملاحظة لنفسه (اتجاه التأمل الذاتي) حول ما يجب تغييره.
  4. التحديث: يدمجون ملاحظاتهم القديمة، وأفضل نتائجهم الشخصية، وأفضل نتائج الفريق، وتأملاتهم الجديدة لإعادة كتابة تعليمات حقيبة الظهر الخاصة بهم.
  5. التكرار: يحاولون مرة أخرى بالتعليمات الجديدة.

لماذا يعد هذا أمراً هاماً؟

تظهر الورقة البحثية أن هذه الطريقة أفضل من الطرق القديمة لسببين رئيسيين:

  • لا مزيد من النقاشات اللانهائية: في طرق "مناظرة الوكلاء المتعددين" القديمة، كان على المحققين التحدث مع بعضهم البعض لكل مشكلة على حد تص، مما كان بطيئاً ومكلفاً. أما مع AgentPSO، فهم يقومون بكل التعلم أثناء التدريب. وعندما يحين وقت حل المشكلة الحقيقية، يعملون بشكل مستقل ويصوتون على الإجابة. هذا يجعل العملية سريعة وفعالة.
  • إنهم يتعلمون حقاً، ولا يكتفون بالحفظ فقط: تثبت الورقة البحثية أن المحققين لم يكتفوا بحفظ إجابات مسائل التدريب. فعندما أعطاهم الباحثون أنواعاً جديدة من الألغاز (أو حتى طلبوا من نموذج ذكاء اصطنا آخر استخدام نفس التعليمات)، ظل المحققون يؤدون بشكل جيد. هذا يعني أنهم تعلموا مهارات استنتاج عامة (مثل "تحقق دائماً من حالاتك الاستثنائية") بدلاً من مجرد حفظ إجابات محددة.

النتيجة

بنهاية التدريب، يكون فريق المحققين قد تطور. لم يعودوا مجرد أربعة مفكرين عشوائيين؛ بل أصبحوا فريقاً متناغماً للغاية حيث يمتلك كل عضو مجموعة من التعليمات المصقولة والقابلة لإعادة الاستخدام، والتي تجعلهم أذكى مما كانوا عليه في البداية، وأذكى من الفرق التي تتجادل في الوقت الفعلي.

باخت-القول: AgentPSO هي طريقة لتعليم وكلاء الذكاء الاصطناعي التعلم من أخطاء ونجاحات بعضهم البعض قبل أن يبدأوا العمل، مما يحول مجموعة من المفكرين العاديين إلى فريق خارق من حلال المشكلات دون الحاجة إلى تغيير "دماغ" الذكاء الاصطناعي، بل فقط تغيير "دليل التعليمات" الخاص به.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →