← أحدث الأبحاث
🤖 AI

SkillHEX: Improving Agent Skills via Hypothesis-Driven Autonomous Exploration and Exploitation

تُعد SkillHEX إطار عمل مغلق الحلقة يعمل على تحسين تطور مهارات الوكيل المستقل في ظل المكافآت الشحيحة وميزانيات التفاعل المحدودة، وذلك عبر الجمع بين التحقق الذاتي القائم على الفرضيات والبحث الشجري الموجه بالأدلة لتجنب فخاخ الاستغلال والموازنة ديناميكيًا بين الاستكشاف والاستغلال.

المؤلفون الأصليون: Yuru Feng, Yaoqi Chen, Beidi Zhao, Qianxi Zhang, Xinjiang Wang, Jianan Lu, Zhirui Wang, Shusen Xu, Zengzhong Li, Qi Chen

نُشر 2026-08-07
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Yuru Feng, Yaoqi Chen, Beidi Zhao, Qianxi Zhang, Xinjiang Wang, Jianan Lu, Zhirui Wang, Shusen Xu, Zengzhong Li, Qi Chen

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تعلم روبوتًا فائق الذكاء كيف يصلح صنبورًا يسرب الماء. أعطيته دليل إرشادات، ولكن في المرة الأولى التي حاول فيها، أسقط مفتاح ربط على قدمك. الروبوت البسيط قد يحاول القيام بنفس الشيء تمامًا مرة أخرى، آملًا في الحصول على نتيجة مختلفة، أو قد يصاب بالذعر ويتوقف. لكن الروبوت المفيد حقًا يحتاج لأن يكون محققًا. يجب عليه أن ينظر إلى الفوضى، ويخمن لماذا أسقط مفتاح الربط (هل كان زلقًا جدًا؟ هل كان الدليل خطأ؟)، ثم يختبر تخمينه، وبعد ذلك يجرب طريقة جديدة. هذا هو عالم "وكلاء الذكاء الاصطناعي" (AI Agents)—وهي برامج حاسوبية لا تكتفي فقط بالدردشة، بل تقوم بالفعل بأشياء في العالم الحقيقي، مثل كتابة الأكواد البرمجية، أو حل المسائل الرياضية، أو إدارة البيانات.

التحدي الكبير لهذه الروبوتات هو أنها غالبًا ما تقع في "لعبة تخمين" حيث لا تحصل إلا على "نعم" أو "لا" بسيطة في النهاية. هل توقف الصنبور عن التسريب؟ نعم أم لا. لا تحصل على تقرير مفيد يقول: "لقد أمسكت بمفتاح الربط بقوة شديدة". بدون هذا التعليق التفصيلي، قد يستمر الروبوت في تجربة نفس الشيء الخاطئ مرارًا وتكرارًا، مما يهدر محاولاته المحدودة لإصلاح المشكلة. هذه الورقة البحثية، التي تحمل اسم SkillHEX، تقدم طريقة ذكية وجديدة لتعلم وكلاء الذكاء الاصطناعي من أخطائهم دون الحاجة إلى معلم بشري يمسك بأيديهم. الأمر يشبه إعطاء الروبوت عدسة مكبرة ودفتر ملاحظات حتى يتمكن من اكتشاف أخطائه بنفسه وتجربة حلول مختلفة حتى ينجح في الأمر.

المشكلة: فخ "العقل أحادي المسار"

تحاول معظم وكلاء الذكاء الاصطناعي اليوم إصلاح أخطائهم عن طريق إجراء تغيير صغير على تعليماتهم والمحاولة مرة أخرى فورًا. يطلق المؤلفون على هذا النهج اسم النهج "الجشع" (Greedy). تخيل أنك تحاول حل متاهة، لكنك تنظر خطوة واحدة فقط للأمام. إذا اصطدمت بحائط، تتجه يسارًا وتستمر في المشي. إذا اصطدمت بحائط آخر، تتجه يسارًا مرة أخرى. في النهاية، قد تعلق في طريق مسدود، مقتنعًا بأن الاتجاه يسارًا هو السبيل الوحيد، رغم أن المخرج موجود في جهة اليمين.

في عالم الذكاء الاصطناعي، يسمى هذا فخ الاستغلال (Exploitation Trap). يتلقى الوكيل إشارة فشل (مثل "فشلت المهمة")، ويخمن سببًا (ربما "أحتاج للالتفاف يسارًا")، ثم يلتزم فورًا بهذا المسار الجديد. إذا كان تخمينه خاطئًا—وهو أمر مرجح جدًا لأن إشارة الفشل غامضة—فإن الوكيل يهدر جميع محاولاته المتبقية في مسار مسدود. إنه يشبه المحقق الذي يعتقل أول مشتبه به دون التحقق من بصمات الأصابع، ثم ينفق كل ميزانيته في محاولة إثبات ذنب ذلك المشتبه به، متجاهلاً الجاني الحقيقي.

الحل: حقيبة أدوات المحقق الخاصة بـ SkillHEX

يقترح المؤلفون نظام SkillHEX، وهو نظام يمنع الوكيل من التسرع في الوصول إلى استنتاج. بدلاً من مجرد تغيير التعليمات والأمل في الأفضل، يستخدم SkillHEX خدعتين رئيسيتين: التحقق الذاتي القائم على الفرضيات والبحث الشجري الموجه بالأدلة.

1. دفتر ملاحظات المحقق (التحقق الذاتي القائم على الفرضيات)
عندما يفشل الوكيل، لا يكتفي SkillHEX بالقول: "حاول مرة أخرى". بل يسأل: "لماذا فشلنا؟". يقوم بإنشاء قائمة من التخمينات المحددة والقابلة للاختبار (الفرضيات). على سبيل المثال: "ربلب أن الكود يفتقد لملف معين؟" أو "ربما الأرقام في تنسيق خاطئ؟".

بدلاً من مجرد التخمين، يقوم الوكيل بكتابة اختبار صغير ومؤتمت للتحقق من كل تخمين. إنه يشبه المحقق الذي يدون ملاحظة: "إذا كان المشتبه به في موقع الجريمة، فسيكون الباب مفتوحًا". بعد ذلك، يقوم الوكيل بتشغيل هذا الاختبار على محاولاته الفاشلة القديمة دون الحاجة للعودة إلى العالم الحقيقي. هذا يخلق كومة من "الأدلة" (نجاح أو فشل لكل تخمين) وهي أكثر تفصيلًا بكثير من رسالة بسيطة تقول "فشلت المهمة". هذا يحول الفشل الغامض إلى خريطة واضحة لما سار بشكل خاطئ.

2. خريطة المسارات المتعددة (البحث الشجري الموجه بالأدلة)
بمجرد حصول الوكيل على هذه الأدلة، فإنه لا يختار فقط التخمين "الأفضل" ويمضي فيه. بدلاً من ذلك، يبني شجرة من الاحتمالات. تخيل كتاب مغامرات "اختر مغامرتك الخاصة"، حيث بدلاً من اختيار مسار واحد فقط، تبقي جميع الخيارات المثيرة للاهتمام مفتوحة على الطاولة.

يحافظ SkillHEX على "شجرة" من نسخ المهارات المختلفة. قد تعتمد بعض الفروع على التخمين الأكثر احتمالًا، بينما تبقي فروع أخرى الخيارات الـ "ربما" حية. ومع جمع الوكيل لمزيد من الأدلة من اختباراته، يمكنه رؤية أي الفروع تبدو واعدة وأيها طرق مسدودة. إذا بدأ فرع ما يبدو سيئًا، يمكن للوكيل بسهء "الرجوع" (Backtrack) وتجربة فرع مختلف من الشجرة، بدلاً من أن يظل عالقًا في مسار كان محكومًا عليه بالفشل منذ البداية. هذا يوازن بين الاستكشاف (تجربة أفكار جديدة وغريبة) والاستغلال (التركيز على الأفكاء التي تبدو جيدة).

ما وجدوه

اختبر الباحثون هذا النظام على 87 مهمة مختلفة، تراوحت من كتابة الأكواد البرمجية إلى حل المسائل الرياضية المعقدة. استخدموا نموذجين قويين من الذكاء الاصطناعي (GPT-5.3-Codef และ Claude Opus 4.7) لمعرفة ما إذا كان بإمكان SkillHEX مساعدتهم على التحسن.

كانت النتائج مبهرة. عندما مُنحوا خمس محاولات فقط لإصلاح مهمة ما، ساعد SkillHEX الذكاء الاصطناعي على النجاح بنسبة 55.9% مع النموذج الأول و 57.9% مع النموذج الثاني. كان هذا أفضل بكثير من الطرق الأخرى التي تحاول فقط إصلاح التعليمات واحدة تلو الأخرى. في الواقع، تفوق SkillHEX على الطريقة التالية في الأفضلية بنحو 9.5 نقطة مئوية.

كما أظهرت الدراسة أن SkillHEX كان ذكيًا في كيفية استخدام "قدراته الذهنية" (الموارد الحوسبية). فمن خلال اختبار التخمينات على البيانات القديمة بدلاً من تشغيل اختبارات جديدة ومكلفة في كل مرة، وفر الكثير من الجهد. وحتى عندما بدأ الذكاء الاصطناعي بمهارة مكتوبة بواسطة بشر (والتي كانت جيدة بالفعل)، استطاع SkillHEX تحسينها، مما رفع معدل النجاح بشكل أكبر في المجالات المعقدة مثل هندسة البرمجيات والرياضيات.

لماذا يهم هذا الأمر

تشير الورقة البحثية إلى أن المفتاح لجعل وكلاء الذكاء الاصطناعي مستقلين حقًا ليس فقط جعلهم أكثر ذكاءً، بل تعليمهم كيفية التفكير في تفكيرهم الخاص. فمن خلال إجبار الوكيل على تدوين تخميناته، واختبارها، وإبقاء خيارات متعددة مفتوحة، يمنع SkillHEX الذكاء الاصطناعي من الوقوع في حلقة مفرغة من الأفكار السيئة.

على الرغم من أن النتائج تستند إلى عمليات محاكاة ومعايير محددة (بمعنى أنها لم تُختبر بعد في كل سيناريوهات العالم الحقيقي)، إلا أن النتائج تشير بقوة إلى أن نهج "المحقق" هذا هو وسيلة قوية لمساعدة وكلاء الذكاء الاصطناعي على التعلم من أخطائهم. إنه يحول دورة الإحباط من "افشل، خمن، افشل مجددًا" إلى عملية منظمة من "افشل، حقق، اختبر، واختر أفضل مسار للمضي قدمًا". وبالنسبة لأي شخص يأمل في بناء روبوتات يمكنها حقًا مساعدتنا في العالم الحقيقي، فإن هذه خطوة كبيرة نحو جعلها أكثر موثوقية وأقل عرضة للاستسلام عندما تصبح الأمور صعبة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →