← أحدث الأبحاث
🤖 AI

Harness-R1: Learning to Edit Executable Runtime Harnesses from Agent Failure Trajectories

يقدم Harness-R1 طريقة مبتكرة تستخدم التعلم التعزيزي عبر الإنترنت لتدريب "مهندس حزام" (harness engineer) مخصص لتوليد رقع برمجية قابلة للتنفيذ تلقائياً من مسارات فشل الوكيل، مما يحسن معدلات نجاح المهام بشكل كبير عبر معايير قياسية متعددة دون الحاجة إلى تحديث أوزان نموذج الوكيل المستهدف.

المؤلفون الأصليون: Shuai Shao, Kangning Zhang, Qingyao Li, Shijian Wang, Hao Wang, Wenxiang Jiao, Yuan Lu, Yi Guo, Weiwen Liu, Weinan Zhang

نُشر 2026-08-04
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Shuai Shao, Kangning Zhang, Qingyao Li, Shijian Wang, Hao Wang, Wenxiang Jiao, Yuan Lu, Yi Guo, Weiwen Liu, Weinan Zhang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مساعداً آلياً عبقرياً وفائق الذكاء. تعطي هذا الروبوت مهمة، مثل "ابحث عن القميص الأحمر المثالي بسعر أقل من 20 دولاراً"، فيبدأ بالعمل. ولكن في بعض الأحيان، قد يرتبك الروبوت. ربما يضغط على الزر الخطأ، أو ينسى ما كان يبحث عنه، أو يعلق في حلقة مفرغة من محاولة شراء نفس السلعة مراراً وتكراراً. في عالم الذكاء الاصطناعي، يُسمى هذا الروبوت "عميلاً" (Agent)، ويُسمى المسار الفوضوي لأفكاره وأفعاله وأخطائه "مسار الحركة" (Trajectory).

عادةً، عندما يرتكب الروبوت خطأً، فإن الطريقة الوحيدة لإصلاحه هي العودة إلى نقطة البداية وإعادة تدريب دماغه بالكامل. وهذا يستغرق الكثير من الوقت والطاقة. ولكن هناك طريقة أخرى: بدلاً من تغيير دماغ الروبوت، يمكنك تغيير "الحزام" (Harness) الذي يرتديه. فكر في الحزام كأنه معدات السلامة الخاصة بالروبوت، وقائمة التحقق الخاصة به، ودليل التواصل الخاص به، وكل ذلك مدمج في شيء واحد. إنه الكود الذي يخبر الروبوت بكيفية التحدث مع العالم، وكيفية مراجعة عمله، وكيفية التعافي عندما يتعثر. السؤال الكبير الذي يطرحه الباحثون هو: هل يمكننا تعليم الروبوت إصلاح حزامه الخاص بناءً على إخفاقاته الماضية، دون الحاجة إلى إعادة تدريب دماغه في كل مرة؟

هذا بالضبط ما تستكشفه ورقة بحثية بعنوان "Harness-R1". فقد بنى الباحثون نظاماً حيث يتعلم ذكاء اصطناعي خاص يسمى "المهندس" (Engineer) كيفية إعادة كتابة حزام الروبوت من خلال دراسة أخطائه الماضية. إليك كيف يعمل الأمر: أولاً، يتركون روبوتاً عادياً (الهدف - Target) يحاول حل المهام ويفشل. ثم ينظر "المهندس" إلى قصص الفشل تلك ويكتب مجموعة جديدة من التعليمات — "رقعة" (Patch) — لإصلاح الحزام. والأهم من ذلك، هم لا يخمنون فقط ما إذا كانت الرقعة جيدة؛ بل يقومون بالفعل بوضع الرقعة على الروبوت ويتركونه يجرب المهام مرة أخرى. إذا نجح الروبوت في المهمة بشكل متكرر، يحصل "المهندس" على مكافأة ويتعلم كتابة رقع أفضل. وإذا جعلت الرقعة الأمور أسوأ، يتعلم "المهندس" ألا يفعل ذلك مرة أخرى.

النتائج رائعة حقاً. فعندما اختبروا ذلك على ثلاث ألعاب مختلفة وصعبة (التسوق عبر الإنترنت، والتنقل في منزل قائم على النصوص، وإدارة قاعدة بيانات)، نجح الروبوت العادي بنسبة 44.3% فقط. وبعد أن تعلم "مهندس Harness-R1" كيفية إصلاح حزامه، قفز معدل النجاح إلى 53.6%. هذا تحسن قدره 9.3 نقطة مئوية بمجرد تعديل الحزام، وليس الدماغ. والأفضل من ذلك، أنهم جربوا ذلك على روبوت تم تدريبه بالفعل ليكون أكثر ذكاءً، ومع ذلك تمكن "المهندس" من رفع أدائه بنسبة 5.0 نقاط إضافية.

كما تظهر الورقة البحثية أن هذا ليس مجرد صدفة لروبوت واحد بعينه. فالمهندس الذي قاموا بتدريبه استطاع النظر إلى روبوت جديد ومختلف لم يره من قبل، ودراسة إخفاقاته، وكتابة إصلاح مخصص ساعد ذلك الروبوت الجديد على النجاح أيضاً. وهذا يشير إلى أن تعلم تحرير "الحزام" هو مهارة يمكن تعليمها للذكاء الاصطناعي، مما يسمح له بالتطور المشترك مع الروبوتات التي يساعدها، مما يجعلها أكثر ذكاءً وموثوقية بمرور الوقت دون الحاجة أبداً إلى إعادة تدريب عقولها الأساسية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →