AI Harness Engineering: A Runtime Substrate for Foundation-Model Software Agents
تقترح هذه الورقة "هندسة تسخير الذكاء الاصطناعي" (AI Harness Engineering)، وهي إطار عمل لركيزة وقت التشغيل ينقل التركيز في هندسة البرمجيات المستقلة من قدرة النموذج وحدها إلى نظام متكامل يتكون من النموذج والمنصة والبيئة، مع تحديد إحدى عشرة مسؤولية للمكونات وسلم من أربعة مستويات لإنتاج تغييرات برمجية قابلة للتحقق والتدقيق والصيانة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك متدرباً مبرمجاً عبقرياً فائق السرعة. هذا المتدرب (النموذج الأساسي) يمكنه كتابة الكود، وإصلاح الأخطاء، وشرح كيفية عمل البرمجيات بشكل أفضل من أي شخص تقريباً. ولكن إذا تركت هذا المتدرب طليقاً في مشروع برمجيات حقيقي دون أي دعم، فغالباً ما سيفشل. قد يصلح الملف الخطأ، أو يكسر شيئاً آخر، أو ينسى ما كان يفعله، أو يعلن النصر بينما لم تكتمل المهمة فعلياً.
لفترة طويلة، اعتقد الناس أن المشكلة تكمن في أن المتدرب ليس ذكياً بما يكفي، وظنوا أننا نحتاج فقط إلى تدريب المتدرب ليكون أكثر ذكاءً.
تجادل هذه الورقة بأن هذا هو المنظور الخاطئ. المشكلة ليست في عقل المتدرب؛ بل في الورشة التي يعمل فيها.
الفكرة الجوهرية: "الحزام" (The Harness)
يقترح المؤلفون أننا بحاجة إلى بناء بنية تحتية وقتية خاصة، أطلقوا عليها اسم "حزام الذكاء الاصطناعي" (AI Harness).
فكر في "حزام الذكاء الاصطناعي" كأنه حزام بناء عالي التقنية أو معدات سلامة لمتسلق.
- المتدرب (النموذج): يمتلك القوة والمهارة للتسلق.
- الجبل (البيئة البرمجية): معقد، مليء بالصخور المتحركة، والشقوق المخفية.
- الحزام (النظام الجديد): هو المعدات التي تربط المتسلق بالجبل. فهو يحمل أدواته، ويشير له إلى موضع القبضة التي يجب أن يمسك بها، ويتحقق مما إذا كان حبله آمناً، ويسجل بدقة كل ما قام به.
بدون الحزام، قد يمتلك المتسلق عضلات قوية، لكنه قد يسقط لأنه لم يعرف أين يضع قدمه أو لم يكن لديه وسيلة للتحقق من سلامته. وتزعم الورقة أن القدرة على هندسة البرمجيات لا تتعلق فقط بذكاء النموذج؛ بل تتعلق بـ النظام (النموذج + الحزام + البيئة) وهو يعمل معاً.
الوظائف الـ 11 للحزام
تقسم الورقة هذا "الحزام" إلى 11 وظيفة محددة، تشبه مدير مشروع ومفتش سلامة في آن واحد:
- تحديد المهمة: إخبار المتدرب بوضوح بما يجب بناؤه.
- اختيار السياق: تسليمه المخططات الصحيحة (الملفات) حتى لا ينظر في الملفات الخاطئة.
- الوصول إلى الأدوات: إعطاؤه مفكات ومفاتيح الربط المناسبة.
- ذاكرة المشروع: تذكيره بتاريخ المبنى وأين توجد الأشياء.
- حالة المهمة: الاحتفاظ بقائمة مراجعة لما أنجزه وما سيقوم به تالياً.
- القابلية للملاحظة: السماح له برؤية السجلات (logs) ورسائل الخطأ بوضوح.
- إسناد الفشل: إذا تعطل شيء ما، مساعدته في معرفة لماذا قبل أن يحاول إصلاحه.
- التحقق: جعله يثبت أن الإصلاح يعمل بالفعل.
- الأذونات: منعه من القيام بأشياء خطيرة (مثل حذف المبنى بأكمله).
- تدقيق العشوائية (Entropy Auditing): التحقق مما إذا كان قد ترك فوضى خلفه (مثل كود قديم أو توثيق غير منظم).
- تسجيل التدخل: تدوين ما إذا كان قد اضطر بشري للتدخل للمساعدة، ولماذا.
تجربة "السلم" (من H0 إلى H3)
لإثبات وجهة نظرهم، بنى المؤلفون "سلماً" من أربعة مستويات لاختبار مقدار المساعدة التي يحتاجها المتدرب. حافظوا على المهمة والنموذج كما هما، لكنهم غيروا مستوى الحزام:
- المستوى 0 (المتدرب العاري): يحصل المتدرب على المهمة والملفات فقط. لا أدوات، لا ذاكرة، ولا فحوصات سلامة. عليه أن يخمن كل شيء.
- المستوى 1 (حزام الأدوات): يحصل المتدرب على قائمة بالأدوات التي يمكنه استخدامها وبروتوكول لاستخدامها. لا يزال بإمكانه الضياع، لكن لديه المعدات الصحيحة.
- المستوى 2 (الخريطة ودفتر الملاحظات): يحصل المتدرب على الأدوات بالإضافة إلى خريطة للمبنى (الهيكلية)، ودفتر ملاحظات للأخطاء السابقة، وقائمة مراجعة لتتبع تقدمه.
- المستوى 3 (معدات السلامة الكاملة): يحصل المتدسب على كل ما سبق، بالإضافة إلى بروتوكول صارم لإعادة إنتاج الخطأ، وتشخيصه، وإصلاحه، وكتابة تقرير رسمي يثبت نجاح الإصلاح قبل أن يُسمح له بالانتهاء.
ماذا وجدوا؟
عندما قاموا بتشغيل نفس المهمة (إصلاح خطأ في تسجيل الدخول) في كل مستوى، كانت النتائج واضحة:
- عند المستوى 0، قد ينجح المتدرب في النهاية في إصلاح الخطأ، لكنه لم يترك أي دليل على كيفية قيامه بذلك، وقد يكون قد أتلف أشياء أخرى.
- عند المستوى 3، لم ينتج المتدرب مجرد إصلاح؛ بل أنتج حزمة كاملة من الأدلة. لقد أظهر الخطأ، وشرح سبب حدوثه، وأظهر الإصلاح، وأجرى اختبارات لتثبت أنه يعمل.
تخلص الورقة إلى أن السؤال لا ينبغي أن يكون "هل الذكاء الاصطناعي ذكي بما يكفي لكتابة الكود؟" بل "هل ينتج نظام (النموذج-الحزام-البيئة) تغييراً قابلاً للتحقق، ومُسنداً، وقابلاً للصيانة؟"
الخلاصة
تشير الورقة إلى أنه لجعل الذكاء الاصطناعي مفيداً حقاً في هندسة البرمجيات، لا ينبغي لنا التركيز فقط على جعل الذكاء الاصطناعي أكثر ذكاءً. نحن بحاجة إلى بناء ورش عمل أفضل (الحزام) تدير السياق، والأدوات، والذاكرة، وفحوصات السلامة.
تماماً كما يعتمد المطور البشري على بيئة التطوير المتكاملة (IDE) الخاصة به، وعلى وثائقه، وعلى مجموعة الاختبارات الخاصة به للقيام بعمل جيد، فإن العميل الآلي (AI Agent) يحتاج إلى حزام مهيكل لتحويل قدرته الخام على البرمجة إلى هندسة برمجيات موثوقة. توفر الورقة مخططاً لبناء هذا "الحزام" وطريقة لقياس مدى فعاليته.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.