From Skill Text to Skill Structure: The Scheduling-Structural-Logical Representation for Agent Skills
تقدم هذه الورقة تمثيل الجدولة-الهيكلية-المنطقية (SSL)، وهو إطار هيكلي مبتكر لمهارات الوكيل يعمل على فك الارتباط بين الجدولة والتنفيذ والأدلة المنطقية ليتفوق بشكل كبير على النماذج المرجعية القائمة على النصوص فقط في مهام اكتشاف المهارات وتقييم المخاطر.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك مكتبة ضخمة من "الوصفات" للوكلاء الذكيين (AI agents). هذه ليست مجرد قوائم للمكونات؛ بل هي تعليمات معقدة ومتعددة الخطوات تخبر الذكاء الاصطناعي كيفية استخدام الأدوات، والوصول إلى الملفات، وتنفيذ المهام. حالياً، تُكتب هذه الوصفات في شكل فقرات نصية طويلة وغير منظمة (مثل ملف SKILL.md).
المشكلة؟ البشر يمكنهم قراءة هذه الفقرات بسهولة، لكن الحواسيب تجد صعوبة في فهم الخطوات المحددة، أو ترتيب العمليات، أو المخاطر الكامنة داخل النص. الأمر يشبه محاولة العثور على مكون معين داخل رواية؛ المعلومات موجودة، لكنها مدفونة داخل القصة.
تقدم هذه الورقة البحثية طريقة جديدة لتنظيم هذه الوصفات تسمى SSL (الجدولة - الهيكلة - المنطق). فكر في SSL كعملية تحويل تلك الرواية الفوضوية إلى مخطط انسيابي واضح يتكون من ثلاثة أجزاء، يمكن للحاسوب مسحه ضوئياً وفهمه فوراً.
إليك كيف تفكك SSL المهارة، باستخدام تشبيهات بسيطة:
1. طبقة الجدولة (Scheduling Layer): "بطاقة القائمة"
ما هي: هذا هو الملخص العلوي. يخبرك بماذا تفعل المهارة، ومتى تُستخدم، وما الذي تحتاجه للبدء.
التشبيه: تخيل دخولك إلى مطعم. لست بحاجة لقراءة السيرة الذاتية الكاملة للطاهي أو تاريخ المطبخ لتعرف أنك تريد "نودلز حارة". أنت فقط تنظر إلى بطاقة القائمة. فهي تسرد اسم الطبق، والسعر (المدخلات)، وما ستحصل عليه في المقابل (المخرجات).
في الورقة البحثية: تقوم هذه الطبقة باستخراج "الهدف" (Goal)، و"الوسوم" (Tags)، و"المدخلات/المخرجات" (Inputs/Outputs) حتى يتمكن الذكاء الاصطناعي بسرعة من اتخاذ قرار: "نعم، هذه المهارة تناسب طلبي"، دون الحاجة لقراءة المستند بالكامل.
2. الطبقة الهيكلية (Structural Layer): "سيناريو الفيلم"
ما هي: تقوم بتقسيم المهارة إلى مشاهد أو مراحل رئيسية.
التشبيه: فكر في فيلم. لا يحدث الأمر دفعة واحدة؛ بل له بنية حبكة: الفصل الأول (التحضير)، الفصل الثاني (الرحلة)، الفصل الثالث (الذروة)، والفصل الرابع (الخاتمة).
في الورقة البحثية: بدلاً من جدار من النصوص، تنظم SSL المهارة في مشاهد مثل "التحضير"، "الاستحواذ"، "التنفيذ"، و"التحقق". هذا يساعد الحاسوب على فهم تدفق المهمة. فهو يعرف أنه يجب عليك "التحضير" قبل أن تتمكن من "التنفيذ".
3. الطبقة المنطقية (Logical Layer): "قائمة الأفعال"
ما هي: هذا هو التفصيل الدقيق لما يحدث فعلياً في كل مشهد. وهي تسرد أفعالاً محددة وما هي الموارد (مثل الملفات أو كلمات المرور) التي تتعامل معها.
التشبيه: هذه هي قائمة اللقطات لمشهد معين في الفيلم. تقول: "الكاميرا 1: اقرأ الملف"، "الكاميرا 2: استدعِ واجهة برمجة التطبيقات (API)"، "الكاميرا 3: اكتب في قاعدة البيانات". كما توضح ما إذا كانت الكاميرا ستلمس "منطقة خطر" (مثل ملف كلمة مرور).
في الورقة البحثية: تحدد هذه الطبقة الأفعال الذرية (مثل "القراءة" أو "الكتابة") وتحدد بدقة الموارد المعنية. وهذا أمر بالغ الأهمية لرصد المخاطر، مثل: "أوه، هذه المهارة على وشك قراءة ملف كلمة مرور وإرساله إلى الإنترنت".
لماذا فعلوا ذلك؟ (التجارب)
اختبر الباحثون نظام "المخطط الانسيابي" الجديد هذا مقابل نظام "النص الفوضوي" بطريقتين رئيسيتين:
1. العثور على الوصفة الصحيحة (اكتشاف المهارة)
- الاختبار: سألوا الحاسوب: "أحتاج إلى مهارة لإصلاح كتابتي"، وراقبوا مدى سرعة قدرته على إيجاد المهارة الصحيحة في مكتبة تضم 6,000 مهارة.
- النتيجة: عندما استخدم الحاسوب مخطط SSL الانسيابي، وجد المهارة الصحيحة بشكل أسرع وأكثر دقة. كان الأمر يشبه الانتقال من البحث في مكتبة عبر قراءة أغلفة كل الكتب من الغلاف للغلاف إلى استخدام فهرس بطاقات مثالي ومنظم.
- النجاح: ارتفع معدل النجاح بشكل كبير (من 0.573 إلى 0.707).
2. رصد الوصفات الخطرة (تقييم المخاطر)
- الاختبار: طلبوا من الحاسوب فحص 500 مهارة وقول: "هل هذه المهارة خطيرة؟ هل تسرق البيانات أو تحذف الملفات؟"
- النتيسة: عندما امتلك الحاسوب مخطط SSL بجانب النص، كان أفضل بكماك في رصد مخاطر محددة مثل "تسريب البيانات" (Data Exfiltration) أو "السلوك التدميري" (Destructive Behavior). جعلت القائمة المنظمة من الأفعال المخاطر "تبرز" بوضوح مثل الأعلام الحمراء على الخريطة.
- النجاح: تحسنت دقة رصد المخاطر (من 0.744 إلى 0.787).
الخلاصة الكبرى
تجادل الورقة البحثية بأن SSL ليس مقصوداً منه استبدال النص الأصلي. لا تزال بحاجة إلى "الرواية" الأصلية (ملف SKILL.md) للحصول على القصة الكاملة، والأمثلة، والسياق البشري.
بدلاً من ذلك، SSL هو "مترجم" يحول تلك الرواية إلى خريطة مهيكلة قابلة للقراءة آلياً.
- يساعد الحواسيب على إيجاد الأداة الصحيحة بسرعة.
- يساعد الحواسيب على رؤية المخاطر بوضوح.
- يحافظ على النص الأصلي كـ "مصدر للحقيقة" بينما يمنح الآلة رؤية نظيفة ومنظمة للعمل بها.
باخت-القول، تظهر الورقة أنه إذا كنت تريد لوكلاء الذكاء الاصطناعي أن يكونوا أكثر أماناً وذكاءً، فلا ينبغي لك فقط تغذيتهم بمزيد من النصوص؛ بل يجب أن تعطيهم خريطة مهيكلة لما يفعله هذا النص بالفعل.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.