HiSkill: Empowering LLM Agents with Hierarchical Skill Graphs
تقدم هذه الورقة HiSkill، وهو إطار عمل لمخطط مهارات هرمي ينظم مسارات التفاعل في مخطط مهيكل يربط المهارات عالية المستوى بالأفعال القابلة للتنفيذ، مما يمكّن وكلاء النماذج اللغوية الكبيرة من استرجاع المخططات الفرعية ذات الصلة بالمهام بكفاءة والقيام بالتنفيذ الموجه الذي يتفوق على الأساليب الحالية مع تقليل استهلاك الرموز (tokens).
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تعلم روبوتًا فائق الذكاء كيف يتنقل في منزل ضخم وفوضوي للعثور على لعبة معينة. أنت لا تريد إعطاء الروبوت دليل تعليمات جديد وطويل في كل مرة يحتاج فيها إلى التقاط جورب أو تشغيل ضوء. بدلاً من ذلك، تريد منه أن يتذكر "مهارات" تعلمها من قبل، مثل "كيفية فتح درج" أو "كيفية حمل كوب". هذا هو عالم نماذج اللغات الكبيرة (LLM) الوكيلية — وهي أنظمة ذكاء اصطناعي يمكنها التحدث والتفكير، لكنها تحتاج إلى تعلم كيفية القيام بالأشياء فعليًا في العالم الحقيقي (أو في محاكاة رقمية لها).
لفترة طويلة، حاول العلماء مساعدة هذه الروبوتات عبر تزويدها بسجل من التجارب الماضية، مثل مذكرات للأشياء التي قامت بها. لكن هناك مشكلة: هذه المذكرات غالبًا ما تكون مجرد قوائم نصية طويلة ومسطحة. الأمر يشبه امتلاك مكتبة حيث كل كتاب فيها ليس سوى جملة واحدة فقط. إذا احتاج الروبوت لمعرفة كيفية "صنع شطيرة"، فقد يجد جملة تقول "اصنع شطيرة"، لكنه لن يعرف الخطوات: أحضر الخبز، أحضر الزبدة، افرد الزبدة، ثم ضع الخبز فوق بعضه. كما أنه لن يعرف ماذا يفعل إذا أسقط الخبز. يتعثر الروبوت لأنه يمتلك الفكرة الكبيرة ولكنه يفتقر إلى الخطوات الصغيرة الملموسة وخطط الطوارح لإصلاح الأخطاء. هذه الورقة البحثية تسأل: كيف يمكننا تنظيم هذه الذكريات حتى يتمكن الروبوت من استخدامها فعليًا لحل المشكلات المعقدة دون أن يصاب بالارتباك؟
هنا يأتي دور HiSkill، وهو أسلوب جديد يعمل كمهندس معماري بارع لعقل الروبوت. فبدلاً من قائمة مسطحة من الذكريات، يبني HiSkill رسمًا بيانيًا مهاريًا هرميًا (hierarchical skill graph). فكر في هذا الرسم البياني كخريطة مترو أنفاق ضخمة وتفاعلية لعقل الروبوت.
في هذه الخريطة، يوجد نوعان رئيسيان من المحطات. المحطات الكبيرة والفخمة هي "عُقد المهارات" (Skill Nodes). هذه هي الأهداف عالية المستوى، مثل "تنظيف المطبخ" أو "البحث عن الكرة الحمراء". لكن المحطة في خريطة المترو لن تكون مفيدة ما لم تعرف أي قطار ستستقل للوصول إليها. وهنا يأتي دور المحطات الأصغر: "عُقد العمليات الذرية" (AtomicOp Nodes). هذه هي الأفعال الصغيرة والملموسة، مثل "أمسك الإسفنجة"، "افتح الصنبور"، أو "امسح الطاولة".
إن سحر HiSkill يكمن في كيفية ربط هذه المحطات. فهو لا يكتفي برسم خط من "تنظيف المطبخ" إلى "أمسك الإسفنجة"، بل يرسم أنواعًا مختلفة من الخطوط (الحواف/edges) التي تخبر الروبوت بالضبط كيف تتناسب الأجزاء مع بعضها البعض:
- خطوط التفكيك (Decomposition lines): توضح أن "تنظيف المطبخ" يتكون من تسلسل محدد من الأفعال الأصغر.
- خطوط الانتقال (Transition lines): توضح أنه بعد "إمساك الإسفنجة"، يمكنك عادةً "فتح الصنبور".
- خطوط الاستعادة (Recovery lines): هي بمثابة مخارج طوارئ؛ فإذا أسقط الروبوت الإسفنجة، تشير هذه الخطوط إلى فعل "التقط الإسفنجة" للعودة إلى المسار الصحيح.
- خطوط الدعم (Support lines): توضح الأدوات أو الخطوات الإضافية المطلوبة قبل بدء مهارة معينة.
عندما يُعطى الروبوت مهمة جديدة، لا يقوم HiSkill بضخ دماغه بالكامل (الرسم البياني بأكمله) في ذاكرة الروبوت! لأن ذلك سيكون عبئًا معلوماتيًا كبيرًا. بدلاً من ذلك، يعمل مثل نظام GPS ذكي؛ فهو ينظر إلى المهمة، ويجد "محطة المهارة" ذات الصلة، ثم يستخرج فقط الخريطة الصغيرة والمدمجة (الرسم البيعي الفرعي/subgraph) اللازمة لتلك الرحلة المحددة. إنه يربط الهدف الكبير بالخطوات الصغيرة وخطط الطوارئ، وكل ذلك في حزمة واحدة مرتبة.
اختبر المؤلفون هذه الفكرة في ثلاثة عوالم رقمية مختلفة: منزل حيث يتعين على الروبوت تحريك الأشياء (ALFWorld)، وموقع إلكتروني حيث يتعين عليه التسوق لشراء عناصر (WebShop)، ومختبر علمي حيث يتعين عليه إجراء تجارب (ScienceWorld). كانت النتائج مبهرة. لم يقم روبوت HiSkill بحل المزيد من المهام من الطرق الأخرى فحسب، بل حلها بشكل أسرع وبقدر أقل بكًا من "التفكير" المطلوب. في الواقع، استخدم 78.75% كلمات (tokens) أقل لإنجاز المهمة مقارنة بأقوى طريقة سابقة. وهذا يشير إلى أنه من خلال تنظيم الذكريات في خريطة مهيكلة ذات اتصالات واضحة بين الأفكار الكبيرة والأفعال الصغيرة، يمكن للروبوتات أن تصبح أكثر كفاءة وموثوقية.
تحقق المؤلفون أيضًا مما يحدث إذا تعطلت الخريطة. إذا قاموا بإزالة محطات الأفعال الصغيرة (AtomicOps)، فإن الروبوت يضيع لأنه يمتلك الأفكار الكبيرة فقط. وإذا أزالوا الخطوط الخاصة (الحواف) التي توضح كيفية الاستعادة من الأخطاء، فإن الروبوت يستسلم عندما تسوء الأمور. وهذا يثبت أن الهيكل نفسه — الطريقة التي ترتبط بها المهارات الكبيرة والأفعال الصغيرة — هو السر وراء نجاح العملية.
باختصار، يقترح HiSkill أنه لجعل وكلاء الذكاء الاصطناعي مفيدين حقًا، لا ينبغي لنا مجرد إعطائهم كومة من الملاحظات. نحن بحاجة إلى منحهم خريطة منظمة ومتصلة توضح ليس فقط "ماذا" يفعلون، بل "كيف" يفعلون ذلك خطوة بخطوة، وماذا يفعلون عندما تسوء الأمور. إنه الفرق بين تسليم شخص ما قائمة من الكلمات وتسليمه دليلًا إرشاديًا مصورًا وتفاعليًا بالكامل.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.