← أحدث الأبحاث
🤖 AI

Bridging Values and Behavior: A Hierarchical Framework for Proactive Embodied Agents

تقدم هذه الورقة ValuePlanner، وهو بنية معرفية هرمية تجمع بين الاستدلال القيمي القائم على النماذج اللغوية الكبيرة والتخطيط الكلاسيكي لتمكين الوكلاء المجسدين من تنفيذ سلوكيات مستقرة، ذاتية التوجيه، وطويلة الأمد عبر حل الصراعات التحفيزية، وهو ما تم التحقق منه من خلال مجموعة تقييم جديدة متمحورة حول القيم في بيئة TongSim.

المؤلفون الأصليون: Chunhui Zhang, Yuxuan Wang, Aoyang Qin, Yi-Long Lu, Kunlun Wu, Yizhou Wang, Wei Wang

نُشر 2026-05-01
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Chunhui Zhang, Yuxuan Wang, Aoyang Qin, Yi-Long Lu, Kunlun Wu, Yizhou Wang, Wei Wang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك روبوتًا مساعدًا في منزلك. في الوقت الحالي، معظم هذه الروبوتات تشبه متدربين مطيعين جدًا ولكنهم مشوشون قليلًا. إذا قلت لهم: "اذهب لتنظيف المطبخ"، سيفعلون ذلك. وإذا قلت لهم: "اذهب لإعداد القهوة"، سيفعلون ذلك أيضًا. لكن إذا ابتعدت وتركتهم بمفردهم؟ فعادة ما يقفون هناك، ينتظرون أمرًا جديدًا. هم لا يعرفون ماذا يفعلون من تلقاء أنفسهم.

تقدم هذه الورقة البحثية نوعًا جديدًا من عقول الروبوتات يسمى ValuePlanner. بدلًا من انتظار الأوامر، يمتلك هذا الروبوت "شخصية" خاصة به ومجموعة من القيم الداخلية التي تخبره بما هو أكثر أهمية. الأمر يشبه إعطاء الروبوت بوصلة أخلاقية وقائمة مهام يكتبها لنفسه.

إليك كيف يعمل الأمر، مقسمًا إلى أجزاء بسيطة:

1. المشكلة: الـ "ماذا" مقابل الـ "كيف"

أدرك المؤلفون أن جعل الروبوت يعمل من تلقاء نفسه أمر صعب لأن هناك وظيفتين مختلفتين:

  • الـ "ماذا" (التفكير عالي المستوى): تقرير ماذا سيفعل بعد ذلك بناءً على ما يبدو مهمًا. (مثال: "من المحتمل أن أقوم بالترتيب لأنني أحب النظام.")
  • الـ "كيف" (الإجراء منخفض المستوى): تحديد الخطوات المحددة للقيام بذلك دون كسر أي شيء. (مثال: "ارفع الكوب، امشِ نحو الحوض، افتح الماء...")

الروبوتات الحالية غالبًا ما تحاول القيام بكليهما في وقت واحد باستخدام عقل واحد كبير (عادةً نموذج لغوي كبير - LLM). المشكلة هي أن هذه العقول الكبيرة قد "تهلوس" (تختلق أشياءً من خيالها) أو تنسى قواعد الفيزياء (مثل محاولة المشي عبر جدار).

2. الحل: فريق مكون من جزأين

بنى المؤلفون ValuePlanner، الذي يقسم المهمة إلى عضوين متخصصين في الفريق يتواصلان مع بعضهما البعض:

  • "المُتخيل" (النموذج اللغوي الكبير - LLM): هذا هو الجزء الإبداعي. ينظر إلى "قيم" الروبوت الداخلية (مثل "أنا أحب الغرفة النظيفة" أو "أريد أن أكون آمنًا") ويقرر هدفًا. هو لا يهتم بالخطوات الصغيرة؛ هو فقط يقول: "لنقم بترتيب الغرفة".
  • "المراقب" (المخطط الرمزي): هذا هو الجزء المنطقي الصارم. يأخذ هدف "المُتخيل" ويتحقق من قواعد المنزل. يقول: "حسنًا، لجعل الغرفة مرتبة، نحتاج إلى التقاط القمامة، ثم وضعها في السلة. لا يمكننا المشي عبر الجدار". هو ينشئ خطة خطوة بخطوة تضمن العمل من الناحية الفيزيائية.

الحلقة السحرية:
إذا قال "المراقب": "مهلاً، هذه الخطة لن تنجح لأن سلة المهملات ممتلئة"، فإن "المُتخيل" لا يستسلم فحسب. بل يحصل على رأي ثانٍ من "الناقد" (عقل ثالث يعمل كمدرب). يقول الناقد: "تلك الخطة كانت فوضوية للغاية. لنحاول هدفًا مختلفًا". يستمرون في تحسين الخطة حتى تصبح مثالية.

3. "القيم" (شخصية الروبوت)

كيف يعرف الروبوت ماذا يفعل عندما لا يكون لديه مدير؟ يستخدم نظامًا يعتمد على علم النفس البشري (تحديدًا نظرية شوارتز للقيم).

تخيل أن الروبوت لديه قرص به 7 إعدادات، مثل مفتاح التحكم في مستوى الصوت لمشاعر مختلفة:

  • الأمان: "أريد أن أكون آمنًا ومريحًا".
  • الوصاية: "أريد الاعتناء بمنزلي والحفاظ على نظافته".
  • الاستمتاع: "أريد الاسترخاء والاستمتاع".
  • الإنجاز: "أريد إنجاز الأمور".

إذا كان الروبوت "جائعًا" (طاقة منخفضة)، فقد يعطي الأولوية لـ الأمان (أكل شيء ما). إذا كان شبعانًا ولكن الغرفة فوضوية، فقد يعطي الأولوية لـ الوصاية (التنظيف). إذا كان يشعر بالملل، فقد يعطي الأولوية لـ الاستمتاع (قراءة كتاب).

الجزء الرائع هو أن الروبوت يمكنه فض النزاعات بين القيم.

  • سيناريو: الغرفة فوضوية، ولكن هناك مزهرية على حافة الطاولة قد تسقط.
  • الروبوت القديم: قد يقوم فقط بالتنظيف ويقلب المزهرية.
  • ValuePlanner: يوازن بين القيم. "الأمان" (عدم كسر المزهرية) أكثر أهمية الآن من "الوصاية" (التنظيف). لذا، سيحرك المزهرية أولاً، ثم ينظف الفوضى. إنه يقوم بمقايضة ذكية.

4. كيف اختبروا ذلك

وضعوا هذا الروبوت في منزل افتراضي (يسمى TongSim) وراقبوه لفترة طويلة دون إعطائه أي أوامر.

  • النتيجة: لم يكتفِ الروبوت بالجلوس هناك. بدأ في التنظيف، والترتيب، والاسترخاء من تلقاء نفسه.
  • المقارنة: قارنوه بروبوتات أخرى تتبع الأوامر فقط أو تستجيب للاحتياجات الأساسية (مثل "أنا جائع، آكل"). كان ValuePlanner أفضل بكثير في وضع خطة متماسكة وطويلة الأمد تبدو وكأنها لشخص حقيقي يعيش في منزل، وليس مجرد آلة تضع علامات في مربعات المهام.

5. الخلاصة

هذه الورقة لا تقول فقط "الروبوتات يمكنها أداء المهام". بل تقول: "الروبوتات يمكن أن تمتلك 'لماذا'".

من خلال فصل التفكير الإبداعي ("ماذا يجب أن أفعل؟") عن التفكير المنطقي ("كيف أفعل ذلك؟")، ومن خلال منح الروبوت مجموعة من القيم الداخلية لتوجيه خياراته، نجح المؤلفون في إنشاء وكيل يمكنه العمل بشكل استباقي. هو لا يتبع نصًا فحسب؛ بل يتخذ قرارات بناءً على ما يعتقد أنه مهم، تمامًا كما يفعل البشر عندما يقررون تنظيف غرفهم رغم أن أحدًا لم يطلب منهم ذلك.

باختًا: لقد علموا الروبوت كيف يمتلك شخصية وخطة، بحيث يمكنه عيش حياته الخاصة في المنزل، بدلًا من مجرد الانتظار لتخبره بما يجب فعله بعد ذلك.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →