← أحدث الأبحاث
💻 computer science

Any House Any Task: Scalable Long-Horizon Planning for Abstract Human Tasks

تقترح الورقة البحثية إطار عمل AHAT، وهو إطار تخطيط طويل المدى وقابل للتوسع يستفيد من نموذج لغوي كبير (LLM) تم تدريبه عبر خوارزمية تعلم تعزيزي مبتكرة (TGPO) لترجمة التعليمات البشرية الغامضة والرسوم البيانية للمشاهد إلى أهداف فرعية بلغة PDDL، مما يمكّن الروبوتات من إنشاء خطط مثالية للمهام المنزلية المعقدة عبر بيئات واسعة.

المؤلفون الأصليون: Zhihong Liu, Yang Li, Rengming Huang, Cewu Lu, Panpan Cai

نُشر 2026-08-04
📖 6 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Zhihong Liu, Yang Li, Rengming Huang, Cewu Lu, Panpan Cai

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم روبوت تنظيف غرفتك الفوضوية. لا تريد إعطاءه دليلاً خطوة بخطوة مثل "التقط الجورب، ثم امشِ خطوتين، ثم انحنِ". هذا ممل للغاية وهش؛ فإذا تحرك الجورب، سيصاب الروبوت بالارتباك. بدلاً من ذلك، تريد فقط أن تقول له: "اجعل هذه الغرفة مرتبة"، وتتركه يكتشف الباقي بنفسه. هذا هو "الكأس المقدسة" في مجال الروبوتات: تحويل رغبة بشرية غامضة إلى خطة عمل مادية مثالية.

للقيام بذلك، يستخدم العلماء غالباً أداتين مختلفتين. الأولى هي نموذج لغوي كبير (LLM)، وهو يشبه أمين مكتبة ذكي جداً ومطلع، يعرف ملايين الحقائق عن العالم ولكنه قد يخترع أحياناً قصصاً أو ينسى قواعد الفيزياء. الثانية هي المخطط الرمزي (Symbolic Planner)، وهو يشبه معلم رياضيات صارم لا يتزحزح عن القواعد، يتبع القواعد بدقة لكنه لا يملك أدنى فكرة عما يعنيه "الترتيب" أو كيف يتحدث مع البشر. التحدي الكبير يكمن في جعل أمين المكتبة الثرثار ومعلم الرياضيات الصارم يعملان معاً دون أن يتسبب أمين المكتبة في حلقة مفرغة للروبوت، أو يرفض معلم الرياضيات البدء لأن التعليمات كانت غامضة للغاية.

هذه هي المشكلة التي يعالجها بحث جديد يسمى TGPO (تحسين السياسة الموجه بالتعقب - Trace-Guided Policy Optimization). يحاول الباحثون تعليم الروبوت كيفية تفكيك الأوامر البشرية الكبيرة والفضفاضة إلى سلسلة من الخطوات الصغيرة القابلة للتحقق والتي يمكن للروبوت اتباعها فعلياً. وقد وجدوا أن مجرد طلب "افعل ذلك فحسب" من ذكاء اصطناعي متطور غالباً ما يؤدي إلى خطط تبدو جيدة على الورق ولكنها تفشل في العالم الحقيقي. بدلاً من ذلك، طوروا طريقة تدريب ذكية حيث يتعلم الذكاء الاصطناعي توليد "تعقب" (trace) لطريقة تفكيره، ويتلقى تصحيحاً من مساعد عندما يرتكب خطأً، ثم يحاول مرة أخرى. الأمر يشبه تعليم طالب ليس فقط بإعطائه درجة في النهاية، بل بمرافقته خلال حل واجباته المنزلية، وإصلاح أخطائه المنطقية في الوقت الفعلي، والسماح له بالممارسة حتى يتقن الأمر. والنتيجة هي نظام أفضل بكثير في التخطيط للمهام الطويلة والمعقدة — مثل تجهيز منزل كامل لحفلة — مقارنة بالطرق السابقة، خاصة عندما تكون التعليمات غامضة.

المشكلة: "العصا السحرية" التي تنكسر

تخيل أن لديك خادماً آلياً. تقول له: "أنا أستضيف تجمعاً احتفالياً، لذا نظف المنزل". الإنسان يفهم هذا فوراً: فهو يعرف أنه يجب عليه جمع القمامة، ومسح الطاولات، وربما وضع بعض الزينة. لكن بالنسبة للروبوت، هذا كابوس. إذا طلبت من ذكاء اصطناعي قياسي أن "يكتب خطة" فحسب، فقد يهذي. قد يقول: "انقل الأريكة إلى المطبخ"، حتى لو كانت الأريكة ثقيلة جداً، أو "شغل الموقد لتنظيف الأرضية"، وهي فكرة سيئة للغاية.

يوضح البحث أن نماذج الذكاء الاصطناعي الحالية بارعة في تخمين الكلمة التالية في الجملة، لكنها سيئة جداً في ضمان أن خططها قابلة للتنفيذ. فهي ترتكب أخطاء صغيرة في البداية — مثل نسيان التقاط كوب قبل تحريك طاولة — وتتراكم هذه الأخطاء مثل بيت من الورق حتى تنهار الخطة بأكملها. ومن ناحية أخرى، فإن مخططي الروبوت التقليديين آمنون جداً؛ فهم لن يفعلوا أي شيء مستحيل. لكنهم أيضاً "أغبياء" جداً؛ فهم يحتاجون منك أن تخبرهم بالضبط ماذا يفعلون باستخدام كود محدد جداً (يسمى PDDL)، ولا يمكنهم فهم دقة عبارة "نظف من أجل حفلة".

الحل: TGPO (المدرب "الموجه بالتعقب")

يقترح المؤلفون طريقة جديدة لتدريب الروبوتات تسمى تحسين السياسة الموجه بالتعقب (TGPO). فكر في TGPO ليس كروبوت يخمن فحسب، بل كطالب يتعلم مع مدرب صارم ومفيد.

إليك كيف يعمل التدريب، باستخدام تشبيه بسيط:

  1. الطالب (سياسة الذكاء الاصطناعي): يحاول عقل الروبوت تفكيك أمرك ("نظف من أجل الحفلة") إلى قائمة من الأهداف الفرعية. ربما يقول: "1. ارفع القمامة. 2. اغسل الأطباق. 3. اكنس الأرضية".
  2. المدرب (المُحقِّق): ينظر مُحقِّق صارم إلى هذه القائمة ويسأل: "انتظر، هل يمكنك حقاً غسل الأطباق إذا كان الحوض مليئاً بالطعام؟ هل تذكرت تحريك الكراسي قبل الكنس؟"
  3. تصحيح "التعقب": إذا كانت خطة الطالب خاطئة، فإن المدرب لا يكتفي بقول "فشل". بدلاً من ذلك، ينظر إلى عملية التفكير (التعقب) ويصلح الخطأ المحدد. قد يقول: "لقد نسيت إفراغ الحوض أولاً. إليك القائمة المصححة من الخطوات".
  4. حلقة الممارسة: يأخذ الروبوت بعد ذلك هذه القائمة المصححة ويحاول توليد بقية الخطة بناءً عليها. إنه يتعلم من التصحيح، وليس فقط من نتيجة "النجاح/الفشل" النهائية.

هذا يختلف عن كيفية تدريب معظم أنواع الذكاء الاصطناعي اليوم. عادةً، تطلب من الذكاء الاصطناعي القيام بشيء ما، وإذا فشل، فأنت فقط تخبره "عمل سيء" وتحاول مرة أخرى. هذا يشبه الرسوب في اختبار رياضيات والحصول على درجة "راسب" دون رؤية علامات القلم الأحمر التي توضح أين أخطأت. أما TGPO فهو يشبه الحصول على علامات القلم الأحمر أثناء خوض الاختبار، حتى تتمكن من إصلاح منطقك قبل تسليم الورقة.

ماذا وجدوا: الروبوت يصبح أكثر ذكاءً

اختبر الباحثون هذه الطة الجديدة على مجموعة واسعة من المهام، من المهام البسيطة مثل "أحضر لي منشفة" إلى المهام المعقدة للغاية مثل "جهز المنزل لمهرجان"، والتي تتضمن تحريك الأثاث، والتنظيف، والتنظيم بترتيب معين.

وقارنوا الروبوت الخاص بهم بنوعين آخرين من المخططين:

  • روبوتات "التلقين" (Prompting): وهي نماذج ذكاء اصطناعي يُطلب منها ببساطة كتابة خطة. وجد البحث أنه كلما زادت المهام صعوبة وتجريداً، فشلت هذه الروبوتات فشلاً ذريعاً. كانت ترتبك بسبب التعقيد وتقترح أفعالاً مستحيلة.
  • روبوتات "التعلم القياسي": وهي روبوتات مدربة باستخدام التعلم المعزز القياسي (التجربة والخطأ). كانت أفضل حالاً من روبوتات التلقين، لكنها لا تزال تعاني عندما تكون التعليمات غامضة أو المهام طويلة جداً.

النتائج:
كان روبوت TGPO هو الفائز الواضح.

  • في المهام السهلة، نجح بنسبة تقارب 88%.
  • في المهام المعقدة (سلاسل طويلة من الإجراءات)، نجح بنسبة 77%.
  • في المهام المجردة (حيث كان على الروبوت تخمين معنى "تنظيف")، نجح بنسبة 70%.

في المقابل، نجح أفضل "روبوت تلقين" بنسبة 22% فقط في تلك المهام المجردة نفسها. يشير البحث إلى أن قدرة TGPO على إصلاح عملية تفكيره في الوقت الفعلي هي المفتاح. فهو لا يخمن فحسب، بل يفكر، ويتحقق، ويصحح، ثم يتحرك.

لماذا يهم هذا؟

يظهر البحث أنه من خلال تعليم الروبوتات توليد "أهداف فرعية قابلة للتحقق" (خطوات صغيرة يمكن فحصها) واستخدام نظام يصحح مسارات تفكيرها، يمكننا جعلها أكثر موثوقية في العالم الحقيقي. ويشير المؤلفون إلى أن هذا يعمل حتى عندما تكون البيئة فوضوية أو التعليمات غامضة.

ومع ذلك، فهم حذرون في الإشارة إلى أن هذا ليس حلاً سحرياً لـ كل مشاكل الروبوتات بعد. فالنظام لا يزال يعتمد على خريطة محددة مسبقاً للعالم (رسم بياني للمشهد) ومجموعة من القواعد التي يعرفها الروبوت. إنه لا يتعلم رؤية العالم من الصفر بمجرد النظر إلى الكاميرا؛ بل يحتاج إلى تلك الخريطة المهيكلة للقيام بتخطيطه. ولكن بالنسبة لمهمة محددة تتمثل في تحويل الكلمات البشرية إلى أفعال روبوتية آمنة وقابلة للتنفيذ، فإن TGPO يقترح خطوة كبيرة للأمام، مما يثبت أنه مع نوعية "التدريب" الصحيحة، يمكن للذكاء الاصطناعي أن يتعلم التخطيط بشكل أفضل بكثير مما يفعل بمفرده.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →