← أحدث الأبحاث
🤖 AI

PRTS: A Primitive Reasoning and Tasking System via Contrastive Representations

إن PRTS هو نموذج تأسيسي للرؤية واللغة والعمل يعيد صياغة ما قبل التدريب كتعلم تعزيزي مشروط بالهدف باستخدام تمثيلات تباينية لتعلم الوعي الذاتي بالوصول إلى الأهداف من المسارات غير المتصلة، مما يحسن بشكل كبير الأداء الروبوتي في المهام طويلة الأمد، والغنية بالتلامس، والمهام الصفرية مقارنة بنسخ السلوك التقليدي.

المؤلفون الأصليون: Yang Zhang, Jiangyuan Zhao, Chenyou Fan, Fangzheng Yan, Tian Li, Haitong Tang, Sen Fu, Xuan'er Wu, Qizhen Weng, Weinan Zhang, Xiu Li, Chi Zhang, Chenjia Bai, Xuelong Li

نُشر 2026-05-01
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yang Zhang, Jiangyuan Zhao, Chenyou Fan, Fangzheng Yan, Tian Li, Haitong Tang, Sen Fu, Xuan'er Wu, Qizhen Weng, Weinan Zhang, Xiu Li, Chi Zhang, Chenjia Bai, Xuelong Li

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تعلم روبوتًا القيام بالأعمال المنزلية. تتعلم معظم الروبوتات الحالية عن طريق المحاكاة: فهي تشاهد فيديو لإنسان يقوم بمهمة ما (مثل التقاط كوب) وتحاول تقليد الحركات الدقيقة التي رأتها. هذا يشبه طالبًا يحفظ رقصة عن ظهر قلب؛ إذا تغيرت الموسيقى، أو انطفأت الأنوار، أو تحرك الراقص إلى مكان مختلف، يصاب الطالب بالارتباك ويتوقف عن الرقص. هو يعرف كيف يتحرك، لكنه لا يفهم حقًا لماذا يتحرك أو إلى أين يتجه.

تقدم ورقة بحثية نظام PRTS (نظام الاستدلال الأولي والمهام)، وهو نوع جديد من عقول الروبوتات التي تتعلم بشكل مختلف. فبدلاً من مجرد نسخ الحركات، يتعلم PRTS فهم الأهداف والتقدم.

إليك تفصيل لكيفية عمله، باستخدام تشبيهات بسيطة:

1. المشكلة: "الروبوت الذي يحفظ فقط"

الروبوتات الحالية تشبه الممثلين الذين حفظوا نصًا مسرحيًا. إذا قال النص "التقط الكوب الأحمر"، سيفعل ذلك. ولكن إذا طلبت منهم "التقط الكوب الأزرق" (حتى لو كانوا قد رأوا كوبًا أزرقًا من قبل)، أو إذا كان الكوب في مكان غريب، فإنهم غالبًا ما يفشلون. إنهم يفتقرون إلى الحس بالاتجاه. هم لا يعرفون ما إذا كانوا يقتربون من الهدف أم يبتعدون عنه.

2. الحل: "البوصلة" (التعلم التعزيزي التبايني)

يضيف PRTS "بوصلة" إلى عقل الروبوت. فهو يستخدم تقنية تسمى التعلم التعزيزي التبايني.

  • التشبيه: تخيل أنك في غابة مظلمة تحاول العثور على نار مخيم (الهدف).
    • الروبوتات القديمة: هي فقط تتذكر المسار الذي سلكته في المرة الماضية. إذا تحركت الأشجار، تضيع.
    • PRTS: يتعلم أن يسأل نفسه: "إذا اتخذت هذه الخطوة، هل أبدو وكأنني أقترب من النار؟" هو لا يحتاج إلى خريطة أو معلم ليخبره "أحسنت!" في كل خطوة. بدلاً من ذلك، يتعلم من خلال المقارنة بين شيئين:
      1. "إذا قمت بهذا الإجراء، هل يبدو الأمر وكأنني أتجه نحو الهدف؟" (نعم/جيد).
      2. "إذا قمت بهذا الإجراء الآخر، هل يبدو الأمر وكأنني أتجه نحو هدف مختلف؟" (لا/سيء).

من خلال القيام بذلك ملايين المرات، يبني الروبوت خريطة داخلية حيث يتم تقييم كل إجراء بناءً على مدى احتمالية وصوله إلى الهدف المحدد الذي أعطيته إياه بالكلمات.

3. الخدعة السحرية: فعل شيئين في وقت واحد

عادةً، تعليم الروبوت "فهم الأهداف" وتعليم "تحريك ذراعيه" هما فصلان دراسيان منفصلان. أنت تعلم العقل، ثم تعلم العضلات. وهذا أمر بطيء ومكلف.

PRTS ذكي لأنه يتعلم كليهما في نفس الوقت في حصة واحدة.

  • التشبيه: تخيل طالبًا يخضع لاختبار حيث يتعين عليه كتابة مقال (الإجراء) وأيضًا حل مسألة رياضية (الهدف) على نفس الورقة.
  • يقوم PRTS بذلك عن طريق إضافة "ملاحظات لاصقة" صغيرة وغير مرئية إلى مدخلات الروبوت. إحدى الملاحظات تتبع الإجراء، والأخرى تتبع الهدف.
  • يعالج عقل الروبوت المشهد بأكمله، ويكتب الإجراء، وفي الوقت نفسه يتحقق من "المسألة الرياضية" (هل هذا الإجراء يقربني من الهدف؟) دون أن يتباطأ. إنه فعال للغاية لدرجة أن استهلاك طاقة الكمبيوتر يكاد يكون مماثلاً للطرق القديمة والأبسط.

4. النتائج: الروبوت الذي يستطيع "التفكير"

اختبر المؤلفون نظام PRTS في عمليات محاكاة وعلى روبوتات حقيقية (بذراعين وذراع واحدة). إليك ما حدث:

  • اختبار "المدى الطويل": عندما طُلب منه القيام بسلسلة طويلة من المهام (مثل "صنع الشاي"، والتي تتضمن غلي الماء، وإحضار كوب، وإضافة الشاي، إلخ)، لم يضل PRTS طريقه في منتصف الطريق. بل استمر في التحقق من "بوصلته" لضمان بقائه على المسار الصحيح.
  • اختبار "التعليمات الجديدة": إذا قلت للروبوت "التقط المكعب الأزرق" بدلاً من الأحمر الذي تدرب عليه، فإنه يستوعب الأمر فورًا. لم يكتفِ بحفظ "التقط الجسم عند الموضع X"؛ بل فهم "التقط الجسم الذي يطابق كلمة 'أزرق'".
  • اختبار "مقاطعة الإنسان": هذا هو الجزء الأكثر إثارة للإعجاب. تخيل أن الروبوت يضع مكعبًا على الطاولة، ثم يأتي إنسان وينتزع المكعب ويضعه في مكان مختلف.
    • الروبوتات القديمة: ستصاب بالارتباك، وتحاول وضع المكعب حيث كان، أو تتوقف ببساطة.
    • PRTS: يدرك فورًا: "أوه، الهدف لا يزال 'وضع المكعب على الطاولة'، لكن المكعب تحرك. أحتاج للذهاب وإحضاره مرة أخرى". إنه يتعافى ويكمل المهمة، تمامًا كما يفعل البشر.

الملخص

PRTS هو عقل روبوت يتوقف عن مجرد "النسخ" ويبدأ في "الاستدلال". إنه يتعلم ربط الكلمات (الأهداف) بالأفعال من خلال السؤال باستمرار: "هل هذه الخطوة تقربني مما طُلب مني فعله؟"

لأنه يتعلم "حس الاتجاه" هذا من الصفر باستخدام كميات هائلة من البيانات، فإنه يصبح أفضل بكثير في التعامل مع المواقف الجديدة، والمهام الطويلة، والأخطاء مقارنة بالروبوتات السابقة. إنه يحول الروبوت من مجرد مقلد بلا عقل إلى مساعد موجه نحو الأهداف.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →