← أحدث الأبحاث
🤖 AI

Think Twice, Act Once: Verifier-Guided Action Selection For Embodied Agents

تقترح الورقة البحثية إطار عمل "اختيار الإجراء الموجه بالتحقق" (VeGAS)، وهو إطار عمل يعمل في وقت الاختبار لتعزيز متانة الوكلاء المجسدين القائمين على النماذج اللغوية الكبيرة متعددة الوسائط، وذلك عبر أخذ عينات من الإجراءات المرشحة واستخدام مُحقق توليدي مدرب خصيصاً — تم بناؤه عبر استراتيجية تخليق بيانات مدفوعة بنموذج لغوي كبير — لاختيار الإجراء الأكثر موثوقية، مما يحقق مكاسب كبيرة في الأداء في المهام المعقدة وطويلة الأمد دون تعديل السياسة الأساسية.

المؤلفون الأصليون: Nishad Singhi, Christian Bialas, Snehal Jauhri, Vignesh Prasad, Georgia Chalvatzaki, Marcus Rohrbach, Anna Rohrbach

نُشر 2026-05-14
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Nishad Singhi, Christian Bialas, Snehal Jauhri, Vignesh Prasad, Georgia Chalvatzaki, Marcus Rohrbach, Anna Rohrbach

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تعلم روبوتاً كيفية تنظيف منزلك. أعطيته تعليمات بسيطة: "ابحث عن جسم رياضي وضعه على الطاولة".

في الماضي، إذا طلبت من روبوت ذكي القيام بذلك، فسيقوم بإلقاء نظرة سريعة، ويخمن ما يجب فعله تالياً، ثم يمسك فوراً بأول شيء يراه. إذا أمسك بإسفنجة ظناً منه أنها كرة، فسيفشل الروبوت، ولن يعرف أنه ارتكب خطأً إلا بعد أن تفسدت المهمة بأكملها. كان الأمر يشبه طالباً يؤدي اختباراً، فيكتب أول إجابة تخطر بباله، ثم يسلم الورقة دون مراجعة عمله.

تقدم هذه الورقة طريقة جديدة تسمى VEGAS (اختيار الإجراء الموجه بالتحقق). فكر في VEGAS كأنك تعطي الروبوت "رأياً ثانياً" قبل أن يتحرك.

المشكلة: الروبوت "المندفع"

الروبوتات الحالية تعمل بواسطة نماذج ذكاء اصطناعي ذكية جداً (تسمى نماذج اللغة الكبيرة متعددة الوسائط). وهي بارعة في فهم اللغة ورؤية الصور. ومع ذلك، فهي تشبه إلى حد كبير العباقرة المندفعين. فعندما تواجه موقفاً صعباً — مثل البحث عن "فاكهة صفراء منحنية" بدلاً من "موزة"، أو تنظيف تفاحة قبل وضعها في الخزانة — غالباً ما تتسرع في إعطاء إجابة. وإذا ارتكبت خطأً صغيراً في البداية، فإن الخطة بأكملها تنهار لأنها لا تتوقف أبداً لتسأل نفسها: "مهلاً، هل هذا صحيح حقاً؟"

الحل: استراتيجية "فكر مرتين"

يقترح المؤلفون تغييراً بسيطاً ولكنه قوي: لا تكتفِ بالتنفيذ فحسب؛ بل فكر مرتين، ثم نفذ مرة واحدة.

إليك كيف تعمل VEGAS، باستخدام تشبيه الطبخ:

  1. الطاهي (السياسة/النموذج): تخيل أن الروبوت هو طاهٍ يحاول اتباع وصفة طعام. بدلاً من مجرد الإمساك بمكون واحد ورميه في القدر، يتوقف الطاهي الآن.
  2. قائمة التذوق (أخذ العينات): يفكر الطاهي في 16 طريقة مختلفة لحل الخطوة الحالية. ربما "أمسك بالطماطم"، أو "أمسك بالبصل"، أو "اذهب إلى الثلاجة أولاً". يكتب الطاهي ملاحظة صغيرة ("سلسلة من الأفكار" - Chain of Thought) تشرح لماذا يعتبر كل خيار جيداً.
  3. الناقد (المُحقّق): هذا هو الجزء السحري. الطاهي لا يختار الفكرة الأولى فحسب، بل يسلم جميع الأفكية الـ 16 إلى ناقد (ذكاء اصطناعي متخصص مدرب على رصد الأخطاء).
    • يقرأ الناقد الوصفة وملاحظات الطاهي.
    • يقول الناقد: "الخيار الأول خاطئ لأنك أمسكت بإسفنجة وليس كرة".
    • "الخيار الثاني خاطئ لأنك حاولت فتح ميكروويف مغلق بالفعل".
    • "الخيار الثالث مثالي!"
  4. الخطوة النهائية: لا ينفذ الطاهي إلا الإجراء الذي أعطاه الناقد "علامة الموافقة".

السر الصغير: تدريب الناقد

قد تتساءل، "ألا يمكننا استخدام ذكاء اصطناعي فائق الذكاء ليكون هو الناقد؟" لقد جرب المؤلفون ذلك، وفشل الأمر. فالذكاء الاصطناعي العام يكون مهذباً للغاية أو غامضاً جداً بحيث لا يستطيع رصد أخطاء الروبوت المحددة.

لحل هذه المشكلة، اخترع المؤلفون "مصنع الفشل الاصطناعي".

  • أخذوا آلاف المهام الناجحة للروبوتات.
  • استخدموا ذكاءً اصطناعياً قوياً لإفسادها عمداً. جعلوا الروبوت يمسك الشيء الخطأ، أو يتخطى خطوة، أو يفتح الباب الخطأ.
  • ثم طلبوا من الذكاء الاصطناعي كتابة تقرير يشرح لماذا كان كل خطأ سيئاً.
  • استخدموا هذه "الأخطاء المزيفة" و"التقارير المزيفة" لتدريب ناقدهم.

الأمر يشبه تدريب مفتش سلامة عبر عرض آلاف الفيديوهات لأشخاص يقومون بأشياء خطيرة وشرح سبب خطورة كل منها بدقة. الآن، عندما يعمل الروبوت الحقيقي، يكون الناقد خبيراً في رصد تلك الأخطاء المحددة.

النتائج

اختبر المؤلفون هذه الطريقة في عالمين افتراضيين (Habitat و ALFRED) حيث يتعين على الروبوتات القيام بالأعمال المنزلية.

  • بدون VEGAS: ينجح الروبوت في حوالي 65% من المهام.
  • مع VEGAS: ينجح الروبوت في حوالي 71% من المهام.
  • في المهام الأكثر صعوبة: كان التحسن هائلاً، حيث وصل إلى 36% أفضل من السابق.

تظهر الورقة أنه من خلال إجبار الروبوت على توليد خيارات متعددة وجعل "ناقد" متخصص يختار الأفضل، يصبح الروبوت أكثر موثوقية، خاصة عندما تكون التعليمات صعبة أو الموقف جديداً.

الملخص

لا تدعي الورقة أن هذا سيشفي الأمراض أو يقود السيارات غداً. هي تدعي ببساء أنه بالنسبة للروبوتات التي تقوم بالمهام المنزلية، فإن الإبطاء للتحقق من عملك (باستخدام مُحقّق مدرب) يجعلها أذكى بكثير وأقل عرضة للفشل عندما تصبح الأمور معقدة. إنها تحول الروبوت من نموذج "خمن وتمنى" إلى نموذج "خطط، تحقق، ثم نفذ".

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →