← أحدث الأبحاث
💻 computer science

π\pi, But Make It Fly: Physics-Guided Transfer of VLA Models to Aerial Manipulation

تقدم هذه الورقة نظام AirVLA، الذي ينقل بنجاح نماذج الرؤية واللغة والعمل (Vision-Language-Action) المدربة مسبقاً إلى مجال المناولة الجوية من خلال الجمع بين البيانات الاصطناعية القائمة على تقنية "Gaussian Splatting" للملاحة وآلية التوجيه المدركة للحمولة التي تدمج قيود ديناميكيات الطيران في عملية أخذ العينات الخاصة بالسياسة، مما يؤدي إلى تحسين معدلات نجاح المهام في العالم الحقيقي بشكل كبير دون إعادة تدريب النموذج التأسيسي.

المؤلفون الأصليون: Johnathan Tucker, Denis Liu, Aiden Swann, Allen Ren, Javier Yu, Jiankai Sun, Brandon Kim, Lachlain McGranahan, Quan Vuong, Mac Schwager

نُشر 2026-03-27
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Johnathan Tucker, Denis Liu, Aiden Swann, Allen Ren, Javier Yu, Jiankai Sun, Brandon Kim, Lachlain McGranahan, Quan Vuong, Mac Schwager

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك طباخاً بارعاً عالمياً، قضى حياته بأكملها في طهي وجبات مثالية في مطبخ ذي أرضية صلبة وثابتة؛ فهو يعرف تماماً كيف يقطع، ويقلب، ويقدم الطعام لأن الطاولة لا تتحرك أبداً، والجاذبية هي القوة الوحيدة التي يحتاج للقلق بشأنها.

الآن، تخيل أنك طلبت من هذا الطباخ أن يطهي نفس الوجبة تماماً، ولكن هذه المرة وهو يقف على ترامبولين عائم ومتذبذب، يهتز ويميل باستمرار ويتفاعل مع الرياح.

هذا هو التحدي الذي واجهه الباحثون في ستانفورد وPhysical Intelligence في ورقتهم البحثية بعنوان "AirVLA".

إليك قصة كيف علموا "دماغاً آلياً" كيف يطير ويمسك الأشياء في آن واحد.

1. المشكلة: "الأرض" مقابل "السماء"

بدأ الباحثون بنموذج ذكاء اصطناعي فائق الذكاء يسمى π0 (Pi-Zero). فكر في هذا الذكاء الاصطناعي كأنه ذلك الطباخ الماهر؛ فقد تم تدريبه على آلاف الساعات من مقاطع الفيديو التي تظهر أذرعاً روبوتية تلتقط الأشياء من فوق الطاولات. تعلم أن "أمسك الكوب" تعني تحريك الذراع للأسفل مباشرة.

ولكن عندما حاولوا استخدام هذا الذكاء الاصطناعي على طائرة بدون طيار (درون)، فشل فشلاً ذريعاً.

  • عدم التطابق: الذراع الروبوتية ثقيلة ومستقرة، أما الدرون فهي خفيفة، متذبذبة، و"ناقصة التفعيل" (وهو مصطلح تقني يعني أنه من الصعب التحكم بها لأن عليها محاربة الجاذبية لمجرد البقاء في الهواء).
  • الاصطدام: عندما حاولت الدرون الإمساك بلعبة، جعل الوزن الزائد للعبة الدرون تهبط كالحجر. لم يكن الذكاء الاصطناعي يعرف كيفية التعويض عن التغير المفاجئ في الوزن لأنه لم يسبق له الطيران من قبل. كان الأمر يشبه طلب الطبخ من الشيف بينما يقف على متن قارب في وسط عاصفة؛ حيث استمر في إسقاط المكونات.

2. الحل: خدعتان سحريتان

لإصلاح ذلك دون إعادة تدريب الذكاء الاصطناعي من الصło (الأمر الذي قد يستغرق وقتاً طويلاً)، ابتكروا "رقعتين" ذكيتين لمساعدة الذكاء الاصطناعي على الطيران.

الخدعة الأولى: "حزام الأمان المستشعر للوزن" (التوجيه المدرك للحمولة)

عندما تمسك الدرون بجسم ما، تصبح أثقل. في العالم الحقيقي، إذا حملت صندوقاً ثقيلاً، فإنك تميل غريزياً للخلف أو تضغط بقوة أكبر بساقيك لتبقى منتصباً. الدرون لا تستطيع فعل ذلك بشكل طبيعي.

أضاف الباحثون "حزام أمان" قائماً على الفيزياء إلى دماغ الذكاء الاصطناعي.

  • كيف يعمل: بينما يقرر الذكاء الاصطناعي ما سيفعله تالياً، يهمس هذا الحزام في أذنه: "مهلاً، لقد أمسكت بشيء ثقيل للتو! سوف تهبط للأسفل. ادفع للأعلى قليلاً أكثر!"
  • النتيجة: بدلاً من التحطم، تقوم الدرون تلقائياً بالتعويض عن الوزن، مما يحافظ على ارتفاعها ثابتاً أثناء الإمساك بالجسم. حول هذا الأمر نسبة النجاح من 0% إلى 50%.

الخدعة الثانية: "محاكي الطيران الافتراضي" (Gaussian Splatting)

لا يمكنك تعليم طيار الطيران عبر بوابة ضيقة بمجرد عرض بعض الفيديوهات له؛ بل يحتاج إلى التدرب على التحطم والتعافي آلاف المرات. لكن الطيران بطائرة درون حقيقية تتحطم هو أمر مكلف وخطير.

لذلك، بنى الفريق عالماً افتراضياً فائق الواقعية باستخدام تقنية 3D Gaussian Splatting.

  • التشبيه: تخيل التقاط صورة لغرفة وتحويلها إلى سحابة من ملايين الجسيمات المتوهجة الصغيرة. يمكنك بعد ذلك الطيران بطائرة درون افتراضية عبر هذه السحابة من الجسيمات.
  • السحر: استخدموا هذا لتوليد آلاف المسارات الجوية "الوهمية" حيث تتدرب الدرون على الطيران عبر البوابات، وتخطئها، ثم تصحح مسارها. قاموا بتغذية هذه الدروس الافتراضية للذكاء الاصطناعي.
  • النتيجة: تعلم الذكاء الاصطناعي كيفية التنقل بين العوائق بشكل أفضل بكثير. وعندما اختبروه في العالم الحقيقي، قفزت نسبة نجاح الطيران عبر البوابات من 45% إلى 100%.

3. الختام الكبير: "الحركة المركبة"

الاختبار النهائي لم يكن مجرد الإمساك أو مجرد الطيران؛ بل كان القيام بكليهما معاً. طلبوا من الدرون القيام بما يلي:

  1. الطيران عبر بوابة ضيقة.
  2. الحوم فوق بطريق محشو (لعبة).
  3. الإمساك بالبطريق.
  4. إسقاطه في سلة.

هذا يشبه مطالبة لاعبة جمباز بالركض في سباق، ثم القفز فوق حاجز، ثم الإمساك بكرة، ثم رميها داخل طوق، كل ذلك وهي تحافظ على توازنها على عارضة متحركة.

النتيجة:
من خلال الجمع بين "حزام الأمان المستشعر للوزن" و"محاكي الطيران الافتراضي"، تمكن الذكاء الاصطناعي من تنفيذ هذه الحركة المركبة المعقدة بنسبة 62% من المرات.

لماذا يهم هذا؟

تثبت هذه الورقة البحثية أننا لسنا بحاجة لبناء دماغ جديد لكل نوع من أنواع الروبوتات. يمكننا أخذ دماغ تدرب على "روبوتات الأرض" ومن خلال القليل من التوجيه الفيزيائي والممارسة الافتراضية، تعليمه الطيران.

  • قبل: روبوت يمكنه العمل فقط على طاولة.
  • بعد: روبوت يمكنه الطيران داخل مبنى منهار لإزالة الأنقاض، أو توصيل الدواء إلى قمة جبل، أو إصلاح خط طاقة، وكل ذلك عبر الاستماع إلى أوامر بشرية بسيطة مثل "طِر عبر البوابة وأمسك بذلك الصندوق".

إنه الفرق بين تعليم سمكة كيف تمشي على الأرض، وبين تعليم سمكة كيف تطير بإعطائها حقيبة نفاثة وخريطة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →