Language-Guided Generation for Personalized Inspection Planning
تقترح هذه الورقة إطار عمل موجهاً بنماذج الرؤية واللغة، لا يتطلب تدريباً، يقوم بتوليد مسارات تفتيش فعالة وسلسة ومتوافقة مع القيود للمركبات الجوية وتحت المائية من خلال استخراج نقاط الاهتمام من الأوصاف النصية، وتحسين النقاط المسارية بشكل تكراري، وحل مسألة البائع المتجول المقيدة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
لطالما اعتمدت الروبوتات التي تتحرك في العالم على مشغلين بشريين لرسم مساراتها، وتحديد ما يجب النظر إليه، وتحديد الترتيب الذي يجب أن تزور به أماكن مختلفة. بالنسبة لطائرة بدون طيار (درون) تفحص جسراً أو غواصة تمسح حطام سفينة، يعني هذا عادةً ضرورة قيام إنسان أولاً برسم خريطة للمنطقة، ثم تحديد كل نقطة تحتاج الروبوت لرؤيتها يدوياً، وأخيراً حساب مسار يربط بينها جميعاً دون الاصطدام. هذه العملية بطيئة، وتتطلب معرفة متخصصة، وتجعل من الصعب على غير الخبراء ببساطة إخبار الآلة بما يريدون رؤيته. وبينما أصبحت الروبوتات مؤخراً أفضل في اتباع التعليمات المنطوقة لإيجاد طريقها في أماكن غير معروفة، إلا أنها لا تزال تواجه صعوبة عندما يكون الهدف هو فحص بيئة معروفة بناءً على وصف بسيط. ويكمن التحدي في ترجمة نية الإنسان رفيعة المستوى — مثل "حلّق داخل الملعب وانظر إلى الملعب" — إلى مسار طيران دقيق وسلس يمكن للآلة تنفيذه فعلياً.
لقد طور فريق من الباحثين طريقة جديدة تسمح للروبوتات بإنشاء خطط الفحص هذه مباشرة من الأوصاف النصية، دون الحاجة إلى أي تدريب خاص أو أمثلة مسبقة. يستخدم نهجهم نوعاً من الذكاء الاصطناعي يُعرف باسم "نموذج اللغة والرؤية"، والذي يمكنه فهم الصور والكلمات في آن واحد. وبدلاً من إجبار البشر على برمجة كل نقطة مسار، يأخذ النظام خريطة ثلاثية الأبعاد لبيئة ما وجملة تصف المهمة. ثم يستنتج بالضبط أين يحتاج الروبوت للذهاب لرؤية الأشياء المذكورة في النص، وبأي ترتيب، ومن أي زاوية. اختبر الباحثون هذا النظام في كل من المحاكاة الحاسوبية والبيئات الواقعية، بما في ذلك طائرة بدون طيار تطير داخل مختبر للتحقق من أشياء محددة. وتظهر النتائج أن الروبوت يمكنه باستمرار إنشاء مسارات طيران تتطابق مع تعليمات المستخدم، حيث يزور المواقع الصحيحة بالتسلسل الصحيح مع الحفاظ على مسار سلس وفعال.
جوهر هذا النظام الجديد هو عملية مكونة من ثلاث خطوات تجسر الفجوة بين جملة بسيطة وخطة طيران معقدة. أولاً، يقرأ النظام نص المستخدم ويحدد نقاط الاهتمام المحددة، مثل ملعب كرة القدم أو مجموعة من المقاعد، جنباً إلى جنب مع أي تعليمات حول مكان تواجد الروبوت بالنسبة لتلك الأشياء. بعد ذلك، يبني خريطة رقمية للمواقع المحتملة التي يمكن للروبوت أن يشغلها داخل البيئة. ولكل موقع محتمل، يطلب النظام من الذكاء الاصطناعي النظر إلى ست زوايا مختلفة للمشهد من تلك النقطة وتقرير ما إذا كان الشيء المستهدف مرئياً وما إذا كان الروبوت في الموقع الصحيح لرؤيته. هذه الخطوة حاسمة لأنها تضمن أن الروبوت لن يكتفي بمجرد الطيران بالقرب من جسم ما، بل سيضع نفسه بالفعل للحصول على رؤية واضحة، مع احترام القيود مثل "حلّق فوق" أو "انظر من الجانب".
بمجرد أن يحدد النظام جميع المواقع الصالحة حيث يمكن للروبوت رؤية الأشياء المطلوبة، يجب عليه تحديد الطريقة الأكثر كفاءة لزيارتها جميعاً. يتضمن ذلك حل مشكلة توجيه معقدة لتحديد أفضل ترتيب لزيارة المواقع، مما يضمن أنه إذا قال المستخدم "اذهب إلى الملعب أولاً، ثم المدرجات"، فإن الروبوت سيتبع هذا التسلسل. غالباً ما يكون المسار الأولي الناتج عن هذه الخطوة متعرجاً وغير فعال، مثل سلسلة من الخطوط المستقيمة التي تربط بين النقاط. ولإصلاح ذلك، يستخدم النظام الذكاء الاصطناعي مرة أخرى لتنعيم المسار. فهو يختبر ما إذا كان بإمكان الروبوت التحرك قليلاً بين نقطتين لإنشاء خط أكثر استقامة وسلاسة دون فقدان الرؤية للهدف أو الاصطدام بعائق. وتستمر عملية الصقل المتكررة هذه حتى يصبح المسار أكثر سلاسة قدر الإمكان، مما يضمن قدرة الروبوت على طيرانه بأمان وسرعة.
أخيراً، يقوم النظام بتحويل هذه السلسلة الملساء من النقاط إلى مسار مستمر وانسيابي يمكن لروبوت حقيقي اتباعه. فهو يحسب السرعة الدقيقة وتغييرات الاتجاه اللازمة للتحرك بين النقاط دون اهتزاز أو توقف، مما يخلق مساراً محسناً رياضياً من حيث الكفاءة. وفي تجاربهم، استخدم الباحثون طائرة بدون طيار صغيرة لاختبار هذه الطريقة في غرفة حقيقية. لقد طلبوا من الطائرة الطيران إلى شعار معين على الأرض ثم التحقق مما إذا كان الباب مغلقاً. نجحت الطائرة في إعادة بناء الغرفة، وتخطيط مسار الطيران بناءً على النص، وتنفيذ المهمة، والهبوط فقط بعد إتمام عملية الفحص. وقد أثبت النظام قدرته على التعامل مع التعليمات المعقدة، مثل زيارة مواقع متعددة بترتيب معين أو الحفاظ على توجه معين بالنسبة لجسم ما، وكل ذلك دون أي تدخل بشري في مرحلة التخطيط.
وجد الباحثون أن طريقتهم تعمل بشكل جيد عبر مجموعة متنوعة من البيئات، من النماذج الرقمية المصنوعة يدوياً إلى المسوحات الواقعية للمباني والمعالم. لقد اختبروا النظام مع نماذج مختلفة من الذكاء الاصطناعي ووجدوا أن النماذج الأكثر تقدماً يمكنها فهم العلاقات المكانية بشكل صحيح، مثل ما إذا كانت نقطة ما "داخل" أو "فوق" جسم ما، بدقة عالية. كما أظهر النظام قدرته على التعامل مع مستويات مختلفة من جودة الصورة، محافظاً على أدائه حتى عندما تكون البيانات المرئية أقل وضوحاً، وهو أمر شائع للكاميرات المثبتة على الطائرات الصغيرة بدون طيار. وبينما تتطلب العملية قوة حوسبة كبيرة لتحليل الصور وإنشاء المسار، فقد أظهر الفريق أنه يمكن القيام بذلك بسرعة نسبية، مما يجعلها حلاً عملياً للتطبيقات الواقعية.
يمثل هذا العمل خطوة مهمة للأمام في جعل الروبوتات أكثر سهولة في الاستخدام وقابلية للتكيف. فمن خلال إزالة الحاجة إلى تخطيط المسار اليدوي والسماح للمستخدمين ببساطة بوصف ما يريدون رؤيته، يفتح النظام الباب لغير الخبراء لنشر روبوتات الفحص في مجالات تتراوح من الهندسة المدنية إلى المسح البحري. ويقر الباحثون بأن النظام لا يزال يعتمد على أجهزة كمبيوتر بعيدة قوية لمعالجة البيانات المرئية، مما قد يثير مخاوف تتعلق بالخصوصية، وأن الذكاء الاصطناعي قد يرتكب أحياناً أخطاء في فهم العلاقات المكانية المعقدة. ومع ذلك، يقترحون أنه يمكن معالجة هذه المشكلات عن طريق تشغيل النظام على أجهزة محلية أو تدريب النماذج على بيانات أكثر تحديداً. وفي النهاية، توضح الدراسة أن الروبوتات يمكنها الآن فهم التعليمات باللغة الطبيعية والعمل بناءً عليها لأداء مهام فحص معقدة، محولةً جملة بسيطة إلى مهمة دقيقة وقابلة للتنفيذ.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.