← أحدث الأبحاث
💻 computer science

IGen: Scalable Data Generation for Robot Learning from Open-World Images

إن IGen هو إطار عمل قابل للتوسع يستفيد من صور العالم المفتوح ونماذج الرؤية واللغة لتخليق مشاهد ثلاثية الأبعاد واقعية وأفعال روبوتية قابلة للتنفيذ، مما يمكّن من تدريب سياسات روبوتية عامة بأداء يضاهي تلك التي يتم تدريبها على بيانات من العالم الحقيقي.

المؤلفون الأصليون: Chenghao Gu, Haolan Kang, Junchao Lin, Jinghe Wang, Duo Wu, Shuzhao Xie, Fanding Huang, Junchen Ge, Ziyang Gong, Letian Li, Hongying Zheng, Changwei Lv, Zhi Wang

نُشر 2026-04-16
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Chenghao Gu, Haolan Kang, Junchao Lin, Jinghe Wang, Duo Wu, Shuzhao Xie, Fanding Huang, Junchen Ge, Ziyang Gong, Letian Li, Hongying Zheng, Changwei Lv, Zhi Wang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تريد تعليم روبوت القيام بالأعمال المنزلية، مثل ري النباتات أو صب الشاي. تقليديًا، لكي تعلم روبوتًا، يجب أن تكون "معلمه" في الحياة الواقعية. عليك توجيه ذراعه جسديًا، وتسجيل كل حركة، والقيام بذلك آلاف المرات لكل مهمة جديدة. الأمر يشبه محاولة تعليم طفل ركوب الدراجة عبر الإمساك بالمقعد والجري بجانبه في كل منعطف. إنه أمر مرهق، بطيء، ولا يمكنك تعليمه إلا في غرفتك الخاصة.

IGen هو اختراع جديد يغير قواعد اللعبة. فبدلاً من الحاجة إلى روبوت حقيقي وغرفة حقيقية، يتيح لنا IGen تعليم الروبوتات باستخدام أي صورة تجدها على الإنترنت.

إليك كيف يعمل الأمر، مقسمًا ببعض التشبيهات البسيطة:

1. المشكلة: معضلة "الصورة الفارغة"

فكر في الصورة الموجودة على هاتفك كـ لحظة مجمدة في الزمن. هي تظهر إبريق شاي وكوبًا، لكنها لا تخبرك كيف تمسك الإبريق، أو أين تصب الشاي، أو مدى القوة المطلوبة للضغط على المقبض. إنها صورة جميلة، لكنها "صامتة" فيما يتعلق بالحركة. الروبوتات تحتاج إلى نص برمجي (سيناريو)، وليس مجرد صورة.

2. الحل: IGen (محرك الخيال)

IGen يشبه مخرج أفلام ذكي جدًا ينظر إلى صورة ثابتة واحدة ويقوم فورًا بكتابة وإخراج وتصوير فيلم كامل لروبوت يقوم بالمهمة. وهو يفعل ذلك عبر ثلاث خطوات سحرية:

الخطوة أ: تحويل الصورة المسطحة إلى عالم ثلاثي الأبعاد (تأثير "الكتاب المنبثق")

أولاً، ينظر IGen إلى صورة ثنائية الأبعاد (مثل صورة مطبخ) ويستخدم الذكاء الاصطناعي لجعلها "تنبثق" وتتحول إلى عالم ثلاثي الأبعاد.

  • التشبيه: تخيل أنك تأخذ رسمًا لمنزل وتحوله سحريًا إلى نموذج ثلاثي الأبعاد يمكنك التجول حوله. يقوم IGen بذلك عن طريق تقدير العمق (مدى بعد الأشياء) وإنشاء "سحابة نقاط" (سحابة رقمية من النقاط تمثل كل جسم).
  • النتيجة: فجأة، أصبح لدى الروبوت خريطة ثلاثية الأبعاد للغرفة، وليس مجرد صورة مسطحة.

الخطوة ب: العقل واليدان (الشيف ومساعد الشيف)

الآن بعد أن أصبح لدى الروبوت خريطة ثلاثية الأبعاد، فإنه يحتاج لمعرفة ما يجب فعله.

  • العقل (VLM): يستخدم IGen "نموذج رؤية ولغة" (ذكاء اصطناعي فائق الذكاء يفهم الصور والكلمات معًا). أنت تقول له: "يرجى ري الزهور". يعمل الذكاء الاصطناعي هنا مثل رئيس الطهاة (Head Chef)، حيث يقسم هذا الأمر الكبير إلى خطوات صغيرة: "1. ابحث عن مرشة الماء. 2. أمسك المقبض. 3. ارفعها للأعلى. 4. أملها فوق النبتة".
  • اليدان (مخطط الحركة): بمجرد أن يعطي الشيف الأوامر، يقوم IGen بحساب الرياضيات الدقيقة لتحريك ذراع الروبوت. إنه يحدد الزوايا والسرعات الدقيقة اللازمة للإمساك بالمرشة دون قلبها. إنه يشبه مساعد الشيف (Sous-Chef) الذي يعرف بالضبط كيفية تقطيع الخضروات بناءً على تعليمات رئيس الطهاة.

الخطوة ج: تصوير تجربة الأداء (البروفة الافتراضية)

هذا هو الجزء الأروع. قبل أن يلمس الروبوت أي جسم حقيقي، يقوم IGen بمحاكاة الحركة بأكملها داخل الكمبيوتر.

  • التشبيه: تخيل لعبة فيديو حيث يمكنك ممارسة مستوى معين مرارًا وتكرارًا دون كسر أي شيء. يأخذ IGen الخريطة ثلاثية الأبعاد وخطة الحركة، ثم يقوم "بإخراج" (Rendering) فيديو للروبوت وهو يؤدي المهمة.
  • السحر: هو لا يخمن فحسب؛ بل يستخدم الفيزياء. إذا رفع الروبوت مرشة الماء، فستتحرك المياه بداخلها بشكل واقعي. إذا أسقط كوبًا، فسيتحطم. إنه ينشئ "جلسة تدريب" مثالية وآمنة يمكن للروبوت التعلم منها.

3. لماذا يعد هذا أمراً هاماً؟

  • تدريب غير محدود: يمكنك أخذ صورة واحدة لمكتب فوضوي، ويمكن لـ IGen توليد 1000 سيناريو تدريبي مختلف (تحريك الكوب لليسار، لليمين، رفعه عاليًا، رفعه منخفضًا). إنه يشبه امتلاك روبوت يمكنه التدرب مليون مرة في الوقت الذي تستغرقه أنت لشرب كوب من القهوة.
  • لا حاجة لروبوتات حقيقية: لا تحتاج إلى أذرع روبوتية باهظة الثمن أو مختبر مليء بالمستشعرات لجمع البيانات. أنت فقط بحاجة إلى كمبيوتر وصورة.
  • نجاح في العالم الحقيقي: تثبت الورقة البحثية أن الروبوتات التي تتدرب فقط على هذه الفيديوهات المولدة حاسوبيًا يمكنها بالفعل الذهي إلى العالم الحقيقي والقيام بالمهمة. إنه يشبه طيارًا لم يسبق له قيادة طائرة حقيقية، لكنه مارس 10,000 ساعة في محاكي طيران مثالي، ليقوم بعدها بهبوط مثالي في أول رحلة حقيقية له.

الخلاصة

IGen هو جسر بين العالم المرئي (مليارات الصور على الإنترنت) والعالم المادي (الروبوتات التي يمكنها الحركة واللمس). إنه يحول الصور "الساكنة" إلى بيانات تدريب "نشطة"، مما يسم يسمح للروبوتات بالتعلم من الإنترنت بأكمله بدلاً من مجرد ساعات قليلة من التوجيه البشري في غرفة واحدة.

إنه الفرق بين محاولة تعلم السباحة عن طريق قراءة كتاب عن الماء، مقابل القفز في مسبح واقع افتراضي حيث يمكنك ممارسة الغوص، والطفو، والسباحة مليون مرة قبل أن تطأ قدمك المحيط الحقيقي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →