← أحدث الأبحاث
🤖 AI

SpatialForge: Bootstrapping 3D-Aware Spatial Reasoning from Open-World 2D Images

تقدم الورقة البحثية SpatialForge، وهو خط معالجة لتخليق البيانات قابل للتوسع يحول صور العالم المفتوح ثنائية الأبعاد إلى مجموعة بيانات مكونة من 10 ملايين زوج لتعزيز وتطوير قدرات الاستدلال المكاني المدركة للثلاثي الأبعاد في النماذج اللغوية البصرية الكبيرة بشكل فعال وكبير.

المؤلفون الأصليون: Zishan Liu, Ruoxi Zang, Yanglin Zhang, Wei Liu, Yin Zhang, Jian Yao, Jiayin Zheng, Zhengzhe Liu

نُشر 2026-05-13
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Zishan Liu, Ruoxi Zang, Yanglin Zhang, Wei Liu, Yin Zhang, Jian Yao, Jiayin Zheng, Zhengzhe Liu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك صديقًا آليًا ذكيًا جدًا يمكنه قراءة كتاب، والنظر إلى صورة، وإخبارك بالضبط بما يحدث في القصة. إنه بارع في الوصف: "هذا كلب أحمر"، أو "هناك ثلاث قطط على الأريكة". لكن إذا سألته: "هل الكلب أقرب إلى النافذة من القطة؟" أو "إذا كنت أقف خلف الأريكة، فهل ستكون القطة على يساري أم يميني؟"، غالبًا ما يرتبك الروبوت. فهو يرى الصورة كرسم مسطح، وليس كعالم ثلاثي الأبعاد.

تقدم هذه الورقة البحثية، SpatialForge، طريقة جديدة لتعليم هذه الروبوتات كيفية فهم المساحة، والعمق، والمنظور دون الحاجة إلى ماسحات ضوئية ثلاثية الأبعاد باهظة الثمن أو كاميرات خاصة.

إليك تفصيل حلهم باستخدام تشبيهات بسيطة:

المشكلة: "عمى العالم المسطح"

نماذج الذكاء الاصطناğı الحالية تشبه الأشخاص الذين لم ينظروا إلا إلى اللوحات الفنية طوال حياتهم. هم يعرفون شكل الشجرة، لكنهم لا يفهمون بالفطرة أن شجرة واحدة تقع خلف أخرى، أو أن سيارة هي أبعد لمجرد أنها تبدو أصغر حجمًا.

المحاولات السابقة لإصلاح ذلك كانت تشبه محاولة بناء نموذج ثلاثي الأبعاد لمدينة كاملة عبر النظر فقط إلى بعض الغرف المحددة في بعض المنازل. استخدموا بيانات من مسوحات ثلاثية الأبعاد داخلية (مثل ألعاب الفيديو أو خرائط الروبوتات). والمشكلة؟ لم تكن هناك "غرف" كافية لتعليم الذكاء الاصطناعي عن العالم بأكم، فالبيانات كانت صغيرة جدًا ومكررة للغاية.

الحل: "SpatialForge" (المترجم من 2D إلى 3D)

بنى المؤلفون مصنعًا ضخمًا ومؤتمتًا يسمى SpatialForge. بدلاً من انتظار المسوحات ثلاثية الأبعاد، أخذوا 10 ملايين صورة ثنائية الأبعاد عادية من الإنترنت (مثل صور الشوارع، والمتنزهات، وغرف المعيشة) وعلموا الذكاء الاصطناعي كيفية "تخمين" الهندسة ثلاثية الأبعاد المخفية داخلها.

فكر في الأمر كالتالي:

  • الطريقة القديمة: محاولة تعلم كيفية عمل السيارة عن طريق تفكيك بعض السيارات اللعبة المحددة في المرآب.
  • طريقة SpatialForge: النظر إلى ملايين الصور لسيارات حقيقية على الطريق وتعليم الذكاء الاصطناعي كيفية استنتاج كيف تتناسب العجلات، والأبواب، والمحرك معًا في مساحة ثلاثية الأبعاد بمجرد رؤية الصورة ثنائية الأبعاد.

كيف يعمل المصنع (سلسلة العمليات)

تمرر المنظومة هذه الصور عبر أربع خطوات، تعمل كفريق من المحررين المتخصصين:

  1. المصفّي (حارس البوابة): يقوم باستبعاد الصور الضبابية، أو لقطات الشاشة، أو الرسومات. هو يحتفظ فقط بالصور الحقيقية والواضحة للعالم الواقعي.
  2. المحقق (المعالج المسبق): ينظر إلى الصورة ويقول: "أرى كلبًا، وكرة، وشجرة". يرسم مربعات حولها ويكتب وصفًا قصيرًا لكل منها.
  3. المهندس الجيومتري (مخمنو الـ 3D):
    • العمق: يستخدم أداة خاصة لتخمين مدى بعد كل جسم. يتعلم أن يقول: "الكرة أمام الكلب لأن الكرة تغطي جزءًا من الكلب".
    • المنظور: يبحث عن أشخاص في الصورة. إذا كان الشخص يواجه الكاميرا، يتعلم الذكاء الاصطناعي أن "يسار" الشخص هو "يمين" الكاميرا. وإذا كان الشخص يولي ظهره للكاميرا، فإن "اليسار" هو "اليسار". هذا يعلم الذكاء الاصطناعي رؤية العالم من وجهة نظر شخص آخر.
  4. المعلم (مراقب الجودة): قبل حفظ الدرس، يقوم ذكاء اصطناعي فائق الذكاء بفحص العمل. يسأل: "هل حصل الطالب على الإجابة الصحيحة؟". إذا ارتكب الذكاء الاصطناعي خطأ في تخمينه، يتم التخلص من هذا الدرس. الدروس المثالية فقط هي التي يتم الاحتفاظ بها.

النتيجة: كتاب مدرسي ضخم

نتيجة هذا المصنع هي مجموعة بيانات تسمى SpatialForge-10M. وهي تحتوي على 10 ملايين سؤال وجواب حول المساحة.

  • السؤال: "أيهما أقرب، السيارة الحمراء أم الشاحنة الزرقاء؟"
  • الإجابة: "السيارة الحمراء."
  • السؤال: "إذا استدار الرجل الذي يرتدي قميصًا أزرق، فهل ستكون الشجرة على يساره أم يمينه؟"
  • الإجابة: "على يمينه."

هل نجح الأمر؟

أخذ المؤلفون نموذج ذكاء اصطناعي قياسي وقاموا بتدريبه باستخدام هذا الكتاب المدرسي الجديد. كانت النتائج مبهرة:

  • أصبح الذكاء الاصطناعي أفضل بكثير في معرفة أي الأجسام أقرب أو أبعد.
  • أصبح أفضل في فهم "اليسار" و"اليمين" اعتمادًا على مكان وقوف الشخص.
  • تحسن في كل اختبار جربوه، مما يثبت أنك لست بحاجة إلى بيانات ثلاثية الأبعاد باهظة الثمن لتعليم الذكاء الاصطناعي عن المساحة ثلاثية الأبعاد؛ بل تحتاج فقط إلى الكثير من الصور ثنائية الأبعاد المعالجة بذكاء.

العقبة (القيود)

المؤلفون صريحون بشأن الحدود. نظرًا لأنهم يخمنون الأبعاد الثلاثية من صور ثنائية الأبعاد، فقد يخطئ الذكاء الاصطناعي أحيانًا في تقدير العمق إذا كانت الصورة مخادعة (مثل الانعكاس في المرآة). كما أنه ليس مثاليًا في قياس المسافات الدقيقة (مثل "السيارة تبعد 5 أمتار بالضبط")، ولكنه جيد جدًا في العلاقات النسبية ("السيارة أقرب من الشجرة").

باختاً مختصراً: SpatialForge هي خدعة ذكية تحول الإنترنت بأكمله من الصور ثنائية الأبعاد إلى فصل دراسي ثلاثي الأبعاد، لتعليم نماذج الذكاء الاصطناعي أخيرًا أن العالم ليس مسطحًا.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →