← أحدث الأبحاث
💻 computer science

LocateAnything3D: Vision-Language 3D Detection with Chain-of-Sight

يقدم LocateAnything3D إطار عمل أصيلاً لنماذج الرؤية واللغة يعيد صياغة الكشف ثلاثي الأبعاد كمسألة تنبؤ بالرمز التالي باستخدام استراتيجية استدلال "سلسلة الرؤية" (Chain-of-Sight) لتحقيق أداء رائد في مجاله وقدرة على التعميم الصفري على معيار Omni3D.

المؤلفون الأصليون: Yunze Man, Shihao Wang, Guowen Zhang, Johan Bjorck, Zhiqi Li, Liang-Yan Gui, Jim Fan, Jan Kautz, Yu-Xiong Wang, Zhiding Yu

نُشر 2026-02-24
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yunze Man, Shihao Wang, Guowen Zhang, Johan Bjorck, Zhiqi Li, Liang-Yan Gui, Jim Fan, Jan Kautz, Yu-Xiong Wang, Zhiding Yu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم روبوت كيفية التنقل في غرفة معيشة فوضوية. يمكنك إعطاؤه صورة ثنائية الأبعاد وتقول له: "هناك كرسي هناك". ولكن إذا حاول الروبوت السير فوقه، فقد يتعثر لأنه لا يعرف مدى بعد الكرسي، أو حجمه، أو الاتجاه الذي يواجهه.

لفترة طويلة، كانت نماذج الرؤية واللغة (VLMs) — وهي عقول الذكاء الاصطناي التي يمكنها رؤية الصور والتحدث عنها — بارعة في وصف الصور ثنائية الأبعاد، لكنها كانت سيئة للغاية في فهم العالم ثلاثي الأبعاد. لقد كانت مثل مرشد سياحي يمكنه وصف لوحة فنية بدقة، لكن ليس لديه أدنى فكرة عن عمق الغرفة.

LocateAnything3D هو أسلوب جديد يعلم هذه النماذج أخيراً كيف "ترى" في الأبعاد الثلاثية، وهو يفعل ذلك من خلال محاكاة الطريقة التي يفكر بها البشر بشكل طبيعي. إليك التفصيل البسيط:

1. الفكرة الجوهرية: "سلسلة الرؤية" (Chain-of-Sight - CoS)

فكر في الطريقة القديمة للتعرف على الأجسام ثلاثية الأبعاد على أنها محاولة لتخمين الشكل الكامل لجسم غامض في الظلام دفعة واحدة. إنها عملية صعبة، وغالباً ما تخطئ فيها.

يقترح المؤلفون طريقة جديدة تسمى Chain-of-Sight. تخيل أنك تنظر إلى صورة لكوب قهوة على طاولة. بدلاً من تخمين الشكل ثلاثي الأبعاد فوراً، يقوم عقلك بما يلي:

  1. الخطوة 1 (المرتكز ثنائي الأبعاد): "حسناً، أرى شكلاً مستديراً في منتصف الصورة. هذا هو الكوب". (أنت تحدد مكانه في الصورة).
  2. الخطوة 2 (القفزة ثلاثية الأبعاد): "بما أنه في المنتصف ويبدو صغيراً، فلا بد أنه على بُعد بضعة أقدام. ربما يبلغ طوله 4 بوصات".

يفعل الذكاء الاصطناعي الشيء نفسه تماماً. فهو يتنبأ أولاً بـ الصندوق ثنائي الأبعاد (مستطيل على الشاشة) ثم يستخدم هذا الصندوق كحجر زاوية للتنبؤ بـ الصندوق ثلاثي الأبعاد (الحجم الفعلي والمسافة في العالم الحقيقي).

التشبيه: الأمر يشبه بناء منزل. أنت لا تظهر السقف فجأة من العدم؛ بل تقوم أولاً بوضع الأساس (الصندوق ثنائي الأبعاد)، ثم تبني الجدران (الحجم)، وأخيراً تضع السقف (الدوران). من خلال إجبار الذكاء الاصطناعي على وضع الأساس أولاً، يصبح الهيكل بأك Total أكثر استقراراً.

2. الترتيب مهم: "من القريب إلى البعيد"

عندما ينظر الإنسان إلى غرفة، فإنه عادة ما يلاحظ كوب القهوة على الطاولة قبل أن يلاحظ اللوحة على الجدار البعيد. كان الذكاء الاصطناعي يمسح الصور سابقاً مثل روبوت يقرأ كتاباً (من اليسار إلى اليمين، ومن الأعلى إلى الأس أسفل). لكن في الأبعاد الثلاثية، يكون ذلك مربكاً لأن جسماً صغيراً بعيداً قد يبدو بجانب جسم كبير قريب تماماً.

يعلم LocateAnything3D الذكاء الاصطناعي المسح من القريب إلى البعيد.

  • لماذا؟ الأجسام القريبة من الكاميرا تعطي الذكاء الاصطناعي أقوى الأدلة. بمجرد أن يعرف الذكاء الاصطناعي مكان الأجسام "القريبة" بدقة، يمكنه استخدامها كمسطرة لتقدير مكان الأجسام "البعيدة".
  • الاستعارة: تخيل أنك تحاول تخمين مسافة جبل. إذا كنت لا تعرف أين توجد الأشجار في المقدمة، فسيظهر الجبل غامضاً. ولكن إذا كنت تعرف أن الأشجار تبعد 10 أقدام، فيمكنك استخدامها لتقدير أن الجبل يبعد 1000 قدم. يستخدم الذكاء الاصطناعي الأجسام القريبة كـ "مسطرة" لبقية المشهد.

3. "وصفة" النجاح

يقدم البحث "وصفة" محددة ليتبعها الذكاء الاصطناعي، والتي يسمونها المنهج الدراسي (مثل المنهج المدرسي):

  • أولاً: ابحث عن الجسم في الصورة ثنائية الأبعاد (الـ "أين").
  • ثانياً: حدد مدى كبر حجمه (الـ "كم الحجم").
  • ثالثاً: حدد الاتجاه الذي يواجهه (الـ "أي اتجاه").

هذا الترتيب حاسم. من الأسهل بكثير تخمين "أين" يوجد الشيء قبل تخمين "حجمه". إذا أخطأت في تحديد الموقع، فسيكون تخمينك للحجم خاطئاً تماماً. هذا النهج المتدرل يمنع الذكاء الاصطناعي من الارتباك و"الهلوسة" (اختلاق أشياء غير موجودة).

4. لماذا يعد هذا أمراً كبيراً؟

  • إنه "مفتوح العالم" (Open-World): يمكنك أن تطلب من الذكاء الاصطناعي العثور على "كرسي أحمر"، أو "مزهرية غريبة الشكل"، أو "قطة"، وسيعمل ذلك. هو لا يحتاج إلى تدريب مسبق على قائمة محددة من الأجسام.
  • إنه مرن: يمكنك التحدث إليه ("ابحث عن الكرسي") أو الإشارة إليه على الشاشة ("انقر هنا، ما هو الصندوق ثلاثي الأبعاد؟")، وهو سيفهم كليهما.
  • إنه الأفضل: في أصعب الاختبارات (معيار Omni3D)، تفوق هذا الأسلوب على جميع النماذج السابقة بفارق هائل. حتى أنه تفوق على النماذج التي مُنحت "أكواد غش" (صناديق ثنائية الأبعاد مثالية للبدء بها).

الملخص

LocateAnything3D يشبه تعليم روبوت القيادة عن طريق تعليمه أولاً التعرف على علامات المرور على خريطة مسطحة، ثم تعليمه لاحقاً مدى بُعد تلك العلامات في العالم الحقيقي. من خلال تقسيم مشكلة الرؤية ثلاثية الأبعاد المعقدة إلى محادثة بسيطة وخطوة بخطوة (ثنائية الأبعاد أولاً، ثم ثلاثية الأبعاد؛ من القريب إلى البعيد)، تعلم الذكاء الاصطناعي أخيراً كيفية إدراك العالم بطريقة آمنة ودقيقة وجاهزة للمهام الواقعية مثل السيارات ذاتية القيادة أو الروبوتات المنزلية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →