GraFT: A Training-Free Framework for Spatial Reasoning in Multimodal Large Language Models via 3D Scene Graphs
يُعد GraFT إطار عمل لا يتطلب تدريباً يعمل على تعزيز الاستدلال المكاني في النماذج اللغوية الكبيرة متعددة الوسائط من خلال الاستفادة من مخطط مشهد ثلاثي الأبعاد لتوفير هندسة حتمية، وتخطيطات متمحورة حول الشيء، وتأريضاً للسمات البصرية، محققاً مكاسب أداء كبيرة في معايير مثل ScanQA وVSI-Bench دون الحاجة إلى ضبط دقيق مكلف أو مشفرات مخصصة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
للتنقل في العالم المادي، يعتمد البشر على حس حدسي بالمكان. فنحن نعرف مدى بُعد الكرسي، وما إذا كان الباب إلى يسارنا أو يميننا، وكيف يتصل تخطيط الغرفة بالممر الذي يليه. هذه القدرة على تفسير البنية ثلاثية الأبعاد لمحيطنا هي أمر أساسي لكيفية تفاعلنا مع كل شيء، من الأثاث إلى المركبات. وفي السنوات الأخيرة، علّم العلماء الحواسيب كيف ترى وتتحدث باستخدام نماذج ذكاء اصطناعي ضخمة تعالج الصور والنصوص معاً. هذه الأنظمة، المعروفة باسم نماذج اللغات الكبيرة متعددة الوسائط، يمكنها وصف صورة أو الإجابة على سؤال حول كائن ما بطلاقة مثيرة للإعجاب. ومع ذلك، عندما تُطلب منها مهام تتطلب استدلالاً مكانياً دقيقاً — مثل قياس المسافة بين عنصرين، أو فهم التخطيط الكامل لغرفة من منظور واحد، أو تحديد حجم جسم ما بدقة — غالباً ما تعاني هذه النماذج. فهي تميل إلى التخمين بناءً على الأنماط الموجودة في بيانات التدريب الخاصة بها بدلاً من حساب الهندسة الفعلية للمشهد، مما يؤدي إلى أخطاء قد تكون واضحة للمراقب البشري.
قام فريق من الباحثين في شركة هواوي تكنولوجيز بتطوير نهج جديد لمعالجة هذه الفجوة دون إعادة تدريب نماذج الذكاء الاصطناعي نفسها. لقد قدموا نظاماً يسمى "GraFT"، والذي يعمل كجسر بين البيانات المرئية الخام التي يراها الكمبيوتر والاستدلال المنطقي الذي يحتاجه للقيام بالمهمة. وبدلاً من إجبار الذكاء الاصطناعي على تعلم القواعد المكانية من الصفر، يقوم "GraFT" ببناء خريطة مدمجة ومنظمة للبيئة، تُعرف باسم "الرسم البياني للمشهد ثلاثي الأبعاد" (3D scene graph). هذه الخريطة ليست صورة معقدة أو سحابة من ملايين النقاط، بل هي قائمة نظيفة ومنظمة من الأشياء، وأحجامها، ومواقعها، وكيفية ارتباطها ببعضها البعض. وبمجرد إنشاء هذه الخريطة، يستخدمها النظام لتزويد الذكاء الاصطناعي بنوع الأدلة المحدد الذي يحتاجه لأي سؤال معطى، مما يسمح لنموذج "جامد" وغير مدرب بحل الألغاز المكانية الصعبة بدقة عالية.
يكمن الابتكار الجوهري لـ "GraFT" في كيفية تخصيص المعلومات التي يغذي بها الذكاء الاصطناعي بناءً على المهمة المحددة قيد التنفيذ. فقد حدد الباحثون أن الأسئلة المختلفة تتطلب أنواعاً مختلفة من الأدلة المرئية. فبالنسبة للأسئلة التي تطلب قياسات دقيقة، مثل المسافة بين طاولة وأريكة، يتجاوز النظام التفسير البصري للذكاء الاصطناعي تماماً؛ وبدلاً من ذلك، يستخدم مجموعة من الأدوات الرمزية لحساب الإجابة مباشرة من الإحداثيات الدقيقة المخزنة في الرسم البياني للمشهد ثلاثي الأبعاد. وهذا يضمن أن تكون الإجابة دقيقة رياضياً، ومستمدة من الهندسة المعروفة للمشهد بدلاً من كونها مجرد تخمين. أما بالنسبة للأسئلة المتعلقة بالتخطيط العام لغرفة ما، مثل تحديد الاتجاه الذي يواجهه شخص ما بالنسبة لمبنى، فيقوم النظام بإنشاء عرض مخصص من منظور علوي للمشهد. وخلافاً للصورة الفوتوغرافية العادية، يتم تجريد هذا العرض من كل الفوضى، حيث يظهر فقط الأشياء ذات الصلة كصناديق بسيطة مع أبعادها الحقيقية، مما يجعل العلاقات المكانية واضحة تماماً. وأخيراً، بالنسبة للأسئلة حول مظهر جسم ما، لا يعرض النظام كل إطار من مقطع الفيديو للذكاء الاصطناعي، بل يستخدم هندسة المشهد لترتيب زوايا الكاميرا المتاحة، مختاراً فقط الإطارات التي يكون فيها الجسم مرئياً بوضوح وفي المنتصف، ويستبعد البقية.
اختبر الباحثون هذا الإطار في اثنين من المعايير الرئيسية المستخدمة لتقييم الاستدلال المكاني في الذكاء الاصطناعي. في مجموعة من الاختبارات المتعلقة بالمسافات والأحجام والأعداد، حسن النظام أداء نموذج ذكاء اصطناعي قياسي بهامش كبير، حيث أظهرت بعض المقاييس مكاسب تقترب من 60 بالمائة. وفي مجموعة أخرى من الاختبارات التي ركزت على فهم تخطيط الغرف والتنقل من خلالها، سمح النظام لنموذج أساسي غير مدرب بأن يتفوق ليس فقط على نماذج الذكاء الاصطناعي العامة الأخرى، بل وأيضاً على العديد من النماذج المتخصصة التي تم تدريبها بكثافة على البيانات المكانية. ومن المثير للاهتمام أن النظام حقق هذه النتائج دون تغيير معلمة واحدة من معلمات نموذج الذكاء الاصطناعي الأساسي؛ لقد قام ببساطة بتغيير الطريقة التي تُقدم بها المعلومات إليه. ووجد الباحثون أنه من خلال مطابقة النوع الصحيح من الأدلة مع السؤال الصحيح، استطاعوا إطلاق قدرات الاستدلال المكاني التي كانت مغلقة سابقاً في نماذج كان يُعتقد أنها غير قادرة على مثل هذه المهام.
يشير نجاح "GraFT" إلى أن قصور نماذج الذكاء الاصطناعي الحالية قد لا يكون ناتجاً عن نقص في الذكاء، بل عن عدم توافق بين البيانات التي تتلقاها وطبيعة السؤال المطروح. فمن خلال توفير تمثيل نظيف ومنظم للعالم المادي، يسمح النظام للذكاء الاصطناعي بالتركيز على الاستدلال بدلاً من المعاناة في تفسير البيانات المرئية الخام والمشوشة. وقد لاحظ الباحثون أن دقة النظام تعتمد في النهاية على جودة الخريطة ثلاثية الأبعاد الأولية، ولكن نظرًا لأن هذه الخريطة سهلة الصيانة والتحديث، يمكن توسيع نطاق الإطار ليشمل مهام جديدة دون الحاجة إلى إعادة تدريب مكلفة. يقدم هذا النهج مساراً عملياً للمضي قدماً في دمج الفهم المكاني في أنظمة الذكاء الاصطناعي، مما يثبت أنه مع الأدوات الصحيحة والمنظور الصحيح، يمكن حتى للنموذج "الجامد" أن يتعلم رؤية العالم في ثلاثة أبعاد.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.