Spatial Chain-of-Thought: Bridging Understanding and Generation Models for Spatial Reasoning Generation
تقترح الورقة البحثية "سلسلة الأفكوت المكانية" (SCoT)، وهي إطار عمل جاهز للاستخدام يربط بين النماذج اللغوية الكبيرة متعددة الوسائط ونماذج الانتشار عبر استخدام النماذج اللغوية الكبيرة متعددة الوسائط كمخططات لتوليد خطط التخطيط، مما يعزز بشكل كبير قدرات الاستدلال المكاني وتوليد الصور دون تكاليف حوسبة عالية.
المؤلفون الأصليون:Wei Chen, Yancheng Long, Mingqiao Liu, Haojie Ding, Yankai Yang, Hongyang Wei, Yi-Fan Zhang, Bin Wen, Fan Yang, Tingting Gao, Han Li, Long Chen
العميل (أنت): لديك رؤية مفصلة. تقول: "أريد باباً أحمر على اليسار، ونافذة زرقاء على بُعد ثلاثة أقدام بالضبط إلى اليمين من الباب، وحديقة بها خمس أشجار بالضبط مرتبة في دائرة مثالية".
المهندس المعماري (مولد الصور بالذكاء الاصطناعي): هذا فنان بارع يمكنه رسم صور جميلة، لكنه أعمى عن المنطق. هو بارع في جعل الأشياء تبدو جميلة، ولكن إذا قلت له "على بُعد ثلاثة أقدام إلى اليمين"، فقد يقوم بمجرد التخمين. غالباً ما ينتهي به الأمر بوضع النافذة على السقف أو جعل الأشجار على شكل مربع بدلاً من دائرة.
لفترة طويلة، حاولنا إصلاح ذلك عبر إعطاء المهندس قاموساً أفضل (كلمات أكثر) أو بتدريبه على فهم الرياضيات. لكن الكلمات فوضوية. إذا قلت "شبكة من المكاتب حيث يكون كل مكتب آخر فارغاً"، سيصاب المهندس بالارتباك وقد يملأها جميعاً.
الحل: "سلسلة الأفكواء المكانية" (SCoT)
ابتكر مؤلفو هذه الورقة وسيطاً عبقرياً. أطلقوا عليه اسم Spatial Chain-of-Thought (SCoT).
فكر في الأمر كأنك توظف مديراً للمشروع بينك (العميل) وبين المهندس المعماري.
1. الطرق القديمة (لماذا فشلت)
"الجسر المستمر": كان هذا يشبه محاولة دمج العميل والمهندس في عقل واحد ضخم. نجح الأمر بشكل جيد ولكنه كان مكلفاً للغاية وبطيئاً في البناء (مثل إعادة بناء مدينة كاملة لإصلاح شارع واحد).
"الجسر النصي": كان مجرد كتابة العميل لرسالة أطول وأكثر تفصيلاً للمهندس. "تأكد من أن المكتب هنا، والكرسي هناك..." المشكلة؟ كان لا يزال على المهندس أن يخمن أين هو "هنا" و"هناك" بالضبط. غالباً ما كانوا يخطئون في التفاصيل الدقيقة.
2. الطريقة الجديدة: مدير المشروع (SCoT)
يستخدم النظام الجديد نموذج لغة كبير متعدد الوسائط (MLLM) ليكون بمثابة مدير المشروع. إليك كيف تسير العملية:
أنت تقول: "فصل دراسي به معلم في المقدمة وطلاب يجلسون بنمط رقعة الشطرنج".
مدير المشروع يفكر: "حسناً، أحتاج إلى حساب الرياضيات. إذا كان المعلم في المقدمة، والطلاب يحتاجون إلى مكاتب فارغة حولهم، فأنا بحاجة إلى تخطيط هذا".
السحر: بدلاً من مجرد كتابة جملة أطول، يقوم مدير المشروع بإنشاء مخطط هندسي. فهو يكتب الوصف ولكنه يرفق إحداثيات دقيقة (مثل إحداثيات GPS) بكل جسم.
المخرج: "معلم [عند الإحداثيات 100، 100]... طالب 1 [عند الإحداثيات 200، 300]... مكتب فارغ [عند الإحداثيات 200، 400]..."
الخطوة 2: البناء (مرحلة "الرسم") يسلم مدير المشروع هذا المخطط الغني بالإحداثيات إلى المهندس المعماري (نموذج الانتشار - Diffusion Model).
لأن المخطط يحتوي على أرقام دقيقة، لا يحتاج المهندس للتخمين. هو يعرف بالضبط أين يرسم المعلم وأين يترك المكتب فارغاً.
يتبع المهندس الخريطة بدقة، مما ينتج صورة تطابق قواعدك المعقدة.
لماذا يعد هذا تغييراً جذرياً؟
قابل للتركيب والتشغيل (Plug-and-Play): لا تحتاج لإعادة بناء المهندس. أنت فقط تستبدل بمدير مشروع أكثر ذكاءً. الأمر يشبه ترقية نظام الـ GPS في السيارة دون تغيير المحرك.
لا مزيد من التخمين: من خلال تحويل "الاستدلال المكاني" (المنطق) إلى "إحداثيات" (أرقام)، يتوقف الذكاء الاصطناعي عن التخمين ويبدأ في الحساب.
التعامل مع التعقيد: يمكنه التعامل مع أصعب الألغاز، مثل "شبكة من 12 مكتباً حيث يجب أن يكون لكل طالب جيران فارغون". يقوم مدير المشروع بحل اللغز المنطفي أولاً، ثم يخبر المهندس بالضبط أين يضع البكسلات.
مثال من الواقع: طلب البيتزا
بدون SCoT: تخبر طباخ البيتزا، "ضع الببروني على اليسار والمشروم على اليمين". يضع الطباخ المكونات في مكان ما، ولكن ربما يضع الببروني في المنتصف، أو المشروم على حافة العجينة.
مع SCoT: تخبر مدير المشروع. يقوم مدير المشروع برسم مخطط: "الببروني عند الساعة 2، المشروم عند الساعة 4، والجبن في كل مكان آخر". ثم يتبع الطباخ المخطط. النتيجة تكون مثالية في كل مرة.
الخلاصة
تقدم هذه الورقة طريقة حيث يفكر الذكاء الاصطناعي في تخطيط الصورة أولاً (بإنشاء خريطة مع إحداثيات) قبل أن يرسم الصورة. هذا يسد الفجوة بين "الفهم" (المنطق) و"التوليد" (الفن)، مما يسمح للحواسيب بإنشاء صور ذات ترتيبات مكانية معقدة قائمة على القواعد كانت مستحيلة سابقاً.
إليك ملخص تقني مفصل لورقة البحث بعنوان: "Spatial Chain-of-Thought: Bridging Understanding and Generation Models for Spatial Reasoning Generation" (سلسلة التفكير المكاني: سد الفجوة بين نماذج الفهم والإنشاء من أجل توليد الاستنتاج المكاني).
1. بيان المشكلة
تتفوق نماذج الانتشار (Diffusion Models) الحالية في توليد صور جمالية، لكنها تعاني في الاستنتاج المكاني المعقد والقيود الدقيقة للتخطيط (مثل: "شبكة 3×4 من المكاتب حيث يجب أن يكون لكل طالب جالس جيران فارغون"). تعاني النهج الحالية لربط النماذج اللغوية الكبيرة متعددة الوسائط (MLLMs) بنماذج الانتشار من مشكلتين رئيسيتين:
الربط المستمر (Continuous Bridging): التدريب المشترك لنماذج الفهم والإنشاء يوحد المهام ولكنه مكلف حاسوبياً ويحتاج إلى كميات هائلة من البيانات.
الربط النصي (Textual Bridging): استخدام النماذج اللغوية الكبيرة (MLLMs) لتوليد مطالبات "سلسلة التفكير" (CoT) النصية هو نهج سهل الاستخدام (Plug-and-play)، ولكنه يعاني من عنق زجاجة معلوماتي. فعملية ضغط القيود المكانية الغنية (الإحداثيات الدقيقة، قواعد التجاور) في لغة طبيعية غالباً ما تؤدي إلى فقدان التفاصيل الهيكلية الدقيقة، مما يتسبب في فشل عملية التوليد.
التحدي الجوهري هو إنشاء جسر يتميز بـ الكفاءة (بدون تدريب مسبق مشترك)، والقابلية للتركيب (مكونات نمطية)، والكثافة المكانية (الحفاظ على القيود الهندسية الدقيقة).
2. المنهجية: سلسلة التفكير المكاني (SCoT)
يقترح المؤلفون إطار عمل SCoT، الذي يستخدم تنسيقاً متداخلاً من النص والإحداثيات كجسر وسيط. يتكون النظام من وحدتين متكاملتين:
أ. المخطط القائم على MLLM (توليد SCoT)
بدلاً من توليد مطالبة باللغة الطبيعية، يعمل النموذج اللغوي الكبير (MLLM) كمخطط مكاني. يقوم بمعالجة مطالبة المستخدم عبر ثلاث مراحل:
التخطيط المكاني (Spatial Planning): إجراء الاستنتاج لبناء تخطيط متسق عالمياً، مع تخصيص صندوق محيط (إحداثيات) لكل كيان لاستيفاء القيود.
التوصيف المرتكز (Grounded Specification): إخراج سلسلة تفكير مكانية (Spatial CoT) بتنسيق متداخل من النص والإحداثيات. في هذا التنسيق، تتبع كل إشارة لكائن في النص إحداثيات الصندوق المحيط الخاص به مباشرة (مثال: ...whiteboard<|bbox|>...).
ب. نموذج التوليد المدرك مكانياً (SCoT Render)
لتفسير تعليمات الإحداثيات هذه، قام المؤلفون بتدريب نموذج انتشار (يعتمد على Qwen-Image-Edit) ليقبل التنسيق المتداخل مباشرة.
بناء البيانات: أنشأوا مجموعتين من البيانات:
SCoT-DenseBox: مجموعة بيانات ضخمة من الصور المشروحة بتعليقات كثيفة وصناديق محيطة على مستوى الكائنات باستخدام Qwen3-VL.
SCoT-AestheticSFT: مجموعة فرعية عالية الجودة للضبط الدقيق (Fine-tuning) للحفاظ على الجودة الجمالية.
استراتيجية التدريب: عملية من مرحلتين:
التدريب المسبق (Pretraining): على SCoT-DenseBox لغرس قدرات الارتكاز على الإحداثيات.
الضبط الدقيق الخاضع للإشراف (SFT): على SCoT-AestheticSFT للحفاظ على جودة الصورة مع تعلم تنفيذ التعليمات المكانية.
تنسيق المدخلات: تم تدريب النموذج على تسلسل متداخل حيث تتناوب رموز النص ورموز الإحداثيات (الصناديق المحيطة)، مما يخلق ارتباطاً غير غامض بين الكائن وموقعه دون الحاجة لتعديلات هيكلية مثل ControlNet.
3. المساهمات الرئيسية
سلسلة التفكير المكاني (SCoT): إطار عمل مبتكر يربط بين تخطيط MLLM وتصوير الانتشار عبر خطة تخطيط مرتكزة وقابلة للتنفيذ (نص + إحداثيات) بدلاً من النص المجرد.
نموذج التوليد المدرك مكانياً (SAGen): نموذج انتشار أساسي مدرب على تعليمات نصية وإحداثيات متداخلة، مما يمكنه من تحليل وفرض القيود المكانية الكثيفة مباشرة.
كفاءة "التركيب والتشغيل" (Plug-and-Play): يفصل هذا النهج بين المخطط (MLLM) والمولد (Diffusion). يمكن استبدال الـ MLLM بنماذج أقوى (مثل Gemini-3 Pro أو GPT-5) دون الحاجة لإعادة تدريب نموذج الانتشار.
بناء مجموعات البيانات: إنشاء SCoT-DenseBox و SCoT-AestheticSFT، مما يوفر الإشراف اللازم للارتكاز الكثيف في المشاهد المعقدة.
4. النتائج التجريبية
تم تقييم الطريقة في اختبارات توليد الصور من النص وتحرير الصور:
T2ICoReBench (الاستنتاج المعقد): حقق SCoT تحسناً كبيراً بنسبة >10% عن أفضل النماذج المرجعية (مثل Qwen-Image و FLUX.1) في الدرجات الإجمالية، وتميز بشكل خاص في مهام الاستنتاج (Reasoning) (76.2 مقابل 50.1) ومهام العلاقات المتعددة (Multi-Relation).
GenEval & OneIG-EN: أظهرت الطريقة أداءً فائقاً في القيود المكانية مثل العد (Counting)، الموقع (Position)، وربط السمات (Attribute)، متفوقة على نماذج الانتشار القياسية والنهج الأخرى المعززة بـ MLLM.
COCO-MIG (التحكم في التخطيط): حققت أعلى معدل نجاح (42.38%) وأعلى معدل نجاح على مستوى الكائن (76.03%)، مما أظهر التزاماً دقيقاً بقيود التخطيط متعددة الكائنات مقارنة بـ GLIGEN و InstanceDiffusion.
تحرير الصور (IVEdit): أظهرت أداءً قوياً في التحرير القائم على التعليمات، محققة أفضل النتائج في الإجمالي (Overall) والوزن (Weighted) بين النماذج مفتوحة المصدر.
دراسات الاستئصال (Ablation Studies):
حجم المخطط (Planner Size): حسنت النماذج اللغوية الأكبر (مثل Gemini-3 Pro) النتائج باستمرار، مما يؤكد أن التخطيط الأفضل يترجم مباشرة إلى توليد أفضل.
نوع الجسر (Bridge Type): تفوق نظام SCoT الكامل (النص + الصندوق المحيط) بشكل كبير على كل من المطالبات النصية الخام و"سلسلة التفكير النصية" (الاستنتاج النصي فقط)، مما يثبت أن الإحداثيات الصريحة ضرورية للدقة المكانية.
5. الأهمية
يعالج هذا العمل فجوة حرجة في الذكاء الاصطناائي التوليدي: عدم قدرة النماذج الحالية على اتباع المنطق المكاني الصارم والمتعدد الخطوات. من خلال تقديم سلسلة التفكير المكاني، يثبت المؤلفون أن:
الإحداثيات الصريحة > اللغة الطبيعية: ترجمة القيود المكانية إلى إحداثيات قابلة للقراءة آلياً أكثر فعالية بكثير من وصفها بالنص.
النمطية هي المفتاح: يمكن تحقيق أداء رائد في الاستنتاج المكاني دون التكلفة الباهظة للتدريب المشترك عبر فصل "المستنتج" (MLLM) عن "الرسام" (Diffusion).
التطبيقات المستقبلية: يمهد هذا الإطار الطريق لتوليد موثوق في المجالات التي تتطلب تحكماً دقيقاً في التخطيط، مثل التصميم المعماري، المواد التعليمية، وتكوين المشاهد المعقدة، مع تقليل طبيعة "التجربة والخطأ" في سير عمل توليد الصور من النصوص الحالي.