💻 computer science

FreeGraftor: Training-Free Cross-Image Feature Grafting for Subject-Driven Text-to-Image Generation

يُعد FreeGraftor إطار عمل لا يتطلب تدريباً يحقق توليد صور عالية الدقة ومتوافقة مع النصوص وموجهة نحو موضوع معين، وذلك من خلال الاستفادة من تطعيم الميزات عبر الصور، والمطابقة الدلالية، واستراتيجية مبتكرة لتهيئة الضوضاء للتغلب على قيود الكفاءة والاتساق في الطرق الحالية.

Zebin Yao, Lei Ren, Huixing Jiang, Wei Chen, Xiaojie Wang, Ruifan Li, Fangxiang Feng2026-04-07
🤖 AI

VERDI: VLM-Embedded Reasoning for Autonomous Driving

إن VERDI هو إطار عمل أثناء وقت التدريب يعمل على تقطير قدرات الاستدلال القائم على المنطق السليم للنماذج اللغوية البصرية الضخمة إلى مجموعات برمجية مستقلة وقابلة للتفاضل ومتكاملة من الطرف إلى الطرف للقيادة الذاتية، وذلك عبر محاذاة مخرجات الوحدات الوسيطة مع سمات الاستدلال النصي، مما يحقق سلامة وأداءً فائقين دون التكاليف العالية للاستدلال الناتجة عن نشر النماذج اللغوية البصرية الضخمة.

Bowen Feng, Zhiting Mei, Julian Ost, Filippo Ghilotti, Baiang Li, Roger Girgis, Anirudha Majumdar, Felix Heide2026-04-07
💻 computer science

SpikeStereoNet: A Brain-Inspired Framework for Stereo Depth Estimation from Spike Streams

تقدم هذه الورقة SpikeStereoNet، وهو أول إطار عمل مستوحى من الدماغ يقوم بتقدير العمق المجسم مباشرة من تدفقات النبضات الخام باستخدام شبكة عصبية نبضية متكررة، محققاً أداءً فائقاً وكفاءة في البيانات على مجموعات بيانات نبضية مقترحة حديثاً، اصطناعية وكانت حقيقية.

Zhuoheng Gao, Yihao Li, Jiyao Zhang, Rui Zhao, Tong Wu, Hao Tang, Zhaofei Yu, Hao Dong, Guozhang Chen, Tiejun Huang2026-04-07
💻 computer science

Chain-of-Frames: Advancing Video Understanding in Multimodal LLMs via Frame-Aware Reasoning

تقدم هذه الورقة البحثية "سلسلة الإطارات" (Chain-of-Frames - CoF)، وهي نهج موحد أحادي المرحلة لفهم الفيديو في النماذج اللغوية الكبيرة متعددة الوسائط، والذي يستفيد من مجموعة بيانات تم إنشاؤها حديثًا (COF-DATA) لتوليد مسارات استدلال تتضمن مراجع صريحة للإطارات، مما يحسن بشكل كبير من التأسيس الزمني وأداء الاختبارات المعيارية دون الاعتماد على وحدات مساعدة معقدة.

Sara Ghazanfari, Francesco Croce, Nicolas Flammarion, Prashanth Krishnamurthy, Farshad Khorrami, Siddharth Garg2026-04-07
🤖 machine learning

Concept-Centric Token Interpretation for Vector-Quantized Generative Models

تقدم هذه الورقة CORTEX، وهو إطار عمل مبتكر يعزز قابلية التفسير للنماذج التوليدية المكممة شعاعياً من خلال تحديد مجموعات الرموز الخاصة بالمفاهيم عبر تحليل على مستوى العينة ومستوى كتاب الشفرات، مما يحسن الشفافية ويُمكّن تطبيقات مثل تحرير الصور المستهدف.

Tianze Yang, Yucheng Shi, Mengnan Du, Xuansheng Wu, Qiaoyu Tan, Jin Sun, Ninghao Liu2026-04-07
🤖 machine learning

Common Inpainted Objects In-N-Out of Context

تقدم الورقة البحثية COinCO، وهي مجموعة بيانات جديدة مكونة من 97,722 صورة تم ترميمها باستخدام نماذج الانتشار (diffusion-based) مع كائنات تم التحقق منها داخل السياق وخارجه، صُممت لتعزيز الفهم البصري القائم على السياق من خلال مهام الاستدلال دقيق التفاصيل، والتنبؤ بالكائنات، وكشف التزييف.

Tianze Yang, Tyson Jordan, Ruitong Sun, Ninghao Liu, Jin Sun2026-04-07
💻 computer science

MT-PCR: Hybrid Mamba-Transformer Network with Spatial Serialization for Point Cloud Registration

تقترح الورقة البحثية MT-PCR، وهو إطار عمل جديد لتسجيل السحابة النقطية يجمع بين بنيتي Mamba وTransformer عبر استخدام منحنيات ملء الفراغ من نوع Z-order للتسلسل المكاني، مما يحقق دقة وكفاءة فائقتين بتعقيد حسابي خطي مقارنة بالطرق الحالية.

Bingxi Liu, An Liu, Hao Chen, Huaqi Tao, Jinqiang Cui, Yiqun Wang, Hong Zhang2026-04-07
💻 computer science

Automated Wildfire Damage Assessment from Multi view Ground level Imagery Via Vision Language Models

يقترح هذا البحث إطار عمل بنظام "التعلم الصفري" (zero-shot) يستفيد من النماذج اللغوية الكبيرة متعددة الوسائط والمُدربة مسبقاً لتقييم أضرار حرائق الغابات من خلال صور متعددة الزوايا من مستوى الأرض، مما يثبت أن دمج منظورات متعددة يحسن دقة التصنيف بشكل كبير مقارنة بالتحليل أحادي المنظور، مع الكشف في الوقت ذاته عن أن طرق التلقين البسيطة تحقق أداءً يضاهي استراتيجيات الاستنتاج المتقدمة.

Miguel Esparza, Archit Gupta, Kai Yin, Yiming Xiao, Ali Mostafavi2026-04-07
💻 computer science

PAOLI: Pose-free Articulated Object Learning from Sparse-view Images

تقدم الورقة البحثية PAOLI، وهي طريقة مبتكرة تعيد بناء الأجسام المفصلية من صور ذات زوايا رؤية ضئيلة مع وضعيات كاميرا غير معروفة، وذلك من خلال إنشاء ارتباطات قوية أولاً بين الأجزاء المعاد بناؤها بشكل مستقل، ثم تحسين الهندسة والمظهر والحركية بشكل مشترك عبر استراتيجية فك تشابك تدريجية.

Jianning Deng, Kartic Subr, Hakan Bilen2026-04-07
💻 computer science

Durian: Dual Reference Image-Guided Portrait Animation with Attribute Transfer

تُعد Durian طريقة مبتكرة لتحريك الصور الشخصية تتيح نقل سمات الهوية عبر صورة مرجعية واحدة أو أكثر من خلال توظيف استراتيجية تدريب إعادة بناء ذاتي باستخدام شبكة مرجعية مزدوجة (Dual ReferenceNet) وقناع تكميلي للتعلم من بيانات الفيديو غير المزدوجة، مما يحقق أداءً هو الأفضل في فئته مع دعم تكوين السمات المتعددة والتدخل السلس.

Hyunsoo Cha, Byungjun Kim, Hanbyul Joo2026-04-07