💻 computer science

UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy

تقدم هذه الورقة تصنيفاً قائماً على القدرات لتحليل التعلم في السياق متعدد الوسائط، وتقترح مجموعة بيانات UniICL-760K وUniICL-Bench للتقييم المنهجي، وتقدم مُعدِّل نماذج خفيف الوزن متكيف مع السياق (Context-Adaptive Prototype Modulator) يحقق أداءً تنافسياً عبر مختلف المهام الموحدة متعددة الوسائط.

Yicheng Xu, Jiangning Zhang, Zhucun Xue, Teng Hu, Ran Yi, Xiaobin Hu, Yong Liu, Dacheng Tao2026-03-27
🤖 machine learning

Amplified Patch-Level Differential Privacy for Free via Random Cropping

تُثبت هذه الورقة أن الاقتصاص العشوائي، وهو تقنية قياسية لتعزيز البيانات، يعزز بطبيعته الخصوصية التفاضلية في نماذج الرؤية الحاسوبية من خلال الاستبعاد الاحتمالي للمحتوى الحساس الموضعي، مما يؤدي إلى تحسين المقايضة بين الخصوصية والمنفعة دون الحاجة إلى تغييرات هيكلية أو تكاليف إضافية.

Kaan Durmaz, Jan Schuchardt, Sebastian Schmidt, Stephan Günnemann2026-03-27
💻 computer science

LLaVA-LE: Large Language-and-Vision Assistant for Lunar Exploration

تقدم هذه الورقة البحثية LLaVA-LE، وهو نموذج لغوي بصري متخصص لاستكشاف القمر يستفيد من مجموعة بيانات متعددة الوسائط واسعة النطاق تم تنسيقها حديثاً (LUCID) ومن منهج تدريب يتكون من مرحلتين للتفوق بشكل كبير على النماذج المرجعية في توصيف التضاريس القمرية والإجابة على الأسئلة العلمية.

Gokce Inal, Pouyan Navard, Alper Yilmaz2026-03-27
💻 computer science

Lookalike3D: Seeing Double in 3D

تقدم الورقة البحثية Lookalike3D، وهو محول متعدد الرؤى (multiview transformer) يستفيد من نماذج الصور التأسيسية الضخمة للكشف عن أزواج الأشياء المتطابقة والمتشابهة في المشاهد الداخلية، مدعوماً بمجموعة بيانات 3DTwins الجديدة، لتحسين مهام الإدراك ثلاثي الأبعاد مثل إعادة البناء والتقسيم المشترك بشكل كبير.

Chandan Yeshwanth, Angela Dai2026-03-27
💻 computer science

Scalable Object Relation Encoding for Better 3D Spatial Reasoning in Large Language Models

تقدم هذه الورقة QuatRoPE، وهي طريقة لتمثيل الموضع قابلة للتوسع تقوم بحساب العلاقات المكانية ثلاثية الأبعاد الزوجية صراحةً عبر نواتج ضرب الانتباه ذات التعقيد الخطي، إلى جانب امتداد RoPE ذي البوابة المعزولة (IGRE) للحفاظ على قدرات النماذج اللغوية الكبيرة الأصلية، مما يعزز الاستدلال المكاني لدى الوكلاء المجسدين دون مشكلات القابلية للتوسع أو الدقة التي واجهت النهج السابقة.

Shengli Zhou, Minghang Zheng, Feng Zheng, Yang Liu2026-03-27
💻 computer science

TIGeR: A Unified Framework for Time, Images and Geo-location Retrieval

تقدم الورقة البحثية TIGeR، وهو إطار عمل محول متعدد الوسائط موحد ومعيار مرجعي واسع النطاق مصمم للاستنتاج المشترك حول المظهر البصري، والموقع الجغرافي، والوقت، مما يتيح قدرات متقدمة مثل استرجاع الصور المدرك للمكان والزمان والتي تتفوق على الأساليب الحالية من خلال نمذجة المشاهد بناءً على سياقها المكاني والزماني المحدد بدلاً من مجرد التشابه البصري.

David G. Shatwell, Sirnam Swetha, Mubarak Shah2026-03-27
🤖 machine learning

Light Cones For Vision: Simple Causal Priors For Visual Hierarchy

تقدم هذه الورقة البحثية "Worldline Slot Attention"، وهي بنية خفيفة الوزن تستفيد من الهندسة اللورنتزية لنمذجة الأشياء كمسارات زمنية-مكانية سببية، مبرهنةً أن ترميز السببية غير المتماثلة بدلاً من الهياكل الشجرية الإقليدية أو الزائدية هو أمر جوهري لتحقيق اكتشاف هرمي عالي الدقة للأجسام المرئية.

Manglam Kartik, Neel Tushar Shah2026-03-27
💻 computer science

DRoPS: Dynamic 3D Reconstruction of Pre-Scanned Objects

يقدم DRoPS نهجاً مبتكراً لإعادة البناء ثلاثي الأبعاد الديناميكي من مقاطع الفيديو العفوية عبر الاستفادة من مسح مسبق ثابت كسابقة صريحة، مستخدماً نموذج غاوس ذو بنية شبكية وتوصيفاً للمعلمات الحركية يعتمد على الشبكات العصبية الالتفافية (CNN) لتحقيق جودة رندر ودقة تتبع متفوقة مقارنة بالطرق الحالية الرائدة.

Narek Tumanyan, Samuel Rota Bulò, Denis Rozumny, Lorenzo Porzi, Adam Harley, Tali Dekel, Peter Kontschieder, Jonathon Lu (…)2026-03-27
💻 computer science

Calibri: Enhancing Diffusion Transformers via Parameter-Efficient Calibration

تقترح الورقة البحثية Calibri، وهي طريقة فعالة في استخدام المعلمات تعمل على تحسين نماذج محولات الانتشار (Diffusion Transformers) عبر تحسين معامل قياس واحد مُتعلم بواسطة الخوارزميات التطورية، مما يؤدي إلى تعزيز جودة التوليد وتقليل خطوات الاستدلال عبر مختلف نماذج تحويل النص إلى صورة.

Danil Tokhchukov, Aysel Mirzoeva, Andrey Kuznetsov, Konstantin Sobolev2026-03-27
🤖 AI

Dissecting Model Failures in Abdominal Aortic Aneurysm Segmentation through Explainability-Driven Analysis

تقترح هذه الورقة إطار عمل لتشكيل المشفر (encoder shaping) موجهًا بالذكاء الاصطناعي القابل للتفسير (XAI)، يستفيد من خرائط التركيز القائمة على العزو لمحاذاة انتباه النموذج مع التنبؤات وتحسين الاستدلال، مما يحسن بشكل كبير من تقسيم تمدد الأوعية الدموية في الأبهر البطني المعقد من خلال التخفيف من حالات الفشل الناجمة عن الهياكل غير ذات الصلة والأهداف منخفضة التباين.

Abu Noman Md Sakib, Merjulah Roby, Zijie Zhang, Satish Muluk, Mark K. Eskandari, Ender A. Finol2026-03-27