💻 computer science

MuRF: Unlocking the Multi-Scale Potential of Vision Foundation Models

تقدم هذه الورقة البحثية MuRF، وهي استراتيجية استدلال عالمية وخالية من التدريب تعزز نماذج الرؤية التأسيسية من خلال دمج الميزات من دقات صور متعددة للاستفادة من المعلومات الدلالية العالمية والدقيقة المتكاملة عبر مختلف مهام الرؤية الحاسوبية.

Bocheng Zou, Mu Cai, Mark Stanley, Dingfu Lu, Yong Jae Lee2026-03-27
💻 computer science

Less Gaussians, Texture More: 4K Feed-Forward Textured Splatting

تقدم الورقة البحثية إطار العمل LGTM، وهو إطار عمل تغذية أمامية يحقق تركيباً قابلاً للتوسع للمناظر من زوايا جديدة بدقة 4K من خلال فصل التعقيد الهندسي عن دقة التصيير عبر بدائيات غاوسية مدمجة مقترنة بأنسجة لكل بدائي، مما يتغلب بذلك على قيود النمو التربيعي للبدائيات في الطرق الحالية.

Yixing Lao, Xuyang Bai, Xiaoyang Wu, Nuoyuan Yan, Zixin Luo, Tian Fang, Jean-Daniel Nahmias, Yanghai Tsin, Shiwei Li, He (…)2026-03-27
🤖 machine learning

Set2Seq Transformer: Temporal and Position-Aware Set Representations for Sequential Multiple-Instance Learning

تقدم الورقة البحثية نموذج Set2Seq Transformer، وهو بنية مبتكرة تهدف إلى نمذجة التعلم متعدد الحالات المتسلسل بفعالية من خلال التقاط هياكل المجموعات غير المعتمدة على الترتيب والارتباطات الزمنية بشكل مشترك عبر تمثيلات مدركة للموضع، مما أظهر أداءً فائقاً في التنبؤ بالنجاح الفني والتنبؤ بخطر حرائق الغابات مقارنة بالطرق الاستاتيكية الحالية.

Athanasios Efthymiou, Stevan Rudinac, Monika Kackovic, Nachoem Wijnberg, Marcel Worring2026-03-26
💬 NLP

Phrase-Instance Alignment for Generalized Referring Segmentation

تقترح هذه الورقة إطار عمل جديداً يعتمد على الوعي بالنماذج الفردية (instance-aware) لمهام التجزئة المرجعية المعممة (Generalized Referring Segmentation)، حيث تعيد صياغة المهمة كعملية محاذاة بين العبارة والنموذج باستخدام فقدان المحاذاة بين العبارة والكائن (Phrase-Object Alignment loss) وآلية تجميع موحدة، محققةً أداءً هو الأفضل في فئته (state-of-the-art) على معايير gRefCOCO وRef-ZOM من خلال التعامل بفعالية مع سيناريوهات الهدف الفردي، والمتعدد، والعدمي.

E-Ro Nguyen, Hieu Le, Dimitris Samaras, Michael S. Ryoo2026-03-26
💻 computer science

CA-LoRA: Concept-Aware LoRA for Domain-Aligned Segmentation Dataset Generation

تقترح هذه الورقة البحثية طريقة "Concept-Aware LoRA" (CA-LoRA)، وهي طريقة ضبط دقيق مبتكرة لنماذج تحويل النص إلى صورة تعمل على تحديث الأوزان المتعلقة بمفاهيم محددة مثل الأسلوب أو زاوية الرؤية بشكل انتقائي لتوليد مجموعات بيانات تقسيم متنوعة ومتوافقة مع النطاق مع الحفاظ على المعرفة المسبقة، مما يجعلها تتفوق على الطرق الحالية في مهام التعميم داخل النطاق وفي النطاقات المختلفة.

Minho Park, Sunghyun Park, Jungsoo Lee, Hyojin Park, Kyuwoong Hwang, Fatih Porikli, Jaegul Choo, Sungha Choi2026-03-26
💬 NLP

Explainable embeddings with Distance Explainer

تقدم هذه الورقة "Distance Explainer"، وهي طريقة جديدة للذكاء الاصطناعي القابل للتفسير (XAI) بعد الحدوث، تعمل على تكييف التقنيات القائمة على البروز لتوليد تفسيرات محلية قوية للتشابه أو الاختلاف بين نقاط البيانات في الفضاءات المتجهة المضمنة من خلال تعيين قيم الإسناد عبر القناع الانتقائي والترشيح المرتب حسب المسافة.

Christiaan Meijer, E. G. Patrick Bos2026-03-26
💻 computer science

RestoreVAR: Visual Autoregressive Generation for All-in-One Image Restoration

تقترح الورقة البحثية RestoreVAR، وهو إطار عمل جديد للترميم البصري ذاتي التراجع (visual autoregressive) لترميم الصور الشامل (all-in-one)، والذي يستفيد من نمذجة فضاء المقياس (scale-space modeling) والتحسينات الهيكلية لتحقيق أداء رائد يتفوق بـ 10 أضعاف سرعة الاستنتاج مقارنة بنماذج الانتشار الكامنة التقليدية.

Sudarshan Rajagopalan, Kartik Narayan, Vishal M. Patel2026-03-26
💻 computer science

FOCUS: Optimal Control for Multi-Entity World Modeling in Text-to-Image Generation

تقدم هذه الورقة البحثية FOCUS، وهو إطار عمل مبني على أسس منهجية يصيغ مطابقة التدفق (flow matching) كتحكم أمثل عشوائي لاستخلاص خوارزميات لا تتطلب ضبطًا دقيقًا وأخرى تعتمد على الضبط الدقيق، والتي تعمل بشكل كبير على تحسين دقة تعدد الموضوعات ومنع تسرب السمات في توليد الصور من النصوص.

Eric Tillmann Bill, Enis Simsar, Thomas Hofmann2026-03-26
💻 computer science

One Patch to Caption Them All: A Unified Zero-Shot Captioning Framework

تقدم هذه الورقة إطار عمل موحداً للوصف الصوري بنمط "التعلم الصفري" (zero-shot) ينتقل من تمثيلات الصور العالمية إلى نموذج قائم على الرقع (patch-centric)، مما يتيح توليد أوصاف لأي مناطق في الصورة دون الحاجة إلى إشراف على مستوى المنطقة عبر تجميع الميزات البصرية الكثيفة من النماذج الأساسية مثل DINO.

Lorenzo Bianchi, Giacomo Pacini, Fabio Carrara, Nicola Messina, Giuseppe Amato, Fabrizio Falchi2026-03-26
💻 computer science

MimiCAT: Mimic with Correspondence-Aware Cascade-Transformer for Category-Free 3D Pose Transfer

تقدم هذه الورقة MimiCAT، وهو نموذج محول متتالي (cascade-transformer) يحقق نقلًا للوضعية ثلاثية الأبعاد غير مقيد بالفئات عبر مورفولوجيات شخصيات متنوعة، وذلك من خلال الاستفادة من مجموعة بيانات بمقياس المليون والارتباط الناعم القائم على النقاط المفتاحية الدلالية للتغلب على القيود الهيكلية للطرق الحالية.

Zenghao Chai, Chen Tang, Yongkang Wong, Xulei Yang, Mohan Kankanhalli2026-03-26