⚡ electrical engineering

Cross-Distribution Diffusion Priors-Driven Iterative Reconstruction for Sparse-View CT

تقترح هذه الورقة إطار العمل "إعادة البناء التكرارية المدفوعة ببوادر الانتشار عبر التوزيعات المختلفة" (CDPIR)، والذي يدمج "محول الاستيفاء القابل للتوسع" (SiT) مع إعادة البناء التكرارية القائمة على النموذج للاستفادة من البوادر عبر التوزيعات وتحسين جودة إعادة بناء التصوير المقطعي المحوسب ذي الرؤية المتفرقة بشكل كبير، لا سيما في سيناريوهات خارج نطاق التوزيع.

Haodong Li, Shuo Han, Haiyang Mao, Yu Shi, Changsheng Fang, Jianjia Zhang, Weiwen Wu, Hengyong Yu2026-04-24
🤖 machine learning

Accelerating Vision Transformers with Adaptive Patch Sizes

تقدم هذه الورقة البحثية "محولات الرقع التكيفية" (Adaptive Patch Transformers - APT)، وهي طريقة تعمل على ضبط أحجام الرقع ديناميكيًا بناءً على محتوى الصورة لتقليل عدد الرموز (tokens) بشكل كبير وتسريع تدريب واستنتاج نماذج "المحولات البصرية" (ViT) بنسبة تصل إلى 50% مع الحفاظ على الأداء عبر مختلف المهام البصرية عالية الدقة.

Rohan Choudhury, JungEun Kim, Jinhyung Park, Eunho Yang, László A. Jeni, Kris M. Kitani2026-04-24
🤖 machine learning

VFM-VAE: Vision Foundation Models Can Be Good Tokenizers for Latent Diffusion Models

تقدم هذه الورقة البحثية VFM-VAE، وهو نهج مبتكر يستفيد من نماذج الرؤية التأسيسية المجمدة كأجهزة ترميز مباشرة لنماذج الانتشار الكامن دون الحاجة إلى التقطير، محققاً جودة فائقة في توليد الصور وتسريعاً في التدريب بمقدار 10 أضعاف مقارنة بالطرق السابقة.

Tianci Bi, Xiaoyi Zhang, Yan Lu, Nanning Zheng2026-04-24
💻 computer science

PercHead: Perceptual Head Model for Single-Image 3D Head Reconstruction & Editing

يُعد PercHead نموذجًا يعتمد على محول الرؤية (Vision Transformer)، ويحقق أداءً رائدًا في إعادة بناء الرأس ثلاثي الأبعاد من صورة واحدة، وتحريرًا ثلاثي الأبعاد قويًا ومنفصلًا، وذلك عبر الاستفادة من فقدٍ إدراكي مبتكر مشتق من DINOv2 وSAM 2.1 للتغلب على الغموض وتعزيز الجودة البصرية.

Antonio Oroz, Matthias Nießner, Tobias Kirschstein2026-04-24
💻 computer science

LRDUN: A Low-Rank Deep Unfolding Network for Efficient Spectral Compressive Imaging

تقترح هذه الورقة LRDUN، وهي شبكة فك تشابك عميقة منخفضة الرتبة تدمج التفكيك منخفض الرتبة في نموذج الاستشعار لتقدير المكونات الطيفية المدمجة بشكل مشترك، مما يحقق إعادة بناء متطورة لتصوير الضغط الطيفي تتفوق على الأساليب الحالية لفك التشابك العميق للصور الطيفية عالية الأبعاد (HSI) مع تقليل التكلفة الحسابية بشكل كبير وتحسين الاستقرار مقارنة بها.

He Huang, Yujun Guo, Wei He2026-04-24
🤖 machine learning

TimePre: Bridging Accuracy, Efficiency, and Stability in Probabilistic Time-Series Forecasting

يُعد TimePre إطار عمل مبتكر يوحد بين كفاءة النماذج القائمة على Perceptron متعدد الطبقات (MLP) والمرونة التوزيعية لتعلم الخيارات المتعددة للتنبؤ الاحتمالي بالسلاسل الزمنية، مستخدماً طبقة تطبيع مث instância مستقرة لتحقيق دقة تبلغ أقصى حد، واستقرار فائق، وسرعات استدلال أسرع بكثير مقارنة بالطرق الحالية.

Lingyu Jiang, Lingyu Xu, Peiran Li, Dengzhe Hou, Qianwen Ge, Dingyi Zhuang, Shuo Xing, Wenjing Chen, Xiangbo Gao, Ting-H (…)2026-04-24
🤖 machine learning

Low Cost, High Efficiency: LiDAR Place Recognition in Vineyards with Matryoshka Representation Learning

تقدم هذه الورقة MinkUNeXt-VINE، وهي طريقة تعلم عميق خفيفة الوزن تستخدم تعلم تمثيل ماتريوشكا (Matryoshka Representation Learning) لتحقيق التعرف على المواقع عبر ليدار (LiDAR) بشكل قوي وفي الوقت الفعلي في بيئات مزارع الكروم غير المهيكلة باستخدام مدخلات متفرقة ومنخفضة التكلفة.

Judith Vilella-Cantos, Mauro Martini, Marcello Chiaberge, Mónica Ballesta, David Valiente2026-04-24
💻 computer science

DAVIS: OOD Detection via Dominant Activations and Variance for Increased Separation

تقدم الورقة البحثية DAVIS، وهي طريقة للكشف عن البيانات خارج التوزيع (out-of-distribution) تتم بعد التدريب (post-hoc)، تعمل على تحسين الفصل بشكل كبير من خلال إثراء متجهات الميزات بالتباين عبر القنوات والتنشيطات المهيمنة لاستعادة الإحصاءات التوزيعية المفقودة أثناء عملية المتوسط العام للقنوات (global average pooling)، مما يحقق أداءً هو الأفضل في فئته عبر بنيات معمارية متنوعة.

Abid Hassan, Tuan Ngo, Saad Shafiq, Nenad Medvidovic2026-04-24
💻 computer science

MaskDiME: Adaptive Masked Diffusion for Precise and Efficient Visual Counterfactual Explanations

يُعد MaskDiME إطار عمل انتشار مقنع تكيفي وخالٍ من التدريب، يعمل على تسريع توليد التفسيرات البصرية التباينية الدقيقة والمتسقة دلاليًا بشكل كبير من خلال التركيز على المناطق ذات الصلة بالقرار، محققًا سرعة استدلال تزيد عن 30 ضعفًا مقارنة بالنماذج المرجعية مع الحفاظ على أداء يضاهي أحدث المعايير التقنية.

Changlu Guo, Anders Nymark Christensen, Anders Bjorholm Dahl, Morten Rieger Hannemose2026-04-24
💬 NLP

AITP: Traffic Accident Responsibility Allocation via Multimodal Large Language Models

تقدم هذه الورقة البحثية نموذج AITP، وهو نموذج لغوي كبير متعدد الوسائط يستفيد من سلسلة أفكار متعددة الوسائط وتوليد معزز بالاسترجاع للقيام بتخصيص مسؤولية حوادث المرور المعقدة، مدعوماً بمعيار DecaTARA الشامل الذي يحتوي على ما يقرب من 68,000 فيديو مشروح.

Zijin Zhou, Songan Zhang2026-04-24