💻 computer science

MorphOPC: Advancing Mask Optimization with Multi-scale Hierarchical Morphological Learning

تقدم هذه الورقة MorphOPC، وهو نموذج تعلم عميق هرمي متعدد المقاييس يصيغ توليد الأقنعة كسلسلة من العمليات المورفولوجية العصبية للتغلب على قيود التحويل الهندسي التي تواجه نهج المشفر-فك التشفير الحالي، مما يحقق دقة طباعة فائقة وتكاليف تصنيع أقل في تصحيح القرب البصري.

Yuting Hu, Lei Zhuang, Chen Wang, Ruiyang Qin, Hua Xiang, Gi-joon Nam, Jinjun Xiong2026-05-14
💻 computer science

SSDA: Bridging Spectral and Structural Gaps via Dual Adaptation for Vision-Based Time Series Forecasting

تقدم هذه الورقة SSDA، وهو إطار عمل للتكيف ثنائي المسار يسد الفجوات الطيفية والهيكلية بين صور السلاسل الزمنية المُصورة والصور الطبيعية، مما يطلق العنان للإمكانات الكاملة لنماذج الرؤية الكبيرة من أجل التنبؤ الدقيق بالسلاسل الزمنية.

Mingrui Zhang, Hanchen Yang, Wengen Li, Xudong Jiang, Yichao Zhang, Jihong Guan, Shuigeng Zhou2026-05-14
💻 computer science

M2Retinexformer: Multi-Modal Retinexformer for Low-Light Image Enhancement

يُعد M2Retinexformer إطار عمل جديداً متعدد الوسائط يعمل على تحسين الصور ذات الإضاءة المنخفضة من خلال دمج دلالات العمق، والبديهيات السطوعية، والميزات الدلالية في مسار صقل تدريجي مع بوابات تكيفية، محققاً أداءً رائداً على مستويات متعددة من المعايير المرجعية.

Youssef Aboelwafa, Hicham G. Elmongui, Marwan Torki2026-05-14
⚡ electrical engineering

Uncovering Latent Pathological Signatures in Pulmonary CT via Cross-Window Knowledge Distillation

تقترح هذه الورقة إطار عمل لتقطير المعرفة عبر النوافذ يُمكّن المشفرات الطلابية من تعلم الأولويات السريرية الكامنة من نموذج معلم مُدرب على النافذة الأكثر إفادة للأشعة المقطعية، مما يحسن بشكل كبير أداء تحليل الأشعة المقطعية للرئة متعددة النوافذ عبر مجموعات مرضية متنوعة من خلال التقاط التفاعلات بين الكثافات التي تفتقدها الطرق الحالية.

Bo Peng, Wujian Xu, Kun Wang, Ximing Liao, Na Wang, Daqian Shi, Tian Li, Jing Gao, Johan Thygesen, Yingqun Ji, Honghan W (…)2026-05-14
💻 computer science

M3Net: A Macro-to-Meso-to-Micro Clinical-inspired Hierarchical 3D Network for Pulmonary Nodule Classification

يُعد M3Net إطار عمل للتعلم العميق ثلاثي الأبعاد هرمي ومستوحى سريرياً، يحاكي سير العمل التشخيصي لأطباء الأشعة من خلال دمج المعلومات السياقية متعددة المقاييس لتحقيق دقة فائقة في تصنيف العُقيدات الرئوية الحميدة والخبيثة وتعزيز قابلية التفسير.

Jinyue Li, Yuzhou Yu, Jingjing Yang, Meng Fu, Yani Zhang, Shuyao He, Dianlong Ge, Xin Ning, Yannan Chu, Qiankun Li2026-05-14
💻 computer science

VideoSEAL: Mitigating Evidence Misalignment in Agentic Long Video Understanding by Decoupling Answer Authority

يعالج VideoSEAL مشكلة "عدم توافق الأدلة" في فهم الفيديو الطويل الوكيل عبر تقديم إطار عمل منفصل من المخطط والمفتش يفصل بين التخطيط طويل الأمد وسلطة الإجابة، مما يتطلب تحققًا على مستوى البكسل لضمان دعم الإجابات بالأدلة المسترجعة وتحقيق أداء رائد في عدة معايير مرجعية.

Chenhao Qiu (Mango TV), Yechao Zhang (Nanyang Technological University), Xin Luo (Mango TV), Shien Song (Mango TV), Xush (…)2026-05-14
💻 computer science

Improving Diffusion Posterior Samplers with Lagged Temporal Corrections for Image Restoration

تقدم هذه الورقة البحثية LAMP، وهو ملحق معياري للنماذج القائمة على الانتشار لترميم الصور، يستفيد من التجزئة من الدرجة الثانية والتصحيحات الزمنية المتأخرة لتحسين دقة واستقرار أخذ عينات اللاحقة دون زيادة التكلفة الحسابية.

Davide Evangelista, Elena Morotti, Francesco Pivi, Maurizio Gabbrielli2026-05-14
💻 computer science

3D Primitives are a Spatial Language for VLMs

تقدم هذه الورقة البحثية نماذج هندسية ثلاثية الأبعاد معبر عنها برمجياً كلغة مكانية قوية لنماذج الرؤية واللغة، مبرهنةً من خلال معيار SpatialBabel، واستراتيجية استدلال Code-CoT الخالية من التدريب، وطريقة الضبط الدقيق ذاتية الإشراف S3^{3}-FT، أن هذا التمثيل الوسيط يعزز بشكل كبير الاستدلال المكاني ويتعمم عبر بنيات نماذج الرؤية واللغة المتنوعة دون الحاجة إلى تسميات بشرية.

Junze Liu, Kun Qian, Florian Dubost, Kai Zhong, Arvind Srinivasan, Nan Chen, Anping Wang, Sam Zhang, Alejandro Mottini (…)2026-05-14
💻 computer science

TrackCraft3R: Repurposing Video Diffusion Transformers for Dense 3D Tracking

يقدم TrackCraft3R أول متتبع ثلاثي الأبعاد كثيف يعمل بنظام التغذية الأمامية يعيد توظيف نماذج محولات الانتشار بالفيديو مسبقة التدريب من خلال توظيف تمثيل ثنائي الكامن ومحاذاة دوران الموضع الزمني (RoPE) للتغلب على قيودها المرتبطة بالإطارات، محققاً أداءً هو الأفضل في فئته مع كفاءة فائقة في السرعة والذاكرة في اختبارات تتبع الفيديو أحادي العدسة.

Jisu Nam, Jahyeok Koo, Soowon Son, Jaewoo Jung, Honggyu An, Junhwa Hur, Seungryong Kim2026-05-14
💻 computer science

Action Emergence from Streaming Intent

تقدم هذه الورقة البحثية "النية المتدفقة" (Streaming Intent)، وهو إطار عمل جديد للقيادة الذاتية من طرف إلى طرف يتيح ظهور الأفعال عبر اشتقاق النية المتدفقة دلاليًا عبر آلية سلسلة من الأفكار لتوجيه مولد أفعال قائم على مطابقة التدفق، محققًا أداءً تنافسيًا وقدرة تحكم غير مسبوقة في الوفاء بالنية على معيار وايمو (Waymo).

Pengfei Jing, Victor Shea-Jay Huang, Hengtong Lu, Jifeng Dai, Xie Yan, Benjin Zhu2026-05-14