💻 computer science

Fair Benchmarking of Emerging One-Step Generative Models Against Multistep Diffusion and Flow Models

تضع هذه الورقة إطاراً عادلاً للمقارنة المرجعية لنماذج التوليد ذات الخطوة الواحدة الناشئة مقابل أنظمة الانتشار والتدفق متعددة الخطوات، كاشفةً أن التقييمات القياسية التي تركز على مقياس FID يمكن أن تكون مضللة بسبب سلوكيات المقاييس المتضاربة تحت تأثير التوجيه الخالي من المصنف، ومثبتةً أن نماذج الخطوة الواحدة تتحسن بشكل ملحوظ مع الاستدلال متعدد الخطوات، مع تقديم مقياس مركب جديد (MMHM) لالتقاط توازنات الجودة والمواءمة بشكل أفضل.

Advaith Ravishankar, Serena Liu, Mingyang Wang, Todd Zhou, Jeffrey Zhou, Arnav Sharma, Ziling Hu, Léopold Das, Abdulaziz (…)2026-03-17
💻 computer science

Joint Segmentation and Grading with Iterative Optimization for Multimodal Glaucoma Diagnosis

تقترح هذه الورقة نموذج تحسين متعدد الوسائط تكراري (IMO) يدمج صور قاع العين وصور التصوير المقطعي للتماسك البصري (OCT) من خلال محاذاة الميزات عبر الوسائط وفك تشفير تحسين تكراري قائم على الانتشار لإزالة الضجيج، وذلك لتحقيق تقسيم دقيق لقرنية العصب البصري والندبة وتصنيف دقيق للجلوكوما في آن واحد.

Zhiwei Wang, Yuxing Li, Meilu Zhu, Defeng He, Edmund Y. Lam2026-03-17
🤖 AI

DualTSR: Unified Dual-Diffusion Transformer for Scene Text Image Super-Resolution

يُعد DualTSR إطار عمل موحداً وشاملاً من الطرف إلى الطرف، يستفيد من عمود فقري واحد لمحول متعدد الوسائط مع هدف انتشار مزدوج لنمذجة توزيعات الصور المستمرة والنصوص المنفصلة في آن واحد، مما يتيح استنتاج المعرفة المسبقة للنصوص داخلياً دون الحاجة إلى وحدات خارجية للتعرف الضوئي على الحروف (OCR) من أجل رفع دقة صور النصوص في المشاهد بفعالية.

Axi Niu, Kang Zhang, Qingsen Yan, Hao Jin, Jinqiu Sun, Yanning Zhang2026-03-17
💻 computer science

Safety-Potential Pruning for Enhancing Safety Prompts Against VLM Jailbreaking Without Retraining

تقدم هذه الورقة "تقليم إمكانات السلامة" (Safety-Potential Pruning)، وهو إطار عمل لا يتطلب إعادة تدريب يعزز سلامة النماذج اللغوية البصرية (VLM) ضد هجمات الاختراق عبر تحديد وتضخيم الشبكات الفرعية الخاملة ذات الصلة بالسلامة من خلال الإزالة الاستراتيجية للأوزان الأقل استجابة، مما يقلل بشكل كبير من معدلات نجاح الهجمات مع الحفاظ على الأداء الحميد.

Chongxin Li, Hanzhang Wang, Lian Duan2026-03-17
💻 computer science

FIND: A Simple yet Effective Baseline for Diffusion-Generated Image Detection

تقترح الورقة البحثية نموذج FIND، وهو نموذج مرجعي عالي الكفاءة وقابل للتعميم للكشف عن الصور المولدة عبر نماذج الانتشار، حيث يستبدل الأساليب القائمة على إعادة البناء المكلفة بمصنف ثنائي بسيط يتم تدريبه للتمييز بين الصور الحقيقية ونسخها المعززة بالضجيج، وذلك من خلال استغلال الاختلافات التوزيعية الجوهرية لتحقيق دقة وسرعة فائقتين.

Jie Li, Yingying Feng, Chi Xie, Jie Hu, Lei Tan, Jiayi Ji2026-03-17
💻 computer science

S2GS: Streaming Semantic Gaussian Splatting for Online Scene Understanding and Reconstruction

تقترح الورقة البحثية S2GS، وهو إطار عمل لمجال دلالي ثلاثي الأبعاد بنموذج غاوسي يتسم بالسببية الصارمة والتزايد، مما يتيح إعادة بناء وفهم المشاهد بشكل مشترك عبر الإنترنت وبشكل قابل للتوسع من خلال فصل المعالجة الهندسية عن المعالجة الدلالية لتجنب اختناقات الذاكرة ووقت التشغيل التي تفرضها الطرق الحالية القائمة على الحوسبة العالمية غير المتزامنة.

Renhe Zhang, Yuyang Tan, Jingyu Gong, Zhizhong Zhang, Lizhuang Ma, Yuan Xie, Xin Tan2026-03-17
💻 computer science

FOCUS: Bridging Fine-Grained Recognition and Open-World Discovery across Domains

تقدم الورقة البحثية إطار عمل FoCUS، وهو أول إطار عمل موحد لاكتشاف الفئات المعممة ذي التعميم النطاقي دقيق التفاصيل (FG-DG-GCD)، والذي يعالج تحدي التعرف على الفئات المعروفة واكتشاف الفئات الجديدة عبر نطاقات غير مرئية من خلال الجمع بين اكتشاف الأجزاء المتسقة مع النطاق وتعزيز الميزات المدرك لعدم اليقين، مع وضع معايير مرجعية جديدة وإثبات دقة فائقة وكفاءة حوسبية أعلى مقارنة بالنماذج المرجعية الحالية.

Vaibhav Rathore, Divyam Gupta, Moloud Abdar, Subhasis Chaudhuri, Biplab Banerjee2026-03-17
💻 computer science

DC-ViT: Modulating Spatial and Channel Interactions for Multi-Channel Images

تقترح الورقة البحثية بنية DC-ViT، وهي بنية مبتكرة للتصوير متعدد القنوات تخفف من تخفيف الميزات من خلال فصل التفاعلات المكانية والقنوية عبر الانتباه الذاتي المنفصل، وتُقدم التجميع المنفصل لتعلم أهميات القنوات الخاصة بالمهمة، مما يؤدي إلى تفوقها على الأساليب الحالية عبر معايير متعددة.

Umar Marikkar, Syed Sameed Husain, Muhammad Awais, Sara Atito2026-03-17
🤖 AI

4D Synchronized Fields: Motion-Language Gaussian Splatting for Temporal Scene Understanding

تقدم هذه الورقة البحثية "الحقول المتزامنة رباعية الأبعاد" (4D Synchronized Fields)، وهي تمثيل غاوسي رباعي الأبعاد مبتكر يتعلم بشكل مشترك الحركة المعتمدة على الكائنات والدلالات المرتبطة باللغة في نموذج واحد مقترن بنيوياً، محققاً أداءً هو الأفضل في مجاله من حيث جودة إعادة البناء والاسترجاع الزمني مفتوح المفردات.

Mohamed Rayan Barhdadi, Samir Abdaljalil, Rasul Khanbayov, Erchin Serpedin, Hasan Kurban2026-03-17
💻 computer science

In-Field 3D Wheat Head Instance Segmentation From TLS Point Clouds Using Deep Learning Without Manual Labels

تقترح هذه الورقة مساراً جديداً للتعلم العميق يتكون من مرحلتين، يستفيد من التجزئة ثنائية الأبعاد بنمط التعلم الصفري ودمج الرؤى المتعددة لتوليد تسميات مستعارة لتدريب نموذج ثلاثي الأبعاد تحت الإشراف، مما يتيح تجزئة مثالية لعينات سنابل القمح في الحقل من سحب النقاط الناتجة عن المسح الليزري الأرضي دون الحاجة إلى تعليقات توضيحية يدوية.

Tomislav Medic, Liangliang Nan2026-03-17