💻 computer science

Neural Network Optimization Reimagined: Decoupled Techniques for Scratch and Fine-Tuning

تُعد DualOpt نهجاً مبتكراً للتحسين يعمل على فك الارتباط بين استراتيجيات التدريب من خلال إدخال تقنية اضمحلال الوزن لكل طبقة في الوقت الفعلي للتدريب من الصفر، وآلية استعادة الوزن المتكاملة للضبط الدقيق لمنع نسيان المعرفة وتحسين الأداء عبر مختلف مهام الرؤية الحاسوبية.

Xin Ning, Qiankun Li, Xiaolong Huang, Qiupu Chen, Feng He, Weijun Li, Prayag Tiwari, Xinwang Liu2026-04-28
💻 computer science

AeSlides: Incentivizing Aesthetic Layout in LLM-Based Slide Generation via Verifiable Rewards

يقدم AeSlides إطار عمل للتعلم التعزيزي يستخدم مجموعة من المقاييس المصممة بدقة والقابلة للتحقق لتحسين توليد الشرائح القائم على النماذج اللغوية الكبيرة مباشرةً من أجل جودة التنسيق الجمالي، متفوقاً بشكل كبير على الأساليب الحالية القائمة على الانعكاس والضبط الدقيق.

Yiming Pan, Chengwei Hu, Xuancheng Huang, Can Huang, Mingming Zhao, Yuean Bi, Xiaohan Zhang, Aohan Zeng, Linmei Hu2026-04-28
💻 computer science

Accelerating New Product Introduction for Visual Quality Inspection via Few-Shot Diffusion-Based Defect Synthesis

تقترح هذه الورقة إطار عمل توليديًا متكاملًا يستخدم نماذج الانتشار لتخليق عيوب صناعية عالية الدقة، مما يتيح فحص الجودة البصرية بفعالية من خلال تعزيز البيانات بنموذج القليل من العينات والتكيف مع النطاق بنموذج الصفر من العينات حتى عندما تكون بيانات العيوب الحقيقية نادرة.

Serkan Hamdi Güğül, Kemal Levi, Burak Acar2026-04-28
💻 computer science

IoT-Enhanced CNN-Based Labelled Crack Detection for Additive Manufacturing Image Annotation in Industry 4.0

تقترح هذه الورقة إطار عمل للتعلم العميق معزز بإنترنت الأشياء يدمج الشبكات العصبية التلافيفية (CNNs)، والحوسبة الحافية، وتقنية التوأم الرقمي لتوفير كشف عالي الدقة والوقت الفعلي للشقوق والتحكم التنبؤي في الجودة لعمليات التصنيع المضاف في بيئات الثورة الصناعية الرابعة.

Mohsen Asghari Ilani, Yaser Mike Banad2026-04-28
💻 computer science

SketchVLM: Vision language models can annotate images to explain thoughts and guide users

يُعد SketchVLM إطار عمل غير معتمد على التدريب ومستقل عن النموذج، يُمكّن نماذج الرؤية واللغة من توليد تراكبات SVG قابلة للتعديل فوق الصور، مما يحسن بشكل كبير من قدرتها على التفسير البصري للاستنتاج وأداء مهام التعليق التوضيحي عبر مختلف المعايسات.

Brandon Collins, Logan Bolton, Hung Huy Nguyen, Mohammad Reza Taesiri, Trung Bui, Anh Totti Nguyen2026-04-28
💻 computer science

Federated Cross-Modal Retrieval with Missing Modalities via Semantic Routing and Adapter Personalization

يُعد RCSR إطار عمل للتعلم الاتحادي صديقاً للتخصيص، يعالج مشكلات البيانات غير المتطابقة توزيعياً (non-IID) وفقدان الأنماط في استرجاع البيانات عبر الوسائط من خلال استخدام تثبيت النماذج الأولية، وموجه دلالي متمحور حول الاسترجاع، ومهايئات خفيفة الوزن خاصة بكل عميل مبنية على نموذج CLIP مجمد.

Hefeng Zhou, Xuan Liu, Sicheng Chen, Wutong Zhang, Wu Yan, Jiong Lou, Chentao Wu, Guangtao Xue, Wei Zhao, Jie Li2026-04-28
⚡ electrical engineering

CT-Guided Spatially-varying Regularization for Voxel-Wise Deformable Whole-Body PET Registration

تقترح هذه الورقة استراتيجية تنظيم مكاني متغير موجهة بالأشعة المقطعية لتسجيل التصوير المقطعي بالإصدار البوزيتروني (PET) لكامل الجسم، تستخدم المعلومات التشريحية من فحوصات الأشعة المقطعية المقترنة لتطبيق قيود تكيفية، مما يسمح بتثبيت الهياكل الصلبة بشكل أكبر مع السماح بالتشوه المرن في الأنسجة الرخوة.

Xiangcen Wu, Ruohua Chen, Sichun Li, Qianye Yang, Sheng Liu, Jianjun Liu, Zhaoheng Xie2026-04-28
💻 computer science

VS-DDPM: Efficient Low-Cost Diffusion Model for Medical Modality Translation

يُعد VS-DDPM إطار عمل انتشار ثلاثي الأبعاد بمتغيرات خطوة فعالاً، صُمم لتسريع ترجمة أنماط الصور الطبية مع الحفاظ على جودة توليدية عالية، محققاً أداءً هو الأفضل في فئته في مهام تخليق صور الرنين المغناطيسي المفقودة ونتائج تنافسية في مهام إزالة الأورام وتخليق الصور المقطعية.

Nikoo Moradi, Gijs Luijten, Behrus Hinrichs-Puladi, Jens Kleesiek, Victor Alves, Jan Egger, André Ferreira2026-04-28
💻 computer science

AnemiaVision: Non-Invasive Anemia Detection via Smartphone Imagery Using EfficientNet-B3 with TrivialAugmentWide, Mixup Augmentation, and Persistent Patient History Management

يُعد AnemiaVision نظام فحص متكامل قائم على الويب يستخدم نموذج EfficientNet-B3 مضبوطاً بدقة وتقنيات تعزيز بيانات متقدمة لتحقيق كشف عالي الدقة وغير جراحي لفقر الدم من خلال صور الهواتف الذكية لملتحمة العين وأسِرّة الأظافر.

Rahul Patel2026-04-28
💻 computer science

AmaraSpatial-10K: A Spatially and Semantically Aligned 3D Dataset for Spatial Computing and Embodied AI

تُعد AmaraSpatial-10K مجموعة بيانات جديدة تضم أكثر من 10,000 أصل ثلاثي الأبعاد عالي الجودة وجاهز للنشر، وتتميز بمقاييس مترية موحدة، وبيانات وصفية دلالية، وخصائص فيزيائية مصممة خصيصاً لدعم الذكاء الاصطزمائي المتجسد، ومحاكاة الروبوتات، والحوسبة المكانية.

Mohammad Sadegh Salehi, Alex Perkins, Igor Maurell, Ashkan Dabbagh, Raymond Wong2026-04-28