🤖 machine learning

Socrates Loss: Unifying Confidence Calibration and Classification by Leveraging the Unknown

تقدم هذه الورقة "خسارة سقراط" (Socrates Loss)، وهي هدف تدريب موحد يدمج فئة مجهولة مساعدة لتحسين دقة التصنيف ومعايرة الثقة في آن واحد، مما يحل بفعالية مقايضة الاستقرار والأداء المتأصلة في الأساليب الحالية.

Sandra Gómez-Gálvez, Tobias Olenyi, Gillian Dobbie, Katerina Taškova2026-04-15
💻 computer science

DreamStereo: Towards Real-Time Stereo Inpainting for HD Videos

يعالج DreamStereo تحديات استكمال الفيديو الستيريولوجي (stereo video inpainting) في الوقت الفعلي من خلال تقديم تقنيات التشويه المتوازي المدرك للتدرج (Gradient-Aware Parallax Warping)، والإسقاط المزدوج القائم على اختلاف المنظر (Parallax-Based Dual Projection)، واستكمال الستيريو المدرك للتناثر (Sparsity-Aware Stereo Inpainting) لتوليد نتائج متسقة هندسيًا وتحقيق تسريع قدره 10.7 ضعفًا، مما يتيح معالجة فيديوهات عالية الدقة بسرعة 25 إطارًا في الثانية على وحدة معالجة رسومية واحدة من نوع A100.

Yuan Huang, Sijie Zhao, Jing Cheng, Hao Xu, Shaohui Jiao2026-04-15
⚡ electrical engineering

CBAM-Enhanced DenseNet121 for Multi-Class Chest X-Ray Classification with Grad-CAM Explainability

تقدم هذه الورقة البحثية نموذج CBAM-DenseNet121، وهو إطار عمل للتعلم بنقل المعرفة معزز بوحدة انتباه الكتل الالتفافية (Convolutional Block Attention Module) يحقق دقة عالية وقابلية للتفسير في التمييز بين الالتهاب الرئوي الطبيعي والبكتيري والفيروسي في صور الأشعة السينية للصدر، مما يعالج الحاجة الماسة للتشخيص متعدد الفئات في البيئات محدودة الموارد، ويكشف أيضاً أن نموذج EfficientNetB3 يقل أداءً عن نموذج CNN مخصص في المهام الثنائية.

Utsho Kumar Dey2026-04-15
💻 computer science

Boosting Robust AIGI Detection with LoRA-based Pairwise Training

تقترح هذه الورقة استراتيجية تدريب زوجي قائمة على تقنية LoRA (LPT) تدمج بين الضبط الدقيق المستهدف لنموذج بصري تأسيسي وبين محاكاة التشوه والحجم لفصل التعميم عن المتانة، مما يؤدي إلى تحسين أداء كشف الصور المولدة بواسطة الذكاء الاصطناجعي بشكل كبير في ظل وجود تشوهات شديدة من العالم الحقيقي.

Ruiyang Xia, Qi Zhang, Yaowen Xu, Zhaofan Zou, Hao Sun, Zhongjiang He, Xuelong Li2026-04-15
💻 computer science

Towards Realistic and Consistent Orbital Video Generation via 3D Foundation Priors

تقترح هذه الورقة طريقة مبتكرة لتوليد فيديوهات مدارية واقعية ومتسقة من صورة واحدة عبر الاستفادة من الميزات الكامنة متعددة المقاييس من نموذج توليدي تأسيسي ثلاثي الأبعاد كأولويات هيكلية، والتي يتم حقنها في نموذج فيديو أساسي عبر محول ثلاثي الأبعاد متعدد المقاييس للتغلب على قيود الانتباه على مستوى البكسل في استقراء الرؤية بعيدة المدى.

Rong Wang, Ruyi Zha, Ziang Cheng, Jiayu Yang, Pulak Purkait, Hongdong Li2026-04-15
💻 computer science

Cell Instance Segmentation via Multi-Task Image-to-Image Schrödinger Bridge

تقترح هذه الورقة إطار عمل "جسر شرويدر" (Schrödinger Bridge) متعدد المهام لتحويل الصور إلى صور، والذي يصيغ تقسيم مثيلات الخلايا كمسألة توليد قائمة على التوزيع مع إشراف مدرك للحدود، محققاً أداءً تنافسياً على مجموعتي بيانات PanNuke وMoNuSeg دون الاعتماد على التدريب المسبق لنموذج SAM أو المعالجة اللاحقة.

Hayato Inoue, Shota Harada, Shumpei Takezaki, Ryoma Bise2026-04-15
💻 computer science

Self-Adversarial One Step Generation via Condition Shifting

تقدم الورقة البحثية APEX، وهو إطار عمل خالٍ من المميز (discriminator-free) يستفيد من إشارات التصحيح التنافسي الداخلية عبر إزاحة الشرط (condition shifting) لتحقيق توليد صور من النصوص في خطوة واحدة بمستوى رائد (state-of-the-art) مع دقة وكفاءة تدريب فائقتين مقارنة بالطرق الحالية.

Deyuan Liu, Peng Sun, Yansen Han, Zhenglin Cheng, Chuyan Chen, Tao Lin2026-04-15
💻 computer science

HyperLiDAR: Adaptive Post-Deployment LiDAR Segmentation via Hyperdimensional Computing

يُعد HyperLiDAR إطار عمل خفيف الوزن لتجزئة بيانات ليدار (LiDAR) لما بعد النشر، يعتمد على الحوسبة فائقة الأبعاد، مما يتيح التكيف الفعال على الأجهزة للقيادة الذاتية من خلال الاستفيد من التعلم السريع واستراتيجية اختيار المخزن المؤقت للتغلب على القيود الحسابية والتحولات البيئية.

Ivannia Gomez Moreno, Yi Yao, Ye Tian, Xiaofan Yu, Flavio Ponzina, Michael Sullivan, Jingyi Zhang, Mingyu Yang, Hun Seok (…)2026-04-15
🤖 machine learning

All in One: A Unified Synthetic Data Pipeline for Multimodal Video Understanding

تقترح هذه الورقة البحثية مساراً موحداً لتوليد البيانات الاصطناعية يقوم تلقائياً بإنشاء تسميات توضيحية متنوعة ومتعددة المهام للفيديو لتدريب النماذج اللغوية الكبيرة متعددة الوسائط، مما يثبت أن النماذج التي تتدرب بشكل أساسي على هذه البيانات الاصطناعية يمكنها التعميم بفعالية، وغالباً ما تتفوق على نظيراتها المدربة على بيانات من العالم الحقيقي، عبر مهام مثل عد الأشياء، والإجابة عن الأسئلة البصرية، والتجزئة.

Tanzila Rahman, Renjie Liao, Leonid Sigal2026-04-15
💻 computer science

CoLA: A Choice Leakage Attack Framework to Expose Privacy Risks in Subset Training

تتحدى هذه الورقة الافتراض القائل بأن التدريب على مجموعات فرعية يقلل من مخاطر الخصوصية من خلال تقديم CoLA، وهو إطار عمل يوضح أن عملية اختيار البيانات نفسها تخلق أسطح هجوم جديدة (هجمات استدلال العضوية للتدريب وهجمات استدلال المشاركة في الاختيار) قادرة على تسريب معلومات حساسة حول كل من بيانات التدريب وسلسلة التوريد الأوسع للبيانات والنماذج.

Qi Li, Cheng-Long Wang, Yinzhi Cao, Di Wang2026-04-15