🤖 AI

SmartDirector: Keyframe-Conditioned Cinematic Video Generation with Narrative Pacing Control

تقدم هذه الورقة SmartDirector، وهو إطار عمل ثنائي المراحل يعزز توليد الفيديو السينمائي والتحكم في وتيرة السرد من خلال الاستفيد من إطارات رئيسية متعددة لدعم سيناريوهات مرنة مثل تركيب المشاهد المتعددة وتمديد الفيديو، متفوقاً بشكل ملحوظ على الأساليب الحالية الرائدة.

Zhida Zhang, Jie Ma, Zhan Peng, Haoxue Wu, Yang Han, Jun Liang, Jie Cao, Jing Li2026-05-28
💻 computer science

SIGMA: Bridging Structural and Distributional Gaps for Vision Foundation Model Adaptation

تقترح الورقة البحثية SIGMA، وهي طريقة فعالة في المعلمات وخفيفة الوزن للضبط الدقيق (Parameter-Efficient Fine-Tuning)، تعمل على جسر الفجوات الهيكلية والتوزيعية في نماذج الرؤية التأسيسية من خلال الدمج المتكيف مع المقياس والتعديل الدلالي، محققةً أداءً فائقاً في مهام التنبؤ الكثيف بنسبة 1.72% فقط من المعلمات القابلة للتدريب.

Lingyu Xiong, Jinjin Shi, Xuran Xu, Cong Luo, Runyu Shi, Ying Huang2026-05-28
💻 computer science

Decoupled Training with Local Reinforcement Fine-Tuning in Federated Learning

تقترح هذه الورقة البحثية FedDTL، وهو إطار عمل جديد للتعلم الاتحادي لنماذج الرؤية واللغة يعمل على فصل مشفرات الصور والنصوص لضمان تحديثات عالمية متماسكة، ويستخدم استراتيجية ضبط دقيق محلي مكونة من مرحلتين تجمع بين التعلم الخاضع للإشراف والتعلم المعزز لموازنة التكيف مع المهام العالمية والتعميم بفعالية في ظل توزيعات البيانات غير المتجانسة.

Yuting Ma, Lechao Cheng, Xiaohua Xu2026-05-28
⚛️ quantum physics

Do We Really Need Quantum Machine Learning?: A Multidimensional Empirical Study

تقدم هذه الورقة دراسة تجريبية متعددة الأبعاد تُظهر أنه في حين أن آلات المتجهات الداعمة الكمومية (QSVM) والشبكات العصبية التلافيفية الكمومية (QCNN) تتسبب عموماً في أوقات تشغيل حسابية أعلى من نظيراتها الكلاسيكية، إلا أنها توفر دقة تصنيف فائقة عند المقاييس الأكبر وكفاءة محسنة بشكل كبير في المعلمات والذاكرة، لا سيالما بالنسبة للشبكات العصبية التلافيفية الكمومية (QCNN).

Sudip Vhaduri, Ryan Gammon, Sayanton Dibbo2026-05-28
💻 computer science

SIGMA: Semantic-Difference Instruction-Grounding Mask Annotator for Text-Driven Image Manipulation Localization

يُعد SIGMA إطار عمل مبتكر يقوم تلقائياً بتوليد أقنعة على مستوى البكسل لتحرير الصور المدفوع بالنصوص من خلال الجمع بين تمايز الميزات الدلالية والبوادئ المكانية المرتكزة على التعليمات، مما يفتح المجال أمام ملايين أزواج التحرير الموجودة لإنشاء مجموعة بيانات تدريبية واسعة النطاق تعزز بشكل كبير أداء نماذج تحديد المواقع لعمليات معالجة الصور.

Peiyu Zhuang, Jianquan Yang, Haodong Li, Zhuoying Cai, Ruitao Xie, Jishen Zeng, Baoying Chen, Jiwu Huang, Xiaochun Cao2026-05-28
🤖 machine learning

Structure-Guided Visual Perturbation Neutralization for LVLMs

تقترح هذه الورقة البحثية إطار عمل SIGN، وهو إطار دفاعي خفيف الوزن وفعال وقابل للتوصيل والتشغيل (plug-and-play)، يعمل على تحييد الاضطرابات العدائية في نماذج الرؤية واللغة الكبيرة من خلال الاستفادة من استخراج البنية المسبقة والتحييد الموجه الديناميكي، محققاً معدلات نجاح دفاعية عالية مع حد أدنى من تعديل الصور والأعباء الحسابية مع الحفاظ على أداء النموذج.

Yuanhe Zhang, Xueting Wang, YanBin Ren, Haoran Gao, Xinhan Zheng, Zhenhong Zhou, Fanyu Meng, Li Sun, Sen Su2026-05-28
💻 computer science

SEMAGIC: Learning Semantically Consistent Deformable 3D Representations from In-the-Wild Images

تقدم الورقة البحثية SEMAGIC، وهو إطار عمل يتعلم تمثيلات ثلاثية الأبعاد قابلة للتشوه ومتسقة دلاليًا من صور أحادية المنظور من الواقع الحر عبر ربط التشوه الهندسي بالمحاذاة الدلالية لإنشاء مراسلات مستقرة على مستوى الفئة، مما يتفوق بشكل كبير على الأساليب الحالية في الاختبارات المرجعية الدلالية.

Sky Cen, Wufei Ma, Guofeng Zhang, Alan Yuille, Adam Kortylewski2026-05-28
🤖 AI

ROVER: Routing Object-Centric Visual Evidence for Grounded Multi-Image Reasoning

تقدم الورقة البحثية ROVER، وهو ملحق خفيف الوزن وقابل للتعلم للنماذج اللغوية الكبيرة متعددة الوسائط، يعزز الاستدلال متعدد الصور القائم على التأسيس من خلال توجيه الأدلة البصرية المتمحورة حول الأشياء بكفاءة عبر آلية ثلاثية الرموز (token triplet) الخاصة بكل خطوة، محققاً أداءً هو الأفضل في فئته على اختبارات معيارية مثل MM-GCoT وVideoEspresso دون المساس بالفهم الشامل للمشهد.

Guannan Lv, Ren Nie, Hongjian Dou2026-05-28
💻 computer science

Bridging the Generalization Gap in Adverse Weather Segmentation: A Training Recipe Perspective

تُثبت هذه الورقة أن وصفة تدريب مُصممة بعناية، وليس التعقيد المعماري، تسد بفعالية فجوة التعميم في تقسيم الصور في الظروف الجوية السيئة من خلال تحقيق معدل تقاطع (mIoU) مرتفع للاختبار يبلغ 59.9% مع حد أدنى من انخفاض الأداء بين التحقق والاختبار عبر استراتيجيات منهجية مثل الضبط الدقيق التكيفي مع النطاق، وخلط البيانات متعدد المصادر، والتعزيز الاصطناعي.

Cong Xu, Pu Luo, Yumei Li, Boyou Xue2026-05-28
💻 computer science

Dual-branch Distilled Transformer for Efficient Asymmetric UAV Tracking

يُعد EATrack إطار عمل فعالاً لتتبع الطائرات بدون طيار غير المتماثل، حيث يستخدم استراتيجية تقطير ثنائية الفروع بتوجيه من المعلم، تجمع بين نقل المعرفة على مستوى الميزات المكانية ومستوى التنبؤ مع التقطير الدقيق المعتمد على الهدف والتكيف الزمني لتحقيق توازن فائق بين الدقة والسرعة في الوقت الفعلي على الاختبارات المعيارية المعقدة.

Hongtao Yang, Bineng Zhong, Qihua Liang, Yaozong Zheng, Xiantao Hu, Yuanliang Xue, Shuxiang Song2026-05-28