💻 computer science

PreciseCache: Precise Feature Caching for Efficient and High-fidelity Video Generation

يعد PreciseCache إطار عمل جاهز للتشغيل يعمل على تسريع توليد الفيديو بشكل كبير من خلال توظيف التخزين المؤقت التدريجي القائم على فرق التردد المنخفض (LFCache) والتخزين المؤقت القائم على الكتل (BlockCache) لتحديد وتخطي الحسابات الزائدة حقاً بدقة، مما يحقق تسريعاً جوهرياً دون التضحية بجودة المخرجات.

Jiangshan Wang, Kang Zhao, Jiayi Guo, Jiayu Wang, Hang Guo, Chenyang Zhu, Xiu Li, Xiangyu Yue2026-03-04
💻 computer science

Flow Matching-enabled Test-Time Refinement for Unsupervised Cardiac MR Registration

تقدم الورقة البحثية FlowReg، وهو إطار عمل لمطابقة التدفق (flow-matching) لتسجيل الرنين المغناطيسي للقلب غير الخاضع للإشراف، والذي يستخدم تدريب الـ warmup-reflow واستراتيجية التخمين الأولي (Initial Guess) لتحقيق دقة تضاهي أحدث ما توصل إليه العلم بخطوتين فقط من الاستدلال، مما يلغي الحاجة إلى نماذج مدربة مسبقاً أو تسميات تجزئة.

Yunguan Fu, Wenjia Bai, Wen Yan, Matthew J Clarkson, Rhodri Huw Davies, Yipeng Hu2026-03-04
💻 computer science

FACE: A Face-based Autoregressive Representation for High-Fidelity and Efficient Mesh Generation

يقدم FACE إطار عمل جديداً للتوليد الذاتي على مستوى الوجه يعامل كل مثلث كرمز (token) واحد لتقليل طول التسلسل والتكاليف الحسابية بشكل جذري، مع تحقيق جودة إعادة بناء رائدة وتمكين التوليد الفعال لشبكات ثلاثية الأبعاد عالية الدقة.

Hanxiao Wang, Yuan-Chen Guo, Ying-Tian Liu, Zi-Xin Zou, Biao Zhang, Weize Quan, Ding Liang, Yan-Pei Cao, Dong-Ming Yan2026-03-04
💻 computer science

InterCoG: Towards Spatially Precise Image Editing with Interleaved Chain-of-Grounding Reasoning

تقدم هذه الورقة البحثية InterCoG، وهو إطار عمل جديد لسلسلة استدلال "التأريض" المتداخلة بين النص والرؤية، والذي يعزز تحرير الصور دقيق التفاصيل في المشاهد المعقدة متعددة الكيانات من خلال استنتاج مواقع الأهداف صراحةً عبر الاستدلال المكاني القائم على النص قبل إجراء التأريض البصري وتحديد النتيجة، مدعوماً بمجموعة بيانات جديدة ووحدات تدريب مساعدة لضمان الدقة المكانية.

Yecong Wan, Fan Li, Chunwei Wang, Hao Wu, Mingwen Shao, Wangmeng Zuo2026-03-04
💻 computer science

CamDirector: Towards Long-Term Coherent Video Trajectory Editing

يُعد CamDirector إطار عمل مبتكر لتحرير مسارات الفيديو يحقق تماسكاً زمنياً طويل الأمد وتحكماً دقيقاً في الكاميرا من خلال الجمع بين مخطط تشويه هجين مع ذاكرة تخزين مؤقت للعالم ونموذج انتشار ذاتي التوجيه مستند إلى التاريخ، وقد تم التحقق من صحته بواسطة معيار جديد يسمى iPhone-PTZ.

Zhihao Shi, Kejia Yin, Weilin Wan, Yuhongze Zhou, Yuanhao Yu, Xinxin Zuo, Qiang Sun, Juwei Lu2026-03-04
🤖 AI

Social-JEPA: Emergent Geometric Isomorphism

تُثبت هذه الورقة أن الوكلاء المستقلين الذين تم تدريبهم باستخدام أهداف تعلم تنبؤية على وجهات نظر متميزة لنفس البيئة يطورون بشكل طبيعي فضاءات كامنة متماثلة هندسياً، مما يتيح نقل المعرفة بصفر محاولة (zero-shot) والتشغيل البيني الفعال دون مشاركة في المعلمات أو تنسيق.

Haoran Zhang, Youjin Wang, Yi Duan, Rong Fu, Dianyu Zhao, Sicheng Fan, Shuaishuai Cao, Wentao Guo, Xiao Zhou2026-03-04
💻 computer science

From Visual to Multimodal: Systematic Ablation of Encoders and Fusion Strategies in Animal Identification

تقدم هذه الدراسة إطار عمل متعدد الوسائط لتحديد هوية الحيوانات يستفيد من مجموعة بيانات ضخمة تضم 1.9 مليون صورة وأوصاف نصية اصطناعية لتحقيق دقة بنسبة 84.28% في معيار (Top-1)، مما يمثل تحسناً بنسبة 11% عن النماذج أحادية الوسيط من خلال التجريد المنهجي للمشفرات واستراتيجية دمج بوابي مثلى.

Vasiliy Kudryavtsev, Kirill Borodin, German Berezin, Kirill Bubenchikov, Grach Mkrtchian, Alexander Ryzhkov2026-03-04
🤖 AI

Beyond Prompt Degradation: Prototype-guided Dual-pool Prompting for Incremental Object Detection

تقترح هذه الورقة إطار عمل PDP، وهو إطار عمل جديد لفك الارتباط بين التلقين (prompt-decoupled) للكشف المتزايد عن الكائنات، والذي يستخدم نموذج تلقين ثنائي المجمعات لفصل المعرفة العامة للمهمة عن المعرفة الخاصة بالمهمة مع توظيف وحدة توليد تسميات مستعارة نموذجية للتخفيف من انحراف التلقين، محققاً بذلك أداءً هو الأفضل في فئته على معايير MS-COCO وPASCAL VOC.

Yaoteng Zhang, Zhou Qing, Junyu Gao, Qi Wang2026-03-04
⚡ electrical engineering

Loss Design and Architecture Selection for Long-Tailed Multi-Label Chest X-Ray Classification

تقدم هذه الورقة تقييماً منهجياً لدوال الخسارة، والبنى الهيكلية، واستراتيجيات ما بعد التدريب لتصنيف صور الأشعة السينية للصدر متعددة الملصقات ذات التوزيع طويل الذيل على معيار CXR-LT 2026، حيث أظهرت أن دمج LDAM-DRW مع هيكل ConvNeXt-Large وإعادة تدريب المصنف يحقق تصنيفاً ضمن أفضل 5 نتائج بمتوسط دقة (mAP) قدره 0.3950، مع تقديم رؤى عملية حول فجوة الأداء بين مرحلتي التطوير والاختبار.

Nikhileswara Rao Sulake2026-03-04
💻 computer science

HAMMER: Harnessing MLLM via Cross-Modal Integration for Intention-Driven 3D Affordance Grounding

يُعد HAMMER إطار عمل مبتكر يستفيد من النماذج اللغوية الكبيرة متعددة الوسائط لتحقيق تجذير الإمكانيات ثلاثية الأبعاد القائم على النوايا، وذلك عبر تجميع نوايا التفاعل في تضمينات مدركة للاتصال وتوظيف التكامل عبر الوسائط الهرمي مع رفع هندسي متعدد الحبيبات لتحديد المواقع ثلاثية الأبعاد بدقة.

Lei Yao, Yong Chen, Yuejiao Su, Yi Wang, Moyun Liu, Lap-Pui Chau2026-03-04