💻 computer science

StreamMeCo: Long-Term Agent Memory Compression for Efficient Streaming Video Understanding

تُعد StreamMeCo إطار عمل فعال لفهم الفيديو المتدفق، حيث يقلل من عبء الذاكرة ويحسن سرعة الاسترجاع من خلال توظيف أخذ عينات الحد الأدنى والأقصى الخالي من الحواف وتقليم الأوزان المدرك للحواف لضغط رسوم الذاكرة البيانية، مع استخدام آلية استرجاع تعتمد على التحلل الزمني للحفاظ على الدقة أو حتى تعزيزها.

Junxi Wang, Te Sun, Jiayi Zhu, Junxian Li, Haowen Xu, Zichen Wen, Xuming Hu, Zhiyu Li, Linfeng Zhang2026-04-13
💻 computer science

BlendFusion -- Scalable Synthetic Data Generation for Diffusion Model Training

تُعد BlendFusion إطار عمل مفتوح المصدر وقابل للتوسع، يقوم بتوليد مجموعات بيانات صور وتسميات توضيحية اصطناعية عالية الجودة من مشاهد ثلاثية الأبعاد باستخدام تتبع المسار ووضع الكاميرا المتمحور حول الأشياء للتخفيف من حدة اضطراب التهام النموذج (MAD) في تدريب نماذج الانتشار.

Thejas Venkatesh, Suguna Varshini Velury2026-04-13
🤖 AI

Leave My Images Alone: Preventing Multi-Modal Large Language Models from Analyzing Images via Visual Prompt Injection

تقدم هذه الورقة "ImageProtector"، وهي طريقة من جانب المستخدم تقوم بتضمين اضطرابات بصرية غير مرئية تقريبًا في الصور لاستحثاث استجابات الرفض في النماذج اللغوية الكبيرة متعددة الوسائط، مما يمنع بفعالية الاستخراج غير المصرح به للمعلومات الحساسة مع إظهار المتانة ضد الإجراءات المضادة الشائعة.

Zedian Shao, Hongbin Liu, Yuepeng Hu, Neil Zhenqiang Gong2026-04-13
💻 computer science

NTIRE 2026 The 3rd Restore Any Image Model (RAIM) Challenge: Multi-Exposure Image Fusion in Dynamic Scenes (Track 2)

تقدم هذه الورقة تحدي NTIRE 2026 الثالث لنموذج استعادة أي صورة (RAIM)، والذي وضع معياراً لدمج الصور متعددة التعريض في المشاهد الديناميكية لمعالجة عيوب مثل التخيل (ghosting) وعدم المحاذاة، مما جذب 114 فريقاً و987 مشاركة لتعزيز قدرات تصوير المدى الديناميكي العالي (HDR).

Lishen Qu, Yao Liu, Jie Liang, Hui Zeng, Wen Dai, Guanyi Qin, Ya-nan Guan, Shihao Zhou, Jufeng Yang, Lei Zhang, Radu Tim (…)2026-04-13
💬 NLP

SiMing-Bench: Evaluating Procedural Correctness from Continuous Interactions in Clinical Skill Videos

تقدم الورقة البحثية SiMing-Bench، وهو أول معيار لتقييم قدرة النماذج اللغوية الكبيرة متعددة الوسائط على الحكم على الصحة الإجرائية من خلال تتبع كيفية تحديث التفاعلات المستمرة لحالات المهارات السريرية، مما يكشف أن النماذج الحالية تعاني بشكل كبير من هذا التقييم الدقيق القائم على المعايير رغم ظهورها بمظهر الكفاءة في التقييمات العالمية العامة.

Xiyang Huang, Jiawei Lin, Keying Wu, Jiaxin Huang, Kailai Yang, Renxiong Wei, Cheng zeng, Jiayi Xiang, Ziyan Kuang, Min (…)2026-04-13
💻 computer science

Scene-Agnostic Object-Centric Representation Learning for 3D Gaussian Splatting

تقترح هذه الورقة إطار عمل لتعلم تمثيل مركزي للأجسام وغير مرتبط بالمشهد لتقنية "Gaussian Splatting" ثلاثية الأبعاد، يستخدم وحدة تعلم مركزية للأجسام عالمية مدربة مسبقاً وكتاب رموز (codebook) للأجسام غير مرتبط بالمشهد لتمكين تحديد الأجسام وتقسيمها بشكل غير مُشرف ومتسق عبر المشاهد والزوايا المختلفة دون الحاجة إلى ضبط دقيق لكل مشهد أو محاذاة معقدة للأقنعة.

Tsuheng Hsu, Guiyu Liu, Juho Kannala, Janne Heikkilä2026-04-13
🤖 AI

Frequency-Enhanced Diffusion Models: Curriculum-Guided Semantic Alignment for Zero-Shot Skeleton Action Recognition

تقترح هذه الورقة نموذج الانتشار الواعي بالتردد لمطابقة الهياكل العظمية والنصوص (FDSM)، وهو إطار عمل مبتكر يدمج وحدات المتبقي الطيفي، وفقدان الطيف التكيفي، والتجريد الدلالي القائم على المنهج الدراسي للتغلب على الانحياز الطيفي لنماذج الانتشار وتحقيق أداء رائد في التعرف على حركات الهيكل العظمي بنمط الصفر (zero-shot).

Yuxi Zhou, Zhengbo Zhang, Jingyu Pan, Zhiyu Lin, Zhigang Tu2026-04-13
💻 computer science

Cross-Modal Knowledge Distillation from Spatial Transcriptomics to Histology

تقترح هذه الورقة إطار عمل لتقطير المعرفة عبر الوسائط ينقل هياكل البيئات النسيجية الغنية المستمدة من النسخ المكاني إلى النماذج التي تعتمد على الهيستولوجيا فقط، مما يتيح التحديد الدقيق للمناطق النسيجية ذات المعنى البيولوجي باستخدام صور صبغة الهيماتوكسيلين والإيوسين (H&E) الوفيرة دون الحاجة إلى بيانات النسخ الجيني عند الاستنتاج.

Arbel Hizmi, Artemii Bakulin, Shai Bagon, Nir Yosef2026-04-13
💻 computer science

Physically Grounded 3D Generative Reconstruction under Hand Occlusion using Proprioception and Multi-Contact Touch

تقترح هذه الورقة إطار عمل توليدي ثلاثي الأبعاد متعدد الوسائط ومرتكز على الفيزياء، يستفيد من الحس العميق وإشارات اللمس متعددة الاتصال لتحقيق إعادة بناء موضوعي للأجسام وتقدير وضعيتها بمقياس متري في ظل وجود حجب يدوي شديد، متفوقة بشكل كبير على النماذج المرجعية التي تعتمد على الرؤية فقط من خلال تقليل الغموض وضمان الاتساق الفيزيائي عبر أهداف قائمة على الفيزياء وتوجيه فك التشفير القابل للتفاضل.

Gabriele Mario Caddeo, Pasquale Marra, Lorenzo Natale2026-04-13
🤖 AI

CLIP-Inspector: Model-Level Backdoor Detection for Prompt-Tuned CLIP via OOD Trigger Inversion

يُعد CLIP-Inspector إطار عمل للكشف عن الأبواب الخلفية على مستوى النموذج لنموذج CLIP المضبط عبر التوليف الدقيق للمطالبات، والذي يستخدم عكس المحفزات خارج نطاق التوزيع لتحديد السلوكيات الخبيثة في بيئات تعلم الآلة كخدمة (MLaaS) شبه النزيهة، ومن ثم إصلاح النماذج المخترقة.

Akshit Jindal, Saket Anand, Chetan Arora, Vikram Goyal2026-04-13