💻 computer science

SteeringDiffusion: A Bottlenecked Activation Control Interface for Diffusion Models

تقدم هذه الورقة البحثية SteeringDiffusion، وهي واجهة تحكم ذات هيكل خلفي مجمد وفعالة في المعلمات، تتعلم رمزاً كامناً مشروطاً بالوصف (prompt) لتمكين مقايضات سلسة، رتيبة، وقابلة للتعديل أثناء وقت التشغيل بين المحتوى والأسلوب في نماذج الانتشار، متفوقة بذلك على الأساليب الحالية مثل LoRA في القدرة على التحكم والاستقرار.

Fangzheng Wu, Brian Summa2026-05-05
💻 computer science

Act2See: Emergent Active Visual Perception for Video Reasoning

تقدم الورقة البحثية إطار العمل Act2See، وهو إطار عمل مبتكر يعزز الاستدلال بالفيديو في نماذج الرؤية واللغة من خلال تمكينها من التداخل النشط بين استرجاع الإطارات الديناميكي والتركيب ضمن عمليات "سلسلة الأفكار" الخاصة بها، مما يحقق أداءً رائدًا في عدة معايير قياسية.

Martin Q. Ma, Yuxiao Qu, Aditya Agrawal, Willis Guo, Paul Pu Liang, Ruslan Salakhutdinov, Louis-Philippe Morency2026-05-05
💻 computer science

Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models

تقدم الورقة البحثية الإدراك النشط للفيديو (VAP)، وهي طريقة لا تتطلب تدريباً تستفيد من نظرية الإدراك النشط ونموذج توليد فيديو خفيف الوزن مشروط بالنص لاختيار الإطارات الرئيسية ديناميكياً، مما يحسن بشكل كبير من كفاءة وقدرات الاستنتاج للنماذج اللغوية البصرية الكبيرة في الإجابة على الأسئلة المتعلقة بالفيديوهات طويلة المدى دون الحاجة إلى تدريب إضافي.

Martin Q. Ma, Willis Guo, Aditya Agrawal, Ankit Gupta, Paul Pu Liang, Ruslan Salakhutdinov, Louis-Philippe Morency2026-05-05
💻 computer science

Deep neural networks with Fisher vector encoding for medical image classification

تقترح هذه الورقة دمج ترميز متجه فيشر (Fisher Vector) مع بنيات هجينة تجمع بين الشبكات العصبية الالتفافية (CNN) والمحولات البصرية (ViT) لتعزيز تصنيف الصور الطبية عبر أحجام مجموعات بيانات متفاوتة، ومعالجة القيود الحسابية من خلال طريقة قابلة للتوسع لتقدير نماذج الخليط الغاوسي (GMM)، مع تحقيق نتائج رائدة أو تنافسية في عدة اختبارات مرجعية.

Lucas O. Lyra, Antonio E. Fabris, Joao B. Florindo2026-05-05
💻 computer science

TrajRAG: Retrieving Geometric-Semantic Experience for Zero-Shot Object Navigation

يُعد TrajRAG إطار عمل للجيل المعزز بالاسترجاع يعمل على تحسين الملاحة نحو هدف كائن (Object Goal Navigation) بنمط الصفر من الشرح (zero-shot) من خلال تجميع واسترجاع تجارب هندسية-دلالية مهيكلة من الحلقات الماضية لتوجيه استدلال النماذج الكبيرة لاختيار نقاط المسار.

Yiyao Wang, Sixian Zhang, Keming Zhang, Xinhang Song, Songjie Du, Shuqiang Jiang2026-05-05
💻 computer science

Exploring Entropy-based Active Learning for Fair Brain Segmentation

تقدم هذه الورقة إطار عمل للتعلم النشط المراعي للعدالة باستخدام استراتيجية اختيار الإنتروبيا الموزونة لتقليل التفاوتات في الأداء بشكل كبير في تقسيم الصور الطبية من خلال إعطاء الأولوية للمجموعات الفرعية ذات الأداء الضعيف، محققةً خفضاً يصل إلى 86% في مقاييس التفاوت مقارنة بالطرق القياسية.

Ghazal Danaee, Mélanie Gaillochet, Christian Desrosiers, Herve Lombaert, Sylvain Bouix2026-05-05
💻 computer science

Multi-Scale Gaussian-Language Map for Zero-shot Embodied Navigation and Reasoning

تقترح الورقة البحثية GLMap، وهي خريطة غاوسية-لغوية متعددة المقاييس تدمج الهندسة الصريحة مع أوصاف دلالية متعددة المقاييس عبر واجهة ثنائية الأنماط ومُقدِّر غاوسي فعال لتمكين الملاحة والاستدلال المتجسد بصفر من التدريب دون الحاجة إلى تدريب إضافي على إسقاط الميزات.

Sixian Zhang, Yiyao Wang, Xinhang Song, Keming Zhang, Zijian Xu, Shuqiang Jiang2026-05-05
💻 computer science

PointCSP: Cross-Sample Semantic Propagation and Stability Preservation in Self-Supervised Point Cloud Learning

تقترح الورقة البحثية PointCSP، وهو إطار عمل لتعلم السحب النقطية ذاتي الإشراف يستخدم الانتشار الدلالي عبر العينات عبر نماذج فضاء الحالة والتقطير غير المتماثل للحفاظ على الدلالات للتغلب على قيود استقلالية العينات، مما يحقق محاذاة دلالية عالمية فائقة ومتانة عبر المشاهد ثلاثية الأبعاد المتنوعة.

Xinxing Yu, Ajian Liu, Sunyuan Qiang, Hui Ma, Liying Yang, Yuzhong Wang, Zhi Rao, Yanyan Liang2026-05-05
💻 computer science

TrajShield: Trajectory-Level Safety Mediation for Defending Text-to-Video Models Against Jailbreak Attacks

تُعد TrajShield إطار عمل دفاعي لا يتطلب تدريباً ويعمل أثناء وقت الاستدلال، يهدف إلى التخفيف من هجمات كسر الحماية والمخاطر الناشئة زمنياً في نماذج تحويل النص إلى فيديو عبر محاكاة مسارات المطالبات لتحديد المحتوى غير الآمن سببياً وإعادة كتابته بشكل أدنى مع الحفاظ على الدقة الدلالية.

Quanchen Zou, Nizhang Li, Wenxin Zhang, Jiaye Lin, Yangchen Zeng, Xiangzheng Zhang, Zonghao Ying2026-05-05
⚡ electrical engineering

Mitigating Multimodal LLMs Hallucinations via Relevance Propagation at Inference Time

تقترح هذه الورقة إطار عمل LIME، وهو إطار عمل للاستدلال في وقت التشغيل لا يتطلب تدريباً، يعمل على التخفيف من الهلوسة في النماذج اللغوية الكبيرة متعددة الوسائط عن طريق استخدام انتشار الصلة على مستوى الطبقات لضبط تمثيلات المفتاح والقيمة ديناميكياً وفرض اعتماد أكبر على المدخلات الإدراكية بدلاً من الأولويات النصية.

Itai Allouche, Joseph Keshet2026-05-05