🤖 machine learning

SpargeAttention2: Trainable Sparse Attention via Hybrid Top-k+Top-p Masking and Distillation Fine-Tuning

تقترح الورقة البحثية SpargeAttention2، وهي طريقة انتباه متناثرة قابلة للتدريب لنماذج الانتشار تجمع بين قاعدة قناع هجينة (Top-k+Top-p) وهدف ضبط دقيق مستوحى من التقطير لتحقيق تشتت بنسبة 95% وتسريع بمقدار 16.2 ضعفًا مع الحفاظ على جودة التوليد.

Jintao Zhang, Kai Jiang, Chendong Xiang, Weiqi Feng, Yuezhou Hu, Haocheng Xi, Jianfei Chen, Jun Zhu2026-02-17
⚡ electrical engineering

Frequency-Enhanced Hilbert Scanning Mamba for Short-Term Arctic Sea Ice Concentration Prediction

تقترح هذه الورقة إطار عمل "مامبا" للمسح الهيلبرتي المعزز بالتردد (FH-Mamba)، والذي يدمج آلية مسح هيلبرتي ثلاثية الأبعاد، وتحويلات المويجات، ووحدة انتباه "شافل" الهجينة لمعالجة تحديات الارتباط الزمني وتفاصيل الحدود بفعالية، مما يحقق تنبؤاً فائقاً لتركيز الجليد البحري في القطب الشمالي على المدى القصير مقارنة بالنماذج المرجعية المتطورة.

Feng Gao, Zheng Gong, Wenli Liu, Yanhai Gan, Zhuoran Zheng, Junyu Dong, Qian Du2026-02-17
💻 computer science

Nighttime Autonomous Driving Scene Reconstruction with Physically-Based Gaussian Splatting

تقترح هذه الورقة نهجاً جديداً لتقنية "Gaussian Splatting" ثلاثية الأبعاد القائمة على الفيزياء، والذي يدمج الإضاءة العالمية ونمذجة الانعكاسات متباينة الخواص لتعزيز جودة إعادة بناء مشاهد القيادة الذاتية الليلية بشكل كبير مع الحفاظ على قدرات التصيير في الوقت الفعلي.

Tae-Kyeong Kim, Xingxin Chen, Guile Wu, Chengjie Huang, Dongfeng Bai, Bingbing Liu2026-02-17
🤖 AI

Privacy-Concealing Cooperative Perception for BEV Scene Segmentation

تقترح هذه الورقة إطار عمل للتعاون الكامن عن الخصوصية (PCC) لتقسيم المشهد الدلالي من منظور عين الطائر، والذي يستخدم التعلم التنافسي لمنع إعادة بناء الصور المرئية من الميزات المشتركة بفعالية مع الحفاظ على أداء تقسيم عالٍ في أنظمة القيادة الذاتية التعاونية.

Song Wang, Lingling Li, Marcus Santos, Guanghui Wang2026-02-17
💻 computer science

A generalizable foundation model for intraoperative understanding across surgical procedures

تقدم الورقة البحثية نموذج ZEN، وهو نموذج تأسيسي قابل للتعميم تم تدريبه على أكثر من 4 ملايين إطار من 21 إجراءً جراحياً عبر تقنية التقطير ذاتي الإشراف متعددة المعلمين، والذي يتفوق باستمرار على النماذج الحالية عبر مهام متنوعة لاحقة ويُظهر تعميماً قوياً عبر الإجراءات المختلفة للفهم أثناء العمليات الجراحية.

Kanggil Park, Yongjun Jeon, Soyoung Lim, Seonmin Park, Jongmin Shin, Jung Yong Kim, Sehyeon An, Jinsoo Rhu, Jongman Kim (…)2026-02-17
💻 computer science

DCDM: Divide-and-Conquer Diffusion Models for Consistency-Preserving Video Generation

تقترح هذه الورقة البحثية إطار عمل DCDM، وهو إطار انتشار قائم على مبدأ "فرق تسد" يعزز اتساق توليد الفيديو من خلال دمج التحليل الدلالي المدفوع بالنماذج اللغوية الكبيرة لضمان التماسك داخل المقطع الواحد، وتمثيلات كاميرا زمنية في فضاء الضجيج للتحكم بين المقاطع، ونموذج توليد مشاهد شامل مع انتباه متفرق لضمان الاستمرارية السردية بين اللقطات.

Haoyu Zhao, Yuang Zhang, Junqi Cheng, Jiaxi Gu, Zenghui Lu, Peng Shu, Zuxuan Wu, Yu-Gang Jiang2026-02-17
💬 NLP

Building Autonomous GUI Navigation via Agentic-Q Estimation and Step-Wise Policy Optimization

تقدم هذه الورقة إطار عمل جديداً متمحوراً حول نماذج اللغات الكبيرة متعددة الوسائط (MLLM) لوكلاء واجهة المستخدم الرسومية (GUI) المستقلين، يجمع بين تقدير (agentic-Q) وتحسين السياسة خطوة بخطوة لتمكين جمع البيانات ذاتي التوليد بكفاءة وتعزيز التعلم المستقر، مما سمح لنموذج Ovis2.5-9B بالتفوق على المنافسين الأكبر حجماً في اختبارات الملاحة والتمركز.

Yibo Wang, Guangda Huzhang, Yuwei Hu, Yu Xia, Shiyin Lu, Qing-Guo Chen, Zhao Xu, Weihua Luo, Kaifu Zhang, Lijun Zhang2026-02-17
🤖 AI

An Ensemble Learning Approach towards Waste Segmentation in Cluttered Environment

تقترح هذه الورقة نهجاً للتعلم التجميعي (EL-4) يجمع بين نموذجي U-Net وFPN لتحسين دقة تقسيم النفايات بشكل كبير في البيئات المزدحمة، محققاً تقاطعاً بين الاتحاد (IoU) بنسبة 0.8306 لتعزيز كفاءة إعادة التدوير الآلي.

Maimoona Jafar, Syed Imran Ali, Ahsan Saadat, Muhammad Bilal, Shah Khalid2026-02-17
💻 computer science

Symmetry-Aware Fusion of Vision and Tactile Sensing via Bilateral Force Priors for Robotic Manipulation

تقترح هذه الورقة نموذج "ترانسفورمر" متعدد الوسائط (Cross-Modal Transformer) معززاً بتنظيم قوة ثنائي الاتجاه مستند إلى الفيزياء لدمج الاستشعار البصري واللمسي بفعالية، محققةً نسبة نجاح تبلغ 96.59% في مهام الإدخال الروبوتية، وهو ما يتجاوز طرق الدمج البدائية ويقترب من أداء المستشعرات ذات الامتيازات.

Wonju Lee, Matteo Grimaldi, Tao Yu2026-02-17
🤖 machine learning

Fine-tuned Vision Language Model for Localization of Parasitic Eggs in Microscopic Images

تقدم هذه الورقة نموذجاً لغوياً بصرياً مضبوطاً بدقة يتفوق على طرق اكتشاف الأشياء التقليدية في تحديد مواقع بيوض الطفيليات في الصور المجهرية، مما يوفر حلاً قابلاً للتوسع ودقيقاً للتشخيص الآلي للديدان المنقولة بالتربة.

Chan Hao Sien, Hezerul Abdul Karim, Nouar AlDahoul2026-02-17