🤖 AI

HiST-VLA: A Hierarchical Spatio-Temporal Vision-Language-Action Model for End-to-End Autonomous Driving

يُعد HiST-VLA نموذجاً هرمياً جديداً للرؤية واللغة والأفعال (Vision-Language-Action) يعتمد على البعد المكاني والزماني، وهو يعالج أوجه القصور في الإدراك المكاني ثلاثي الأبعاد والاستدلال العددي للقيادة الذاتية من خلال دمج الوعي الهندسي، والتناثر الديناميكي للرموز (dynamic token sparsification)، ومخطط يعتمد على المحولات الهرمية (hierarchical transformer-based planner) لتحقيق أداء رائد في اختبار NAVSIM v2.

Yiru Wang, Zichong Gu, Yu Gao, Anqing Jiang, Zhigang Sun, Shuo Wang, Yuwen Heng, Hao Sun2026-02-17
🤖 machine learning

Ask the Expert: Collaborative Inference for Vision Transformers with Near-Edge Accelerators

تقترح هذه الورقة إطار عمل للاستدلال التعاوني ينسق بين نموذج "رؤية محول" (Vision Transformer) خفيف الوزن عند الحافة مع نماذج خبراء متعددة قريبة من الحافة باستخدام آلية توجيه ديناميكية وتدريب تخصصي تدريجي، مما يحقق تحسينات كبيرة في الدقة وزمن الاستجابة وكفاءة الطاقة مقارنة بالتنفيذ المستقل عند الحافة أو في السحابة.

Hao Liu, Suhaib A. Fahmy2026-02-17
🧬 biology

CellMaster: Collaborative Cell Type Annotation in Single-Cell Analysis

يُعد CellMaster عميلًا يعمل بالذكاء الاصطناعي يستفيد من النماذج اللغوية الكبيرة لإجراء توصيف لأنواع الخلايا يتميز بالقابلية للتفسير وبدون تدريب مسبق في بيانات تسلسل الحمض النووي الريبي أحادي الخلية (single-cell RNA-seq)، محققًا دقة فائقة مقارنة بالأدوات الحالية — لا سيما للحالات الخلوية النادرة والمستحدثة — دون الحاجة إلى تدريب مسبق أو قواعد بيانات ثابتة للمؤشرات.

Zhen Wang, Yiming Gao, Jieyuan Liu, Enze Ma, Jefferson Chen, Mark Antkowiak, Mengzhou Hu, JungHo Kong, Dexter Pratt, Zhi (…)2026-02-17
🤖 AI

Visual Foresight for Robotic Stow: A Diffusion-Based World Model from Sparse Snapshots

تقدم هذه الورقة FOREST، وهو نموذج عالم قائم على الانتشار يتنبأ بتكوينات الحاويات المستقبلية من لقطات متباعدة وإجراءات التخزين المخطط لها، مما يظهر دقة هندسية فائقة مقارنة بالنماذج الاستدلالية ويوفر إشارات استشرافية قيمة لمهام تخطيط المستودعات اللاحقة.

Lijun Zhang, Nikhil Chacko, Petter Nilsson, Ruinian Xu, Shantanu Thakar, Bai Lou, Harpreet Sawhney, Zhebin Zhang, Mudit (…)2026-02-17
🤖 AI

Detecting Brick Kiln Infrastructure at Scale: Graph, Foundation, and Remote Sensing Models for Satellite Imagery Data

تتناول هذه الورقة تحدي مراقبة أفران الطوب واسعة النطاق في جنوب ووسط آسيا من خلال تنسيق مجموعة بيانات أقمار صناعية عالية الدقة واقتراح ClimateGraph، وهو نموذج قائم على الرسوم البياسية متكيف إقليمياً، مع مقارنته بنماذج خطوط معالجة الاستشعار عن بعد والنماذج التأسيسية لإثبات نقاط القوة المتكاملة لهذه النهج في اكتشاف البنية التحتية للأفران.

Usman Nazir, Xidong Chen, Hafiz Muhammad Abubakar, Hadia Abu Bakar, Raahim Arbaz, Fezan Rasool, Bin Chen, Sara Khalid2026-02-17
💬 NLP

Using Deep Learning to Generate Semantically Correct Hindi Captions

يقترح هذا البحث إطار عمل للتعلم العميق يجمع بين الشبكات العصبية التلافيفية سابقة التدريب (تحديداً VGG16)، وآليات الانتباه، وشبكات الذاكرة الطويلة قصيرة المدى ثنائية الاتجاه لتوليد أوصاف صور باللغة الهندية دقيقة دلالياً من مجموعة بيانات Flickr8k، محققاً أفضل أداء مع درجات BLEU-1 وBLEU-4 تبلغ 0.59 و0.19 على التوالي.

Wasim Akram Khan, Anil Kumar Vuppala2026-02-17
💻 computer science

The Diffusion Duet: Harmonizing Dual Channels with Wavelet Suppression for Image Separation

تقترح هذه الورقة نموذج فصل الانتشار ثنائي القنوات (DCDSM)، الذي يدمج نماذج الانتشار مع وحدة كبت موجية مبتكرة لتحقيق أحدث مستويات الفصل والترميم الأعمى للصور من خلال التعلم الفعال لتوزيعات المصادر وتعزيز فصل التفاصيل في سيناريوهات الخلط المعقدة والمشوشة وغير الخطية.

Jingwei Li, Wei Pu2026-02-17
⚡ electrical engineering

FUTON: Fourier Tensor Network for Implicit Neural Representations

تقدم الورقة البحثية FUTON، وهو تمثيل عصبي ضمني مبتكر ينمذج الإشارات باستخدام تفكيك تنسور منخفض الرتبة لدوال فوريه لتحقيق تدريب أسرع، وتقارب أفضل، وأداء متفوق في تمثيل الصور والمسائل العكسية مقارنة بالنهج المعتمد على الشبكات العصبية متعددة الطبقات (MLP) والأكثر تطوراً.

Pooya Ashtari, Pourya Behmandpoor, Nikos Deligiannis, Aleksandra Pizurica2026-02-17
🤖 AI

FlowHOI: Flow-based Semantics-Grounded Generation of Hand-Object Interactions for Dexterous Robot Manipulation

يُعد FlowHOI إطار عمل لمطابقة التدفق مكون من مرحلتين يولد تسلسلات تفاعل بين اليد والجسم متماسكة زمنياً ومرتكزة دلالياً من أجل عمليات التحكم الروبوتية الماهرة عبر فصل عملية الإمساك عن عملية التحكم، والاستفادة من إعادة بناء المشاهد باستخدام تقنية التقطيع الغاوسي ثلاثي الأبعاد (3D Gaussian splatting)، واستخدام نموذج مسبق واسع النطاق لتفاعلات اليد والجسم مستمد من فيديوهات المنظور الشخصي لتحقيق دقة فائقة، ونجاح في محاكاة الفيزياء، وسرعة استدلال تتفوق على النماذج المرجعية القائمة على الانتشار.

Huajian Zeng, Lingyun Chen, Jiaqi Yang, Yuantai Zhang, Fan Shi, Peidong Liu, Xingxing Zuo2026-02-17
💻 computer science

GLIMPSE : Real-Time Text Recognition and Contextual Understanding for VQA in Wearables

تقدم الورقة البحثية GLIMPSE، وهي بنية هجينة للأجهزة القابلة للارتداء تحل التوتر بين التعرف عالي الدقة على النصوص وكفاءة البطارية من خلال المعالجة الانتقائية للإطارات عالية الدقة لغرض التعرف الضوئي على الحروف (OCR) مع بث فيديو منخفض الدقة للسياق، محققةً دقة بنسبة 72% في مهام الأسئلة والأجوبة المرئية للنصوص (Text VQA) باستهلاك طاقة يقل عن نصف استهلاك البث كامل الدقة.

Akhil Ramachandran, Ankit Arun, Ashish Shenoy, Abhay Harpale, Srihari Jayakumar, Debojeet Chatterjee, Mohsen Moslehpour (…)2026-02-17