💻 computer science

Object-Centric Stereo Ranging for Autonomous Driving: From Dense Disparity to Census-Based Template Matching

تقدم هذه الورقة نظاماً للقياس الاستريو (stereo ranging) في الوقت الفعلي ومتيناً للقيادة الذاتية، يدمج التباين الكثيف (dense disparity)، والبديهيات أحادية العين (monocular priors)، وخوارزمية مطابقة القوالب القائمة على التعداد (Census-based template matching) المتمحورة حول الأجسام والمسرعة بواسطة وحدة معالجة الرسومات (GPU) مع تحسين المعايرة عبر الإنترنت، وذلك لتحقيق كشف دقيق للمركبات بعيدة المدى تحت ظروف القيادة المتنوعة.

Qihao Huang2026-04-10
💬 NLP

PASK: Toward Intent-Aware Proactive Agents with Long-Term Memory

تقدم هذه الورقة نظام PASK، وهو نظام وكيل استباقي يتميز بنموذج DD-MM-PAS ومعيار LatentsNeeds-Bench الجديد، والمصمم لاستنتاج احتياجات المستخدم الكامنة وتنفيذ تدخلات في الوقت المناسب في البيئات المعقدة والواقعية من خلال الاستفيادة من كشف النوايا المتدفق والذاكرة الهجينة طويلة الأمد.

Zhifei Xie, Zongzheng Hu, Fangda Ye, Xin Zhang, Haobo Chai, Zihang Liu, Pengcheng Wu, Guibin Zhang, Yue Liao, Xiaobin Hu (…)2026-04-10
💻 computer science

Adapting Foundation Models for Annotation-Efficient Adnexal Mass Segmentation in Cine Images

تقترح هذه الورقة إطار عمل لتقسيم الصور يتسم بكفاءة التسمية للكتل الملحقة في صور الموجات فوق الصوتية السينمائية، والذي يستفيد من عمود فقري من طراز DINOv3 مدرب مسبقاً مع فك تشفير من طراز DPT لتحقيق أداء رائد وكفاءة بيانات فائقة مقارنة بالنماذج التقليدية الخاضعة للإشراف الكامل.

Francesca Fati, Alberto Rota, Adriana V. Gregory, Anna Catozzo, Maria C. Giuliano, Mrinal Dhar, Luigi De Vitis, Annie T. (…)2026-04-10
💻 computer science

AtlasOCR: Building the First Open-Source Darija OCR Model with Vision Language Models

تقدم هذه الورقة AtlasOCR، وهو أول نموذج مفتوح المصدر للتعرف الضوئي على الحروف (OCR) للدارجة المغربية، والذي يحقق أداءً هو الأفضل في فئته من خلال ضبط نموذج لغوي بصري بـ 3 مليارات معلمة باستخدام مجموعة بيانات فريدة تجمع بين البيانات الاصطناعية والواقعية إلى جانب تقنيات تدريب فعالة.

Imane Momayiz, Soufiane Ait Elaouad, Abdeljalil Elmajjodi, Haitame Bouanane2026-04-10
🔬 physics

Tensor-Augmented Convolutional Neural Networks: Enhancing Expressivity with Generic Tensor Kernels

تقدم الورقة البحثية الشبكات العصبية التلافيفية المعززة بالموتّرات (TACNN)، وهي بنية ضحلة موجهة فيزيائياً تستبدل النوى التقليدية بموتّرات عامة لالتقاط الارتباطات الميزية عالية الرتبة، محققةً دقة تنافسية على مجموعة بيانات Fashion-MNIST بعدد طبقات أقل بكثير من الشبكات العصبية التلافيفية العميقة مثل VGG-16 وGoogLeNet.

Chia-Wei Hsing, Wei-Lin Tu2026-04-10
💬 NLP

Small Vision-Language Models are Smart Compressors for Long Video Understanding

تقترح الورقة البحثية Tempo، وهو إطار عمل مدرك للاستعلام يستفيد من نموذج رؤية-لغة صغير كضاغط زمني محلي وموجه تخصيص الرموز التكيفي لتقطير مقاطع الفيديو التي تبلغ مدتها ساعة واحدة بكفاءة إلى تمثيلات مدمجة ومتوافقة مع القصد، محققاً أداءً هو الأفضل في فئته على مقاييس فهم مقاطع الفيديو طويلة المدى مع العمل ضمن ميزانيات رموز صارمة.

Junjie Fei, Jun Chen, Zechun Liu, Yunyang Xiong, Chong Zhou, Wei Wen, Junlin Han, Mingchen Zhuge, Saksham Suri, Qi Qian (…)2026-04-10
💻 computer science

Uni-ViGU: Towards Unified Video Generation and Understanding via A Diffusion-Based Video Generator

يقترح Uni-ViGU إطار عمل يرتكز على التوليد يوحد بين توليد الفيديو وفهمه من خلال توسيع مولد فيديو قائم على الانتشار باستخدام طريقة مطابقة تدفق موحدة وآلية تدريب ثنائية الاتجاه، مما يتغلب بفعالية على عدم التوازن الحسابي بين هاتين المهمتين لتحقيق أداء تنافسي في كلا المجالين.

Luozheng Qin, Jia Gong, Qian Qiao, Tianjiao Li, Li Xu, Haoyu Pan, Chao Qu, Zhiyu Tan, Hao Li2026-04-10
💻 computer science

PolySLGen: Online Multimodal Speaking-Listening Reaction Generation in Polyadic Interaction

تقدم هذه الورقة بحثًا حول PolySLGen، وهو إطار عمل عبر الإنترنت يولد ردود فعل استماع وتحدث متعددة الوسائط ملائمة سياقيًا ومتماسكة زمنيًا للمشاركين المستهدفين في التفاعلات الجماعية متعددة الأطراف من خلال تجميع إشارات الحركة والإشارات الاجتماعية بفعالية من جميع أعضاء المجموعة.

Zhi-Yi Lin, Thomas Markhorst, Jouh Yeong Chew, Xucong Zhang2026-04-10
💻 computer science

Bag of Bags: Adaptive Visual Vocabularies for Genizah Join Image Retrieval

تقدم هذه الورقة طريقة "حقيبة الحقائب" (BoB)، وهي طريقة مفردات بصرية تكيفية تستبدل كتب الرموز العالمية بمفردات محلية خاصة بكل جزء لتحسين استرجاع قصاصات مخطوطات جنيزا القاهرة بشكل كبير، وذلك من خلال تحقيق زيادة نسبية قدرها 6.1% في دقة النتائج الأولى (top-1) مقارنة بالنماذج المرجعية المتطورة لأسلوب "حقيبة الكلمات".

Sharva Gogawale, Gal Grudka, Daria Vasyutinsky-Shapira, Omer Ventura, Berat Kurar-Barakat, Nachum Dershowitz2026-04-10
💻 computer science

On the Global Photometric Alignment for Low-Level Vision

تحدد هذه الورقة أن عدم الاتساق الضوئي في بيانات التدريب المزدوجة يسبب اعتلالات في التحسين في نماذج الرؤية منخفضة المستوى الخاضعة للإشراف، وتقترح فقدان محاذاة ضوئية (PAL) مبتكرًا يعالج هذه المشكلة عبر فصل التباينات الضوئية المزعجة عن المحتوى الهيكلي من خلال محاذاة لونية تآلفية ذات صيغة مغلقة، مما يحسن الأداء والتعميم عبر مختلف المهام والبنى الهيكلية.

Mingjia Li, Tianle Du, Hainuo Wang, Qiming Hu, Xiaojie Guo2026-04-10