🤖 machine learning

Performance Analysis of Edge and In-Sensor AI Processors: A Comparative Review

تستعرض هذه الورقة مشهد معالجات الذكاء الاصطناعي عند الحافة وفي المستشعر ذات الطاقة فائقة الانخفاض، وتجري اختباراً معيارياً تجريبياً لنموذج تقسيم على منصات GAP9 وSTM32N6 وSony IMX500 لتوضيح أنه في حين توفر المعالجة داخل المستشعر أداءً متفوقاً من حيث الطاقة والتأخير، فإن البنيات المختلفة توفر مقايضات متميزة بين زمن الاستجابة وكفاءة الطاقة وميزانيات القدرة.

Luigi Capogrosso, Pietro Bonazzi, Michele Magno2026-03-11
💻 computer science

Granulon: Awakening Pixel-Level Visual Encoders with Adaptive Multi-Granularity Semantics for MLLM

إن Granulon هو نموذج لغوي كبير متعدد الوسائط ومبتكر يستفيد من مشفر بصري قائم على DINOv3 معزز بمتحكم في الدقة مشروط بالنص وتجميع رموز تكيفي لتوحيد الإدراك على مستوى البكسل مع الدلالات خشنة الحبيبات ديناميكيًا، مما يحسن الدقة بشكل كبير ويقلل من الهلوسة مقارنة بالنهج الحالية.

Junyuan Mao, Qiankun Li, Linghao Meng, Zhicheng He, Xinliang Zhou, Kun Wang, Yang Liu, Yueming Jin2026-03-11
💻 computer science

Where, What, Why: Toward Explainable 3D-GS Watermarking

تقدم هذه الورقة إطار عمل أصيلاً في التمثيل لعلامات مائية لتقنية الـ 3D Gaussian Splatting قابلة للتفسير، يستخدم وحدة "Trio-Experts" وبوابة "Safety and Budget Aware" لتحسين اختيار الحامل والتعويض البصري، محققةً متانة ودقة فائقتين مع توفير رؤى قابلة للتدقيق في عملية وضع العلامة المائية.

Mingshu Cai, Jiajun Li, Osamu Yoshie, Yuya Ieiri, Yixuan Li2026-03-11
💻 computer science

Computer Vision-Based Vehicle Allotment System using Perspective Mapping

تقترح هذه الورقة نظام مواقف ذكية يعتمد على الرؤية الحاسوبية وفعال من حيث التكلفة، يستخدم خوارزمية YOLOv8 للكشف عن المركبات ورسم خرائط المنظور العكسي لدمج مشاهد الكاميرات المتعددة في بيئة ثلاثية الأبعاد محاكية لتوجيه المستخدمين إلى المواقف الشاغرة.

Prachi Nandi, Sonakshi Satapathy, Suchismita Chinara2026-03-11
💻 computer science

HECTOR: Hybrid Editable Compositional Object References for Video Generation

يُعد HECTOR خط إنتاج مبتكر لتوليد الفيديو يتيح تحكماً تركيبياً دقيقاً من خلال دعم التكييف المرجعي الهجين من الصور الثابتة ومقاطع الفيديو الديناميكية، مع السماح للمستخدمين بتحديد مسارات ومواقع وأحجام وسرعات الأجسام الفردية بشكل صريح لتخليق مقاطع فيديو متماسكة وعالية الدقة.

Guofeng Zhang, Angtian Wang, Jacob Zhiyuan Fang, Liming Jiang, Haotian Yang, Alan Yuille, Chongyang Ma2026-03-11
🔬 physics

Multi-Kernel Gated Decoder Adapters for Robust Multi-Task Thyroid Ultrasound under Cross-Center Shift

تقترح هذه الورقة البحثية "المُهايئات ذات النوى المتعددة المبوّبة" (MKGA) ومتغيرها المتبقي (ResMKGA) لمعالجة التدهور غير المتماثل في الميزات تحت تأثير انزياح النطاق عبر المراكز في تصوير الغدة الدرقية بالموجات فوق الصوتية، وذلك من خلال الاستفادة من نقاط القوة المتكاملة للشبكات العصبية الالتفافية (CNNs) والمحولات الرؤيوية (ViTs) لتعزيز متانة التجزئة ودقة تشخيص الخباثة.

Maziar Sabouri, Nourhan Bayasi, Arman Rahmim2026-03-11
💻 computer science

MEGC2026: Micro-Expression Grand Challenge on Visual Question Answering

تقدم تحدي MEGC 2026 مهمتين جديدتين، هما الإجابة على الأسئلة حول فيديوهات التعبيرات الدقيقة (ME-VQA) والإجابة على الأسئلة حول فيديوهات التعبيرات الدقيقة طويلة المدى (ME-LVQA)، وذلك للنهوض بتحليل التعبيرات الوجهية الدقيقة من خلال الاستفادة من قدرات الاستدلال متعددة الوسائط لنماذج الرؤية واللغة الكبيرة على كل من تتابعات الفيديو قصيرة وطويلة المدة.

Xinqi Fan, Jingting Li, John See, Moi Hoon Yap, Su-Jing Wang, Adrian K. Davison2026-03-11
🤖 AI

BiCLIP: Domain Canonicalization via Structured Geometric Transformation

تقدم الورقة البحثية BiCLIP، وهو إطار عمل بسيط وفعال من حيث عدد المعلمات، يحقق أداءً هو الأفضل في فئته في مجال التكيف مع النطاقات ببيانات قليلة لنماذج الرؤية واللغة، وذلك عبر تطبيق تحويل هندسي مهيكل لمحاذاة الميزات متعددة الوسائط عبر نطاقات متباينة باستخدام مجموعة صغيرة من عينات المرتكز.

Pranav Mantini, Shishir K. Shah2026-03-11
⚡ electrical engineering

Can You Hear, Localize, and Segment Continually? An Exemplar-Free Continual Learning Benchmark for Audio-Visual Segmentation

يقدم هذا البحث أول معيار للتعلم المستمر الخالي من الأمثلة لتقسيم الصوت والمرئيات (AVS)، ويقترح نموذج ATLAS المرجعي، الذي يستخدم التكييف المسبق الموجه صوتياً والترسيخ منخفض الرتبة للتخفيف بفعالية من النسيان الكارثي في البيئات الديناميكية والمتطورة.

Siddeshwar Raghavan, Gautham Vinod, Bruce Coburn, Fengqing Zhu2026-03-11
💻 computer science

SurgCalib: Gaussian Splatting-Based Hand-Eye Calibration for Robot-Assisted Minimally Invasive Surgery

تقدم هذه الورقة SurgCalib، وهو إطار عمل يعتمد على تقنية Gaussian Splatting وبدون استخدام علامات مرجعية، يحقق معايرة دقيقة للعين واليد لروبوت "دا فينشي" الجراحي من خلال تحسين التقديرات الكينماتيكية عبر مسار رندرة (rendering) قابل للتفاضل، مما يتغلب بذلك على عدم الدقة الناتج عن نظام الحركة بالكابلات ويتجنب مشكلات التعقيم المرتبطة بالعلامات المرجعية التقليدية.

Zijian Wu, Shuojue Yang, Yu Chung Lee, Eitan Prisman, Yueming Jin, Septimiu E. Salcudean2026-03-11