🔬 optics

A Lensless Polarization Camera

تقترح هذه الورقة كاميرا استقطاب عديمة العدسة، مدمجة وذات لقطة واحدة، تستخدم مشتتاً وقناع استقطاب مخططاً بالاقتران مع خوارزمية إعادة بناء متخصصة لاستعادة أربع صور استقطاب خطي، مما يوفر بديلاً خفيف الوزن ومنخفض التكلفة للأنظمة التقليدية القائمة على تعدد الإرسال.

Noa Kraicer, Shay Elmalem, Erez Yosef, Hani Barhum, Raja Giryes2026-03-19
💻 computer science

GazeOnce360: Fisheye-Based 360{\deg} Multi-Person Gaze Estimation with Global-Local Feature Fusion

تقدم هذه الورقة البحثية نموذج GazeOnce360، وهو نموذج مبتكر يعمل من البداية إلى النهاية لتقدير اتجاهات نظرة العين ثلاثية الأبعاد لعدة أشخاص من كاميرا عين السمكة واحدة موجهة للأعلى، مدعوماً بمجموعة بيانات MPSGaze360 الاصطناعية الجديدة وببنية ثنائية الدقة تدمج السياق العالمي مع ميزات العين المحلية للتعامل مع تشوه عين السمكة الشديد.

Zhuojiang Cai, Zhenghui Sun, Feng Lu2026-03-19
💻 computer science

Generalist Multimodal LLMs Gain Biometric Expertise via Human Salience

تُثبت هذه الورقة أن النماذج اللغوية الكبيرة متعددة الوسائط ذات الأغراض العامة، عندما يتم تعزيزها بمطالبات بروز الخبراء البشريين ونشرها في ظل قيود خصوصية صارمة، يمكنها اكتشاف هجمات عرض قزحية العين بفعالية، متفوقةً بذلك على نماذج الشبكات العصبية التلافيفية المتخصصة والممتحنين البشريين دون الحاجة إلى نقل البيانات البيومترية الحساسة إلى السحب العامة.

Jacob Piland, Byron Dowling, Christopher Sweet, Adam Czajka2026-03-19
💻 computer science

Visual Product Search Benchmark

تقدم هذه الورقة معياراً هيكلياً لتقييم نماذج التضمين البصري مفتوحة المصدر، والخاصة متعددة الوسائط، والمتخصصة في مجالات محددة، وذلك لاسترجاع المنتجات على مستوى الحالة في السياق الصناعي، باستخدام مجموعة متنوعة من البيانات المنسقة لتقييم الأداء تحت قيود واقعية دون معالجة لاحقة.

Karthik Sulthanpete Govindappa2026-03-19
💻 computer science

Adaptive Anchor Policies for Efficient 4D Gaussian Streaming

تقترح هذه الورقة إطار عمل "التدفق الغاوسي الفعال" (EGS)، وهو إطار تعلّم تعزيزي قابل للتركيب يعمل على تحسين اختيار المرتكزات والميزانية لتدفق الغاوس رباعي الأبعاد ديناميكيًا، محققًا توازنات فائقة بين الجودة والكفاءة مقارنة بطرق أخذ العينات الثابتة مثل "أخذ عينات النقطة الأبعد".

Ashim Dahal, Rabab Abdelfattah, Nick Rahimi2026-03-19
🤖 machine learning

From Drop-off to Recovery: A Mechanistic Analysis of Segmentation in MLLMs

تقدم هذه الورقة تحليلاً آلياً لتقسيم النماذج اللغوية الكبيرة متعددة الوسائط (MLLM) من خلال الكشف عن أنه بينما تؤدي المهايئات (adapters) في البداية إلى تدهور التمثيلات المكانية، فإن طبقات النماذج اللغوية الكبيرة اللاحقة تعمل تدريجياً على استعادة دقة التقسيم من خلال الصقل بوساطة الانتباه والتفاعلات الثنائية للرموز (tokens).

Boyong Wu, Sanghwan Kim, Zeynep Akata2026-03-19
🤖 AI

Directing the Narrative: A Finetuning Method for Controlling Coherence and Style in Story Generation

تقترح هذه الورقة إطار عمل مكوناً من مرحلتين يجمع بين انتباه المجموعات المشتركة (GSA) لضمان الاتساق الجوهري للشخصيات، وتحسين التفضيل المباشر (DPO) لمواءمة الأسلوب، محققةً أداءً هو الأفضل في حالته في مجال تصور القصص من خلال تحسين هوية الشخصيات وتماسك الأسلوب بشكل كبير في معيار ViStoryBench.

Jianzhang Zhang, Yijing Tian, Jiwang Qu, Chuang Liu2026-03-19
🤖 AI

Symphony: A Cognitively-Inspired Multi-Agent System for Long-Video Understanding

تعد Symphony نظاماً متعدد الوكلاء مستوحىً معرفياً يعمل على تعزيز فهم الفيديوهات الطويلة من خلال تفكيك المهام إلى مهام فرعية دقيقة، وتوظيف التعاون القائم على التفكير العميق والتأمل، واستخدام التأسيس القائم على نماذج الرؤية واللغة الكبيرة (VLM) لتحقيق أداء رائد في المعايير المرجعية الرئيسية.

Haiyang Yan, Hongyun Zhou, Peng Xu, Xiaoxue Feng, Mengyi Liu2026-03-19
🤖 AI

Recurrent Reasoning with Vision-Language Models for Estimating Long-Horizon Embodied Task Progress

تقترح الورقة البحثية R2VLM\text{R}^2\text{VLM}، وهو إطار عمل استدلالي تكراري يعالج مقتطفات الفيديو المحلية بشكل متكرر مع الحفاظ على سلسلة أفكار متطورة لتقدير تقدم مهام التجسيد طويلة المدى بكفاءة ودقة، محققاً أداءً هو الأفضل في فئته دون التكلفة الحسابية لمعالجة مسارات الفيديو الكاملة.

Yuelin Zhang, Sijie Cheng, Chen Li, Zongzhao Li, Yuxin Huang, Yang Liu, Wenbing Huang2026-03-19
💻 computer science

MedSAD-CLIP: Supervised CLIP with Token-Patch Cross-Attention for Medical Anomaly Detection and Segmentation

يُعد MedSAD-CLIP تكييفاً خاضعاً للإشراف لنموذج CLIP من أجل كشف الشذوذ والتقطيع في المجال الطبي، حيث يستخدم آلية الانتباه المتقاطع بين الرموز والرقع (Token-Patch Cross-Attention)، والمهايئات خفيفة الوزن، وفقدان التباين القائم على الهامش (margin-based contrastive loss) لتحقيق أداء فائق في التحديد والتصنيف عبر مجموعات بيانات طبية متنوعة مع الحفاظ على قدرات التعميم الخاصة بالنموذج.

Thuy Truong Tran, Minh Kha Do, Phuc Nguyen Duy, Min Hun Lee2026-03-19