💻 computer science

LG-GER: Language-Guided Group Emotion Recognition via Multimodal Evidence Distillation

تقترح الورقة البحثية إطار عمل LG-GER، وهو إطار عمل موجه لغوياً يستفيد من نموذج لغوي كبير متعدد الوسائط لتوليد وتقطير أدلة عاطفية كثيفة ومترابطة مكانياً في عمود فقري واحد للرؤية واللغة، مما يتيح التعرف على العواطف الجماعية بكفاءة دون الحاجة إلى كاشف ويتفوق على الأساليب متعددة المسارات الحالية في مجموعات البيانات المرجعية.

Ahmed Shehab Khan, Zhiyuan Li, Yan Tong2026-08-26
💬 NLP

Continual Visual Learning under Evolving Semantic Concept Shift

يقدم هذا البحث إطار عمل SemReWrite، المصمم للتعامل مع التحولات المتطورة في المفاهيم الدلالية في النماذج البصرية التأسيسية من خلال التحديث الانتقائي لخرائط الربط بين المرئيات والدلالات التي أصبحت عتيقة مع الحفاظ على المعرفة الصالحة، وهو ما تم التحقق من صحته عبر معيار جديد (EvoShift-Bench) ومقاييس تقييم متخصصة.

Ismail Lamaakal, Chaymae Yahyati, Yassine Maleh, Khalid El Makkaoui, Ibrahim Ouahbi2026-08-26
💬 NLP

Wontopos Tablet 2: Measuring Multilingual and Multimodal Memory Retrieval Without Lexical Matching

تقدم هذه الورقة Wontopos Tablet 2، وهو محرك ذاكرة طويلة الأمد متعدد الوسائط وخالٍ من المعجم، يحقق أداءً عالياً في الاسترجاع عبر اللغات للنصوص والصور الخالية من التعليقات، بينما يثبت بشكل حاسم أن مقاييس التقييم القياسية غير مستقرة للغاية وأن نماذج الاسترجاع الكثيف الحالية تفشل في التعميم عبر اللغات.

Sunwoo Kim2026-08-26✓ Author reviewed
💻 computer science

ROI-Gated SAHI: Content-Adaptive Slicing-Based Inference for Efficient Object Detection

تقترح هذه الورقة إطار عمل ROI-Gated SAHI، وهو إطار استدلال تكيفي للمحتوى يستخدم مقترحاً خفيف الوزن لتقييد عملية الصقل القائمة على التقطيع في مناطق المقدمة، مما يظهر تسريعاً كبيراً في المشاهد المتفرقة مع تسليط الضوء على ضرورة سياسات التوجيه التكيفية للحفاظ على الأداء القوي والكفاءة عبر مختلف كثافات الصور.

Rashid Riyadh, Abd Ullah Khan, Imad Gohar, Muzammil Behzad2026-08-26
💻 computer science

GlanceWAM: Sparse Test-Time Imagination for World-Action Models

يعمل GlanceWAM على حل مقايضة زمن الاستجابة والنجاح في تعلم الروبوتات من خلال فصل التخيل البصري غير المتزامن والخلفي عن التحكم في الوقت الفعلي ضمن نموذج DiT فيديو واحد، محققاً أداءً هو الأفضل في فئته على معايير RoboCasa وLIBERO مع التنفيذ بسرعة تزيد بمقدار 24 مرة عن النماذج المرجعية المتزامنة.

Linhan Wang, Zijian An, Mingyuan Zhang, Chen Dai, Yi Xu, Can Cui, Zichong Yang, Yinlin Chen, Lifeng Zhou, Chang-Tien Lu2026-08-26
🤖 AI

RefineRank: Joint Box Refinement and Ranking for Surgical Spatio-Temporal Grounding

يقدم RefineRank وحدة تدريبية خفيفة الوزن تعمل على تنقيح إحداثيات المربعات المحيطة وترتيب المرشحين بشكل مشترك عبر دمج الميزات من نماذج الرؤية واللغة الطبية والنماذج الكشفية مفتوحة النطاق المجمدة، مما يحقق أداءً رائدًا في التوطين المكاني والزماني الجراحي دون إعادة تدريب النماذج الأساسية.

Linzhe Jiang, Jiayuan Huang, Changhao Zhang, Chunyang Jiang, Zhehua Mao, Mobarak I. Hoque2026-08-26
💻 computer science

Boot-and-Feedback Framework for Generalist-Expert Model Collaboration in Breast Ultrasound Diagnosis

تقترح الورقة البحثية إطار عمل "التمهيد والتغذية الراجعة" (BooF)، الذي يجمع بشكل تآزري بين النماذج اللغوية الكبيرة متعددة الوسائط ونماذج الخبراء البصرية من خلال مرحلة تمهيد موجهة بالمعجم ومرحلة دمج تغذية راجعة قائمة على الانتباه، وذلك لتحسين دقة التشخيص وقابلية التفسير لتحليل الموجات فوق الصوتية للثدي بشكل كبير مع الحد من الهلوسة.

Ming Cheng, Hongyu Sun, Zhaolin Chen, Jun Liu, Hossein Rahmani, Qiuhong Ke2026-08-26
🤖 AI

When Seeing Is Not Enough: Benchmarking Interactive Visual Grounding in LVLMs

تقدم هذه الورقة معياراً للتقييم في مجال التأسيس البصري التفاعلي في النماذج اللغوية البصرية الكبيرة (LVLMs)، كاشفةً أن النماذج الحالية تقصر بشكل كبير عن المعايير البشرية، وتواجه صعوبة في السعي الاستباقي وراء المعلومات عند عدم توفر وصف أولي، وتظهر ضعفاً في المعايرة بين الثقة والدقة.

Zhengxiang Wang, Owen Rambow2026-08-26
💻 computer science

Source-Face Authenticity Detection for 3D Gaussian Heads Reconstructed from a Single Portrait: A Benchmark and Dedicated Detector

تقدم هذه الورقة أول معيار مرجعي واسع النطاق وكاشفاً مبتكراً ذا مرحلتين يستفيد من الترميز التلقائي المقنع، والتعلم التبايني متعدد الرؤى، ودمج الرموز متعدد المستويات للتمييز بفعالية بين الوجوه المصدرية الحقيقية والمزيفة في رؤوس غاوس ثلاثية الأبعاد المعاد بناؤها من صور شخصية واحدة، مما يعالج تحدي ضعف آثار التزوير في الأساليب الحالية.

Yujie Gao, Zijian Yu, Yan Hong, Jun Lan, Jianfu Zhang2026-08-26
💻 computer science

Phase-Aligned Finite-Fourier Periodic Deformation for 4D Medical Image Interpolation

تقترح هذه الورقة طريقة مبتكرة لاستكمال الصور الطبية رباعية الأبعاد (4D) تتعلم عملية تشوه مستمرة باستخدام حقل سرعة مشروط بالطور مع أساس فوريه محدود وإعادة تمثيل زمني محاذٍ للطور لنمذجة الحركة الفسيولوجية القريبة من الدورية وغير المنتظمة بفعالية، محققةً أداءً هو الأفضل في فئته في توليد أحجام وسيطة معقولة تشريحياً من ملاحظات متفرقة.

Haojin Li, Hengzhuo Wang, Zhiheng Ma, Mingyang Ou, Heng Li, Jiang Liu2026-08-26