💻 computer science

SchröMind: Mitigating Hallucinations in Multimodal Large Language Models via Solving the Schrödinger Bridge Problem

يُعد SchrödMind إطار عمل مبتكر يقلل من الهلوسة في النماذج اللغوية الكبيرة متعددة الوسائط من خلال استخدام مسألة جسر شرودنجر لإنشاء رسم خرائط منخفض التكلفة على مستوى الرمز (token) بين التنشيطات الهلوسية والتنشيطات الحقيقية.

Ziqiang Shi, Rujie Liu, Shanshan Yu, Satoshi Munakata, Koichi Shirahata2026-02-11
💻 computer science

Scalpel: Fine-Grained Alignment of Attention Activation Manifolds via Mixture Gaussian Bridges to Mitigate Multimodal Hallucination

تُعد Scalpel طريقة استدلال غير مرتبطة بنموذج محدد تعمل على التخفيف من الهلوسة متعددة الوسائط في النماذج اللغوية البصرية الضخمة، وذلك باستخدام نماذج الخليط الغاوسي والنقل الأمثل الإنتروبي لمحاذاة متشعبات تنشيط الانتباه غير المتوافقة بدقة نحو مناطق بصرية أكثر مصداقية.

Ziqiang Shi, Rujie Liu, Shanshan Yu, Satoshi Munakata, Koichi Shirahata2026-02-11
📊 statistics

ECG-IMN: Interpretable Mesomorphic Neural Networks for 12-Lead Electrocardiogram Interpretation

تقترح الورقة البحثية ECG-IMN، وهي بنية شبكة عصبية قابلة للتفسير تستخدم شبكة فائقة (hypernetwork) لتوليد أوزان خطية خاصة بكل عينة، مما يوفر عزوات ميزات عالية الدقة وشفافة رياضياً لتصنيف تخطيط كهربائية القلب ذي الـ 12 مسرى دون الاعتماد على طرق التفسير البعدية غير المستقرة.

Vajira Thambawita, Jonas L. Isaksen, Jørgen K. Kanters, Hugo L. Hammer, Pål Halvorsen2026-02-11
🤖 AI

AnyTouch 2: General Optical Tactile Representation Learning For Dynamic Tactile Perception

لمعالجة نقص البيانات الزمنية الغنية في الاستشعار اللمسي، تقدم هذه الورقة **ToucHD**، وهي مجموعة بيانات هرمية واسعة النطاق، و **AnyTouch 2**، وهو إطار عمل لتعلم التمثيل العام يوحد بين الفهم على مستوى الكائن والإدراك الديناميكي الدقيق والمدرك للقوة عبر مستشعرات لمسية بصرية متنوعة.

Ruoxuan Feng, Yuxuan Zhou, Siyu Mei, Dongzhan Zhou, Pengwei Wang, Shaowei Cui, Bin Fang, Guocai Yao, Di Hu2026-02-11
💻 computer science

VideoAfford: Grounding 3D Affordance from Human-Object-Interaction Videos via Multimodal Large Language Model

تقدم الورقة البحثية **VideoAfford**، وهو إطار عمل يستفيد من النماذج اللغوية الكبيرة متعددة الوسائط ومجموعة بيانات جديدة ضخمة قائمة على الفيديو (**VIDA**) لتحقيق تحديد دقيق لخصائص الإمكانية ثلاثية الأبعاد (3D affordance) من خلال استخراج أولويات التفاعل الديناميكي من فيديوهات التفاعل بين الإنسان والأشياء.

Hanqing Wang, Mingyu Liu, Xiaoyu Chen, Chengwei MA, Yiming Zhong, Wenti Yin, Yuhao Liu, Zhiqing Cui, Jiahao Yuan, Lu Dai (…)2026-02-11
🤖 AI

GenSeg-R1: RL-Driven Vision-Language Grounding for Fine-Grained Referring Segmentation

يقدم GenSeg-R1 إطار عمل مفككاً يعتمد على مبدأ "التفكير ثم التجزئة"، والذي يستخدم تحسين السياسة النسبية للمجموعات (GRPO) لضبط نماذج الرؤية واللغة لتوليد مطالبات مكانية مهيكلة لنموذج SAM 2، محققاً أداءً هو الأفضل في فئته في مجال تجزئة الصور المرجعية دقيقة التفاصيل دون الحاجة إلى تعليقات توضيحية لسلسلة الاستدلال الخاضعة للإشراف.

Sandesh Hegde, Jaison Saji Chacko, Debarshi Banerjee, Uma Mahesh2026-02-11
🤖 AI

From Lightweight CNNs to SpikeNets: Benchmarking Accuracy-Energy Tradeoffs with Pruned Spiking SqueezeNet

تقدم هذه الورقة تقييماً معيارياً منهجياً للشبكات العصبية النبضية (SNNs) خفيفة الوزن والمُحوّلة من بنيات الشبكات العصبية الالتفافية (CNN) المدمجة، حيث تُظهر أن نسخةً مُقلمة من شبكة "SqueezeNet" (المسماة SNN-SqueezeNet-P) يمكنها تحقيق دقة تقارب دقة الشبكات العصبية الالتفافية مع تقليل استهلاك الطاقة بنسبة تزيد عن 88%.

Radib Bin Kabir, Tawsif Tashwar Dipto, Mehedi Ahamed, Sabbir Ahmed, Md Hasanul Kabir2026-02-11
🤖 machine learning

Self-Supervised Learning as Discrete Communication

تقترح هذه الورقة تأطير التعلم الخاضع للإشراف الذاتي كعملية اتصالات منفصلة حيث تتنبأ شبكة طالب برسائل ثنائية من معلم عبر قناة ذات سعة ثابتة، باستخدام تنظيم معدل الترميز وإعادة تهيئة دورية لرأس الإسقاط لتعلم تمثيلات بصرية مهيكلة ودلالية ومدمجة.

Kawtar Zaher, Ilyass Moummad, Olivier Buisson, Alexis Joly2026-02-11
💻 computer science

Where Do Images Come From? Analyzing Captions to Geographically Profile Datasets

تتقصى هذه الورقة البحثية التحيز الجغرافي في مجموعات البيانات متعددة الوسائط واسعة النطاق عبر استخدام النماذج اللغوية الكبيرة لربط أزواج الصور والتعليقات بالدول، مما يكشف أن بيانات التدريب منحازة بشدة نحو الدول ذات الناتج المحلي الإجمالي المرتفع والناطقة باللغة الإنجليزية وتفتقر إلى تمثيل كبير من دول الجنوب العالمي.

Abhipsa Basu, Yugam Bahl, Kirti Bhagat, Preethi Seshadri, R. Venkatesh Babu, Danish Pruthi2026-02-11
🤖 AI

Coupled Inference in Diffusion Models for Semantic Decomposition

تقترح هذه الورقة إطار عمل للتفكيك الدلالي يعامل المهمة كمسألة عكسية، باستخدام الاستدلال المقترن في نماذج الانتشار مع التوجيه القائم على إعادة البناء لتفكيك التمثيلات المقيدة إلى عواملها الكامنة المكونة لها.

Calvin Yeung, Ali Zakeri, Zhuowen Zou, Mohsen Imani2026-02-11