💻 computer science

DRIFT: Transferring Reasoning Priors for Efficient MLLM Fine-Tuning

تقترح الورقة البحثية طريقة DRIFT، وهي طريقة ضبط دقيق خفيفة الوزن تنقل قدرات الاستنتاج من النماذج اللغوية الكبيرة النصية فقط إلى النماذج متعددة الوسائط بكفاءة عبر حقن سابق استنتاجي محسوب مسبقاً في فضاء التدرج، مما يتغلب على عدم استقرار الدمج البارامتري الساذج مع تحقيق أداء متفوق بتكاليف حوسبة أقل بكثير.

Chao Huang, Zeliang Zhang, Jiang Liu, Ximeng Sun, Jialian Wu, Xiaodong Yu, Ze Wang, Chenliang Xu, Emad Barsoum, Zicheng (…)2026-04-28
🤖 machine learning

MERIT: Modular Framework for Multimodal Misinformation Detection with Web-Grounded Reasoning

يُعد MERIT إطار عمل معياري عند وقت الاستدلال يعمل على تحسين الكشف عن المعلومات المضللة متعددة الوسائط من خلال تفكيك عملية التحقق إلى وحدات متخصصة — وهي الجنائيات البصرية، والمحاذاة عبر الوسائط، والتحقق من الادعاءات المعزز بالاسترجاع، والحكم المعاير — متفوقاً بذلك على النماذج المرجعية الحالية للتعلم الصفري في اختبار MMFakeBench.

Mir Nafis Sharear Shopnil, Sharad Duwal, Abhishek Tyagi, Adiba Mahbub Proma2026-04-28
💻 computer science

AV-Master: Dual-Path Comprehensive Perception Makes Better Audio-Visual Question Answering

تقترح الورقة البحثية AV-Master، وهو إطار عمل جديد للإجابة على الأسئلة السمعية البصرية، يعزز قدرات الاستنتاج في المشاهد المعقدة من خلال توظيف آلية أخذ عينات تركيز تكيفية ديناميكية للارتباط الزمني، واستراتيجية مدركة للتفضيل لاختيار الوسائط، وفقدان تباين ثنائي المسار لتعلم التمثيلات عبر الوسائط الخاصة بالأسئلة، مما يؤدي إلى تفوقه بشكل كبير على الأساليب الحالية في المقاييس المرجعية واسعة النطاق.

Jiayu Zhang, Shuo Ye, Qilang Ye, Xun Lin, Zihan Song, Zitong Yu2026-04-28
💻 computer science

POUR: A Provably Optimal Method for Unlearning Representations via Neural Collapse

تقدم هذه الورقة البحثية طريقة POUR، وهي طريقة إسقاط هندسي مثالية بشكل مثبت لتعلم الآلة غير المكتمل (machine unlearning) تعمل على إزالة مفاهيم بصرية محددة على مستوى التمثيل من خلال الاستفادة من نظرية الانهيار العصبي (Neural Collapse) لتحقيق التوازن بين فعالية النسيان، ودقة الاحتفاظ، والتمايز بين الفئات، متفوقة بذلك على الأساليب الحالية الرائدة.

Anjie Le, Can Peng, Yuyuan Liu, J. Alison Noble2026-04-28
🤖 machine learning

Designing Instance-Level Sampling Schedules via REINFORCE with James-Stein Shrinkage

تقترح هذه الورقة طريقة ما بعد التدريب غير مرتبطة بنموذج محدد تعمل على تحسين توليد النص إلى صورة من خلال تعلم جداول أخذ عينات خاصة بكل حالة عبر سياسة ديريكليه (Dirichlet) يتم تحسينها بواسطة خط أساس مكافأة جديد يعتمد على انكماش جيمس-شتاين (James-Stein shrinkage).

Peiyu Yu, Suraj Kothawade, Sirui Xie, Ying Nian Wu, Hongliang Fei2026-04-28
💻 computer science

Voxify3D: Pixel Art Meets Volumetric Rendering

يعتبر Voxify3D إطار عمل تفاضلياً ثنائي المراحل يعمل على أتمتة توليد فن الفوكسل (voxel art) من المشبكات ثلاثية الأبعاد عبر دمج الإشراف البكسلي المتعامد، والمحاذاة القائمة على الرقع لنموذج CLIP، والكمية المعتمدة على Gumbel-Softmax المقيدة بلوحة ألوان لتحقيق التجريد الهندسي، والحفاظ الدلالي، والتماسك اللوني المنفصل.

Yi-Chuan Huang, Jiewen Chan, Hao-Jen Chien, Yu-Lun Liu2026-04-28
💻 computer science

Visual Funnel: Resolving Contextual Blindness in Multimodal Large Language Models

تقترح الورقة البحثية "Visual Funnel"، وهي طريقة من خطوتين لا تتطلب تدريباً، تعالج مشكلة "العمى السياقي" في النماذج اللغوية الكبيرة متعددة الوسائط من خلال البناء الديناميكي لمحفظة مدرجة بمقياس الإنتروبيا من محاصيل الصور الهرمية للحفاظ على التنوع الهيكلي بين التفاصيل دقيقة الحبيبات والسياق العالمي.

Woojun Jung, Jaehoon Go, Mingyu Jeon, Sunjae Yoon, Junyeong Kim2026-04-28
⚡ electrical engineering

A Graph-Augmented knowledge Distillation based Dual-Stream Vision Transformer with Region-Aware Attention for Gastrointestinal Disease Classification with Explainable AI

تقترح هذه الورقة إطار عمل هجين لتقطير المعرفة ثنائي المسار يستفيد من نموذج Swin-ViT عالي السعة لتدريب نموذج Tiny-ViT مدمج، مما يحقق تصنيفاً دقيقاً للغاية وفعالاً وقابلاً للتفسير سريرياً لأمراض الجهاز الهضمي من خلال الانتباه المدرك للمناطق وتقنيات الذكاء الاصطناي القابل للتفسير.

Md Assaduzzaman, Nushrat Jahan Oyshi, Eram Mahamud2026-04-28
💻 computer science

B-FIRE: Binning-Free Diffusion Implicit Neural Representation for Hyper-Accelerated Motion-Resolved MRI

تقدم الورقة البحثية B-FIRE، وهو إطار عمل للتمثيل العصبي الضمني الخالي من التقسيد (binning-free) يستفيد من مشفر وفك تشفير بنمط شبكة عصبية تلافيفية (CNN-INR) مُدرب على مراجع مقسمة حركياً، لإعادة بناء تشريح بطني ثلاثي الأبعاد فوري عالي الدقة من بيانات فضاء k غير الكارتيزية ناقصة العينات بشكل شديد، متفوقاً بشكل كبير على الأساليب الحالية في التصوير بالرنين المغناطيسي الحجمي الديناميكي.

Di Xu, Hengjie Liu, Yang Yang, Mary Feng, Jin Ning, Xin Miao, Jessica E. Scholey, Alexandra E. Hotca-cho, William C. Che (…)2026-04-28
🤖 machine learning

OTI: A Model-free and Visually Interpretable Measure of Image Attackability

تقترح هذه الورقة "كثافة نسيج الكائن" (OTI)، وهو مقياس جديد، وخالٍ من النماذج، وقابل للتفسير بصرياً، يقيس مدى هشاشة الصور من خلال قياس كثافة نسيج الكائنات الدلالية، متجاوزاً بذلك حدود الطرق الحالية المعتمدة على الوسائط غير القابلة للتفسير.

Jiaming Liang, Haowei Liu, Chi-Man Pun2026-04-28