🤖 machine learning

Feature-Space Smoothing: Certified Robustness of Deep Representations

تقترح هذه الورقة البحثية تنعيم فضاء الميزات (FS)، وهو إطار عمل للمتانة المعتمدة يقوم بتحويل مشفرات الميزات إلى نسخ منعمّة ذات حدود تشابه جيب التمام مضمونة تحت تأثير الاضطرابات، معززة بـ "معزز التنعيم الغاوسي" (GSB) القابل للتركيب والتشغيل لتحسين المتانة في نماذج مثل النماذج اللغوية الكبيرة متعددة الوسائط (MLLMs) دون الحاجة إلى إعادة التدريب.

Song Xia, Meiwen Ding, Chenqi Kong, Wenhan Yang, Xudong Jiang2026-05-20
🤖 AI

FreeOrbit4D: Training-Free Arbitrary Camera Redirection for Monocular Videos via Foreground-Complete 4D Reconstruction

يُعد FreeOrbit4D إطار عمل لا يتطلب تدريباً يتيح إعادة توجيه الكاميرا التعسفية لمقاطع الفيديو أحادية العدسة من خلال إعادة بناء نموذج وسيط رباعي الأبعاد (4D) كامل عبر معالجة منفصلة للمقدمة والخلفية، مما يوفر دعامات هندسية تضمن نتائج دقيقة ومتسقة زمنياً حتى في ظل تغييرات زوايا الرؤية الكبيرة والصعبة.

Wei Cao, Hao Zhang, Fengrui Tian, Yulun Wu, Yingying Li, Shenlong Wang, Ning Yu, Yaoyao Liu2026-05-20
💻 computer science

Contextualized Visual Personalization in Vision-Language Models

تقدم هذه الورقة البحثية CoViP، وهو إطار عمل موحد يعالج تحدي التخصيص البصري السياقي في نماذج الرؤية واللغة من خلال صياغة المهمة، وتوظيف التعلم التعزيزي والتوليد المعزز بالتعليقات الوصفية لتحسين وصف الصور المخصص، وإثبات المكاسب الشاملة عبر مهام التخصيص اللاحقة مع التحقق من الاستخدام الحقيقي للسياق البصري من خلال تقييمات تشخيصية صارمة.

Yeongtak Oh, Sangwon Yu, Junsung Park, Han Cheol Moon, Jisoo Mok, Sungroh Yoon2026-05-20
🧬 biology

How does longer temporal context enhance multimodal narrative video processing in the brain?

تُظهر هذه الدراسة أن زيادة السياق الزمني لمقاطع الفيديو تعزز بشكل كبير من التوافق بين الدماغ والنماذج للنماذج اللغوية الكبيرة متعددة الوسائط (ولكن ليس لنماذج الفيديو أحادية الوسائط)، مما يكشف عن تطابق هرمي بين المقاييس الزمنية للتكامل العصبي الأطول في مناطق الدماغ العليا والطبقات العميقة للنماذج اللغوية الكبيرة متعددة الوسائط أثناء فهم السرد.

Prachi Jindal, Anant Khandelwal, Manish Gupta, Bapi S. Raju, Subba Reddy Oota, Tanmoy Chakraborty2026-05-20
💻 computer science

Toward Fine-Grained Speech Inpainting Forensics:A Dataset, Method, and Metric for Multi-Region Tampering Localization

تعالج هذه الورقة الفجوة الحرجة في كشف عملية استكمال الكلام (speech inpainting) متعدد المناطق من خلال تقديم مجموعة بيانات MIST، وإطار عمل ISA لتحديد التلاعب التكراري، ومقياس SF1@tau، مما يثبت أن الكواشف الحالية تفشل في مواجهة التلاعبات الجزئية بينما تنجح الطريقة المقترحة في تحديد عدد غير معروف من الأجزاء المتلاعب بها بفعالية.

Tung Vu, Yen Nguyen, Hai Nguyen, Cuong Pham, Cong Tran2026-05-20
💻 computer science

CAB: Accelerating Flow and Diffusion Sampling via Rectification and Corrected Adams-Bashforth

تقدم الورقة البحثية CAB (آدامز-باشفورث المصحح)، وهو أداة أخذ عينات خالية من التدريب تعمل على تسريع نماذج التدفق والانتشار عبر تحويل ديناميكيات أخذ العينات إلى نظام إحداثي مستقيم وتطبيق متنبئ متعدد الخطوات مع حد تصحيحي، مما يحسن بشكل كبير مقايضة الجودة والكفاءة في أنظمة الخطوات المنخفضة دون الحاجة إلى تقييمات إضافية للدالة.

Anuska Roy, Pravin Nair2026-05-20
⚡ electrical engineering

SpecX: A Large-Scale Benchmark for Multi-Modal Spectroscopy and Cross-Paradigm Evaluation

تقدم هذه الورقة البحثية SpecX، وهو معيار مرجعي واسع النطاق ومتعدد الوسائط يضم 1.7 مليون جزيء عبر أنماط طيفية متنوعة، صُمم لتمكين التقييم عبر النماذج للنماذج الطيفية المتخصصة والنماذج اللغوية متعددة الوسائط مع تسليط الضوء على الحاجة إلى نماذج تأسيسية أصلية للطيف.

Chengrui Xiang, Tengfei Ma, Yujie Chen, Tong Wang, Haowen Chen, Xiangxiang Zeng2026-05-20
🤖 machine learning

Spectral Gradient Surgery for Domain-Generalizable Dataset Distillation

تقدم هذه الورقة البحثية "جراحة التدرج الطيفي" (Spectral Gradient Surgery - SGS)، وهي طريقة مبتكرة لتقطير مجموعات البيانات القابلة للتعميم عبر المجالات (DGDD)، تعمل على فك الارتباط بين المعلومات المميزة للفئات والمعلومات الخاصة بكل مجال في مجموعات البيانات الاصطناعية من خلال الاستفادة من التحليل الطيفي للتدرجات الخاصة بكل مجال، مما يحسن بشكل كبير من القدرة على التعميم خارج نطاق التوزيع.

Minyoung Oh, Najeong Chae, Jae-Young Sim2026-05-20
🤖 machine learning

INAR-VL: Input-Aware Routing for Edge-Cloud Vision-Language Inference

يُعد INAR-VL نظام توجيه خفيف الوزن بين الحافة والسحابة، يقوم بالاختيار ديناميكيًا بين نماذج الرؤية واللغة المحلية وتلك القائمة على السحابة بناءً على تعقيد المدخلات، مما يحقق انخفاضًا كبيرًا في زمن الاستجابة واستهلاك الطاقة مع الحفاظ على دقة تقارب دقة النماذج السحابية.

Ahmed Šabanović, Paul Joe Maliakel, Ivona Brandić2026-05-20
🤖 machine learning

Delta Attention Residuals

تقترح هذه الورقة "بقايا دلتا الانتباه" (Delta Attention Residuals)، وهي بنية مبتكرة تستبدل الحالات الخفية التراكمية بتمثيلات دلتا لكل طبقة في اتصالات البقايا القائمة على الانتباه لمنع انهيار التوجيه وتحقيق تحسينات كبيرة في الحيرة (perplexity) عبر مختلف أحجام النماذج.

Cheng Luo, Zefan Cai, Junjie Hu2026-05-20