🤖 machine learning

Can VLMs Reason Robustly? A Neuro-Symbolic Investigation

تُثبت هذه الورقة أنه بينما تفشل نماذج الرؤية واللغة القياسية في التعميم تحت تأثير انزياح المتغيرات المصاحبة في مهام الاستنتاج البصري الاستنباطي، يحقق منهج VLC المقترح أداءً قويًا من خلال فصل الإدراك عن الاستنتاج عبر إطار عمل عصبي-رمزي يجمع بين التعرف على المفاهيم القائم على نماذج الرؤية واللغة وبين التنفيذ الرمزي الدقيق للدوائر المنطقية.

Weixin Chen, Antonio Vergari, Han Zhao2026-03-26
💻 computer science

Uncertainty-Aware Vision-based Risk Object Identification via Conformal Risk Tube Prediction

تقدم هذه الورقة "تنبؤ أنبوب المخاطر المطابق" (Conformal Risk Tube Prediction)، وهو إطار عمل موحد يعالج أوجه القصور في النهج الحتمية في تحديد الأجسام الخطرة القائمة على الرؤية من خلال نمذجة عدم اليقين المكاني والزماني لتوفير ضمانات التغطية ودرجات مخاطر معايرة، والتي تم التحقق من صحتها من خلال مجموعة بيانات ومقاييس جديدة لسيناريوهات القيادة المعقدة ومتعددة المخاطر.

Kai-Yu Fu, Yi-Ting Chen2026-03-26
💻 computer science

Revealing Multi-View Hallucination in Large Vision-Language Models

تقدم هذه الورقة مفهوم الهلوسة متعددة الرؤى في النماذج اللغوية البصرية الكبيرة، وتقدم معيار MVH-Bench لتقييم هذه المسألة، وتقترح تقنية فك تشفير خالية من التدريب تسمى فك التشفير التبايني لإزاحة المرجع (RSCD) والتي تحسن أداء النموذج بشكل كبير عن طريق كبح التداخل البصري من وجهات النظر أو النماذج المختلفة.

Wooje Park, Insu Lee, Soohyun Kim, Jaeyun Jang, Minyoung Noh, Kyuhong Shim, Byonghyo Shim2026-03-26
💻 computer science

High-Fidelity Face Content Recovery via Tamper-Resilient Versatile Watermarking

تقدم هذه الورقة VeriFi، وهو إطار عمل للعلامات المائية متعدد الاستخدامات يحقق في آن واحد استعادة عالية الدقة لمحتوى الوجه، وتحديد التلاعب على مستوى البكسل، وحماية قوية لحقوق الطبع والنشر، وذلك عبر تضمين علامات مائية دلالية كامنة مدمجة واستخدام محاكي هجمات الذكاء الاصطنا-توليدي (AIGC) للتغلب على المقايضات بين الدقة والوظائف التي واجهتها الأساليب السابقة.

Peipeng Yu, Jinfeng Xie, Chengfu Ou, Xiaoyu Zhou, Jianwei Fei, Yunshu Dai, Zhihua Xia, Chip Hong Chang2026-03-26
💻 computer science

PointRFT: Explicit Reinforcement Fine-tuning for Point Cloud Few-shot Learning

تقدم هذه الورقة البحثية PointRFT، وهو أول نموذج للضبط الدقيق بالتعزيز لتعلم السحب النقطية من حالات قليلة العينات، والذي يستفيد من دوال مكافأة متخصصة للتفوق على الضبط الدقيق الخاضع للإشراف وتحقيق أداء رائد في سيناريوهات ندرة البيانات.

Yankai Wang, Yiding Sun, Qirui Wang, Pengbo Li, Chaoyi Lu, Dongxu Zhang2026-03-26
💻 computer science

Leave No Stone Unturned: Uncovering Holistic Audio-Visual Intrinsic Coherence for Deepfake Detection

تقدم هذه الورقة البحثية HAVIC، وهو كاشف للتزييف العميق يستفيد من التماسك الجوهري السمعي البصري الشامل المتعلم من مقاطع الفيديو الأصلية لتحقيق تعميم وأداء فائقين على مجموعة بيانات جديدة عالية الدقة (HiFi-AVDF)، متفوقاً بشكل كبير على الأساليب الحالية الرائدة في سيناريوهات عبر مجموعات البيانات.

Jielun Peng, Yabin Wang, Yaqi Li, Long Kong, Xiaopeng Hong2026-03-26
🤖 machine learning

GRMLR: Knowledge-Enhanced Small-Data Learning for Deep-Sea Cold Seep Stage Inference

تقترح هذه الورقة إطار عمل GRMLR، وهو إطار تصنيف معزز معرفيًا يستفيد من رسم بياني للمعرفة البيئية لتقييد نموذج الانحدار اللوجستي متعدد الحدود، مما يتيح استدلالًا قويًا لمراحل المنافسات الباردة في أعماق البحار من مجموعات بيانات ميكروبية صغيرة للغاية دون الحاجة إلى ملاحظات الكائنات الكبيرة أثناء التنبؤ.

Chenxu Zhou, Zelin Liu, Rui Cai, Houlin Gong, Yikang Yu, Jia Zeng, Yanru Pei, Liang Zhang, Weishu Zhao, Xiaofeng Gao2026-03-26
💻 computer science

SLAT-Phys: Fast Material Property Field Prediction from Structured 3D Latents

تُعد SLAT-Phys طريقة متكاملة تتنبأ بسرعة بحقول خصائص المواد المتغيرة مكانياً (معامل يونغ، والكثافة، ونسبة بواسون) للأصول ثلاثية الأبعاد مباشرة من صورة واحدة RGB عبر الاستفيد من الميزات الكامنة ثلاثية الأبعاد سابقة التدريب، محققةً تسريعاً بمقدار 120 ضعفاً مقارنة بالأساليب السابقة مع الحفاظ على دقة تنافسية.

Rocktim Jyoti Das, Dinesh Manocha2026-03-26
💻 computer science

CAKE: Real-time Action Detection via Motion Distillation and Background-aware Contrastive Learning

تقدم الورقة البحثية CAKE، وهو إطار عمل للكشف عن الأفعال عبر الإنترنت في الوقت الفعلي، والذي يحقق أداءً رائدًا بكفاءة عالية باستخدام مُكيِّف حركة ديناميكي وتعلم تبايني عائم لتقطير ملامح الحركة الشبيهة بالتدفق البصري في نماذج RGB دون حساب التدفق بشكل صريح.

Hieu Hoang, Dung Trung Tran, Hong Nguyen, Nam-Phong Nguyen2026-03-26
💻 computer science

HAM: A Training-Free Style Transfer Approach via Heterogeneous Attention Modulation for Diffusion Models

تقترح هذه الورقة طريقة HAM، وهي طريقة لنقل الأسلوب دون الحاجة إلى تدريب لنماذج الانتشار، تستخدم تعديل الانتباه غير المتجانس (تحديداً تنظيم الانتباه العالمي ونقل الانتباه المحلي) وتهيئ ضجيج الأسلوب لتحقيق توازن فعال بين نقل الأسلوب المعقد والحفاظ على هوية المحتوى دون الحاجة إلى تدريب إضافي.

Yeqi He, Liang Li, Zhiwen Yang, Xichun Sheng, Zhidong Zhao, Chenggang Yan2026-03-26