🤖 machine learning

Fixed-Point Masked Generative Modeling

تقدم هذه الورقة البحثية CoFRe، وهو إطار عمل للنماذج التوليدية المقنعة ذات النقطة الثابتة يستفيد من فقد الاتساق عبر الخطوات واستراتيجية إعادة الاستخدام ثلاثية الحالات لتمكين إزالة الضجيج ذات العمق التكيفي، مما يقلل بشكل كبير من تكاليف التدريب واستهلاك الذاكرة مع تحسين جودة التوليد في ظل ميزانيات أخذ عينات منخفضة عبر وسائط النصوص والصور.

Andrea Miele, Yiming Qin, Alba Carballo-Castro, Justin Deschenaux, Pascal Frossard2026-06-01
💻 computer science

BadBone: Backdoor Attacks Against Backbone Models in Visual Prompt Learning

تقدم هذه الورقة البحثية BadBone، وهو هجوم "باب خلفي" مبتكر يستهدف النماذج الأساسية (backbone models) عبر تحسين ثنائي المستوى لإصابة المهام اللاحقة التي تستخدم تعلم التلقين (prompt learning) بشكل خفي، مع إثبات أن الدفاعات الحالية المتطورة غير فعالة إلى حد كبير ضد هذا التهديد.

Ziqing Yang, Rui Wen, Xinlei He, Yun Shen, Michael Backes, Yang Zhang2026-06-01
🤖 AI

ERGeoBench:A Comprehensive Benchmark for Embodied Reasoning and Geo-localization in Multimodal Large Language Models

تقدم هذه الورقة ERGeoBench، وهو معيار تشخيصي شامل يتكون من 2,207 صورة بانورامية عالمية لمشاهد الشوارع، يقيم نماذج اللغات الكبيرة متعددة الوسائط عبر إعدادات تجسيدية تدريجية للكشف عن قيودها الحالية في الإدراك دقيق التفاصيل والتحديد الجغرافي المتري، مع تسليط الضوء على الترابط القوي بين التحديد المكاني وقدرات الاستدلال المكاني الأوسع.

Kaiwen Xue, Tao Wei, Guoxin Zhang, Zhonghong Ou, Kaoyan Lu, Yu Feng, Yifan Zhu, Haoran Luo2026-06-01
💬 NLP

Learning from Fine-Grained Visual Discrepancies: Mitigating Multimodal Hallucinations via In-Context Visual Contrastive Optimization

تقترح هذه الورقة البحثية "التحسين التبايني البصري داخل السياق" (IC-VCO)، وهو إطار عمل دقيق رياضياً معزز بالتقطير التبايني البصري وتوليد العينات السلبية الصعبة بدقة، للحد بفعالية من الهلوسة متعددة الوسائط في نماذج الرؤية واللغة عبر معالجة أوجه القصور في أساليب التفضيل البصري الحالية.

Haolin Deng, Xin Zou, Zhiwei Jin, Chen Chen, Haonan Lu, Xuming Hu2026-06-01
💬 NLP

FBHM: Functional Benchmarking and Steering of VLMs for Hateful Meme Detection

تقدم هذه الورقة البحثية FBHM، وهو معيار مرجعي جديد يكشف أن نماذج الرؤية واللغة المتطورة تفشل في التعميم على كشف الميمات التي تنطوي على خطاب كراهية بسبب الاعتماد على الاستدلالات الخاصة بمجموعات البيانات، وتقترح LSV، وهي طريقة متجه توجيه منخفضة البيانات تعمل على تحسين الأداء بشكل كبير من خلال تطبيق التدخلات السببية.

Paramananda Bhaskar, Naquee Rizwan, Daksh Jogchand, Saurabh Kumar Pandey, Animesh Mukherjee2026-06-01
🤖 machine learning

A Unifying View of Variational Generative Wasserstein Flows

تقدم هذه الورقة تدفقات واسرستاين التوليدية (GWF)، وهي إطار نظري موحد قائم على تدفقات تدرج واسرستاين ومخططات JKO المعلمية، والذي لا يكتفي باشتقاق وربط النماذج التوليدية الحالية فحسب، بل يمتد أيضاً ليشمل أهدافاً جديدة مثل مقاييس الاحتمال التكاملية وتباين "ماكسيموم" المربع لتقديم خوارزميات مبتكرة.

Paul Caucheteux, Clément Bonet, Anna Korba2026-06-01
💻 computer science

LiftNav: Path Planning via Semantic Lifting in TSDF-Guided Gaussian Splatting

يُعد LiftNav إطار عمل هجين للملاحة يدمج بين تقنية Gaussian Splatting الموجهة بـ TSDF مع الرفع الدلالي في الوقت الفعلي وتحسين B-spline لتمكين تخطيط مسار آمن ومدرك للأجسام في البيئات الداخلية غير المعروفة، متفوقاً على النماذج المرجعية لمجالات الإشعاع بمعدل جدوى يصل إلى 100% ومسارات أقصر.

Hannah Schieber, Dominik Frischmann, Victor Schaack, Angela P. Schoellig, Daniel Roth2026-06-01
⚡ electrical engineering

Self-Tuning Regularization for Image Scanning Microscopy

تقدم هذه الورقة إطار عمل للتنظيم الصريح ذاتي الضبط لإعادة بناء مجهر المسح الصوري، والذي يجمع بين مطابقة بيانات بواسون متعددة الإطارات واختيار المعلمات التكيفي لتحقيق دقة فائقة واستقطاع بصري مستقر وخالٍ من العيوب دون الاعتماد على قواعد توقف تجريبية.

Sofia Agostoni, Lisa Cuneo, Christian Daniele, Giacomo Garré, Laurent Le, Alessandro Zunino, Giuseppe Vicidomini, Luca C (…)2026-06-01
💻 computer science

YARD: Y-Architecture Register Decoding for Efficient Hallucination Mitigation in Large Vision-Language Models

يُعد YARD إطار عمل لا يتطلب تدريباً يعمل على الحد من الهلوسة في النماذج اللغوية البصرية الكبيرة عبر توظيف بنية على شكل حرف Y لمشاركة الحسابات الضحلة والتفرع عند الطبقات المتوسطة، حيث يستبدل الرموز البصرية دقيقة التفاصيل برموز سجل (register tokens) لتوليد إشارة تباينية فعالة دون التسبب في تأخير ناتج عن تمريرة أمامية ثانية.

Ting Chen, Geng Li, Guohao Chen, Yu Hu, Guan Huang, Mai Chen, Langsheng Lei, Jun Du2026-06-01
💻 computer science

VolFill: Single-View Amodal 3D Scene Reconstruction with Volumetric Flow Matching

يُعد VolFill إطار عمل توليدي يستفيد من مشفر تلقائي متباين (VAE) ثلاثي الأبعاد هجين ومحول انتشار كامن لإعادة بناء هندسات مشاهد ثلاثية الأبعاد كاملة، بما في ذلك الهياكل المخفية، من صورة واحدة RGB عبر الاستفادة من نماذج الهندسة التأسيسية ومطابقة التدفق الحجمي.

Tuan Duc Ngo, Chuang Gan, Evangelos Kalogerakis2026-06-01