🤖 machine learning

Dynamic Aware: Adaptive Multi-Mode Out-of-Distribution Detection for Trajectory Prediction in Autonomous Vehicles

تقترح هذه الورقة إطار عمل مبتكرًا للكشف التكيفي متعدد الأنماط عن القيم المتطرفة (out-of-distribution) في التنبؤ بمسار المركبات ذاتية القيادة، والذي يعمل صراحةً على نمذجة أخطاء التنبؤ المتغيرة زمنياً والمرتبطة بالنمط لتحسين سرعة ودقة الكشف بشكل كبير مقارنةً بالنهج القائمة على الرؤية وتقدير عدم اليقين الحالية.

Tongfei Guo, Lili Su2026-03-16
💻 computer science

LowDiff: Efficient Diffusion Sampling with Low-Resolution Condition

يُعد LowDiff إطار عمل انتشار فعال يستفيد من نموذج موحد ومتتالي لتوليد صور عالية الدقة من ظروف منخفضة الدقة، محققاً تحسناً في الإنتاجية يتجاوز 50% مع الحفاظ على جودة الصور أو تجاوز الطرق الحالية عبر مجموعات بيانات متنوعة.

Jiuyi Xu, Qing Jin, Meida Chen, Andrew Feng, Yang Sui, Yangming Shi2026-03-16
🤖 AI

Robust Fine-Tuning from Non-Robust Pretrained Models: Mitigating Suboptimal Transfer With Epsilon-Scheduling

تحدد هذه الورقة "النقل دون الأمثل" (suboptimal transfer) كنمط فشل عند الضبط الدقيق المتين للنماذج سابقة التدريب غير المتينة، وتقترح "جدولة إبسيلون" (Epsilon-Scheduling)، وهي جدولة مبتكرة لقوة الاضطراب تخفف من هذه المشكلة لتحسين المتانة المتوقعة باستمرار عبر تكوينات متنوعة.

Jonas Ngnawé, Maxime Heuillet, Sabyasachi Sahoo, Yann Pequignot, Ola Ahmad, Audrey Durand, Frédéric Precioso, Christian (…)2026-03-16
💻 computer science

SDPose: Exploiting Diffusion Priors for Out-of-Domain and Robust Pose Estimation

تستفيد SDPose من الميزات الكامنة القوية من مستويات إعادة أخذ العينات (upsampling) محددة لشبكات Stable Diffusion U-Nets مسبقة التدريب، مدمجة مع وحدة تجميع خفيفة الوزن وفقدان إعادة بناء إضافي، لتحقيق أداء رائد في تقدير وضعية جسم الإنسان عبر مجالات متنوعة وظروف تحديّة.

Shuang Liang, Jing He, Chuanmeizhi Wang, Lejun Liao, Guo Zhang, Yingcong Chen, Yuan Yuan2026-03-16
💻 computer science

Training-free Uncertainty Guidance for Complex Visual Tasks with MLLMs

تقترح هذه الورقة إطار عمل لا يتطلب تدريباً يستفيد من عدم اليقين الجوهري في النماذج اللغوية الكبيرة متعددة الوسائط للاختيار الذاتي للمدخلات البصرية الأكثر إفادة، مما يمكن النماذج الجاهزة من تحقيق أداء تنافسي في المهام المعقدة دقيقة التفاصيل مثل البحث البصري، وفهم الفيديو الطويل، والتأريض الزمني دون الحاجة إلى ضبط دقيق خاص بالمهمة.

Sanghwan Kim, Rui Xiao, Stephan Alaniz, Yongqin Xian, Zeynep Akata2026-03-16
🤖 AI

RobotArena \infty: Scalable Robot Benchmarking via Real-to-Sim Translation

تقدم الورقة البحثية RobotArena \infty، وهو إطار عمل معياري لتقييم الأداء يقوم بتحويل عروض الروبوتات في العالم الحقيقي إلى بيئات محاكاة لتقييم سياسات الرؤية واللغة والعمل من خلال تسجيل النقاط الآلي وتفضيلات البشر عبر التعهيد الجماعي، وذلك للتغلب على قيود العمالة والسلامة وإعادة الإنتاج التي تفرضها الاختبارات التقليدية في العالم الحقيقي.

Yash Jangir, Yidi Zhang, Pang-Chi Lo, Kashu Yamazaki, Chenyu Zhang, Kuan-Hsun Tu, Tsung-Wei Ke, Lei Ke, Yonatan Bisk, Ka (…)2026-03-16
💻 computer science

Referee: Reference-aware Audiovisual Deepfake Detection

تقترح الورقة البحثية "Referee"، وهي طريقة جديدة للكشف عن التزييف العميق السمعي البصري المدركة للمرجع، تستخدم وحدات عنق زجاجة الهوية والمطابقة لنمذجة الاتساق البيومتري الخاص بالمتحدث من مثال واحد، محققةً أداءً هو الأفضل في فئته من حيث التعميم عبر طرق التلاعب، ومجموعات البيانات، واللغات غير المرئية.

Hyemin Boo, Eunsang Lee, Jiyoung Lee2026-03-16
💻 computer science

FSDAM: Few-Shot Driving Attention Modeling via Vision-Language Coupling

إن FSDAM هو إطار عمل للتعلم بلقطات قليلة يستفيد من الاقتران بين الرؤية واللغة وبنية ثنائية المسار للتنبؤ بنظرة السائق وتوليد تفسيرات مهيكلة باستخدام 90 مثالاً مشروحاً فقط، محققاً أداءً تنافسياً وقدرة قوية على التعميم الصفري في سيناريوهات القيادة الذاتية.

Kaiser Hamid, Can Cui, Khandakar Ashrafi Akbar, Ziran Wang, Nade Liang2026-03-16
🤖 AI

FAPE-IR: Frequency-Aware Planning and Execution Framework for All-in-One Image Restoration

إن FAPE-IR هو إطار عمل موحد لترميم الصور يستفيد من نموذج لغوي كبير متعدد الوسائط مجمد لتوليد خطط ترميم مدركة للتردد، مما يوجه منفذ انتشار يعتمد على خليط من الخبراء (MoE) مع تقنية LoRA لاختيار الخبراء المناسبين ديناميكيًا لتحقيق أداء رائد في مجال الحالة الراهنة وقدرة قوية على التعميم الصفري عبر مهام التدهور المتنوعة.

Jingren Liu, Shuning Xu, Qirui Yang, Yun Wang, Xiangyu Chen, Zhong Ji2026-03-16
💻 computer science

EvoLMM: Self-Evolving Large Multimodal Models with Continuous Rewards

يُعد EvoLMM إطار عمل ذاتي التطور يعزز قدرات الاستنتاج في النماذج اللغوية الكبيرة متعددة الوسائط بطريقة غير خاضعة للإشراف تماماً، وذلك عبر استخدام وكيلين متعاونين لتوليد أسئلة مرتبطة بالصور وحلها من خلال الاتساق الداخلي، محققاً مكاسب أداء كبيرة في اختبارات الرياضيات متعددة الوسائط دون الاعتماد على بيانات مشروحة أو نماذج مكافأة خارجية.

Omkar Thawakar, Shravan Venkatraman, Ritesh Thawkar, Abdelrahman Shaker, Hisham Cholakkal, Rao Muhammad Anwer, Salman Kh (…)2026-03-16