💻 computer science

GraphFusion3D: Dynamic Graph Attention Convolution with Adaptive Cross-Modal Transformer for 3D Object Detection

يُعد GraphFusion3D إطار عمل موحداً للكشف عن الأجسام ثلاثية الأبعاد يعالج تحديات السحب النقطية المتناثرة وغير المكتملة من خلال دمج محول متكيف عبر الوسائط (Adaptive Cross-Modal Transformer) لإثراء الميزات متعددة الوسائط، ووحدة استدلال رسومي (Graph Reasoning Module) ذات انتباه متعدد المقاييس لنمذجة كل من الهياكل الهندسية المحلية والسياق الدلالي العالمي ديناميكياً.

Md Sohag Mia, Md Nahid Hasan, Muhammad Abdullah Adnan2026-05-12
💻 computer science

ProcObject-10K: Benchmarking Object-Centric Procedural Understanding in Instructional Videos

تقدم هذه الورقة ProcObject-10K، وهو أول معيار اختبار مصمم لتقييم الاستدلال المتمحور حول الأشياء والربط الزمني في مقاطع الفيديو التعليمية، مما يكشف أن النماذج متعددة الوسائط الحالية تعتمد بشكل كبير على الأولويات اللغوية بدلاً من ديناميكيات الأشياء دقيقة التفاصيل، مع إثبات أن الضبط الدقيق المتمحور حول الأشياء يمكن أن يسد هذه الفجوة بفعالية.

Wenliang Guo, Yu Kong2026-05-12
🤖 AI

RAG-HAR: Retrieval Augmented Generation-based Human Activity Recognition

يُعد RAG-HAR إطار عمل يعتمد على الاسترجاء المعزز ولا يتطلب تدريباً، حيث يسخر النماذج اللغوية الكبيرة وهندسة الأوامر المُحسّنة لتحقيق أداء رائد في التعرف على الأنشطة البشرية عبر معايير متنوعة، مع تمكين تحديد الأنشطة غير المرئية دون الحاجة إلى ضبط دقيق للنموذج أو مجموعات بيانات ضخمة موسومة.

Nirhoshan Sivaroopan, Hansi Karunarathna, Chamara Madarasingha, Anura Jayasumana, Kanchana Thilakarathna2026-05-12
💻 computer science

Large Video Planner Enables Generalizable Robot Control

تقدم هذه الورقة نموذجاً تأسيسياً للفيديو واسع النطاق، تم تدريبه على بيانات الأنشطة البشرية بمقياس الإنترنت، والذي يولد خطط فيديو بنمط "الصفر استباقي" (zero-shot) لمهام روبوتية مستحدثة، والتي يتم تحويلها بعد ذلك إلى أفعال قابلة للتنفيذ لإظهار قدرة قوية على التعميم والجدوى في العالم الحقيقي.

Boyuan Chen, Tianyuan Zhang, Haoran Geng, Caiyi Zhang, Peihao Li, Kiwhan Song, William T. Freeman, Jitendra Malik, Piete (…)2026-05-12
🤖 AI

Selective LoRA for Visual Tokens and Attention Heads

تقدم الورقة البحثية Image-LoRA، وهي طريقة لضبط المعلمات بكفاءة عالية تهدف إلى تكييف الرموز المرئية فقط ومجموعة فرعية مدمجة من مسارات القيم لرؤوس الانتباه، وذلك لتقليل التكاليف الحسابية مع الحفاظ على أداء النموذج الأساسي المجمد في النصوص النقية.

Tiange Luo, Lajanugen Logeswaran, Jaekyeom Kim, Justin Johnson, Honglak Lee2026-05-12
🔢 mathematics

OCP-GN: A Scalable Second-order Optimizer for Stochastic Optimization

تقدم هذه الورقة البحثية خوارزمية OCP-GN، وهي خوارزمية تحسين من الدرجة الثانية جديدة تعتمد على مبدأ التحكم الأمثل (Optimal Control Principle)، والتي تحقق تعقيداً حسابياً قدره O(d) ومتانة قوية لتدريب الشبكات العصبية واسعة النطاق، مما يظهر تفوقاً ملحوظاً على الطرق الحالية عبر معايير قياسية متعددة.

Jindi Zhong, Congyaohui Yin, Zhaorong Zhang, Huanshui Zhang2026-05-12
🤖 machine learning

CORP: Closed-Form One-shot Representation-Preserving Structured Pruning for Transformers

تقترح الورقة البحثية CORP، وهي طريقة تقليم هيكلي مغلقة الصيغة وذات خطوة واحدة، تقوم بإزالة مكونات الـ MLP والـ attention في نماذج الـ Transformers باستخدام البيانات غير المصنفة فقط وإعادة البناء الأفيني لتحقيق دقة عالية دون الحاجة إلى إعادة التدريب أو الضبط الدقيق.

Boxiang Zhang, Baijian Yang2026-05-12
💻 computer science

HLGFA: High-Low Resolution Guided Feature Alignment for Unsupervised Anomaly Detection

تقترح الورقة البحثية إطار عمل HLGFA، وهو إطار عمل جديد وغير خاضع للإشراف للكشف عن الشذوذ الصناعي يحقق أداءً رائدًا من خلال نمذجة اتساق الميزات عبر الدقة بين التمثيلات عالية الدقة ومنخفضة الدقة لتحديد حالات الشذوذ حيث يختل التوافق، دون الاعتماد على إعادة البناء على مستوى البكسل.

Han Zhou, Yuxuan Gao, Yinchao Du, Xuezhe Zheng2026-05-12
💻 computer science

Action-Guided Attention for Video Action Anticipation

تقترح هذه الورقة آلية "الانتباه الموجه بالأفعال" (AGA)، وهي آلية انتباه مبتكرة تستفيد من تسلسلات الأفعال المتوقعة لتوجيه نمذجة النوايا الكامنة وتحسين التعميم في توقع الأفعال بالفيديو، كما يتضح من أدائها المتفوق في معيار EPIC-Kitchens-100 وقدرتها على تقديم رؤى قابلة للتفسير حول تبعيات الأفعال.

Tsung-Ming Tai, Sofia Casarin, Andrea Pilzer, Werner Nutt, Oswald Lanz2026-05-12
💻 computer science

Clinically Aware Synthetic Image Generation for Concept Coverage in Chest X-ray Models

تقدم الورقة البحثية إطار عمل CARPA، وهو إطار عمل مدرك سريرياً ومرتكز تشريحياً لتوليد صور أشعة سينية اصطناعية للصدر يعمل على توسيع نطاق تغطية المفاهيم من خلال اضطرابات محكومة، مما يؤدي إلى تحسين أداء ونموذج التشخيص بالتعلم العميق ومعايرته وموثوقيته مقارنة بالطرق الحالية.

Amy Rafferty, Rishi Ramaesh, Ajitha Rajan2026-05-12