🤖 machine learning

AVA-VLA: Improving Vision-Language-Action models with Active Visual Attention

تقدم الورقة البحثية AVA-VLA، وهو إطار عمل يعزز نماذج الرؤية واللغة والعمل (Vision-Language-Action) للتحكم الروبوتي من خلال إعادة صياغة تعلم السياسات كعملية ماركوف لاتخاذ القرار تحت حالة الملاحظة الجزئية (Partially Observable Markov Decision Process) وتوظيف الانتباه البصري النشط للتركيز ديناميكياً على المناطق البصرية ذات الصلة بناءً على تاريخ المهمة، محققاً أداءً هو الأفضل في فئته (state-of-the-art) في الاختبارات المعيارية والمهام الواقعية.

Lei Xiao, Jifeng Li, Juntao Gao, Feiyang Ye, Yan Jin, Jingjing Qian, Jing Zhang, Yong Wu, Xiaoyuan Yu2026-04-13
💻 computer science

RADSeg: Unleashing Parameter and Compute Efficient Zero-Shot Open-Vocabulary Segmentation Using Agglomerative Models

يقدم RADSeg إطار عمل لتقسيم الصور مفتوح المفردات بنمط الصفر (zero-shot) يتميز بالكفاءة في المعلمات والحوسبة، وذلك عبر الاستفادة من نموذج RADIO التأسيسي مع آليات انتباه وتحسين مبتكرة، محققاً دقة هي الأفضل في فئتها تتجاوز النماذج الأكبر حجماً بكثير مع تقليل زمن الاستجابة وتكاليف الذاكرة بشكل كبير.

Omar Alama, Darshil Jariwala, Avigyan Bhattacharya, Seungchan Kim, Wenshan Wang, Sebastian Scherer2026-04-13
🤖 AI

Out-of-the-box: Black-box Causal Attacks on Object Detectors

تقدم هذه الورقة BlackCAtt، وهو إطار عمل لهجوم سببي بنظام الصندوق الأسود يقوم ببناء اضطرابات تنافسية قابلة للتفسير، وغير محسوسة، وغير مرتبطة بهندسة معمارية محددة عبر استهداف مجموعات بكسل دنيا كافية سببياً، مما يقلل بشكل كبير من حجم الهجوم مع الحفاظ على معدلات النجاح أو تحسينها مقارنة بالطرق الحالية.

Melane Navaratnarajah, David A. Kelly, Hana Chockler2026-04-13
🤖 AI

Relational Visual Similarity

تعالج هذه الورقة الفجوة الحرجة في مقاييس التشابه البصري الحالية من خلال تقديم إطار عمل جديد ومجموعة بيانات مجهولة المصدر مكونة من 114 ألف صورة ووصف لتدريب نموذج رؤية ولغة قادر على قياس التشابه العلاقاتي — أي مطابقة الصور بناءً على منطقها الهيكلي الداخلي بدلاً من مجرد سماتها البصرية السطحية.

Thao Nguyen, Sicheng Mo, Krishna Kumar Singh, Yilin Wang, Jing Shi, Nicholas Kolkin, Eli Shechtman, Yong Jae Lee, Yuheng (…)2026-04-13
💻 computer science

4D-RGPT: Toward Region-level 4D Understanding via Perceptual Distillation

تقدم هذه الورقة البحثية 4D-RGPT، وهو نموذج لغوي كبير متعدد الوسائط متخصص تم تدريبه عبر التقطير الإدراكي رباعي الأبعاد (Perceptual 4D Distillation) لتعزيز الإدراك رباعي الأبعاد والاستدلال الزمني، إلى جانب معيار R4D-Bench المصمم لتقييم الفهم على مستوى المنطقة في المشاهد الديناميكية المدركة للعمق.

Chiao-An Yang, Ryo Hachiuma, Sifei Liu, Subhashree Radhakrishnan, Raymond A. Yeh, Yu-Chiang Frank Wang, Min-Hung Chen2026-04-13
🤖 AI

Tiled Prompts: Overcoming Prompt Misguidance in Image and Video Super-Resolution

تقترح الورقة البحثية "المطالبات المبلطة" (Tiled Prompts)، وهو إطار عمل موحد لرفع دقة الصور والفيديو يقوم بتوليد مطالبات نصية خاصة بكل بلاطة للتغلب على أخطاء التوجيه الموضعي والهلوسة الناتجة عن استخدام وصف عالمي واحد في مسارات التبليط الكامنة، مما يحسن بشكل كبير الجودة الإدراكية والدقة بأقل قدر من العبء الإضافي.

Bryan Sangwoo Kim, Jonghyun Park, Jong Chul Ye2026-04-13
🤖 machine learning

When & How to Write for Personalized Demand-aware Query Rewriting in Video Search

تقدم هذه الورقة WeWrite، وهو إطار عمل لإعادة كتابة الاستعلامات المخصص والمدرك للطلب، والذي يعالج تحديات تخفيف الإشارة وزمن الاستجखावة من خلال استراتيجية تنقيب عينات مؤتمتة، ونموذج تدريب هجين يجمع بين الضبط الدقيق الموجه (SFT) وتعزيز السياسة من خلال المكافأة (GRPO)، وبنية نشر "الاستدعاء الوهمي" المتوازية، مما أدى إلى تحسينات ملموسة في التفاعل مع البحث عن الفيديو وخفض معدلات إعادة صياغة الاستعلام.

Cheng cheng, Chenxing Wang, Aolin Li, Haijun Wu, Huiyun Hu, Juyuan Wang2026-04-13
🤖 machine learning

Ranked Activation Shift for Post-Hoc Out-of-Distribution Detection

تقترح الورقة البحثية "إزاحة التنشيط المرتب" (Ranked Activation Shift - RAS)، وهي طريقة لاحقة (post-hoc) خالية من المعلمات الفائقة، تعمل على تحسين اتساق الكشف عن البيانات خارج التوزيع عبر نماذج وبيانات متنوعة من خلال استبدال قيم التنشيط المرتبة بملف مرجعي ثابت للبيانات داخل التوزيع، مما يتغلب على عدم الاستقرار في النهج القائمة على القياس الموجودة حالياً.

Gianluca Guglielmo, Marc Masana2026-04-13
🤖 machine learning

Silhouette Loss: Differentiable Global Structure Learning for Deep Representations

تقدم هذه الورقة "فقدان الظل الناعم" (Soft Silhouette Loss)، وهو دالة هدف خفيفة الوزن وقابلة للتفاضل مستوحاة من مبادئ التجميع الكلاسيكية، تعمل على تعزيز تعلم التمثيل العميق من خلال فرض تماسك داخل الفئة وفصل بين الفئات على المستوى العالمي، مما يحقق دقة وكفاءة فائقتين عند دمجه مع التقاطع العرضي والتعلم التبايني الخاضع للإشراف.

Matheus Vinícius Todescato, Joel Luís Carbonera2026-04-13
💻 computer science

Pretrain-then-Adapt: Uncertainty-Aware Test-Time Adaptation for Text-based Person Search

تقترح هذه الورقة إطار عمل التكيف عند وقت الاختبار الواعي بعدم اليقين (UATTA)، وهو نموذج جديد قائم على مبدأ "التدريب المسبق ثم التكيف" يتيح إعادة معايرة ديناميكية وخالية من الملصقات للنماذج في عملية البحث عن الأشخاص القائمة على النصوص، وذلك عبر استخدام آلية عدم الاتفاق في الاسترجاع ثنائي الاتجاه لتقدير عدم اليقين والتخفيف من حدة انزياح النطاق في بيانات الاختبار غير المصنفة.

Jiahao Zhang, Shaofei Huang, Yaxiong Wang, Zhedong Zheng2026-04-13