💻 computer science

Counterfactual Sensitivity Is Not Repairability: Auditing Replay Probes for Video Evidence

تقدم هذه الورقة CARVE، وهي طريقة تدقيق مضادة للواقع تعتمد على الصندوق الأسود، تميز بين التأسيس البصري الحقيقي والارتباطات الزائفة في الوكلاء المرئيين من خلال مقارنة استقرار الإجابة تحت ظروف إعادة التشغيل "الزائفة" و"المدمرة" المتطابقة، مما يثبت فعاليتها كإشارة توجيه قابلة للتكرار لتحسين اختيار الأسئلة والدقة.

Rama AlHamidi, Rasul Khanbayov, Erchin Serpedin, Hasan Kurban2026-08-18
🤖 AI

RRFC: Recursive Refinement via Feedback Conditioning for Iterative Image-to-Image Generation

تقدم هذه الورقة البحثية "التحسين المتكرر عبر التكييف بالتغذية الراجعة" (RRFC)، وهو إطار عمل معياري يعزز مولدات الصور من صورة إلى صورة الحالية من خلال تمكين التصحيح الذاتي التكراري عبر حلقات التغذية الراجعة، مما يظهر تحسينات كبيرة في دقة إعادة البناء والحفاظ على الهوية عبر مختلف بنيات النماذج والمهام.

Kareem Hassani, Chaymaa Abbas, Hadi Al Mubasher, Mariette Awad2026-08-18
💻 computer science

ConceptFormer: Learning Adaptive Latent Concepts for Query-Document Alignment in Visual Document Retrieval

يُعد ConceptFormer إطار عمل مبتكر لاسترجاع الوثائق المرئية، حيث يتعلم مفاهيم كامنة تكيفية مشروطة بالاستعلام لسد الفجوة الدلالية بفعالية بين الاستعلامات وهياكل الوثائق المعقدة، محققاً تحسينات ملحوظة في الأداء مقارنة بالنماذج المرجعية الحالية دون الاعتماد على أوصاف نصية وسيطة أو تعليقات توضيحية مرئية خام.

Peng Chunyi, Xu Zhipeng, Yan Yukun, Liu Zhenghao, Yu Shi, Mei Sen, Sun Yubo, Zhang Yongheng, Zhou Jie, Gu Yu, Yu Ge, Sun (…)2026-08-18
💻 computer science

PixelControl: Fine-Grained Condition Fidelity in Text-to-Image Diffusion

يُعد PixelControl إطار عمل للانتشار (diffusion) قابل للتحكم في فضاء البكسل، يعزز دقة مطابقة الشروط دقيقة التفاصيل في توليد الصور من النصوص عبر تجنب اختناقات الفضاء الكامن من خلال آلية حقن التحكم الواعي بالبنية وفقدان الدورة الهرمي متعدد المقاييس، مما يحسن بشكل كبير من دقة حدود الأجسام والمناطق الصغيرة مقارنة بالطرق الحالية.

Xin Lin, Haodong Li, Zhifei Zhang, Yutong Yang, Haitian Zheng, Juanxi Tian, Zhe Lin, Truong Nguyen2026-08-18
💻 computer science

YOLO26-RD: An End-to-End Road Damage Detection Network With Learnable Contrast Enhancement and Edge-Guided Downsampling

تقدم هذه الورقة YOLO26-RD، وهو كاشف لأضرار الطرق يعمل من البداية إلى النهاية ويتميز بتعزيز تباين قابل للتعلم وتقليل عينات موجه بالحواف، والذي يحقق أداءً هو الأفضل في فئته من خلال تدقيق مجموعة البيانات أولاً لدحض فرضية "الأجسام الصغيرة" ومن ثم تحسين البنية التحتية عبر الإزالة الاستراتيجية للميزات بدلاً من إضافة الوحدات.

Sompote Youwai, Pawarotorn Chaipetch, Hathairat Samaikul, Theerayut Yonseng2026-08-18
💻 computer science

Anatomical and Physical Supervision for CT-less PET Attenuation Correction: BIC-MAC 2026 Challenge

تقدم هذه الورقة مشاركة في تحدي BIC-MAC 2026 تعمل على تعزيز تصحيح التوهين في التصوير المقطعي بالإصدار البوزيتروني (PET) بدون استخدام التصوير المقطعي المحوسب (CT)، وذلك عبر الجمع بين الإشراف التشريحي من خلال مستخرج TotalSegmentator مجمد، والإشراف الفيزيائي من خلال خسائر إسقاط التوهين القابلة للتفاضل ضمن إطار عمل nnU-Net مدرب مسبقاً.

Petros Chatzitoulousis, George K. Matsopoulos2026-08-18
🤖 AI

Identifying Confusion Trends in Concept-based XAI for Multi-Label Classification

تقيم هذه الورقة طرق الذكاء الاصطناٍعي القابل للتفسير القائم على المفاهيم (CXAI)، وتحديداً CRP وCRAFT، على الشبكات العصبية العميقة المدربة على التصنيف متعدد الملصقات باستخدام مجموعة بيانات MS-COCO، كاشفةً أن هذه التقنيات تحدد بفعالية نقاط ضعف تعلم النموذج، وتوضح كيف يقلل تميز المفاهيم من الارتباك، وتكشف عن الانحيازات الناجمة عن مجموعة البيانات.

Haadia Amjad, Ronald Tetzlaff2026-08-18
🤖 machine learning

PWLR: Pairwise Witness Local Rejection for Boundary-Aware Out-of-Distribution Detection

تقدم الورقة البحثية طريقة "الرفض المحلي للشهود الثنائي" (PWLR)، وهي طريقة تستفيد من نموذج لغوي بصري كبير (MLLM) لتوليد وفحص أدلة بصرية محلية موثوقة كأدلة حدودية صريحة بين الفئات المتنافسة داخل التوزيع، مما يحسن بشكل كبير من أداء الكشف عن البيانات خارج التوزيع القريبة (near-OOD) عبر الجمع بين التحقق المحلي الثنائي ودرجات الفئات العالمية.

Chengyao Jia, Ruixuan Wang2026-08-18
💻 computer science

FlowDance: Music-Driven Dance Video Generation with Parallel Pose and RGB Streams

تقدم الورقة البحثية FlowDance، وهو إطار عمل يولد مقاطع فيديو رقص مدفوعة بالموسيقى من خلال دمج مسارات الوضعية (pose) وRGB المتوازية مع تقنيات حقن متخصصة للحفاظ على الحركة والهوية، مدعوماً بمجموعة بيانات رقص عالية الدقة تم تنسيقها حديثاً.

Genying Li, Boda Lin, Jiachen Li, Zijian Jia, Haojie Zheng, Yiming Wang, Shuchen Weng, Si Li2026-08-18
💻 computer science

MITE-Net: SWaP-Optimized 4K Video Tiny Target Perception for Embodied Edge SAR

تقدم هذه الورقة MITE-Net، وهي بنية متتالية محسنة من حيث الحجم والقدرة والطاقة (SWaP)، تتميز بشبكة اقتراح مناطق قائمة على الحركة مستوحاة حيوياً وخالية من التعلم ورأس كشف خفيف الوزن، مما يحقق إدراكاً في الوقت الفعلي وعالي الكفاءة للأهداف الصغيرة بدقة 4K لمهام البحث والإنقاذ المتجسدة على الأجهزة الطرفية مع إنشاء مجموعات بيانات ومعايير مرجعية جديدة.

Mingshuo Xu, Mu Hua, Jigen Peng, Qi Wang, Shigang Yue2026-08-18