💻 computer science

The Algorithmic Gaze of Image Quality Assessment: An Audit and Trace Ethnography of the LAION-Aesthetics Predictor

تُدقق هذه الورقة في "متنبئ لايون للجماليات" (LAION-Aesthetics Predictor) لتكشف كيف تعزز نظرته الخوارزمية الانحيازات الغربية والذكورية والإمبريالية من خلال تصفية المحتوى بشكل غير متناسب وإعطاء الأولوية لجماليات ثقافية محددة، داعيةً في نهاية المطاف إلى التحول نحو أساليب تقييم تعددية في تطوير الذكاء الاصطناعي.

Jordan Taylor, William Agnew, Maarten Sap, Sarah E. Fox, Haiyi Zhu2026-03-10
💻 computer science

S2DiT: Sandwich Diffusion Transformer for Mobile Streaming Video Generation

تقدم الورقة البحثية S2DiT، وهو نموذج "Streaming Sandwich Diffusion Transformer" مبتكر يستفيد من آليات الانتباه الفعالة، وبنية "الساندوتش" المدركة للميزانية، وإطار عمل تقطير "2 في 1" لتحقيق توليد فيديو عالي الدقة وفي الوقت الفعلي على الأجهزة المحمولة بأداء يضاهي النماذج المخصصة للخوادم.

Lin Zhao, Yushu Wu, Aleksei Lebedev, Dishani Lahiri, Meng Dong, Arpit Sahni, Michael Vasilkovsky, Hao Chen, Ju Hu, Aliak (…)2026-03-10
💻 computer science

Query-Guided Spatial-Temporal-Frequency Interaction for Music Audio-Visual Question Answering

تقترح هذه الورقة البحثية QSTar، وهي طريقة تفاعل مكاني-زماني-ترددي جديدة موجهة بالاستعلام ومعززة بكتلة استدلال سياق الاستعلام، والتي تعمل على تحسين أداء الإجابة على الأسئلة السمعية البصرية بشكل كبير من خلال الدمج العميق بين الأدلة الموجهة بالاستعلام وخصائص التردد الصوتي مع الإدراك البصري، متفوقة بذلك على الأساليب متعددة الوسائط الحالية في العديد من المعايركات.

Kun Li, Michael Ying Yang, Sami Sebastian Brandt2026-03-10
🤖 machine learning

MeanCache: From Instantaneous to Average Velocity for Accelerating Flow Matching Inference

يعد MeanCache إطار عمل لا يتطلب تدريباً يعمل على تسريع استنتاج مطابقة التدفق (Flow Matching) عبر استبدال تخزين السرعة اللحظية بنهج متوسط السرعة باستخدام حاصل ضرب جاكوبي-متجه مخزن واستراتيجية جدولة استقرار المسار، محققاً تسريعاً كبيراً (يصل إلى 4.56 ضعفاً) مع الحفاظ على جودة توليد عالية عبر نماذج مثل FLUX.1 وHunyuanVideo.

Huanlin Gao, Ping Chen, Fuyuan Shi, Ruijia Wu, Li YanTao, Qiang Hui, Yuren You, Ting Lu, Chao Tan, Shaoan Zhao, Zhaoxian (…)2026-03-10
💻 computer science

PhysDrape: Learning Explicit Forces and Collision Constraints for Physically Realistic Garment Draping

يُعد PhysDrape حلاً هجيناً يجمع بين الشبكات العصبية والفيزيائية، حيث يدمج شبكة عصبية رسومية مستوحاة من الفيزياء مع نظام تفاضلي لإسقاط القوة والتصادم على مرحلتين، وذلك لتحقيق ثني ملابس واقعي فيزيائياً مع تداخل ضئيل جداً ودقة فائقة مقارنة بالأساليب الحالية القائمة على التعلم العميق.

Minghai Chen, Mingyuan Liu, Ning Ma, Jianqing Li, Yuxiang Huan2026-03-10
💻 computer science

3DMedAgent: Unified Perception-to-Understanding for 3D Medical Analysis

تقدم الورقة البحثية 3DMedAgent، وهو وكيل موحد يستفيد من نموذج لغوي بصري كبير (MLLM) مرن وذاكرة هيكلية طويلة الأمد لتنسيق أدوات متباينة لتفكيك تحليل التصوير المقطعي المحوسب ثلاثي الأبعاد المعقد إلى مهام فرعية قابلة للتنفيذ تعتمد على البعد الثنائي، مما يتيح فهماً طبياً عاماً ثلاثي الأبعاد دون الحاجة إلى ضبط دقيق خاص بالنماذج ثلاثية الأبعاد.

Ziyue Wang, Linghan Cai, Chang Han Low, Haofeng Liu, Junde Wu, Jingyu Wang, Rui Wang, Lei Song, Jiang Bian, Jingjing Fu (…)2026-03-10
🤖 machine learning

Latent Equivariant Operators for Robust Object Recognition: Promise and Challenges

تُظهر هذه الورقة أن الشبكات العصبية التي تتعلم مؤثرات متكافئة في فضاء كامن يمكنها التعميم بفعالية على التحويلات المتناظرة خارج نطاق التوزيع على مجموعات بيانات بسيطة مثل MNIST المدوّرة، بينما تسلط الضົນ أيضاً على التحديات الكبيرة المنطوية في توسيع نطاق هذا النهج ليشمل بيانات أكثر تعقيداً.

Minh Dinh, Stéphane Deny2026-03-10
💻 computer science

Open-Vocabulary Domain Generalization in Urban-Scene Segmentation

تقدم هذه الورقة البحثية "التعميم النطاقي مفتوح المفردات في التجزئة الدلالية" (OVDG-SS)، وهو إطار عمل ومعيار جديد للقيادة الذاتية يعالج كلاً من النطاقات والفئات غير المرئية، وتقترح آلية S2-Corr، وهي آلية مدفوعة بحالة الفضاء لتنقية الارتباطات بين النص والصورة في نماذج الرؤية واللغة لتحقيق أداء قوي عبر البيئات الحضرية المتنوعة.

Dong Zhao, Qi Zang, Nan Pu, Wenjing Li, Nicu Sebe, Zhun Zhong2026-03-10
💻 computer science

InfScene-SR: Arbitrary-Size Image Super-Resolution via Iterative Joint-Denoising

يقترح إطار العمل InfScene-VF إطاراً قائماً على الانتشار لرفع دقة الصور لأحجام تعسفية، مما يقضي على عيوب الحدود ويسمح باستنتاج متوازٍ وفعال من حيث الذاكرة للصور ذات الدقة الجيجابكسلية عبر تقديم دمج مصحح التباين وتصحيح التباين المنفصل مكانياً لتحقيق إلغاء ضجيج مشترك مستمر مكانياً.

Shoukun Sun, Zhe Wang, Xiang Que, Jiyin Zhang, Xiaogang Ma2026-03-10
💻 computer science

Object-Scene-Camera Decomposition and Recomposition for Data-Efficient Monocular 3D Object Detection

تقترح هذه الورقة مخططاً للتلاعب بالبيانات عبر الإنترنت يقوم بتفكيك صور التدريب إلى مكونات مستقلة لكل من الكائن والمشهد والكاميرا، ثم يعيد تركيبها مع وضعيات مضطربة لتوليد بيانات تدريب متنوعة، مما يؤدي إلى تحسين كفاءة البيانات وأداء نماذج اكتشاف الأجسام ثلاثية الأبعاد أحادية العدسة في كل من بيئات الإشراف الكامل والجزئي.

Zhaonian Kuang, Rui Ding, Meng Yang, Xinhu Zheng, Gang Hua2026-03-10