💻 computer science

MiTA Attention: Efficient Fast-Weight Scaling via a Mixture of Top-k Activations

تقترح هذه الورقة بحث "MiTA attention"، وهو إطار عمل موحد يعمل على توسيع الأوزان السريعة في نماذج "Transformers" بكفاءة من خلال ضغط طبقة "MLP" ذات العرض "N" إلى طبقة أضيق، وبناء خبراء قابلين للتشكل عبر استراتيجية "خليط من أعلى k من التنشيطات" (Mixture of Top-k Activations)، مما يتيح التعامل الفعال مع التسلسلات الطويلة للغاية.

Qishuai Wen, Zhiyuan Huang, Xianghan Meng, Wei He, Chun-Guang Li2026-03-06
💻 computer science

Learning to Select Like Humans: Explainable Active Learning for Medical Imaging

تقترح هذه الورقة إطار عمل للتعلم النشط الموجه بالقابلية للتفسير، والذي يعمل على تحسين تحليل الصور الطبية من خلال اختيار العينات استراتيجياً بناءً على كل من عدم اليقين التنبؤي وعدم توافق الانتباه مع المناطق المحددة من قبل الخبراء، مما يحقق كفاءة بيانات فائقة وقابلية للتفسير السريري مقارنة بالطرق التقليدية.

Ifrat Ikhtear Uddin, Longwei Wang, Xiao Qin, Yang Zhou, KC Santosh2026-03-06
💻 computer science

EA-Swin: An Embedding-Agnostic Swin Transformer for AI-Generated Video Detection

تقترح الورقة البحثية نموذج EA-Swin، وهو نموذج Swin Transformer غير معتمد على التضمين يحقق دقة وتعماً في التعميم بمستويات رائدة في اكتشاف الفيديوهات المولدة بواسطة الذكاء الاصطناعي من خلال نمذجة التبعيات المكانية والزمانية على التضمينات سابقة التدريب، مدعوماً بمجموعة بيانات مرجعية جديدة واسعة النطاق.

Hung Mai, Loi Dinh, Duc Hai Nguyen, Dat Do, Luong Doan, Khanh Nguyen Quoc, Huan Vu, Naeem Ul Islam, Tuan Do2026-03-06
💻 computer science

CityGuard: Graph-Aware Private Descriptors for Bias-Resilient Identity Search Across Urban Cameras

يُعد CityGuard إطار عمل محول (transformer) يعتمد على الرسوم البيانية ومراعٍ للخصوصية، يُمكّن من تحديد هوية الأشخاص بدقة ومتانة ومقاومة للتحيز عبر كاميرات حضرية موزعة، وذلك من خلال دمج التعلم المتري المتكيف مع التشتت، والاهتمام المشروط مكانياً للمحاذاة الهندسية التقريبية، والتمثيلات (embeddings) ذات الخصوصية التفاضلية لتحقيق التوازن بين دقة الاسترجاع وحماية البيانات.

Rong Fu, Yibo Meng, Jia Yee Tan, Jiaxuan Lu, Rui Lu, Jiekai Wu, Zhaolu Kang, Simon Fong2026-03-06
💻 computer science

RobustVisRAG: Causality-Aware Vision-Based Retrieval-Augmented Generation under Visual Degradations

تقدم الورقة البحثية RobustVisRAG، وهو إطار عمل ثنائي المسار موجه بالسببية يعمل على فك الارتباط بين الدلالات البصرية وعوامل التدهور لتحسين أداء الاسترجاع والتوليد بشكل كبير تحت مختلف أنواع التشوهات البصرية، وهو ما تم التحقق منه من خلال معيار مرجعي جديد واسع النطاق ومكاسب تجريبية جوهرية.

I-Hsiang Chen, Yu-Wei Liu, Tse-Yu Wu, Yu-Chien Chiang, Jen-Chien Yang, Wei-Ting Chen2026-03-06
💻 computer science

Diffusion Probe: Generated Image Result Prediction Using CNN Probes

يُعد "Diffusion Probe" إطار عمل محايد للنماذج يستفيد من الخصائص الإحصائية لخرائط الانتباه المتقاطع في مراحلها المبكرة في نماذج الانتشار من النص إلى الصورة للتنبؤ بدقة بجودة الصورة النهائية، مما يتيح الإنهاء المبكر الفعال لعمليات التوليد ذات الإمكانات المنخفضة ويقلل من الأعباء الحسابية.

Benlei Cui, Bukun Huang, Zhizeng Ye, Xuemei Dong, Tuo Chen, Hui Xue, Dingkang Yang, Longtao Huang, Jingqun Tang, Haiwen (…)2026-03-06
💻 computer science

DiffusionHarmonizer: Bridging Neural Reconstruction and Photorealistic Simulation with Online Diffusion Enhancer

يُعد DiffusionHarmonizer إطار عمل توليدي عبر الإنترنت يعمل في خطوة واحدة، يستفيد من مسار مخصص لتنقية البيانات لتحويل عمليات رندرة إعادة البناء العصبي غير المكتملة إلى محاكاة واقعية فوتوغرافية ومتسقة زمنياً، مما يحل المشكلات الناتجة عن العيوب بفعالية ويقوم بمواءمة الأجسام الديناميكية المدرجة لتطوير الروبوتات ذاتية القيادة.

Yuxuan Zhang, Katarína Tóthová, Zian Wang, Kangxue Yin, Haithem Turki, Riccardo de Lutio, Yen-Yu Chang, Or Litany, Sanja (…)2026-03-06
💻 computer science

UFO-4D: Unposed Feedforward 4D Reconstruction from Two Images

يقدم UFO-4D إطار عمل موحد للتغذية الأمامية يعيد بناء تمثيلات رباعية الأبعاد كثيفة وصريحة من مجرد صورتين غير محددتي الوضعية، وذلك عبر التقدير المشترك لشرائح غاوس ثلاثية الأبعاد الديناميكية، والهندسة، والحركة، ووضعية الكاميرا من خلال نهج ذاتي الإشراف يستفيد من البدائيات الهندسية المشتركة ليتفوق بشكل كبير على الأساليب السابقة.

Junhwa Hur, Charles Herrmann, Songyou Peng, Philipp Henzler, Zeyu Ma, Todd Zickler, Deqing Sun2026-03-06
💻 computer science

Dr. Seg: Revisiting GRPO Training for Visual Large Language Models through Perception-Oriented Design

يتحدى الدكتور سيج الافتراض القائل بأن تدريب (GRPO) القائم على اللغة ينتقل بسلاسة إلى الإدراك البصري من خلال تقديم إطار عمل جاهز للتشغيل يتضمن آلية "النظر للتأكيد" (Look-to-Confirm) ووحدة "المكافأة ذات الترتيب التوزيعي" (Distribution-Ranked Reward) التي تعزز الأداء بشكل كبير في السيناريوهات البصرية المعقدة دون الحاجة إلى تعديلات هيكلية.

Haoxiang Sun, Tao Wang, Chenwei Tang, Li Yuan, Jiancheng Lv2026-03-06
💻 computer science

Improving Text-to-Image Generation with Intrinsic Self-Confidence Rewards

تقدم الورقة البحثية SOLACE، وهو إطار عمل للتدريب اللاحق غير خاضع للإشراف بالكامل لتوليد الصور من النصوص، يستفيد من إشارات الثقة الذاتية الجوهرية المستمدة من استعادة الضجيج لتحسين أداء النموذج دون الحاجة إلى نماذج مكافأة خارجية أو مجموعات بيانات مشروحة.

Seungwook Kim, Minsu Cho2026-03-06