⚡ electrical engineering

ARCHE: Autoregressive Residual Compression with Hyperprior and Excitation

تقدم هذه الورقة البحثية ARCHE، وهو إطار عمل لضغط الصور يعتمد على التعلم من الطرف إلى الطرف، ويحقق كفاءة رائدة في معدل التشويه (rate-distortion) من خلال توحيد الأولويات الهرمية والمكانية والقائمة على القنوات مع إعادة معايرة الميزات التكيفية، كل ذلك مع الحفاظ على الكفاءة الحسابية دون الاعتماد على المكونات المتكررة أو القائمة على المحولات (transformer).

Sofia Iliopoulou, Dimitris Ampeliotis, Athanassios Skodras2026-03-12
💻 computer science

OilSAM2: Memory-Augmented SAM2 for Scalable SAR Oil Spill Detection

تقترح الورقة البحثية نموذج OilSAM2، وهو إطار عمل للتقسيم معزز بالذاكرة يتميز ببنك ذاكرة هرمي متعدد المقاييس واستراتيجية تحديث متسقة بنيوياً ودلالياً لتحقيق كشف قوي ومتطور لبقع الزيت في صور رادار الفتحة الاصطناعية (SAR) غير المرتبة، وذلك من خلال التغلب على التحديات المتعلقة بتباين المظهر والانجراف الدلالي.

Shuaiyu Chen, Ming Yin, Peng Ren, Chunbo Luo, Zeyu Fu2026-03-12
🤖 machine learning

Why Does It Look There? Structured Explanations for Image Classification

تقترح الورقة البحثية إطار عمل I2X، الذي يحول التفسير غير المهيكل إلى تفسيرات قائمة على النماذج الأولية المهيكلة للكشف عن عمليات اتخاذ القرار في النموذج وتحسين دقة التصنيف بشكل فعال من خلال الاضطراب المستهدف للعينات.

Jiarui Li, Zixiang Yin, Samuel J Landry, Zhengming Ding, Ramgopal R. Mettu2026-03-12
💻 computer science

ID-LoRA: Identity-Driven Audio-Video Personalization with In-Context LoRA

يُعد ID-LoRA إطار عمل مبتكر يوحد التخصيص الصوتي والمرئي في تمريرة توليدية واحدة عبر تكييف نموذج LTX-2 الانتشار باستخدام تقنية In-Context LoRA المدفوعة بالهوية وتقنيات متخصصة مثل المواضع الزمنية السلبية وتوجيه الهوية، مما يحقق تشابهاً فائقاً في الصوت والمظهر البصري بأقل قدر من بيانات التدريب.

Aviad Dahan, Moran Yanuka, Noa Kraicer, Lior Wolf, Raja Giryes2026-03-12
🤖 machine learning

Taming Score-Based Denoisers in ADMM: A Convergent Plug-and-Play Framework

تقدم هذه الورقة البحثية خوارزمية ADMM-PnP مع مزيل ضجيج AC-DC مبتكر يعالج عدم تطابق المتشعبات ويضع ضمانات التقارب للنماذج التوليدية القائمة على الدرجة ضمن إطار عمل ADMM، مما يؤدي إلى تحسين جودة الحل عبر مختلف المسائل العكسية.

Rajesh Shrestha, Xiao Fu2026-03-12
💻 computer science

The Orthogonal Vulnerabilities of Generative AI Watermarks: A Comparative Empirical Benchmark of Spatial and Latent Provenance

تثبت هذه الدراسة تجريبياً أن العلامات المائية الحالية للذكاء الاصطواري التوليدي أحادية النطاق (المكانية والكامنة) تمتلك ثغرات أمنية متعارضة ومتعامدة تجاه أدوات التحرير الحديثة، مما يثبت عدم كفايتها لضمان موثوقية المصدر الرقمي ويؤكد الحاجة الماسة لبناء معماريات تشفيرية مستقبلية متعددة النطاقات.

Jesse Yu, Nicholas Wei2026-03-12
💻 computer science

Fuel Gauge: Estimating Chain-of-Thought Length Ahead of Time in Large Multimodal Models

تقدم هذه الورقة Fuel Gauge، وهي طريقة مبتكرة تتنبأ بطول تسلسل التفكير (Chain-of-Thought) في النماذج اللغوية الكبيرة متعددة الوسائط مسبقاً عبر استخراج معامل "وقود" خفي، مما يتيح تخصيصاً أكثر كفاءة للذاكرة وتحسيناً لأداء الاستدلال عبر مختلف المعايك المرجعية.

Yuedong Yang, Xiwen Wei, Mustafa Munir, Radu Marculescu2026-03-12
⚡ electrical engineering

Overcoming Visual Clutter in Vision Language Action Models via Concept-Gated Visual Distillation

تقدم هذه الورقة البحثية تقنية "التقطير البصري الموجه بالمفاهيم" (CGVD)، وهي إطار عمل استدلالي خالي من التدريب ومستقل عن النموذج، يتغلب على "فجوة الدقة والاستنتاج" في نماذج الرؤية واللغة والعمل من خلال تحليل التعليمات لتحديد المشتتات واستخدام عملية إعادة طلاء (inpainting) قائمة على تحويل فوريه لتوليد ملاحظات نظيفة، مما يؤدي إلى تحسين معدلات نجاح التلاعب الروبوتي بشكل كبير في البيئات شديدة الازدحام.

Sangmim Song, Sarath Kodagoda, Marc Carmichael, Karthick Thiyagarajan2026-03-12
💻 computer science

One Token, Two Fates: A Unified Framework via Vision Token Manipulation Against MLLMs Hallucination

تقترح هذه الورقة إطار عمل موحداً وخالياً من التدريب، يخفف من هلاوس النماذج اللغوية الكبيرة متعددة الوسائط (MLLMs) عبر الاستفادة التآزرية من الرموز المرئية من خلال المعايرة البصرية التآزرية لتعزيز الدلالات المرئية، والمعايرة التمثيلية السببية لتصحيح الانحيازات اللغوية، محققاً تحسينات كبيرة في الدقة مع حد أدنى من عبء الاستدلال.

Zhan Fa, Yue Duan, Jian Zhang, Lei Qi, Yinghuan Shi2026-03-12
💻 computer science

Motion Forcing: A Decoupled Framework for Robust Video Generation in Motion Dynamics

تقدم هذه الورقة البحثية "Motion Forcing"، وهو إطار عمل مفكك يعمل على موازنة المقايضة بين الجودة البصرية، والاتساق الفيزيائي، والقدرة على التحكم في توليد الفيديو المعقد عبر فصل الديناميكيات هرمياً إلى مراحل النقطة، والشكل، والمظهر، واستخدام استرداد النقاط المقنع لفرض تعلم القوانين الفيزيائية الكامنة.

Tianshuo Xu, Zhifei Chen, Leyi Wu, Hao Lu, Ying-cong Chen2026-03-12