🤖 AI

Second-Order Multi-Level Variance Correction for Modality Competition in Multimodal Models

تقدم هذه الورقة ML-FOP-SOAP، وهو إطار تحسين من الدرجة الثانية يتميز بتصحيح التباين متعدد المستويات والإسقاط الفيشري-المتعامد لحل مشكلة تنافس الأنماط في النماذج متعددة الوسائط ذاتية الانحدار، مما يتيح تدريبًا مستقرًا للدفعات الكبيرة ويحسن بشكل كبير كلاً من كفاءة العينات وسرعة وقت التنفيذ مقارنة بـ AdamW.

Yishun Lu, Wes Armour2026-05-18
💻 computer science

MAgSeg: Segmentation of Agricultural Landscapes in High-Resolution Satellite Imagery using Multimodal Large Language Models

يُعد MagSeg نهجاً جديداً لنماذج اللغات الكبيرة متعددة الوسائط والخالية من فك التشفير، والذي يستخدم تنسيقاً متخصصاً لضبط التعليمات للتغلب على تحديات السياق ومحاذاة النطاق، مما يتيح تجزئة دقيقة وقابلة للتوسع للمناظر الطبيعية الزراعية المعقدة لصغار المزارعين في دول الجنوب باستخدام صور الأقمار الصناعية عالية الدقة.

Piyush Tiwary, Utkarsh Ahuja, Depanshu Sani, Aishwarya Jayagopal, Sagar Gubbi, Subhashini Venugopalan, Alok Talekar, Vai (…)2026-05-18
🤖 AI

Evaluating Design Video Generation: Metrics for Compositional Fidelity

تقدم هذه الورقة إطار تقييم رباعي الأبعاد مؤتمتًا بالكامل لتقييم دقة التكوين في توليد فيديوهات التصميم، مما يعالج غياب المعايير المرجعية الموحدة لضمان القيود الهيكلية مثل الحفاظ على التخطيط والتحكم الدقيق في الحركة.

Adrienne Deganutti, Dingning Cao, Jaejung Seol, Elad Hirsch, Purvanshi Mehta2026-05-18
🤖 AI

Offline Semantic Guidance for Efficient Vision-Language-Action Policy Distillation

تقدم هذه الورقة VLA-AD، وهو إطار عمل للتقطير يستفيد من التوجيه الدلالي غير المتصل بنموذج رؤية-لغة (Vision-Language Model) لتدريب سياسات طالبة خفيفة الوزن وعالية السرعة تضاهي أو تتجاوز أداء نماذج الرؤية-اللغة-الفعل (Vision-Language-Action) الضخمة المعلمة مع إلغاء الحاجة إلى النموذج المعلم أثناء الاستدلال.

Jin Shi, Brady Zhang, Yishun Lu2026-05-18
💻 computer science

DAPL: Integration of Positive and Negative Descriptions in Text-Based Person Search

تقترح الورقة البحثية إطار عمل DAPL، وهو إطار عمل مبتكر للبحث عن الأشخاص القائم على النصوص يدمج كلاً من الأوصاف الإيجابية والسلبية من خلال تعلم محفز السمات المزدوج، وتعلم تباين الصورة والسمة المزدوج، والمطابقة الحساسة بين الصورة والسمة، وفقدان التشابه الديناميكي لكل رمز (Token) لتحسين دقة الاسترجاع والمتانة بشكل كبير.

Yuchuan Deng, Zhanpeng Hu, Zijie Xin, Chuang Deng, Qijun Zhao2026-05-15
🤖 machine learning

Pro-DG: Procedural Diffusion Guidance for Architectural Facade Generation

تقدم هذه الورقة Pro-DG، وهو مسار عمل جديد لـ ControlNet يستفيد من القواعد الإجرائية الهرمية لتوليد واجهات معمارية واقعية للغاية مع تعديلات هيكلية دقيقة، مثل تكرار الطوابق وإعادة ترتيب النوافذ، مع الحفاظ على دقة المظهر المحلي والهوية المعمارية.

Aleksander Plocharski, Jan Swidzinski, Przemyslaw Musialski2026-05-15
💻 computer science

Hyperspectral Image Land Cover Captioning Dataset for Vision Language Models

تقدم الورقة البحثية HyperCap، وهي أول مجموعة بيانات لتعليق الصور فائقة الطيف واسعة النطاق تجمع بين البيانات الطيفية والتعليقات النصية على مستوى البكسل لتعزيز تعلم الرؤية واللغة وتحسين الأداء في تطبيقات الاستشعار عن بعد.

Aryan Das, Tanishq Rachamalla, Pravendra Singh, Koushik Biswas, Vinay Kumar Verma, Swalpa Kumar Roy2026-05-15
⚡ electrical engineering

Dual Ascent Diffusion for Inverse Problems

تقدم هذه الورقة "صعود الرفع المزدوج" (Dual Ascent Diffusion)، وهو إطار تحسين صعود مزدوج مبتكر يستفيد من مسبقات نماذج الانتشار لحل المشكلات العكسية غير محددة الحل بجودة صورة فائقة، ومتانة تجاه الضجيج، وسرعة، ودقة في الملاحظة مقارنة بالطرق الحالية المتطورة.

Minseo Kim, Axel Levy, Gordon Wetzstein2026-05-15
💻 computer science

PacTure: Efficient PBR Texture Generation on Packed Views with Visual Autoregressive Models

يُعد PacTure إطار عمل فعالاً يقوم بتوليد أنسجة PBR عالية الجودة ومتسقة عالمياً للمجسمات ثلاثية الأبعاد من خلال الأوصاف النصية، وذلك عبر الجمع بين تقنية حزم الرؤية الجديدة لتعزيز دقة تعدد الرؤى دون تكلفة إضافية وبين نموذج التنبؤ ذاتي الانحدار التالي للمقياس للتحكم الدقيق.

Fan Fei, Jiajun Tang, Fei-Peng Tian, Boxin Shi, Ping Tan2026-05-15
💻 computer science

FALO: Fast and Accurate LiDAR 3D Object Detection on Resource-Constrained Devices

تقدم الورقة البحثية FALO، وهو إطار عمل للكشف عن الأجسام ثلاثية الأبعاد باستخدام تقنية ليدار (LiDAR) صديق للأجهزة، والذي يستخدم التسلسل أحادي الأبعاد القائم على الفوكسل (voxel-based 1D sequencing) وكتل ConvDotMix المبتكرةة لتحقيق دقة هي الأفضل في فئتها مع توفير سرعات استنتاج أسرع بكثير على الأجهزة الطرفية محدودة الموارد مقارنة بالطرق الحالية.

Shizhong Han, Hsin-Pai Cheng, Hong Cai, Jihad Masri, Soyeb Nagori, Fatih Porikli2026-05-15