💻 computer science

Fields of The World: A Field Guide for Extracting Agricultural Field Boundaries

تقدم هذه الورقة منظومة "حقول العالم" (FTW)، وهي مورد شامل يتضمن معياراً عالمياً يضم 1.6 مليون مضلع للحقول الزراعية، ونماذج مدربة مسبقاً، وأدوات لاستخراج حدود الحقول وتصنيف أنواع المحاصيل على المستويين المحلي والوطني.

Isaac Corley, Hannah Kerner, Caleb Robinson, Jennifer Marcus2026-02-10
💻 computer science

Chain-of-Caption: Training-free improvement of multimodal large language model on referring expression comprehension

تقترح هذه الورقة البحثية "Chain-of-Caption"، وهو إطار عمل لا يتطلب تدريباً يعزز بشكل كبير أداء نماذج اللغات الكبيرة متعددة الوسائط في فهم التعبيرات المرجعية من خلال الجمع الاستراتيجي بين سياقات نصية وبصرية متعددة عبر استخدام الأدوات، محققاً مكاسب في الدقة تتراوح بين 5% إلى 30% عبر مختلف المعايير المرجعية دون الحاجة إلى ضبط دقيق.

Yik Lung Pang, Changjae Oh2026-02-10
🤖 AI

Tighnari v2: Mitigating Label Noise and Distribution Shift in Multimodal Plant Distribution Prediction via Mixture of Experts and Weakly Supervised Learning

يقترح Tighnari v2 إطار عمل للدمج متعدد الوسائط يستفيد من بيانات "الوجود-الغياب" المتفرقة وعالية الجودة وبيانات "الوجود فقط" الوفيرة والمشوبة بالضجيج للتنبؤ بتوزيع النباتات، وذلك عبر استخدام استراتيجية التوسيم الزائف القائمة على الموقع الجغرافي ومنهجية "خليط الخبراء" للتخفيف من حدة ضجيج التسميات والتحولات في التوزيع.

Haixu Liu, Yufei Wang, Tianxiang Xu, Chuancheng Shi, Hongsheng Xing2026-02-10
💻 computer science

CAE-AV: Improving Audio-Visual Learning via Cross-modal Interactive Enrichment

تقترح الورقة البحثية CAE-AV، وهو إطار عمل جديد يحسن التعلم السمعي البصري من خلال توظيف وحدات بروز موجهة بالاتفاق عبر الوسائط ومحاذية للتعليقات الوصفية لموازنة العلاقات المكانية والزمانية ديناميكيًا وضخ التوجيه الدلالي، مما يقلل بفعالية من عدم المحاذاة بين الوسائط ويحقق أداءً رائدًا على العديد من المعايير المرجعية.

Yunzuo Hu, Wen Li, Jing Zhang2026-02-10
🤖 AI

UrbanGraphEmbeddings: Learning and Evaluating Spatially Grounded Multimodal Embeddings for Urban Science

تقدم هذه الورقة البحثية UGData، وهي مجموعة بيانات متعددة الوسائط ذات أساس مكاني، وUGE، وهي استراتيجية تدريب ثنائية المراحل تعمل على محاذاة صور عرض الشارع مع رسوم بيانية مكانية مهيكلة، مما يحسن الأداء بشكل كبير في مهام الفهم الحضري عبر مختلف النماذج الخلفية للرؤية واللغة.

Jie Zhang, Xingtong Yu, Yuan Fang, Rudi Stouffs, Zdravko Trivic2026-02-10
💬 NLP

Prism: Spectral-Aware Block-Sparse Attention

يُعد Prism آلية انتباه ذات تخلخل كتلوي (block-sparse) لا تتطلب تدريباً، ويحقق تسريعاً يصل إلى 5.1 ضعفاً عبر استخدام نهج مدرك للطيف لتصحيح فقدان المعلومات الموضعية الناتجة عن التجميع المتوسط (mean pooling) في تضمينات الموضع الدوارة (RoPE).

Xinghao Wang, Pengyu Wang, Xiaoran Liu, Fangxu Liu, Jason Chu, Kai Song, Xipeng Qiu2026-02-10
💻 computer science

Gesture Matters: Pedestrian Gesture Recognition for AVs Through Skeleton Pose Evaluation

تقدم هذه الدراسة إطار عمل لتصنيف الإيماءات للمركبات ذاتية القيادة يستخدم تقدير الوضعية ثنائي الأبعاد و76 ميزة مستخرجة من مجموعة بيانات WIVW لتصنيف إيماءات المشاة إلى أربع فئات، محققة دقة بنسبة 87% من خلال تسليط الضوء على القدرة التمييزية لموقع اليد وسرعة الحركة.

Alif Rizqullah Mahdi, Mahdi Rezaei, Natasha Merat2026-02-10
💻 computer science

Are Vision Foundation Models Foundational for Electron Microscopy Image Segmentation?

بينما تحقق نماذج الرؤية التأسيسية (VFMs) ذات التكيف خفيف الوزن أداءً قوياً في تقسيم الميتوكوندريا على مجموعات بيانات المجهر الإلكتروني الفردية، إلا أنها تفشل في التعميم عبر مجموعات البيانات غير المتجانسة بسبب عدم التطابق المستمر في النطاق الذي لا تستطيع استراتيجيات الضبط الدقيق فعالة المعلمات الحالية التغلب عليه دون آليات إضافية لمحاذاة النطاق.

Caterina Fuster-Barceló, Virginie Uhlmann2026-02-10
💻 computer science

BADet: Boundary-Aware 3D Object Detection from Point Clouds

يُعد BADet إطار عمل للكشف عن الأجسام ثلاثية الأبعاد مدركاً للحدود، وهو يحسن الطرق الحالية ذات المرحلتين من خلال بناء رسم بياني للجوار المحلي لاستغلال ارتباطات الحدود صراحةً بين المقترحات، واستخدام وحدة خفيفة الوزن لتجميع ميزات المنطقة لتعزيز تمثيل الميزات، محققاً أداءً هو الأفضل في حالته على مجموعتي بيانات KITTI وnuScenes.

Rui Qian, Xin Lai, Xirong Li2026-02-09
💻 computer science

3D Object Detection for Autonomous Driving: A Survey

تقدم هذه الورقة مسحاً شاملاً حول الكشف عن الأجسام ثلاثية الأبعاد للقيادة الذاتية، حيث تغطي المكونات الأساسية مثل المستشعرات ومجموعات البيانات، وتحلل الأساليب المتطورة من خلال المقارنات الكمية ودراسات الحالة، وتحدد اتجاهات البحث المستقبلية.

Rui Qian, Xin Lai, Xirong Li2026-02-09