💻 computer science

Background Fades, Foreground Leads: Curriculum-Guided Background Pruning for Efficient Foreground-Centric Collaborative Perception

تقترح الورقة البحثية FadeLead، وهو إطار عمل موجه بمنهج تعليمي يعزز الإدراك التعاوني كفء النطاق الترددي من خلال التقليم التدريجي لإرسال الخلفية أثناء التدريب لإجبار النموذج على استيعاب السياق الجوهري في ميزات المقدمة المدمجة، مما يجعله يتفوق على الأساليب الحالية في كل من السيناريوهات المحاكية والواقعية.

Yuheng Wu, Xiangbo Gao, Quang Tau, Zhengzhong Tu, Dongman Lee2026-03-25
🤖 AI

Do Vision-Language Models Measure Up? Benchmarking Visual Measurement Reading with MeasureBench

تقدم هذه الورقة البحثية "MeasureBench"، وهو معيار شامل ومسار توليد بيانات قابل للتوسع لتقييم قراءة القياسات البصرية، كاشفةً أن النماذج اللغوية البصرية الحالية تعاني في التحديد المكاني دقيق التفاصيل، لكنها تظهر تحسناً ملحوظاً بعد الضبط الدقيق بالتعزيز على البيانات الاصطناعية.

Fenfen Lin, Yesheng Liu, Haiyu Xu, Chen Yue, Zheqi He, Mingxuan Zhao, Miguel Hu Chen, Jiakang Liu, JG Yao, Xi Yang2026-03-25
🤖 AI

Operational machine learning for remote spectroscopic detection of CH4_{4} point sources

تقدم هذه الورقة أول عملية نشر تشغيلي لنظام تعلم آلي مؤتمت ضمن نظام مراقبة الميثان والتحقق منه (MARS) التابع لبرنامج الأمم المتحدة للبيئة، والذي يستخدم نماذج التعلم العميق التجميعي على بيانات الأقمار الصناعية العالمية لتقليل الكشوفات الخاطئة بشكل كبير والتحقق من آلاف المصادر النقطية للميثان، مما يتيح تخفيف الانبعاثات البشرية المنشأ بمساعدة الذكاء الاصطناعي وبشكل قابل للتوسع.

Vít Růžička, Gonzalo Mateo-García, Itziar Irakulis-Loitxate, Juan Emmanuel Johnson, Manuel Montesino San Martín, Anna Al (…)2026-03-25
💻 computer science

Tell Model Where to Look: Mitigating Hallucinations in MLLMs by Vision-Guided Attention

تقترح هذه الورقة البحثية "الانتباه الموجه بالرؤية" (VGA)، وهي طريقة لا تتطلب تدريباً تعمل على الحد من الهلوسة في النماذج اللغوية الكبيرة متعددة الوسائط من خلال توجيه تركيز النموذج ديناميكياً إلى المناطق المرئية ذات الصلة بناءً على محتوى الرموز الدلالية، مما يحقق أداءً رائدًا في تقليل الهلوسة مع زمن انتقال ضئيل للغاية.

Jianfei Zhao, Feng Zhang, Xin Sun, Chong Feng, Zhixing Tan2026-03-25
💻 computer science

From Inpainting to Layer Decomposition: Repurposing Generative Inpainting Models for Image Layer Decomposition

تقترح هذه الورقة إعادة توظيف نماذج الملء التوليدي (generative inpainting) لغرض تفكيك طبقات الصور من خلال الضبط الدقيق خفيف الوزن ووحدة دمج سياق متعددة الوسائط مبتكرة، محققةً تفوقاً في إزالة الكائنات واستعادة الأجزاء المحجوبة باستخدام مجموعة بيانات اصطناعية فقط.

Jingxi Chen, Yixiao Zhang, Xiaoye Qian, Zongxia Li, Cornelia Fermuller, Caren Chen, Yiannis Aloimonos2026-03-25
💻 computer science

TRivia: Self-supervised Fine-tuning of Vision-Language Models for Table Recognition

تقدم الورقة البحثية TRivia، وهي طريقة للضبط الدقيق ذاتي الإشراف تعتمد على تحسين السياسة النسبي المجموعي والإجابة على الأسئلة الموجهة بالانتباه لتمكين نماذج الرؤية واللغة من تعلم التعرف على الجداول مباشرة من البيانات غير المصنفة، مما أدى إلى نموذج TRivia-3B مفتوح المصدر الذي يتفوق على الأنظمة المملوكة الحالية في معايير رئيسية.

Junyuan Zhang, Bin Wang, Qintong Zhang, Fan Wu, Zichen Wen, Jialin Lu, Junjie Shan, Ziqi Zhao, Shuya Yang, Ziling Wang (…)2026-03-25
🤖 AI

Think Before You Drive: World Model-Inspired Multimodal Grounding for Autonomous Vehicles

تقدم الورقة البحثية ThinkDeeper، وهو إطار عمل مستوحى من النماذج العالمية يعزز عملية التأسيس البصري للمركبات ذاتية القيادة من خلال الاستنتاج حول الحالات المكانية المستقبلية لحل الأوامر الغامضة، مدعوماً بمجموعة بيانات DrivePilot الجديدة والمثبت عبر أداء متميز في مختلف الاختبارات المعيارية.

Haicheng Liao, Huanming Shen, Bonan Wang, Yongkang Li, Yihong Tang, Chengyue Wang, Dingyi Zhuang, Kehua Chen, Hai Yang (…)2026-03-25
💻 computer science

Coarse-to-Fine Hierarchical Alignment for UAV-based Human Detection using Diffusion Models

تقدم هذه الورقة البحثية "المحاذاة الهرمية من الخشن إلى الناعم" (CFHA)، وهو إطار عمل قائم على الانتشار يتكون من ثلاث مراحل يعمل على سد الفجوة بين النطاقين الاصطناعي والواقعي في كشف البشر بواسطة الطائرات بدون طيار عبر فك الارتباط والمحاذاة بين الأسلوب العالمي والمحتوى المحلي مع إزالة الهلوسات، مما يؤدي إلى تحسين دقة الكشف بشكل كبير دون الحاجة إلى تعليقات توضيحية واقعية مكثفة.

Wenda Li, Meng Wu, Liangzhao Chen, Sungmin Eum, Heesung Kwon, Qing Qu2026-03-25
💬 NLP

PaperBanana: Automating Academic Illustration for AI Scientists

إن PaperBanana هو إطار عمل وكيل (agentic framework) يعمل على أتمتة إنشاء الرسوم التوضيحية الأكاديمية والمخططات الإحصائية الجاهزة للنشر من خلال تنسيق وكلاء متخصصين للاسترجاع المرجعي، والتخطيط، والتحويل الرسومي، والنقد الذاتي، محققاً أداءً فائقاً في الدقة، والوضوح، والجمالية على معيار قياسي جديد مستمد من منشورات مؤتمر NeurIPS 2025.

Dawei Zhu, Rui Meng, Yale Song, Xiyu Wei, Sujian Li, Tomas Pfister, Jinsung Yoon2026-03-25
🤖 AI

Residual Decoding: Mitigating Hallucinations in Large Vision-Language Models via History-Aware Residual Guidance

تقدم هذه الورقة البحثية "التحليل المتبقي" (ResDec)، وهي طريقة مبتكرة لا تتطلب تدريباً، تستفيد من معلومات الرموز التاريخية وآليات الاستدلال الداخلي للحد بفعالية من الهلوسة وتعزيز التأسيس البصري في النماذج اللغوية البصرية الكبيرة دون الحاجة إلى تدريب إضافي.

Xinrong Chen, Xu Chu, Yingmin Qiu, Hengyuan Zhang, Jing Xiong, Shiyu Tang, Shuai Liu, Shaokang Yang, Cheng Yang, Hayden (…)2026-03-25