💻 computer science

ChatENV: An Interactive Vision-Language Model for Sensor-Guided Environmental Monitoring and Scenario Simulation

يُعد ChatENV نموذجاً تفاعلياً للرؤية واللغة يدمج صور الأقمار الصناعية مع بيانات الاستشعار من العالم الحقيقي لتمكين التفكير الزمني المتقدم وتفكير "ماذا لو" للمراقبة البيئية، متجاوزاً بذلك قيود النماذج الحالية عبر الاستفادة من مجموعة بيانات ضخمة مدعومة بأجهزة الاستشعار وبنية هندسية مضبوطة بدقة.

Hosam Elgendy, Ahmed Sharshar, Ahmed Aboeitta, Mohsen Guizani2026-04-20
⚡ electrical engineering

Intelligent Healthcare Imaging Platform: A VLM-Based Framework for Automated Medical Image Analysis and Clinical Report Generation

تقدم هذه الورقة إطار عمل متعدد الوسائط ذكيًا يستفيد من نموذج Google Gemini 2.5 Flash والنماذج اللغوية البصرية لأتمتة اكتشاف الأورام وإنشاء التقارير السريرية عبر أنماط متعددة من التصوير الطبي، وتتميز بقدرات التعلم من الصفر (zero-shot learning) وواجهة سهلة الاستخدام لتعزيز كفاءة سير العمل الإشعاعي.

Samer Al-Hamadani2026-04-20
⚡ electrical engineering

MMAudioSep: Taming Video-to-Audio Generative Model Towards Video/Text-Queried Sound Separation

يُعد MMAudioSep نموذجاً توليدياً يستفيد من نموذج تأسيسي مدرب مسبقاً لتحويل الفيديو إلى صوت لتحقيق فصل صوتي متفوق ومستند إلى استعلامات الفيديو والنصوص بكفاءة مع الحفاظ على قدراته التوليدية الأصلية.

Akira Takahashi, Shusuke Takahashi, Yuki Mitsufuji2026-04-20
💬 NLP

Power to the Clients: Federated Learning in a Dictatorship Setting

تقدم هذه الورقة وتحلل "العملاء الدكتاتوريين" (dictator clients)، وهم فئة جديدة من المشاركين الخبيثين في التعلم الاتحادي القادرين على محو مساهمات العملاء الآخرين تماماً مع الحفاظ على مساهماتهم الخاصة، مستكشفةً تأثيرهم من خلال تحليل التقارب النظري والتقييمات التجريبية عبر سيناريوهات تعاونية وعدائية متنوعة.

Mohammadsajad Alipour, Mohammad Mohammadi Amiri2026-04-20
🤖 AI

MM-Telco: Benchmarks and Multimodal Large Language Models for Telecom Applications

تقدم هذه الورقة MM-Telco، وهي مجموعة شاملة من المعايير المرجعية متعددة الوسائط والنماذج المضبوطة بدقة والمصممة للتغلب على التحديات الخاصة بالمجال وتعزيز أداء النماذج اللغوية الكبيرة في تطبيقات الاتصالات مثل تحسين الشبكات، واستكشاف الأخطاء وإصلاحها، ودعم العملاء.

Anshul Kumar, Gagan Raj Gupta, Manish Rai, Apu Chakraborty, Ashutosh Modi, Abdelaali Chaoub, Soumajit Pramanik, Moyank G (…)2026-04-20
💻 computer science

A Contextual Analysis of Driver-Facing and Dual-View Video Inputs for Distraction Detection in Naturalistic Driving Environments

تُظهر هذه الدراسة أنه في حين أن دمج سياق الفيديو المواجه للطريق يمكن أن يحسن بشكل كبير من دقة اكتشاف التشتت لبنيات معينة مثل SlowOnly، إلا أنه قد يؤدي إلى تدهور الأداء في بنيات أخرى مثل SlowFast بسبب صراعات تمثيلية، مما يسلط الضوء على الحاجة الماسة لتصميم نماذج واعية بالدمج في بيئات القيادة الواقعية.

Anthony Dontoh, Stephanie Ivey, Armstrong Aboah2026-04-20
💻 computer science

FETAL-GAUGE: A Benchmark for Assessing Vision-Language Models in Fetal Ultrasound

تقدم هذه الورقة البحثية Fetal-Gauge، وهو أول معيار مرجعي واسع النطاق للأسئلة والأجوبة البصرية يضم أكثر من 42,000 صورة و93,000 زوج من الأسئلة والأجوبة لتقييم نماذج الرؤية واللغة في الموجات فوق الصوتية للجنين، مما يكشف عن فجوات كبيرة في الأداء تسلط الضوء على الحاجة الملحة لهياكل متكيفة مع المجال لمعالة تحديات رعاية ما قبل الولادة العالمية.

Hussain Alasmawi, Numan Saeed, Mohammad Yaqub2026-04-20
🤖 AI

MedGemma vs GPT-4: Open-Source and Proprietary Zero-shot Medical Disease Classification from Images

تُظهر هذه الدراسة أن نموذج MedGemma مفتوح المصدر، والمُعدل باستخدام تقنية LoRA، يتفوق بشكل كبير على نموذج GPT-4 المملوك لشركة OpenAI في تصنيف الأمراض طبياً من الصور بأسلوب التعلم الصفري، محققاً دقة وحساسية أعلى مع التأكيد على الأهمية البالغة للضبط الدقيق المتخصص في المجال لضمان موثوقية الذكاء الاصطناعي السريري.

Md. Sazzadul Islam Prottasha, Nabil Walid Rafi2026-04-20
💬 NLP

Mechanisms of Prompt-Induced Hallucination in Vision-Language Models

تتقصى هذه الورقة البحثية الهلوسة الناجمة عن المطالبات في نماذج الرؤية واللغة، كاشفةً أن هذه الأخطاء تنبع من رؤوس انتباه محددة تعطي الأولوية للمطالبات النصية على الأدلة البصرية، وتُثبت أن استئصال هذه الرؤوس يقلل بشكل كبير من الهلوسة دون الحاجة إلى تدريب إضافي.

William Rudman, Michal Golovanevsky, Dana Arad, Yonatan Belinkov, Ritambhara Singh, Carsten Eickhoff, Kyle Mahowald2026-04-20
📊 statistics

Scalable spatial point process models for forensic footwear analysis

تقدم هذه الورقة نموذجاً بايزياً هرمياً قابلاً للتوسع يستخدم أطر غاوسية كامنة ومعاملات متغيرة مكانياً لتحديد ندرة أنماط التآكل العرضي على نعال الأحذية بدقة، مما يعزز موثوقية تحديد الهوية الجنائية للأحذية.

Alokesh Manna, Neil Spencer, Dipak K. Dey2026-04-20