💻 computer science

SatReg: Regression-based Neural Architecture Search for Lightweight Satellite Image Segmentation

تُعد SatReg إطار عمل يعتمد على الانحدار ومراعٍ للعتاد، يعمل على تحسين نماذج تقسيم صور الأقمار الصناعية خفيفة الوزن بكفاءة من أجل النشر عند الحافة عبر تقليص مساحة البحث إلى متغيرات العرض الرئيسية، وتوصيف الأداء على منصة NVIDIA Jetson Orin Nano، واستخدام نماذج بديلة لاختيار البنى القريبة من المثالية دون بحث شامل.

Edward Humes, Tinoosh Mohsenin2026-04-15
💻 computer science

NTIRE 2026 Challenge on Single Image Reflection Removal in the Wild: Datasets, Results, and Methods

تستعرض هذه الورقة تحدي NTIRE 2026 حول إزالة الانعكاس من الصور المنفردة في الظروف الواقعية، مع تسليط الضوء على تقديم مجموعة بيانات OpenRR-5k الواقعية، ومشاركة أكثر من 100 فريق، والأداء المتطور الذي حققته الطرق الأعلى تصنيفاً.

Jie Cai, Kangning Yang, Zhiyuan Li, Florin-Alexandru Vasluianu, Radu Timofte, Jinlong Li, Jinglin Shen, Zibo Meng, Junya (…)2026-04-15
💻 computer science

SIMPLER: H&E-Informed Representation Learning for Structured Illumination Microscopy

تقدم الورقة البحثية SIMPLER، وهو إطار عمل للتعلم الذاتي عبر الوسائط يستفيد من الأنسجة المصبوغة بصبغة الهيماتوكسيلين والإيوسين (H&E) كمرتكز دلالي لتدريب نماذج مجهر الإضاءة المهيكلة (SIM) مسبقاً، مما يمكنها من تعلم تمثيلات نسيجية قوية تتفوق على النهج الحالية في المهام التشخيصية اللاحقة دون إضعاف أداء صبغة (H&E).

Abu Zahid Bin Aziz, Syed Fahim Ahmed, Gnanesh Rasineni, Mei Wang, Olcaytu Hatipoglu, Marisa Ricci, Malaiyah Shaw, Guang (…)2026-04-15
💻 computer science

Context Matters: Vision-Based Depression Detection Comparing Classical and Deep Approaches

تقارن هذه الدراسة بين نماذج الميزات المصنوعة يدويًا الكلاسيكية ونهج التعلم العميق للكشف عن الاكتئاب القائم على الرؤية عبر سياقي الأم والطفل والمريض والإكلينيكي، حيث وجدت أن النهج الكلاسيكي حقق دقة وعدالة أعلى بينما أظهر كلا النهجين قدرة محدودة على التعميم عبر السياقات، مما يشير إلى أن الاكتئاب يتجلى بطرق خاصة بكل سياق.

Maneesh Bilalpur, Saurabh Hinduja, Sonish Sivarajkumar, Nicholas Allen, Yanshan Wang, Itir Onal Ertugrul, Jeffrey F. Coh (…)2026-04-15
💻 computer science

Multi-modal, multi-scale representation learning for satellite imagery analysis just needs a good ALiBi

تقدم هذه الورقة Scale-ALiBi، وهي آلية انتباه محولة (transformer attention mechanism) مبتكرة ذات انحيازات ترميز مكاني تتيح تعلم تمثيل متعدد الوسائط ومتعدد المقاييس لصور الأقمار الصناعية بفعالية، مما يظهر أداءً محسناً في معيار GEO-Bench من خلال بنية ثلاثية التباين وإعادة البناء إلى جانب مجموعة بيانات منسقة تم إصدارها حديثاً.

Patrick Kage, Pavlos Andreadis2026-04-15
💻 computer science

Agentic Video Generation: From Text to Executable Event Graphs via Tool-Constrained LLM Planning

تقدم هذه الورقة نظاماً لتوليد الفيديو القائم على الوكلاء، والذي يستبدل التخليق المباشر للبكسلات بمسار نموذج لغوي كبير حتمي ومقيد بالأدوات يقوم ببناء وتنفيذ "رسوم بيانية للأحداث في الزمان والمكان" (GEST) رسمية داخل محرك ألعاب ثلاثي الأبعاد، مما يحقق صلاحية فيزيائية وتوافقاً دلالياً أعلى بكثير من مولدات الفيديو العصبية الحالية.

Nicolae Cudlenco, Mihai Masala, Marius Leordeanu2026-04-15
💻 computer science

GTASA: Ground Truth Annotations for Spatiotemporal Analysis, Evaluation and Training of Video Models

تقدم هذه الورقة البحثية GTASA، وهي مجموعة بيانات لمقاطع فيديو متعددة الممثلين ذات حقائق أرضية مكانية وزمانية دقيقة تم إنشاؤها بواسطة محرك GEST-Engine، والتي تعالج تحديات تقييم جودة توليد الفيديو وتكشف أن المشفرات ذاتية الإشراف تلتقط البنية المكانية بشكل أكثر فعالية من المشفرات البصرية لنماذج اللغة والرؤية (VLM).

Nicolae Cudlenco, Mihai Masala, Marius Leordeanu2026-04-15
💻 computer science

Enhancing Fine-Grained Spatial Grounding in 3D CT Report Generation via Discriminative Guidance

تقترح هذه الورقة إطار عمل "التحفيز بالدلالات التمييزية مع إسقاط التحفيز" (DCP-PD)، الذي يعزز التوطين المكاني دقيق التفاصيل في توليد تقارير الأشعة المقطعية ثلاثية الأبعاد من خلال استخلاص دلالات صريحة من التقارير النصية الحرة لتوجيه التدريب، محققاً أداءً هو الأفضل في فئته على مجموعة بيانات CT-RATE ومحسناً بشكل كبير من القدرة على التعميم خارج نطاق التوزيع، مع الكشف عن تحديات مستمرة في تحديد المواقع المرضية بدقة.

Chenyu Wang, Weicheng Dai, Han Liu, Wenchao Li, Kayhan Batmanghelich2026-04-15
💻 computer science

PERCEPT-Net: A Perceptual Loss Driven Framework for Reducing MRI Artifact Tissue Confusion

تُعد PERCEPT-Net إطار عمل جديد للتعلم العميق يستخدم "فقدان الإدراك الحركي" (Motion Perceptual Loss) للتمييز بفعالية بين آثار الحركة في التصوير بالرنين المغناطيسي وقمعها مع الحفاظ على البنى التشريحية الحرجة، مما يتغلب على قيود التعميم للنماذج الحالية ويحسن جودة الصور السريرية بشكل كبير.

Ziheng Guo, Danqun Zheng, Chengwei Chen, Boyang Pan, Shuai Li, Ziqin Yu, Xiaoxiao Chen, Langdi Zhong, Yun Bian, Nan-Jie (…)2026-04-15
💻 computer science

BareBones: Benchmarking Zero-Shot Geometric Comprehension in VLMs

تقدم الورقة البحثية "BareBones"، وهو معيار اختبار صفري (zero-shot) يستخدم ظلالاً على مستوى البكسل، لتوضيح أن نماذج الرؤية واللغة المتطورة تعاني من "منحدر انحياز الملمس" (Texture Bias Cliff) الشديد عند حرمانها من إشارات RGB، مما يكشف عن اعتمادها على الملمس والسياق بدلاً من الفهم الهندسي الحقيقي.

Aaditya Baranwal, Vishal Yadav, Abhishek Rajora2026-04-15