⚡ electrical engineering

Biomechanically Accurate Gait Analysis: A 3d Human Reconstruction Framework for Markerless Estimation of Gait Parameters

تقدم هذه الورقة إطار عمل لإنشاء نماذج ثلاثية الأبعاد للبشر بدون علامات، وهو إطار عمل قابل للتوسع يستخلص علامات ذات دلالة ميكانيكية حيوية من الفيديو لتقدير معلمات المشي بدقة، مما يظهر توافقاً قوياً مع البيانات المرجعية القائمة على العلامات ويتفوق على طرق تقدير الوضعية التقليدية في التطبيقات السريرية والواقعية.

Akila Pemasiri, Ethan Goan, Glen Lichtwark, Robert Schuster, Luke Kelly, Clinton Fookes2026-03-04
💻 computer science

NeighborMAE: Exploiting Spatial Dependencies between Neighboring Earth Observation Images in Masked Autoencoders Pretraining

يُعد NeighborMAE إطار عمل للتعلم الخاضع للإشراف الذاتي يعمل على تعزيز تمثيل صور استشعار الأرض من خلال الاستفادة من التبعيات المكانية بين الصور المتجاورة عبر إعادة البناء المشترك واستراتيجية استدلالية ديناميكية لنسب الحجب وتوزين الخسارة، مما يؤدي إلى أداء فائق عبر مختلف المهام اللاحقة مقارنة بالنماذج المرجعية الحالية.

Liang Zeng, Valerio Marsocci, Wufan Zhao, Andrea Nascetti, Maarten Vergauwen2026-03-04
📊 statistics

Functional Properties of the Focal-Entropy

تقدم هذه الورقة تحليلاً منظماً من الناحية المعلوماتية لـ "الإنتروبيا البؤرية" (focal-entropy)، حيث تؤسس لخصائصها الرياضية وتوضح كيف يعمل "الفقد البؤري" (focal-loss) بشكل جوهري على تغيير التوزيعات الاحتمالية عبر تضخيم الاحتمالات متوسطة المدى مع كبح كل من النتائج عالية الاحتمالية والنتائج منخفضة الاحتمال للغاية في التعلم غير المتوازن للفئات.

Jaimin Shah, Martina Cardone, Alex Dytso2026-03-04
💻 computer science

SemGS: Feed-Forward Semantic 3D Gaussian Splatting from Sparse Views for Generalizable Scene Understanding

يُعد SemGS إطار عمل بنظام التغذية الأمامية يعيد بناء مجالات دلالية ثلاثية الأبعاد قابلة للتعميم من مشاهد نادرة باستخدام بنية ثنائية الفروع ذات طبقات CNN مشتركة وانتباه مدرك للكاميرا، مما يتيح فهماً دلالياً للمشاهد وتوليد مناظر جديدة من زوايا مختلفة بسرعة فائقة وبأداء رائد دون الحاجة إلى تحسين خاص بكل مشهد.

Sheng Ye, Zhen-Hui Dong, Ruoyu Fan, Tian Lv, Yong-Jin Liu2026-03-04
💬 NLP

Through the Lens of Contrast: Self-Improving Visual Reasoning in VLMs

تقترح هذه الورقة VC-STaR، وهو إطار عمل جديد للتحسين الذاتي يستفيد من الأزواج التباينية البصرية للتخفيف من الهلوسة في المبررات التي تولدها النماذج، مما أدى إلى إنتاج مجموعة بيانات VisCoR-55K التي تعزز بشكل كبير قدرات الاستنتاج البصري للنماذج اللغوية الرؤية.

Zhiyu Pan, Yizheng Wu, Jiashen Hua, Junyi Feng, Shaotian Yan, Bing Deng, Zhiguo Cao, Jieping Ye2026-03-04
💻 computer science

Maximizing Generalization: The Effect of Different Augmentation Techniques on Lightweight Vision Transformer for Bengali Character Classification

تُظهر هذه الدراسة أن الجمع بين تقنيات تعزيز "التحويل الأفيني العشوائي" (Random Affine) و"تغيير تباين الألوان" (Color Jitter) يعزز بشكل كبير من قدرة نموذج "EfficientViT" خفيف الوزن على التعميم والدقة في التعرف على الحروف البنغالية المكتوبة بخط اليد في مجموعتي بيانات "Ekush" و"AIBangla"، محققاً أعلى مستويات دقة بلغت 97.48% و97.57% على التوالي.

Rafi Hassan Chowdhury, Naimul Haque, Kaniz Fatiha2026-03-04
💬 NLP

Evaluating Cross-Modal Reasoning Ability and Problem Characteristics with Multimodal Item Response Theory

تقدم هذه الورقة البحثية M3IRT، وهو إطار عمل لنظرية الاستجابة للمفردة متعدد الوسائط يقوم بتفكيك قدرة النموذج وصعوبة المفردة إلى مكونات تعتمد على الصور فقط، والنصوص فقط، والمكونات عابرة الوسائط، وذلك لتصفية الأسئلة التي تعتمد على المسارات المختصرة، مما يتيح تقييماً أكثر موثوقية وفعالية من حيث التكلفة للاستدلال الحقيقي عابر الوسائط في النماذج اللغوية الكبيرة متعددة الوسائط.

Shunki Uebayashi, Kento Masui, Kyohei Atarashi, Han Bao, Hisashi Kashima, Naoto Inoue, Mayu Otani, Koh Takeuchi2026-03-04
💻 computer science

Designing UNICORN: a Unified Benchmark for Imaging in Computational Pathology, Radiology, and Natural Language

تقدم الورقة البحثية UNICORN، وهو معيار مرجعي عام موحد يتميز بإطار تقييم معياري مكون من خطوتين ومقياس تجميعي مبتكر لتقييم تعميم النماذج الطبية التأسيسية عبر الوسائط المتعددة والمهام المختلفة بشكل منهجي عبر بيانات تصوير ولغة طبيعية متنوعة من مؤسسات متعددة.

Michelle Stegeman, Lena Philipp, Fennie van der Graaf, Marina D'Amato, Clément Grisi, Luc Builtjes, Joeran S. Bosma, Jud (…)2026-03-04
💻 computer science

NOVA: Sparse Control, Dense Synthesis for Pair-Free Video Editing

تقدم هذه الورقة NOVA، وهو إطار عمل لتحرير الفيديو غير مقيد بالأزواج يجمع بين توجيهات الإطارات الرئيسية المتفرقة التي يوفرها المستخدم وبين توليد الحركة والنسيج الكثيف، والذي تم تدريبه عبر استراتيجية محاكاة التدهور لتحقيق دقة تحرير عالية واتساق زمني دون الحاجة إلى مجموعات بيانات ضخمة مقترنة.

Tianlin Pan, Jiayi Dai, Chenpu Yuan, Zhengyao Lv, Binxin Yang, Hubery Yin, Chen Li, Jing Lyu, Caifeng Shan, Chenyang Si2026-03-04
💻 computer science

Structure-Aware Text Recognition for Ancient Greek Critical Editions

تتناول هذه الورقة أوجه القصور في نماذج اللغة المرئية في التعرف على التخطيطات المعقدة للطبعات النقدية لليونانية القديمة من خلال تقديم مجموعة بيانات اصطناعية واسعة النطاق ومعيار مرجعي من العالم الحقيقي، مما يثبت أنه بينما يتخلف أداء التعلم الصفري عن الأدوات التقليدية، يمكن للنماذج التي تم ضبطها بدقة مثل Qwen3VL-8B أن تحقق دقة تضاهي أحدث ما توصل إليه العلم.

Nicolas Angleraud, Antonia Karamolegkou, Benoît Sagot, Thibault Clérice2026-03-04