💻 computer science

Revisiting 2D Foundation Models for Scalable 3D Medical Image Classification

تقدم هذه الورقة البحثية AnyMC3D، وهو إطار عمل قابل للتوسع يعمل على تكييف النماذج التأسيسية ثنائية الأبعاد لتصنيف الصور الطبية ثلاثية الأبعاد باستخدام ملحقات خفيفة الوزن، مما يثبت أن مثل هذه النهج القائمة على النماذج ثنائية الأبعاد يمكن أن تتفوق على البنيات الأصلية ثلاثية الأبعاد وتحقق أداءً رائدًا عبر مهام متنوعة باستخدام نموذج موحد واحد.

Han Liu, Bogdan Georgescu, Yanbo Zhang, Youngjin Yoo, Michael Baumgartner, Riqiang Gao, Jianing Wang, Gengyan Zhao, Eli (…)2026-03-30
🤖 AI

EDU-CIRCUIT-HW: Evaluating Multimodal Large Language Models on Real-World University-Level STEM Student Handwritten Solutions

تقدم هذه الورقة EDU-CIRCUIT-HW، وهي مجموعة بيانات تضم أكثر من 1,300 حل مكتوب بخط اليد لمستويات جامعية في مجالات العلوم والتكنولوجيا والهندسة والرياضيات (STEM) حقيقية، للكشف عن فجوات موثوقية كبيرة في النماذج اللغوية الكبيرة متعددة الوسائط الحالية في التعرف على المنطق المعقد المكتوب بخط اليد، وتُظهر أن الاستفادة من أنماط الخطأ المحددة مع حد أدنى من التدخل البشري يمكن أن تعزز بفعالية متانة التصحيح الآلي.

Weiyu Sun, Liangliang Chen, Yongnuo Cai, Huiru Xie, Yi Zeng, Ying Zhang2026-03-30
💻 computer science

Dynamic High-frequency Convolution for Infrared Small Target Detection

تقترح هذه الورقة البحثية "الالتفاف الديناميكي عالي التردد" (DHiF)، وهو بديل جاهز للاستبدال المباشر للالتفاف القياسي، يقوم بتوليد مرشحات متماثلة ومتمركزة حول الصفر بشكل تكيفي لنمذجة وتمييز الأهداف الصغيرة ذات الأشعة تحت الحمراء عالية التردد عن الضجيج المعقد صراحةً، مما يؤدي إلى تحسين أداء الكشف بشكل كبير عبر مختلف الشبكات.

Ruojing Li, Chao Xiao, Qian Yin, Wei An, Nuo Chen, Xinyi Ying, Miao Li, Yingqian Wang2026-03-30
💻 computer science

Wid3R: Wide Field-of-View 3D Reconstruction via Camera Model Conditioning

تُعد Wid3R شبكة عصبية أمامية جديدة تتيح إعادة بناء ثلاثي الأبعاد بمجال رؤية واسع من خلال نمذجة الصور واسعة الزاوية مباشرة عبر تمثيل قائم على الأشعة وتكييف نموذج الكاميرا، مما يلغي الحاجة إلى المعايرة الصريحة أو إزالة التشويه مع تحقيق مكاسب كبيرة في الأداء في المشاهد ذات الـ 360 درجة.

Dongki Jung, Jaehoon Choi, Adil Qureshi, Somi Jeong, Dinesh Manocha, Suyong Yeon2026-03-30
🤖 AI

DUET-VLM: Dual stage Unified Efficient Token reduction for VLM Training and Inference

يُعد DUET-VLM إطار عمل متعدد الاستخدامات ثنائي المراحل يجمع بين ضغط الوعي بالوفرة المعتمد على الرؤية فقط وبين إسقاط الرموز الموجه بالنص البارز لتحقيق تقليص هجومي في الرموز المرئية (يصل إلى 89% للصور و93.4% للفيديو) مع الحفاظ على دقة النماذج اللغوية البصرية أو حتى تجاوزها مقارنة بالنماذج الأساسية.

Aditya Kumar Singh, Hitesh Kandala, Pratik Prabhanjan Brahma, Zicheng Liu, Emad Barsoum2026-03-30
💻 computer science

ORION: ORthonormal Text Encoding for Universal VLM AdaptatION

إنَّ ORION هو إطار عمل لضبط أجهزة ترميز النصوص (text encoder) بأسلوب "التوصيل والتشغيل" (plug-and-play)، يعمل على تعزيز نماذج الرؤية واللغة مسبقة التدريب عبر تحسين تضمينات الفئات (class embeddings) لتحقيق التعامد الزوجي (pairwise orthogonality) ودقة النموذج الأصلي (prototype fidelity) باستخدام أسماء الفئات فقط، مما يؤدي إلى تحسين الأداء بشكل كبير عبر سيناريوهات التعلم الصفري (zero-shot)، والتعلم القليل (few-shot)، والتكيف في وقت الاختبار (test-time adaptation).

Omprakash Chakraborty, Jose Dolz, Ismail Ben Ayed2026-03-30
🤖 AI

PedaCo-Gen: Scaffolding Pedagogical Agency in Human-AI Collaborative Video Authoring

يُعد PedaCo-Gen نظاماً تعاونياً بين الإنسان والذكاء الاصطناعي مستنداً إلى أسس تربوية، يستخدم مرحلة تمثيل وسيطة ونظرية ماير للتعلم بالوسائط المتعددة لتمكين المعلمين من خلال السقالات الميتامعرفية، مما يعزز بشكل كبير جودة وفعالية التدريس للفيديوهات المُنشأة مقارنة بطرق التوليد التقليدية ذات الخطوة الواحدة.

Injun Baek, Yearim Kim, Nojun Kwak2026-03-30
🤖 machine learning

From Pixels to Patches: Pooling Strategies for Earth Embeddings

تقدم هذه الورقة مجموعة بيانات EuroSAT-Embed لتوضيح أن استراتيجيات التجميع المتقدمة، لا سيما تلك التي تستفيد من الإحصاءات التوزيعية مثل التباين المشترك، تتفوق بشكل كبير على تجميع المتوسط القياسي في تجميع التضمينات الجيومكانية على مستوى البكسل من أجل التصنيف على مستوى المنطقة، خاصة في ظل تحولات التوزيع الجغرافي الصعبة.

Isaac Corley, Caleb Robinson, Inbal Becker-Reshef, Juan M. Lavista Ferres2026-03-30
💻 computer science

UE5-Forest: A Photorealistic Synthetic Stereo Dataset for UAV Forestry Depth Estimation

تقدم هذه الورقة البحثية UE5-Forest، وهي مجموعة بيانات ستيريو اصطناعية واقعية للغاية تم إنشاؤها باستخدام محرك Unreal Engine 5 باستخدام 115 شجرة ممسوحة ضوئياً ومنصة محاكاة ZED Mini لتوفير خرائط تباين (disparity maps) دقيقة للغاية كحقائق أرضية لتدريب شبكات مطابقة الستيريو الخاضعة للإشراف في تطبيقات الطائرات بدون طيار في مجال الغابات حيث لا يمكن الحصول على بيانات من العالم الحقيقي.

Yida Lin, Bing Xue, Mengjie Zhang, Sam Schofield, Richard Green2026-03-30
💻 computer science

A Survey of OCR Evaluation Methods and Metrics and the Invisibility of Historical Documents

تنقد هذه الورقة أساليب تقييم التعرف الضوئي على الحروف (OCR) الحالية لاعتمادها المفرط على مجموعات البيانات الحديثة والغربية، مجادلةً بأن هذا التحيز يجعل الوثائق التاريخية والمهمشة — ولا سيما الصحف السوداء — غير مرئية بنيوياً، ويؤدي إلى ضرر تمثيلي من خلال الفشل في استيعاب تحدياتها الطباعية والمادية الفريدة.

Fitsum Sileshi Beyene, Christopher L. Dancy2026-03-30