💻 computer science

Dynamic High-frequency Convolution for Infrared Small Target Detection

تقترح هذه الورقة البحثية "الالتفاف الديناميكي عالي التردد" (DHiF)، وهو بديل جاهز للاستبدال المباشر للالتفاف القياسي، يقوم بتوليد مرشحات متماثلة ومتمركزة حول الصفر بشكل تكيفي لنمذجة وتمييز الأهداف الصغيرة ذات الأشعة تحت الحمراء عالية التردد عن الضجيج المعقد صراحةً، مما يؤدي إلى تحسين أداء الكشف بشكل كبير عبر مختلف الشبكات.

Ruojing Li, Chao Xiao, Qian Yin, Wei An, Nuo Chen, Xinyi Ying, Miao Li, Yingqian Wang2026-03-30
💻 computer science

Wid3R: Wide Field-of-View 3D Reconstruction via Camera Model Conditioning

تُعد Wid3R شبكة عصبية أمامية جديدة تتيح إعادة بناء ثلاثي الأبعاد بمجال رؤية واسع من خلال نمذجة الصور واسعة الزاوية مباشرة عبر تمثيل قائم على الأشعة وتكييف نموذج الكاميرا، مما يلغي الحاجة إلى المعايرة الصريحة أو إزالة التشويه مع تحقيق مكاسب كبيرة في الأداء في المشاهد ذات الـ 360 درجة.

Dongki Jung, Jaehoon Choi, Adil Qureshi, Somi Jeong, Dinesh Manocha, Suyong Yeon2026-03-30
🤖 AI

DUET-VLM: Dual stage Unified Efficient Token reduction for VLM Training and Inference

يُعد DUET-VLM إطار عمل متعدد الاستخدامات ثنائي المراحل يجمع بين ضغط الوعي بالوفرة المعتمد على الرؤية فقط وبين إسقاط الرموز الموجه بالنص البارز لتحقيق تقليص هجومي في الرموز المرئية (يصل إلى 89% للصور و93.4% للفيديو) مع الحفاظ على دقة النماذج اللغوية البصرية أو حتى تجاوزها مقارنة بالنماذج الأساسية.

Aditya Kumar Singh, Hitesh Kandala, Pratik Prabhanjan Brahma, Zicheng Liu, Emad Barsoum2026-03-30
💻 computer science

ORION: ORthonormal Text Encoding for Universal VLM AdaptatION

إنَّ ORION هو إطار عمل لضبط أجهزة ترميز النصوص (text encoder) بأسلوب "التوصيل والتشغيل" (plug-and-play)، يعمل على تعزيز نماذج الرؤية واللغة مسبقة التدريب عبر تحسين تضمينات الفئات (class embeddings) لتحقيق التعامد الزوجي (pairwise orthogonality) ودقة النموذج الأصلي (prototype fidelity) باستخدام أسماء الفئات فقط، مما يؤدي إلى تحسين الأداء بشكل كبير عبر سيناريوهات التعلم الصفري (zero-shot)، والتعلم القليل (few-shot)، والتكيف في وقت الاختبار (test-time adaptation).

Omprakash Chakraborty, Jose Dolz, Ismail Ben Ayed2026-03-30
🤖 AI

PedaCo-Gen: Scaffolding Pedagogical Agency in Human-AI Collaborative Video Authoring

يُعد PedaCo-Gen نظاماً تعاونياً بين الإنسان والذكاء الاصطناعي مستنداً إلى أسس تربوية، يستخدم مرحلة تمثيل وسيطة ونظرية ماير للتعلم بالوسائط المتعددة لتمكين المعلمين من خلال السقالات الميتامعرفية، مما يعزز بشكل كبير جودة وفعالية التدريس للفيديوهات المُنشأة مقارنة بطرق التوليد التقليدية ذات الخطوة الواحدة.

Injun Baek, Yearim Kim, Nojun Kwak2026-03-30
🤖 machine learning

From Pixels to Patches: Pooling Strategies for Earth Embeddings

تقدم هذه الورقة مجموعة بيانات EuroSAT-Embed لتوضيح أن استراتيجيات التجميع المتقدمة، لا سيما تلك التي تستفيد من الإحصاءات التوزيعية مثل التباين المشترك، تتفوق بشكل كبير على تجميع المتوسط القياسي في تجميع التضمينات الجيومكانية على مستوى البكسل من أجل التصنيف على مستوى المنطقة، خاصة في ظل تحولات التوزيع الجغرافي الصعبة.

Isaac Corley, Caleb Robinson, Inbal Becker-Reshef, Juan M. Lavista Ferres2026-03-30
💻 computer science

UE5-Forest: A Photorealistic Synthetic Stereo Dataset for UAV Forestry Depth Estimation

تقدم هذه الورقة البحثية UE5-Forest، وهي مجموعة بيانات ستيريو اصطناعية واقعية للغاية تم إنشاؤها باستخدام محرك Unreal Engine 5 باستخدام 115 شجرة ممسوحة ضوئياً ومنصة محاكاة ZED Mini لتوفير خرائط تباين (disparity maps) دقيقة للغاية كحقائق أرضية لتدريب شبكات مطابقة الستيريو الخاضعة للإشراف في تطبيقات الطائرات بدون طيار في مجال الغابات حيث لا يمكن الحصول على بيانات من العالم الحقيقي.

Yida Lin, Bing Xue, Mengjie Zhang, Sam Schofield, Richard Green2026-03-30
💻 computer science

A Survey of OCR Evaluation Methods and Metrics and the Invisibility of Historical Documents

تنقد هذه الورقة أساليب تقييم التعرف الضوئي على الحروف (OCR) الحالية لاعتمادها المفرط على مجموعات البيانات الحديثة والغربية، مجادلةً بأن هذا التحيز يجعل الوثائق التاريخية والمهمشة — ولا سيما الصحف السوداء — غير مرئية بنيوياً، ويؤدي إلى ضرر تمثيلي من خلال الفشل في استيعاب تحدياتها الطباعية والمادية الفريدة.

Fitsum Sileshi Beyene, Christopher L. Dancy2026-03-30
💻 computer science

Do All Vision Transformers Need Registers? A Cross-Architectural Reassessment

تعيد هذه الورقة إنتاج وإعادة تقييم نقدي للادعاءات المتعلقة بضرورة وجود "السجلات" (registers) في نماذج المحولات الرؤيوية (Vision Transformers) عبر مختلف البنيات وأحجام النماذج، مؤكدةً بعض الفوائد مع الكشف عن أن فعاليتها والمصطلحات المرتبطة بها ليست قابلة للتطبيق بشكل عالمي.

Spiros Baxevanakis, Platon Karageorgis, Ioannis Dravilas, Konrad Szewczyk2026-03-30
🤖 AI

ViGoR-Bench: How Far Are Visual Generative Models From Zero-Shot Visual Reasoners?

تقدم الورقة البحثية ViGoR-Bench، وهو إطار عمل معياري موحد مصمم لتقييم قدرات الاستدلال البصري في وضع "الصفر استباقي" (zero-shot) للنماذج التوليدية من خلال تجاوز المقاييس السطحية لتقييم العمليات الوسيطة والأبعاد المعرفية الدقيقة، مما يكشف أن حتى الأنظمة المتطورة تعاني من عجز منطقي كبير.

Haonan Han, Jiancheng Huang, Xiaopeng Sun, Junyan He, Rui Yang, Jie Hu, Xiaojiang Peng, Lin Ma, Xiaoming Wei, Xiu Li2026-03-30