💻 computer science

The Less You Depend, The More You Learn: Synthesizing Novel Views from Sparse, Unposed Images with Minimal 3D Knowledge

تقترح هذه الورقة إطار عمل للتغذية الأمامية لتوليد منظور الرؤية الجديد، وهو إطار عمل قابل للتوسع ومرتكز على البيانات، يحقق أداءً يضاهي أحدث ما توصل إليه العلم دون الاعتماد على بنية ثلاثية الأبعاد صريحة أو وضعيات كاميرا، مما يؤكد المبدأ القائل بأن الطرق التي تتطلب معرفة أقل بالبنية ثلاثية الأبعاد تتعلم في النهاية بشكل أكثر فعالية مع زيادة بيانات التدريب.

Haoru Wang, Kai Ye, Minghan Qin, Yangyan Li, Wenzheng Chen, Baoquan Chen2026-04-21
⚡ electrical engineering

Integrating Feature Selection and Machine Learning for Nitrogen Assessment in Grapevine Leaves using In-Field Hyperspectral Imaging

تُظهر هذه الدراسة أن دمج التصوير الفائق الطيفي الميداني مع إطار عمل لاختيار الميزات التجميعي يتيح تقديراً دقيقاً، ومحدداً للأصناف، ومتسق النطاق لحالة النيتروجين في أوراق الكروم ومظلتها، مما يوفر أداة قوية لتحسين تسميد مزارع الكروم.

Atif Bilal Asad, Achyut Paudel, Safal Kshetri, Chenchen Kang, Salik Ram Khanal, Nataliya Shcherbatyuk, Pierre Davadant (…)2026-04-21
💻 computer science

LVLM-Aware Multimodal Retrieval for RAG-Based Medical Diagnosis with General-Purpose Models

تقترح هذه الورقة إطار عمل خفيف الوزن للاسترجاع متعدد الوسائط، يكون مدركاً لنماذج اللغة الكبيرة متعددة الوسائط (LVLM)، ويعزز دقة التشخيص في البيئات الطبية ذات الموارد المحدودة من خلال تدريب مسترجع لاختيار السياق الذي يوجه نماذج (LVLM) عامة الأغراض نحو التنبؤات الصحيحة، مع تحديد ومعالجة فئة جديدة من أخطاء "الاسترجاع غير المتسق".

Nir Mazor, Tom Hope2026-04-21
🤖 machine learning

CaTS-Bench: Can Language Models Describe Time Series?

تقدم هذه الورقة CaTS-Bench، وهو معيار شامل يتميز بتعليقات توضيحية أعيدت كتابتها بشرياً ومسارات لتوليد البيانات الاصطناعية لتقييم وتحسين قدرة النماذج اللغوية على وصف اتجاهات السلاسل الزمنية بدقة من خلال سرديات باللغة الطبيعية.

Luca Zhou, Pratham Yashwante, Marshall Fisher, Alessio Sampieri, Zihao Zhou, Fabio Galasso, Rose Yu2026-04-21
🤖 machine learning

Constructive Distortion: Improving MLLMs with Attention-Guided Image Warping

تقدم الورقة البحثية AttWarp، وهي طريقة خفيفة الوزن ولا تتطلب تدريباً، تعمل على تحسين الإدراك والاستنتاج دقيق التفاصيل لنماذج اللغات الكبيرة متعددة الوسائط من خلال تشويه مدخلات الصور ديناميكياً عند الاختبار لتخصيص دقة أعلى للمناطق ذات الصلة بالاستعلام بناءً على الانتباه عبر الوسائط، مع الحفاظ على السياق العالمي.

Dwip Dalal, Gautam Vashishtha, Utkarsh Mishra, Jeonghwan Kim, Madhav Kanda, Hyeonjeong Ha, Svetlana Lazebnik, Heng Ji, U (…)2026-04-21
💻 computer science

Densemarks: Learning Canonical Embeddings for Human Heads Images via Point Tracks

تقترح الورقة البحثية DenseMarks، وهو تمثيل متعلم مبتكر يستخدم محول الرؤية (Vision Transformer) للتنبؤ بالتمثيلات المرجعية ثلاثية الأبعاد (3D canonical embeddings) لبكسلات الرأس البشري، مما يتيح إنشاء توافقات كثيفة وتتبعاً عالي الجودة ومتيناً عبر مختلف الوضعيات والأفراد من خلال التدريب على مسارات النقاط من فيديوهات واقعية.

Dmitrii Pozdeev, Alexey Artemov, Ananta R. Bhattarai, Artem Sevastopolsky2026-04-21
🤖 machine learning

Preparation of Fractal-Inspired Computational Architectures for Automated Neural Design Exploration

تقدم هذه الورقة FractalNet، وهو إطار عمل قائم على القوالب يولد بكفاءة أكثر من 1,200 بنية شبكة عصبية متنوعة من خلال التكرار الهيكلي المستوحى من الفركتلات (الكسيريات)، مما يثبت أن مثل هذه التصميمات تحقق أداءً قويًا على مجموعة بيانات CIFAR-10 مع كفاءة حوسبية عالية.

Yash Mittal, Dmitry Ignatov, Radu Timofte2026-04-21
🤖 machine learning

SHRUG-FM: Reliability-Aware Foundation Models for Earth Observation

تقدم الورقة البحثية إطار عمل SHRUG-FM، وهو إطار عمل يعتمد على الوعي بالموثوقية لتعزيز سلامة وقابلية تفسير النماذج التأسيسية الجيومكانية لمراقبة الأرض، وذلك عبر دمج إشارات عدم اليقين الجيوفيزيائية، وإشارات التضمين، وإشارات عدم اليقين التنبؤي لتحديد والامتناع عن حالات الفشل المحتملة في مهام رسم الخرائط السريعة عالية المخاطر.

Maria Gonzalez-Calabuig, Kai-Hendrik Cohrs, Vishal Nedungadi, Zuzanna Osika, Ruben Cartuyvels, Steffen Knoblauch, Joppe (…)2026-04-21
💻 computer science

BOP-ASK: Object-Interaction Reasoning for Vision-Language Models

تقدم هذه الورقة البحثية BOP-ASK، وهي مجموعة بيانات ضخمة تضم أكثر من 150 ألف صورة و33 مليون زوج من الأسئلة والأجوبة المستمدة من أوضاع الأجسام في الفضاء ثلاثي الأبعاد (6D)، والمصممة لتدريب واختبار نماذج الرؤية واللغة في مهام الاستنتاج الدقيق للتفاعل مع الأجسام، مثل التحديد الدقيق للمواقع ثلاثية الأبعاد، والتوافق الفيزيائي، والتخطيط المكاني متعدد الخطوات.

Vineet Bhat, Sungsu Kim, Valts Blukis, Greg Heinrich, Prashanth Krishnamurthy, Ramesh Karri, Stan Birchfield, Farshad Kh (…)2026-04-21
🤖 machine learning

Joint Distillation for Fast Likelihood Evaluation and Sampling in Flow-based Models

تقدم هذه الورقة البحثية إطار عمل "التقطير المشترك للتدفق السريع" (F2D2)، الذي يعمل على تسريع كل من عملية أخذ العينات وتقييم احتمالية السجل في النماذج التوليدية القائمة على التدفق بمقدار رتبتين من حيث الحجم، وذلك من خلال التقطير المشترك لمسار أخذ العينات والتباعد التراكمي من حقل سرعة مشترك.

Xinyue Ai, Yutong He, Albert Gu, Ruslan Salakhutdinov, J Zico Kolter, Nicholas Matthew Boffi, Max Simchowitz2026-04-21