🤖 machine learning

Hierarchy-Guided Multimodal Representation Learning for Taxonomic Inference

تقدم هذه الورقة CLiBD-HiR وCLiBD-HiR-Fuse، وهما إطارا عمل للتعلم متعدد الوسائط يعتمدان على الهيكلية الهرمية، واللذان يستفيدان من البنية التصنيفية للتصنيف البيولوجي لتحسين دقة تحديد التنوع البيولوجي والمتانة ضد البيانات الضوضائية أو المفقودة بشكل كبير مقارنة بنهج الملصقات المسطحة الحالية.

Sk Miraj Ahmed, Xi Yu, Yunqi Li, Yuewei Lin, Wei Xu2026-03-27
🤖 AI

Demographic Fairness in Multimodal LLMs: A Benchmark of Gender and Ethnicity Bias in Face Verification

تقدم هذه الورقة دراسة معيارية تقيم التحيز القائم على النوع الاجتماعي والعرق في تسعة من النماذج اللغوية الكبيرة متعددة الوسائط مفتوحة المصدر في مهام التحقق من الوجه، كاشفةً أن النماذج المتخصصة تتفوق على النماذج العامة مع إثبات أن الدقة العالية لا تضمن العدالة الديموغرافية وأن أنماط التحيز تختلف بشكل كبير عن أنظمة التعرف على الوجه التقليدية.

Ünsal Öztürk, Hatef Otroshi Shahreza, Sébastien Marcel2026-03-27
🤖 machine learning

LanteRn: Latent Visual Structured Reasoning

يُعد LanteRn إطار عمل مبتكر يعزز قدرات الاستدلال البصري للنماذج متعددة الوسائط الكبيرة من خلال تمكينها من دمج اللغة مع تمثيلات بصرية كامنة، مدمجة ومستمرة، مما يتجنب قيود الأوصاف المقتصرة على النصوص وعدم كفاءة الاستدلال المباشر في فضاء البكسل.

André G. Viveiros, Nuno Gonçalves, Matthias Lindemann, André Martins2026-03-27
💻 computer science

Designing Any Imaging System from Natural Language: Agent-Constrained Composition over a Finite Primitive Basis

تقدم هذه الورقة نظاماً مستقلاً متعدّد الوكلاء وتنسيق مواصفات مهيكلاً يترجم الأوصاف اللغوية الطبيعية إلى تصميمات تصوير حاسوبي مُحققة، محققاً جودة بمستوى الخبراء وممكناً أنماطاً تركيبية جديدة مع توفير إطار نظري للحد من أخطاء إعادة البناء.

Chengshuai Yang2026-03-27
⚡ electrical engineering

Colon-Bench: An Agentic Workflow for Scalable Dense Lesion Annotation in Full-Procedure Colonoscopy Videos

تقدم هذه الورقة Colon-Bench، وهو معيار مرجعي شامل يضم أكثر من 500 فيديو كامل لإجراءات تنظير القولون مع تعليقات توضيحية كثيفة ومتعددة الوسائط تم إنشاؤها عبر سير عمل وكيل ذكي، والذي يُستخدم لتقييم وتحسين النماذج اللغوية الكبيرة متعددة الوسائط بدقة للكشف عن الآفات الطبية وتحليلها.

Abdullah Hamdi, Changchun Yang, Xin Gao2026-03-27
💻 computer science

Persistent Robot World Models: Stabilizing Multi-Step Rollouts via Reinforcement Learning

تقدم هذه الورقة إطار عمل للتعلم التعزيزي لما بعد التدريب يعمل على تثبيت عمليات التوليد الذاتي متعددة الخطوات في نماذج العالم الروبوتية المشروطة بالأفعال، وذلك عبر تكييف أهداف التباين، وتوظيف مقارنات للمرشحين ذات أطوال متغيرة، واستخدام مكافآت الدقة البصرية متعددة المنظور، مما يحقق جودة تنبؤ رائدة في مجموعة بيانات DROID.

Jai Bardhan, Patrik Drozdik, Josef Sivic, Vladimir Petrik2026-03-27
🤖 AI

Just Zoom In: Cross-View Geo-Localization via Autoregressive Zooming

تقترح الورقة البحثية "Just Zoom In"، وهي طريقة جديدة لتحديد الموقع الجغراغرافي عبر الرؤى (cross-view geo-localization) تستبدل استرجاع الصور التبايني التقليدي بعملية تكبير ذاتية تنبؤية (autoregressive) من الخشن إلى الناعم فوق خرائط أقمار صناعية على مستوى المدينة، محققةً أداءً هو الأفضل في فئتها من خلال الاستفادة بشكل أفضل من البنية الهندسية ومعالجة عدم تطابق التغطية.

Yunus Talha Erzurumlu, Jiyong Kwag, Alper Yilmaz2026-03-27
💻 computer science

LEMMA: Laplacian pyramids for Efficient Marine SeMAntic Segmentation

تقدم الورقة البحثية نموذج LEMMA، وهو نموذج تقسيم دلالي خفيف الوزن يستخدم أهرامات لابلاس لتعزيز التعرف على الحواف وتقليل التكاليف الحسابية بشكل جذري مع تحقيق أداء رائد في تطبيقات الاستشعار عن بعد البحرية.

Ishaan Gakhar, Laven Srivastava, Sankarshanaa Sagaram, Aditya Kasliwal, Ujjwal Verma2026-03-27✓ Author reviewed
💻 computer science

TRACE: Object Motion Editing in Videos with First-Frame Trajectory Guidance

تقدم الورقة البحثية Trace، وهو إطار عمل يتكون من مرحلتين يتيح تحرير حركة الأجسام في الفيديوهات بشكل عملي وقابل للتحكم عبر السماح للمستخدمين بتصميم مسار في إطار مرجعي واحد، والذي يتم بعد ذلك رسمه كمسارات صناديق متوافقة مع الإطارات ويُستخدم لإعادة توليد الجسم مع الحفاظ على محتوى المشهد الأصلي.

Quynh Phung, Long Mai, Cusuh Ham, Feng Liu, Jia-Bin Huang, Aniruddha Mahapatra2026-03-27
💻 computer science

SlotVTG: Object-Centric Adapter for Generalizable Video Temporal Grounding

تقترح الورقة البحثية SlotVTG، وهو محول (adapter) خفيف الوزن متمحور حول الكائنات، يعمل على تعزيز قدرة النماذج اللغوية الكبيرة متعددة الوسائط على التعميم خارج النطاق (Out-of-Domain) لمهام التوطين الزمني للفيديو عبر تفكيك الرموز البصرية إلى فتحات (slots) متماسكة دلالياً دون الحاجة إلى إعادة تدريب النموذج بالكامل.

Jiwook Han, Geo Ahn, Youngrae Kim, Jinwoo Choi2026-03-27