🤖 machine learning

Towards Faithful Multimodal Concept Bottleneck Models

تقدم هذه الورقة البحثية f-CBM، وهو إطار عمل لنماذج عنق الزجاجة المفاهيمية متعدد الوسائط يتسم بالأمانة، والذي يعمل على تحسين كشف المفاهيم والحد من التسرب بشكل مشترك من خلال فقد تسرب قابل للتفاضل ورأس تنبؤ يعتمد على شبكة كولموغوروف-أرنولد، محققاً توازناً محسناً بين التفسيرية ودقة التنبؤ عبر مجموعات البيانات المكونة من صور ونصوص أو نصوص فقط.

Pierre Moreau, Emeline Pineau Ferrand, Yann Choho, Benjamin Wong, Annabelle Blangero, Milan Bhan2026-03-16
💻 computer science

Perceive What Matters: Relevance-Driven Scheduling for Multimodal Streaming Perception

تقترح هذه الورقة إطار عمل جدولة جديداً وخفيف الوزن للإدراك التدفيقي متعدد الوسائط في التعاون بين الإنسان والروبوت، والذي يستفيد من سياق المشهد ومخرجات الإطارات السابقة لتخصيص الموارد الحسابية ديناميكياً، مما يقلل زمن الاستجابة بشكل كبير مع تحسين استدعاء التنشيط ودقة الإطارات الرئيسية مقارنة بمسارات المعالجة المتوازية التقليدية.

Dingcheng Huang, Xiaotong Zhang, Kamal Youcef-Toumi2026-03-16
💻 computer science

Towards Spatio-Temporal World Scene Graph Generation from Monocular Videos

تقدم هذه الورقة مجموعة بيانات ActionGenome4D ومهمة إنشاء مخطط المشهد العالمي (WSGG) لتمكين فهم المشهد المتمحور حول العالم والمستمر زمنياً من مقاطع الفيديو أحادية العدسة، مقترحةً ثلاث طرق مبتكرة وواضعةً خطوط أساس للاستدلال بشأن الأشياء المرئية والمحجوبة على حد سواء.

Rohith Peddi, Saurabh, Shravan Shanmugam, Likhitha Pallapothula, Yu Xiang, Parag Singla, Vibhav Gogate2026-03-16
💻 computer science

Out of Sight, Out of Mind? Evaluating State Evolution in Video World Models

تقدم هذه الورقة STEVO-Bench، وهو معيار تقييمي يختبر ما إذا كانت نماذج العالم المرئية (video world models) قادرة على الحفاظ على تطور الحالة بشكل مستقل عن الملاحظة، وذلك عبر اختبار أدائها تحت ظروف محكومة من حيث الحجب، والإضاءة، وحركات الكاميرا، مما يكشف في النهاية عن قيود كبيرة في الفصل بين هذه العمليات.

Ziqi Ma, Mengzhan Liufu, Georgia Gkioxari2026-03-16
🤖 AI

Visual-ERM: Reward Modeling for Visual Equivalence

تقدم هذه الورقة البحثية Visual-ERM، وهو نموذج مكافأة توليدي متعدد الوسائط يقيم مهام تحويل الرؤية إلى كود من خلال التقييم المباشر للتفاوتات البصرية الدقيقة في الفضاء المُصوّر، متجاوزاً بذلك قيود إشارات المكافأة الحالية لتحسين أداء التعلم التعزيزي وتوسيع نطاق الأداء عند الاختبار بشكل كبير عبر مهام إعادة بناء المخططات والجداول والرسوم المتجهة (SVG).

Ziyu Liu, Shengyuan Ding, Xinyu Fang, Xuanlang Dai, Penghui Yang, Jianze Liang, Jiaqi Wang, Kai Chen, Dahua Lin, Yuhang (…)2026-03-16
🤖 machine learning

Representation Learning for Spatiotemporal Physical Systems

تجادل هذه الورقة بأن تقييم النماذج الفيزيائية الزمكانية بناءً على قدرتها على تقدير المعلمات الفيزيائية الحاكمة، بدلاً من التنبؤ بالإطار التالي، يكشف أن طرق التعلم في الفضاء الكامن مثل نماذج (JEPAs) غالباً ما تتفوق على كل من نماذج التنبؤ على مستوى البكسل والنهج ذاتية الإشراف العامة في تعلم تمثيلات ذات صلة فيزيائياً.

Helen Qu, Rudy Morel, Michael McCabe, Alberto Bietti, François Lanusse, Shirley Ho, Yann LeCun2026-03-16
🤖 machine learning

Capturing Temporal Dynamics in Large-Scale Canopy Tree Height Estimation

تقدم هذه الورقة نهجاً جديداً للتعلم العميق يستخدم السلاسل الزمنية للأقمار الصناعية Sentinel-1 وSentinel-2، المدربة على بيانات ليدار (LiDAR) من نظام GEDI، لإنشاء أول خرائط زمنية لارتفاع الغطاء الشجري بدقة 10 أمتار لأوروبا للفترة 2019-2022، مما يتيح مراقبة الغابات وتقدير الكتلة الحيوية على نطاق واسع وبدقة عالية.

Jan Pauls, Max Zimmer, Berkant Turan, Sassan Saatchi, Philippe Ciais, Sebastian Pokutta, Fabian Gieseke2026-03-13
💻 computer science

InvAD: Inversion-based Reconstruction-Free Anomaly Detection with Diffusion Models

تقترح الورقة البحثية InvAD، وهي طريقة جديدة للكشف عن الشذوذ تعتمد على العكس، والتي تحقق أداءً هو الأفضل في فئتها وتسريعاً في الاستدلال بمقدار ضعفين من خلال تجاوز إعادة البناء الصريح وإزالة الضجيج المكلفة حوسبياً، وبدلاً من ذلك استنتاج المتغيرات الكامنة عبر خطوات عكس DDIM قليلة لقياس الانحرافات عن توزيع مسبق معروف.

Shunsuke Sakai, Xiangteng He, Chunzhi Gu, Leonid Sigal, Tatsuhito Hasegawa2026-03-13
💻 computer science

Image Segmentation via Variational Model Based Tailored UNet: A Deep Variational Framework

تقترح هذه الورقة VM_TUNet، وهو إطار عمل هجين مبتكر يدمج معادلة كاهن-هيليارد المعدلة من الدرجة الرابعة مع بنية UNet مخصصة للجمع بين القدرة على التفسير والحفاظ على الحواف التي تتميز بها النماذج التباينية وبين تعلم الميزات التكيفي للتعلم العميق، محققاً أداءً فائقاً في تقسيم الصور مع تحديد دقيق للحدود.

Kaili Qi, Wenli Yang, Ye Li, Zhongyi Huang2026-03-13
💻 computer science

TextFlux: An OCR-Free DiT Model for High-Fidelity Multilingual Scene Text Synthesis

يُعد TextFlux إطار عمل يعتمد على نماذج المحولات الانتشارية (DiT) وخالٍ من تقنيات التعرف الضوئي على الحروف (OCR)، ويحقق توليدًا عالي الدقة وقابلاً للتحكم للنصوص المشهدية متعددة اللغات مع قدرة توسع قوية في بيئات الموارد المنخفضة، بينما يتطلب 1% فقط من بيانات التدريب المستخدمة من قبل الطرق المنافسة.

Yu Xie, Jielei Zhang, Pengyu Chen, Weihang Wang, Longwen Gao, Peiyi Li, Qian Qiao, Zhouhui Lian2026-03-13