💻 computer science

KARL: Knowledge-Aware Reasoning and Reinforcement Learning for Knowledge-Intensive Visual Grounding

تعالج هذه الورقة فجوة التجذير المعرفي في عملية التأسيس البصري كثيف المعرفة من خلال اقتراح KARL، وهو إطار عمل يجمع بين بيانات الاستدلال الموجهة معرفيًا والتعلم التعزيزي التكيفي لتحسين تحديد مواقع الكيانات، والذي تم التحقق من صحته بواسطة مقياس KVG-Bench الجديد.

Xinyu Ma, Ziyang Ding, Zhicong Luo, Chi Chen, Zonghao Guo, Derek F. Wong, Zhen Zhao, Xiaoyi Feng, Maosong Sun2026-04-03
💻 computer science

Fast Sphericity and Roundness approximation in 2D and 3D using Local Thickness

تقترح هذه الورقة خوارزمية جديدة وفعالة حاسوبياً لتقريب قيم الكروية والتدوير في الصور ثنائية وثلاثية الأبعاد من خلال الاستفادة من قيم السمك المحلي لتبسيط حسابات مساحة السطح وانحناء الزوايا، مما يوفر بديلاً سريعاً للتعريفات الصارمة لمجموعات البيانات المجهرية الضخمة.

Pawel Tomasz Pieta, Peter Winkel Rasumssen, Anders Bjorholm Dahl, Anders Nymark Christensen2026-04-03
🤖 machine learning

Power-scaled Bayesian Inference with Score-based Generative Models

تقترح هذه الورقة خوارزمية توليدية قائمة على الدرجة (score-based) تتيح تحكماً مرناً، دون الحاجة لإعادة التدريب، في تأثير الاحتمالية المسبقة (prior-likelihood) في الاستدلال البايزي لنمذجة السرعة الزلزالية، مما يثبت أن رفع مقياس قوة الاحتمالية (likelihood) يحسن دقة البيانات، بينما يؤدي تقليل قوة الاحتمالية المسبقة (prior) إلى تعزيز التنوع الهيكلي.

Huseyin Tuna Erdinc, Yunlin Zeng, Abhinav Prakash Gahlot, Felix J. Herrmann2026-04-03
🤖 machine learning

Demystifying Transition Matching: When and Why It Can Beat Flow Matching

تُثبت هذه الورقة نظرياً وتجريبياً أن مطابقة الانتقال (Transition Matching) تتفوق على مطابقة التدفق (Flow Matching) في النمذجة التوليدية من خلال تحقيق تباعد كولباك - ليبلر (KL divergence) أقل وتقارب أسرع، لا سيما عند استهداف توزيعات ذات أنماط متباعدة جيداً وتباينات غير مهملة بفضل قدرتها على الحفاظ على تغاير الهدف من خلال التحديثات العشوائية.

Jaihoon Kim, Rajarshi Saha, Minhyuk Sung, Youngsuk Park2026-04-03
💬 NLP

WAON: Large-Scale Japanese Image-Text Pair Dataset for Improving Model Performance on Japanese Cultural Tasks

تقدم هذه الورقة البحثية WAON، وهو مجموعة بيانات يابانية ضخمة للصور والنصوص تحتوي على ما يقرب من 155 مليون مثال، إلى جانب معيار تقييم منسق (WAON-Bench)، لمعالجة ندرة البيانات الثقافية اليابانية عالية الجودة ولإثبات أن الضبط الدقيق على مجموعة البيانات هذه يحسن بشكل كبير أداء نماذج الرؤية واللغة في المهام الثقافية اليابانية.

Issa Sugiura, Shuhei Kurita, Yusuke Oda, Daisuke Kawahara, Yasuo Okabe, Naoaki Okazaki2026-04-03
💻 computer science

FastSurfer-CC: A robust, accurate, and comprehensive framework for corpus callosum morphometry

تقدم هذه الورقة FastSurfer-CC، وهو إطار عمل آلي بالكامل وقوي لقياس مورفولوجيا الجسم المقطعي (corpus callosum)، يتفوق على الأدوات الحالية في التجزئة واستخراج المقاييس، بينما ينجح في اكتشاف الفروق المرضية الدقيقة لدى مرضى داء هنتنغتون التي تغفل عنها الأساليب الحالية المتطورة.

Clemens Pollak, Kersten Diers, Santiago Estrada, David Kügler, Martin Reuter2026-04-03
🤖 machine learning

Bias Is a Subspace, Not a Coordinate: A Geometric Rethinking of Post-hoc Debiasing in Vision-Language Models

تقدم هذه الورقة البحثية "إزالة الانحياز عبر إسقاط الفضاء الجزئي" (Subfield Projection Debiasing - SPD)، وهو إطار هندسي يحسن الأساليب اللاحقة القائمة على الإحداثيات من خلال تحديد وإزالة الانحياز باعتباره فضاءً خطياً موزعاً بدلاً من كونه إحداثيات معزولة، مما يحقق عدالة أقوى بكثير مع حد أدنى من الخسارة في الأداء في نماذج الرؤية واللغة.

Dachuan Zhao, Weiyue Li, Zhenda Shen, Yushu Qiu, Bowen Xu, Haoyu Chen, Yongchao Chen2026-04-03
🤖 machine learning

Structure is Supervision: Multiview Masked Autoencoders for Radiology

تقدم هذه الورقة البحثية "المشفرات التلقائية المقنعة متعددة الرؤى" (MVMAE) ومتغيرها المعزز بالنصوص (MVMAE-V2T)، وهي أطر عمل ذات تعلم ذاتي التوجيه تستفيد من البنية الطبيعية متعددة الرؤى والتقارير الإشعاعية للبيانات السريرية لتعلم تمثيلات قوية وذات صلة بالأمراض تتفوق على النماذج المرجعية الحالية القائمة على التعلم الخاضع للإشراف واللغة والرؤية في تصنيف الصور الطبية.

Sonia Laguna, Andrea Agostini, Alain Ryser, Samuel Ruiperez-Campillo, Irene Cannistraci, Moritz Vandenhirtz, Stephan Man (…)2026-04-03
🤖 machine learning

Deterministic World Models for Verification of Closed-loop Vision-based Systems

تقترح هذه الورقة نموذج عالم حتمي (DWM) يلغي المتغيرات الكامنة العشوائية لرسم خرائط حالات النظام مباشرة إلى صور، مما يتيح تحققاً أكثر دقة لأنظمة التحكم القائمة على الرؤية ذات الحلقة المغلقة من خلال مجموعات وصول أضيق وحدود إحصائية صارمة لانحرافات المسار.

Yuang Geng, Zhuoyang Zhou, Zhongzheng Zhang, Siyuan Pan, Hoang-Dung Tran, Ivan Ruchkin2026-04-03
💻 computer science

SALAD: Achieve High-Sparsity Attention via Efficient Linear Attention Tuning for Video Diffusion Transformer

تُعد SALAD طريقة ضبط دقيق فعالة لنماذج محولات الانتشار المرئية (Video Diffusion Transformers) تحقق ما يصل إلى 90% من ندرة الانتباه وتسريعاً في الاستدلال بمقدار ضعفين من خلال إدخال فرع انتباه خطي خفيف الوزن متوازن مع انتباه نادر عبر استراتيجية قياس ثابتة-ديناميكية متعددة المستويات، كل ذلك مع الحفاظ على جودة التوليد بأقل قدر من بيانات التدريب والتكلفة الحسابية.

Tongcheng Fang, Hanling Zhang, Ruiqi Xie, Zhuo Han, Xin Tao, Tianchen Zhao, Pengfei Wan, Wenbo Ding, Wanli Ouyang, Xuefe (…)2026-04-03