💻 computer science

Are VLMs Lost Between Sky and Space? LinkS2^2Bench for UAV-Satellite Dynamic Cross-View Spatial Intelligence

تقدم هذه الورقة البحثية LinkS2^2Bench، وهو أول معيار يربط بين لقطات الطائرات بدون طيار الديناميكية وصور الأقمار الصناعية الثابتة لتقييم وتحسين الذكاء المكاني عبر الرؤى لنماذج الرؤية واللغة، مما يكشف عن فجوات أداء كبيرة ويقترح محول محاذاة عبر الرؤى (Cross-View Alignment Adapter) لمعالجتها.

Dian Liu, Jie Feng, Di Li, Yuhui Zheng, Guanbin Li, Weisheng Dong, Guangming Shi2026-04-03
💻 computer science

Jagle: Building a Large-Scale Japanese Multimodal Post-Training Dataset for Vision-Language Models

تقدم هذه الورقة Jagle، وهو أكبر مجموعة بيانات يابانية لتدريب النماذج متعددة الوسائط بعد التدريب المسبق حتى الآن، والتي تضم 9.2 مليون نموذج تم إنشاؤها من مصادر متنوعة، مما يعزز بشكل كبير أداء نماذج الرؤية واللغة اليابانية مع الحفاظ على قدراتها الإنجليزية أو تحسينها.

Issa Sugiura, Keito Sasagawa, Keisuke Nakao, Koki Maeda, Ziqi Yin, Zhishen Yang, Shuhei Kurita, Yusuke Oda, Ryoko Tokuhi (…)2026-04-03
💻 computer science

True to Tone? Quantifying Skin Tone Fidelity and Bias in Photographic-to-Virtual Human Pipelines

تقترح هذه الورقة منهجية آلية بالكامل وقابلة للتوسع لقياس دقة لون البشرة في مسارات عمل البشر الافتراضيين، كاشفةً أن استراتيجيات الاستخراج الحالية تظهر انحيازاً يعتمد على النمط الظاهري وتنتج باستمرار أخطاءً لونية أعلى بالنسبة لدرجات البشرة الداكنة.

Gabriel Ferri Schneider, Erick Menezes, Rafael Mecenas, Paulo Knob, Victor Araujo, Soraia Raupp Musse2026-04-03
💻 computer science

COMPASS: Complete Multimodal Fusion via Proxy Tokens and Shared Spaces for Ubiquitous Sensing

تقترح الورقة البحثية إطار COMPASS، وهو إطار عمل قوي للدمج متعدد الوسائط يعالج تحديات فقدان الوسائط من خلال تخليق رموز بديلة (proxy tokens) محددة الهدف في فضاء كامن مشترك لضمان تلقي رأس الدمج دائمًا بنية مدخلات كاملة وثابتة، مما يجعله يتفوق على الأساليب الحالية عبر سيناريوهات استشعار متنوعة.

Hao Wang, Yanyu Qian, Pengcheng Weng, Zixuan Xia, William Dan, Yangxin Xu, Fei Wang2026-04-03
📈 economics

Network Structure in UK Payment Flows: Evidence on Economic Interdependencies and Implications for Real-Time Measurement

تُثبت هذه الورقة أن تحليل شبكات المدفوعات بين القطاعات في المملكة المتحدة باستخدام سمات نظرية المخططات يحسن بشكل كبير من دقة التنبؤ الاقتصادي والآنية (nowcasting) في الوقت الفعلي، لا سيما أثناء الاضطرابات مثل جائحة كوفيد-19، وذلك من خلال الكشف عن الترابطات الهيكلية والأهمية النظامية التي تغفلها الأساليب الثنائية التقليدية.

Aditya Humnabadkar2026-04-03
💻 computer science

PLUME: Latent Reasoning Based Universal Multimodal Embedding

يقدم PLUME إطار عمل لتمثيل متعدد الوسائط عالمي يستبدل استدلال سلسلة الأفكار الصريح والمكلف حاسوبياً بعملية تدحرج حالة كامنة موجهة دلالياً وفعالة، محققاً أداء استرجاع فائقاً على معيار MMEB-v2 مع توفير سرعة استنتاج تزيد عن 30 ضعفاً.

Chenwei He, Xiangzhao Hao, Tianyu Yang, Yuxiang Ma, Yuheng Jia, Lingxiang Wu, Chaoyang Zhao, Haiyun Guo, Jinqiao Wang2026-04-03
💻 computer science

FlowSlider: Training-Free Continuous Image Editing via Fidelity-Steering Decomposition

يُعد FlowSlider طريقةً لا تتطلب تدريباً للتحرير المستمر للصور في تدفق التصحيح (Rectified Flow)، حيث يحقق تحكماً سلساً وموثوقاً بأسلوب المنزلق عبر تفكيك التحديثات إلى حدّي دقة وتوجيه متعامدين، مما يسمح بتعديل القوة عبر تغيير قياس حد التوجيه دون الحاجة إلى وحدات مساعدة أو تدريب لاحق.

Taichi Endo, Guoqing Hao, Kazuhiko Sumi2026-04-03
💻 computer science

Center-Aware Detection with Swin-based Co-DETR Framework for Cervical Cytology

تقدم هذه الورقة حلاً فائزاً لتحدي RIVA لخلية عنق الرحم يجمع بين هيكل Swin-Large وإطار عمل Co-DINO، ويقدم التنبؤ بنقطة المركز، وتعزيز البيانات المتخصص، وتحسين الصندوق الهندسي لمعالجة تحديات التوزيع الكثيف للخلايا والتعليقات التوضيحية ذات الحجم الثابت في صور خلوات عنق الرحم.

Yan Kong, Yuan Yin, Hongan Chen, Yuqi Fang, Caifeng Shan2026-04-03
💻 computer science

Beyond the Fold: Quantifying Split-Level Noise and the Case for Leave-One-Dataset-Out AU Evaluation

تُثبت هذه الورقة أن التحقق المتقاطع الحصري للموضوعات في الكشف عن وحدات الحركة الوجهية يُدخل تباينًا عشوائيًا كبيرًا يمكن أن يحجب التحسينات الحقيقية للنموذج، مما يدعو إلى اعتماد تقييم "ترك مجموعة بيانات واحدة خارجًا" للكشف عن مقاييس أداء أكثر استقرارًا وقابلية للتفسير.

Saurabh Hinduja, Gurmeet Kaur, Maneesh Bilalpur, Jeffrey Cohn, Shaun Canavan2026-04-03
💻 computer science

Modular Energy Steering for Safe Text-to-Image Generation with Foundation Models

تقترح هذه الورقة إطار عمل معياريًا للاستدلال في وقت التشغيل لا يتطلب تدريبًا، يستفيد من التغذية الراجعة للتدرج من النماذج التأسيسية للرؤية واللغة المجمدة كإشارات إشرافية قائمة على الطاقة لتوجيه توليد الصور من النص نحو الأمان دون المساس بجودة الصورة أو قابلية توسع النموذج.

Yaoteng Tan, Zikui Cai, M. Salman Asif2026-04-03