💻 computer science

FullFlow: Upgrading Text-to-Image Flow Matching Models for Bidirectional Vision--Language Generation

تُعد FullFlow طريقةً فعالةً من حيث الكفاءة في المعلمات، حيث تعمل على ترقية نماذج توليد الصور من النصوص القائمة على التدفق المستقيمي (rectified-flow) والمُدربة مسبقاً إلى مولدات ثنائية الاتجاه للرؤية واللغة عبر تدريب محولات خفيفة الوزن فقط، محققةً أداءً رائدًا في كل من توليد الصور والنصوص مع تقليل التكاليف الحسابية بشكل كبير مقارنةً بالأساليب الحالية.

Eric Tillmann Bill, Enis Simsar, Alessio Tonioni, Thomas Hofmann2026-05-21
💻 computer science

Capability \neq Interpretability: Human Interpretability of Vision Foundation Models

تقدم هذه الورقة إطاراً قائماً على الفيزياء النفسية يثبت أن نماذج الرؤية التأسيسية أقل قابلية للتفسير من قبل البشر باستمرار مقارنة بنظيراتها الخاضعة للإشراف، مما يكشف أن القابلية للتفسير هي بُعد مستقل مدفوع بمحلية الميزات والمحاذاة الدلالية خشنة الحبيبات بدلاً من القدرة الإجمالية للنموذج.

Julien Colin, Lore Goetschalckx, Nuria Oliver, Thomas Serre2026-05-21
💻 computer science

ParaVT: Taming the Tool Prior Paradox for Parallel Tool Use in Agentic Video Reinforcement Learning

يقدم ParaVT إطار عمل جديداً متعدد الوكلاء لاستدعاء أدوات الفيديو المتوازي في التعلم المعزز، متجاوزاً "مفارقة أولوية الأداة" من خلال خوارزمية PARA-GRPO الخاصة به لتحقيق فهم فائق للفيديوهات الطويلة مع تحسين استقرار التنسيق والقدرة على تحمل الأخطاء مقارنة بالنماذج المرجعية المتسلسلة.

Zuhao Yang, Kaichen Zhang, Sudong Wang, Keming Wu, Zhongyu Yang, Bo Li, Xiaojuan Qi, Shijian Lu, Xingxuan Li, Lidong Bin (…)2026-05-21
💻 computer science

Latent Space Guided Scenario Sampling for Multimodal Segmentation Under Missing Modalities

تقترح هذه الورقة استراتيجية تدريب مبتكرة للتجزئة الدلالية متعددة الوسائط في ظل فقدان بعض الوسائط، حيث توجه عملية الضبط الدقيق نحو سيناريوهات توافر الوسائط الأكثر غنىً بالمعلومات من خلال تعلم توزيع أخذ العينات من الفضاء الكامن مسبق التدريب بناءً على تشوه التمثيل، مما يؤدي إلى تفوقها على طرق الضبط الدقيق القياسية وطرق التكيف القائمة على تقنية LoRA.

Irem Ulku, Ö. Özgür Tanrıöver, Erdem Akagündüz2026-05-21
💻 computer science

Lighting-aware Unified Model for Instance Segmentation

تقدم هذه الورقة وحدة "Lighting Convolutional-Attention" (LCA)، وهي وحدة مهايئة خفيفة الوزن تعزز من متانة الإضاءة للنماذج التأسيسية مثل SAM لتقسيم العناصر من خلال معالجة ميزات RGB جنباً إلى جنب مع خرائط التباين والتحسين عبر استراتيجية تدريب زوجي، والتي تم التحقق من صحتها من خلال تجارب مكثفة على المعايير الحالية ومجموعة بيانات اصطناعية جديدة قائمة على Unity.

Qisai Liu, Alloy Das, Zhanhong Jiang, Joshua R. Waite, Aditya Balu, Adarsh Krishnamurthy, Soumik Sarkar2026-05-21
💻 computer science

Understanding Model Behavior in Monocular Polyp Sizing

تدقق هذه الورقة البحثية نماذج تصنيف حجم السلائل أحادية العدسة عبر مجموعات بيانات وبنيات متنوعة، كاشفةً أن أداءها يعتمد على إشارات سلوك الفحص بدلاً من المقاييس المترية الحقيقية، وتحدد دقة المقياس المتري ومتانة قناع التجزئة كعائقين مستقلين تفشل طرق تقدير العمق والمعايرة الحالية في التغلب عليهما.

Xinqi Xiong, Andrea Dunn Beltran, Junmyeong Choi, Sarah K. McGill, Marc Niethammer, Roni Sengupta2026-05-21
🔬 physics

EPC-3D-Diff: Equivariant Physics Consistent Conditional 3D Latent Diffusion for CBCT to CT Synthesis

تقترح الورقة البحثية EPC-3D-Diff، وهو إطار عمل جديد للانتشار الكامن ثلاثي الأبعاد المشروط يدمج فقدان تباين نطاق الإسقاط المستمد من الفيزياء لتخليق أحجام تصوير مقطعي محوسب عالية الجودة ودقيقة من حيث وحدات هونسفيلد (HU) من فحوصات التصوير المقطعي بالحزمة المخروطية (CBCT)، متفوقاً بشكل كبير على أحدث الأساليب في كل من مجموعات بيانات النماذج التجريبية والبيانات السريرية.

Alzahra Altalib, Chunhui Li, Haytham Al Ewaidat, Khaled Alawneh, Ahmad Qendel, Alessandro Perelli2026-05-21
💻 computer science

Goodbye Drift: Anchored Tree Sampling for Long-Horizon Video-to-Video Generation

تقدم هذه الورقة البحثية "أخذ عينات الشجرة المرتكزة" (ATS)، وهو مجدول استدلال لا يتطلب تدريباً، يعمل على التخفيف من مشكلات الانحراف واستمرارية الفيديو طويلة الأمد عبر استبدال عمليات التوليد التتابعية ذاتية الانحدار باستراتيجية استكمال هرمية مقيدة بمرتكزات، مما يحقق جودة واستقراراً فائقين في توليد الفيديو من فيديو إلى فيديو تحت كاميرا ثابتة.

Matthew Bendel, Stephen W. Bailey, Mithilesh Vaidya, Sumukh Badam, Xingzhe He2026-05-21
💻 computer science

Oracle Supervision Transfers for Hyperparameter Prediction in Model-Based Image Denoising

تقترح الورقة البحثية HyperDn، وهو متنبئ يعتمد على تكوين واحد مشروط، يقوم بنقل الإشراف المثالي (oracle supervision) من تكوينات إزالة الضجيج المصدرية إلى تكوينات هدف جديدة، مما يتيح التنبؤ بالمعلمات الفائقة بمستوى يقارب المستوى المثالي لمرشحات إزالة الضجيج في الصور القائمة على النماذج، وذلك بعدد أقل بكثير أو حتى بدون تسميات مثالية مستهدفة.

Jianmin Liao, Lixin Shen, Yuesheng Xu2026-05-21
🧬 biology

Platonic Representations in the Human Brain: Unsupervised Recovery of Universal Geometry

تُثبت هذه الورقة أن التمثيلات العصبية الوظيفية (fMRI) الخاصة بكل فرد في القشرة البصرية البشرية تشترك في بنية هندسية عالمية، مما يتيح الترجمة غير الخاضعة للإشراف للتمثيلات العصبية عبر الأفراد من خلال دورات متعامدة دون الحاجة إلى بيانات مقترنة أو نماذج وسيطة.

Pablo Marcos-Manchón, Rishi Jha, Lluís Fuentemilla2026-05-21