🤖 AI

PhotoFlow: Agentic 3D Virtual Photography Missions

تقدم الورقة البحثية PhotoFlow، وهو إطار عمل وكيل يتميز بهيكلية (المخرج-المراجع-العاكس)، وVPhotoBench، وهو معيار جديد، لتمكين التصوير الفوتوغرافي الافتراضي المشروط باللغة في مشاهد ثلاثية الأبعاد عشوائية من خلال الجمع بفعالية بين الاستدلال المكاني المعقد والتقدير الجمالي للتفوق على الأساليب الحالية.

Jiarui Guo, Haojia Wei, Yiming Zhang, Yifei Liu, Yuning Gong, Hongjie Zhang, Xue Yang, Zhihang Zhong2026-05-25
🤖 machine learning

Debiased Negative Mining Improves Out-of-distribution Detection with Pre-trained Vision-Language Models

تقترح هذه الورقة طريقة مبتكرة للكشف عن البيانات خارج التوزيع باستخدام نماذج الرؤية واللغة سابقة التدريب، والتي تعالج مشكلة السلبيات الكاذبة في تنقيب الملصقات السلبية من خلال تقديم إطار نظري لأخذ العينات غير المنحازة، والذي تم تنفيذه عملياً كأخذ عينات بطريقة مونت كارلو لتحقيق أداء يمثل أحدث ما توصل إليه العلم.

Bo Peng, Jie Lu, Guangquan Zhang, Zhen Fang2026-05-25
🤖 AI

Not Too Generative, Not Too Discriminative: The Human Alignment Sweet Spot

باستخدام نماذج الطاقة المشتركة لعزل أهداف التعلم ضمن بنية ثابتة، تُظهر هذه الدراسة أن التمثيلات المرئية المتوافقة مع القدرات البشرية لا يتم تعظيمها من خلال التدريب التمييزي أو التوليدي البحت، بل من خلال توازن أمثل بين كلا الهدفين.

Jorge Chang Ortega, Bastien Le Lan, Thomas Serre, Victor Boutin2026-05-25
💬 NLP

Decomposing Queries into Tool Calls for Long-Video Keyframe Retrieval

تقدم الورقة البحثية ToolMerge، وهي طريقة مبتكرة لاسترجاع الإطارات الرئيسية تستفيد من نموذج لغوي كبير لتفكيك الاستعلامات إلى استدعاءات أدوات محددة ودمج نتائجها عبر معاملات بولينية، مما يظهر أداءً تنافسيًا على مقياس Molmo-2 Moments المقترح حديثًا.

Michal Shlapentokh-Rothman, Prachi Garg, Yu-Xiong Wang, Derek Hoiem2026-05-25
💻 computer science

MuellerPT: Decomposition Driven Pretraining for Dense Learning in Mueller Polarimetry

يقدم MuellerPT إطار عمل للتدريب المسبق بتوجيه فيزيائي يتنبأ بخرائط تفكيك Lu-Chipman من مصفوفات ميويلر باستخدام مجموعة بيانات جديدة واسعة النطاق، مما يحسن بشكل كبير من كفاءة الملصقات ونقل العينات عبر مختلف العينات لمهام التجزئة والتصنيف في المجال الحيوي الطبي تحت سيناريوهات التعلم بلقطات قليلة.

Adam Tlemsani, Yingdian Li, Maxime Giot, Naim Slim, Christopher J. Peters, Abhijeet Ghosh, Daniel S. Elson2026-05-25
🤖 AI

Leveraging Foundation Models for Causal Generative Modeling

تقدم هذه الورقة FM-CGM، وهو إطار عمل معياري يستفيد من النماذج التأسيسية سابقة التدريب وآلية توجيه دلالي سببي مبتكرة لتمكين الاكتشاف السببي، والتدخل، وتوليد الصور الواقعي المضاد للواقع (counterfactual) ضمن مسار موحد في مرحلة الصفر (zero-shot).

Aneesh Komanduri, Xintao Wu2026-05-25
💻 computer science

Vision Transformers Need Better Token Interaction

تحدد هذه الورقة "الانتشار الدلالي" كسبب لتدهور تمثيلات الرقع في نماذج المحولات الرؤيوية أثناء التدريب المطول، وتقترح استبدال انتباه "softmax" بـ "entmax-1.5" لتمكين تفاعلات الرموز الانتقائية، مما يحسن بشكل كبير أداء التنبؤ الكثيف مع الحفاظ على السياق العالمي.

Linxiang Su2026-05-25
💻 computer science

HorizonStream: Long-Horizon Attention for Streaming 3D Reconstruction

تُعد HorizonStream نموذج "ترانسفورمر" (Transformer) مبتكرًا للمدى الطويل، يحقق إعادة بناء ثلاثية الأبعاد عبر الإنترنت مستقرة وبأداء فائق على تسلسلات تتجاوز 10,000 إطار بذاكرة ثابتة ووقت خطي، وذلك من خلال تحليل الانتشار الهندسي إلى اضمحلال متعدد المقاييس الزمنية ومطابقة مكانية زمانية موضعية للتغلب على قيود الانجراف والذاكرة في الطرق الحالية.

Chong Cheng, Peilin Tao, Nanjie Yao, Guanzhi Ding, Xianda Chen, Yuansen Du, Xiaoyang Guo, Wei Yin, Weiqiang Ren, Qian Zh (…)2026-05-25
💻 computer science

Smart-Insertion-V: Photorealistic Video Insertion via a Closed-Loop Feedback Dual-Stream Framework

تقترح الورقة البحثية Smart-Insertion-V، وهو إطار عمل ثنائي المسار ذو تغذية راجعة مغلقة الحلقة يدمج إدراج الفيديو مع نقل أسلوب الصورة، ويستخدم وحدات متخصصة مثل Dual-World-View RoPE ووحدة التوجيه المنفصلة (Decoupled Guidance Module) لتحقيق إدراج كائنات واقعي ومتناغم حتى في ظل وجود فجوات أسلوبية حادة بين النطاقات.

Xiao Cao, Yansong Qu, Xiangzhen, Chang, Wen Xiao, Jiakui Hu, Heyuan Li, Jialun Liu, Zhiyong Huang, Xuelong Li2026-05-25
💬 NLP

ETCHR: Editing To Clarify and Harness Reasoning

تقدم الورقة البحثية ETCHR، وهو إطار عمل لتحرير الصور يعتمد على الفصل والوعي بالاستدلال، يعمل على سد الفجوة بين الأسئلة المجردة والتحولات البصرية من خلال وصفة تدريب مكونة من مرحلتين، مما يعزز بشكل كبير قدرات الاستدلال البصري لمختلف النماذج اللغوية الكبيرة متعددة الوسائط عبر عائلات مهام متعددة.

Beichen Zhang, Yuhong Liu, Jinsong Li, Yuhang Zang, Jiaqi Wang, Dahua Lin2026-05-25