💻 computer science

VSearcher: Long-Horizon Multimodal Search Agent via Reinforcement Learning

تقدم هذه الورقة البحثية VSearcher، وهو وكيل بحث متعدد الوسائط يعتمد على التعلم التعزيزي يحول النماذج الساكنة إلى متصفحات ويب قادرة على تنفيذ مهام طويلة المدى من خلال خط إنتاج تكراري لتخليق البيانات واستراتيجية تدريب تعتمد على الضبط الدقيق الموجه (SFT) ثم التعلم التعزيزي (RL)، محققاً أداءً فائقاً في معيار MM-SearchExam المقترح.

Ruiyang Zhang, Qianguo Sun, Chao Song, Yiyan Qi, Zhedong Zheng2026-03-09
💻 computer science

Think-as-You-See: Streaming Chain-of-Thought Reasoning for Large Vision-Language Models

تقدم هذه الورقة إطار عمل "التفكير أثناء الرؤية" (TaYS)، وهو إطار عمل موحد يتيح تسلسلاً استنتاجياً متزامناً وتدفقياً لسلاسل الأفكار لنماذج اللغة والرؤية الكبيرة من خلال فصل الترميز البصري عن الاستنتاج النصي، مما يتفوق على النهج التقليدي القائم على الدفعات والتداخل في كل من الدقة وزمن الاستجابة لفهم الفيديو في الوقت الفعلي.

Jialiang Zhang, Junlong Tong, Junyan Lin, Hao Wu, Yirong Sun, Yunpu Ma, Xiaoyu Shen2026-03-09
💻 computer science

Digital-Twin Losses for Lane-Compliant Trajectory Prediction at Urban Intersections

تقدم هذه الورقة إطار عمل للتنبؤ بمسار المركبات (V2X) في التقاطعات الحضرية مدفوعاً بالتوأم الرقمي، والذي يستخدم دالة خسارة توأم مبتكرة إلى جانب متوسط مربع الخطأ (MSE) القياسي لفرض قواعد المرور، وتجنب الاصطدام، وتنوع الحركة، مما يقلل بشكل كبير من انتهاكات السلامة مع الحفاظ على دقة التنبؤ العالية والأداء في الوقت الفعلي.

Kuo-Yi Chao, Erik Leo Haß, Melina Gegg, Jiajie Zhang, Ralph Raßhofer, Alois Christian Knoll2026-03-09
💻 computer science

Thinking with Spatial Code for Physical-World Video Reasoning

تقدم هذه الورقة البحثية "التفكير باستخدام الكود المكاني"، وهو إطار عمل يحول مقاطع الفيديو من نوع RGB إلى تمثيلات ثلاثية الأبعاد متماسكة زمنياً بشكل صريح باستخدام مشفر مكاني متخصص والتعلم التعزيزي، مما يمكّن النماذج اللغوية الكبيرة من تحقيق أداء رائد في الاستدلال البصري للعالم الفيزيائي على مقياس VSI-Bench.

Jieneng Chen, Wenxin Ma, Ruisheng Yuan, Yunzhi Zhang, Jiajun Wu, Alan Yuille2026-03-09
🤖 machine learning

From Decoupled to Coupled: Robustness Verification for Learning-based Keypoint Detection with Joint Specifications

تقدم هذه الورقة أول إطار عمل للتحقق من المتانة المقترن لكواشف النقاط الرئيسية القائمة على الخرائط الحرارية، والذي يستخدم برنامج خطي بمتغيرات صحيحة مختلطة لتقييد الانحرافات عبر جميع النقاط الرئيسية بشكل مشترك، مما يوفر ضمانات سليمة وأقل تحفظاً من الطرق السابقة المنفصلة.

Xusheng Luo, Changliu Liu2026-03-09
🤖 AI

DreamCAD: Scaling Multi-modal CAD Generation using Differentiable Parametric Surfaces

يُعد DreamCAD إطار عمل توليدي متعدد الوسائط يُمكّن من توليد نماذج CAD عالية الدقة وقابلة للتوسع عبر تمثيل تمثيلات هندسية (BReps) قابلة للتعديل كأطح بارامترية قابلة للتفاضل للتدريب على شبكات ثلاثية الأبعاد غير مُعنونة، مع تقديمه أيضاً لمجموعة بيانات CADCap-1M واسعة النطاق لدفع أبحاث تحويل النص إلى CAD.

Mohammad Sadil Khan, Muhammad Usama, Rolandos Alexandros Potamias, Didier Stricker, Muhammad Zeshan Afzal, Jiankang Deng (…)2026-03-09
🤖 AI

Adversarial Batch Representation Augmentation for Batch Correction in High-Content Cellular Screening

تقترح هذه الورقة البحثية "تعزيز تمثيل الدفعات الخصومي" (ABRA)، وهو إطار عمل لتعميم النطاق يقوم بتخليق اضطرابات الدفعات الحيوية في الحالة الأسوأ عبر نمذجة عدم اليقين الهيكلي والهوامش الهندسية الزاوية لتحقيق أحدث مستويات تصحيح الدفعات والتعميم في الفحص الخلوي عالي المحتوى دون الاعتماد على معرفة مسبقة إضافية.

Lei Tong, Xujing Yao, Adam Corrigan, Long Chen, Navin Rathna Kumar, Kerry Hallbrook, Jonathan Orme, Yinhai Wang, Huiyu Z (…)2026-03-09
💻 computer science

Rethinking Concept Bottleneck Models: From Pitfalls to Solutions

تقدم هذه الورقة CBM-Suite، وهو إطار عمل شامل يعالج القيود الرئيسية لنماذج عنق زجاجة المفاهيم (Concept Bottleneck Models) من خلال اقتراح مقياس قائم على الإنتروبيا لصلة المفهوم، وطبقة غير خطية لمنع تجاوز عنق الزجاجة، واستراتيجية تقطير لسد فجوة الدقة مع النماذج الغامضة.

Merve Tapli, Quentin Bouniot, Wolfgang Stammer, Zeynep Akata, Emre Akbas2026-03-09
🤖 machine learning

Making Reconstruction FID Predictive of Diffusion Generation FID

تقدم هذه الورقة مقياس FID المترابط (iFID)، وهو مقياس مبتكر يحقق ارتباطاً قوياً مع FID الخاص بنماذج الانتشار من خلال استيفاء التمثيلات الكامنة بين عينات مجموعة البيانات وأقرب جيرانها، متجاوزاً بذلك قيود FID إعادة البناء التقليدي في التنبؤ بجودة النماذج التوليدية.

Tongda Xu, Mingwei He, Shady Abu-Hussein, Jose Miguel Hernandez-Lobato, Haotian Zhang, Kai Zhao, Chao Zhou, Ya-Qin Zhang (…)2026-03-09
🤖 AI

When Rubrics Fail: Error Enumeration as Reward in Reference-Free RL Post-Training for Virtual Try-On

تقدم هذه الورقة طريقة "عد الأخطاء الضمني" (IEC)، وهي طريقة تدريب لاحقة تعتمد على التعلم المعزز وتفتقر إلى المرجع، حيث تقوم بحصر الأخطاء ووزنها لتوليد المكافآت، مما يظهر أداءً فائقاً على طريقة "المعايير كمكافآت" (RaR) في مهام القياس الافتراضي حيث توجد مخرجات متعددة صالحة وتغيب الإجابات المرجعية المثالية.

Wisdom Ikezogwo, Mehmet Saygin Seyfioglu, Ranjay Krishna, Karim Bouyarmane2026-03-09