🤖 machine learning

Insight-V++: Towards Advanced Long-Chain Visual Reasoning with Multimodal Large Language Models

تقدم هذه الورقة البحثية Insight-V++، وهو إطار عمل موحد متعدد الوكلاء يعالج ندرة بيانات الاستدلال البصري طويلة السلسلة من خلال توظيف مسار قابل للتوسع وذاتي التحسين باستخدام خوارزميات ST-GRPO وJ-GRPO المبتكرة لتعزيز قدرات الاستدلال المكاني-الزماني في النماذج اللغوية الكبيرة متعددة الوسائط بشكل كبير.

Yuhao Dong, Zuyan Liu, Shulin Tian, Yongming Rao, Ziwei Liu2026-03-20
🤖 AI

VLM-AutoDrive: Post-Training Vision-Language Models for Safety-Critical Autonomous Driving Events

يُعد VLM-AutoDrive إطار عمل معياري لما بعد التدريب يعمل على تكييف النماذج اللغوية الرؤية العامة لتكتشف بفعالية أحداث القيادة النادرة والحرجة من حيث السلامة، مثل الاصطدامات، وذلك عبر دمج البيانات الوصفية، والأوصاف المولدة بواسطة النماذج اللغوية الكبيرة، واستدلال سلسلة الأفك "chain-of-thought"، مما يحقق مكاسب كبيرة في الأداء واتخاذ قرار قابل للتفسير في لقطات كاميرات لوحة القيادة الواقعية.

Mohammad Qazim Bhat, Yufan Huang, Niket Agarwal, Hao Wang, Michael Woods, John Kenyon, Tsung-Yi Lin, Xiaodong Yang, Ming (…)2026-03-20
💻 computer science

Semantic Segmentation and Depth Estimation for Real-Time Lunar Surface Mapping Using 3D Gaussian Splatting

تقدم هذه الورقة إطار عمل لرسم خرائط سطح القمر في الوقت الفعلي يدمج التجزئة الدلالية وتقدير العمق الكثيف مع تقنية "Gaussian Splatting" ثلاثية الأبعاد لتحقيق إعادة بناء ثلاثية الأبعاد عالية الدقة وتفصيلية في البيئات الصعبة، متفوقة بذلك على النماذج المرجعية التقليدية للسحابة النقطية التي لا تعتمد على تقنية ليدار (LiDAR).

Guillem Casadesus Vila, Adam Dai, Grace Gao2026-03-20
💻 computer science

Toward Reliable, Safe, and Secure LLMs for Scientific Applications

تقترح هذه الورقة إطار عمل شاملاً لنشر نماذج لغوية كبيرة موثوقة في التطبيقات العلمية من خلال تقديم تصنيف متخصص للتهديدات، ونظام متعدد الوكلاء لتوليد اختبارات مرجعية عدائية متخصصة في مجالات معينة، واستراتيجية دفاعية متعددة الطبقات تدمج اختبار الاختراق، وضوابط الحدود، ووكلاء سلامة استباقيين لمعالجة مخاطر الموثوقية والسلامة والأمن الفريدة التي تواجه العلماء الاصطناعيين.

Saket Sanjeev Chaturvedi, Joshua Bergerson, Tanwi Mallick2026-03-20
🤖 machine learning

Fast and Generalizable NeRF Architecture Selection for Satellite Scene Reconstruction

تقدم هذه الورقة PreSCAN، وهو إطار عمل تنبؤي يستفيد من تحليل SHAP لتحديد اتساق تعدد الرؤى كعامل رئيسي في جودة NeRF، مما يتيح اختيار البنيات المثلى لإعادة بناء المشاهد الساتلية في أقل من 30 ثانية مع حد أدنى من الخطأ، مع تقليل استهلاك الطاقة وزمن الاستجابة عند النشر على الحافة بشكل كبير دون إعادة تدريب.

Devjyoti Chakraborty, Zaki Sukma, Rakandhiya D. Rachmanto, Kriti Ghosh, In Kee Kim, Suchendra M. Bhandarkar, Lakshmish R (…)2026-03-20
💻 computer science

Unrolled Reconstruction with Integrated Super-Resolution for Accelerated 3D LGE MRI

تقترح هذه الورقة إطار عمل إعادة بناء غير ملفوف هجين يدمج شبكة تعزيز دقة الصور العميقة (EDSR) مباشرة في حلقة التحسين لفرض اتساق البيانات وتعزيز الدقة بشكل مشترك، مما يظهر جودة صورة فائقة وأداءً متفوقًا في تقسيم الأذين الأيسر لتصوير الرنين المغناطيسي ثلاثي الأبعاد المسرع لتعزيز غادولينيوم المتأخر مقارنة بالطرق الحالية.

Md Hasibul Husain Hisham, Shireen Elhabian, Ganesh Adluru, Jason Mendes, Andrew Arai, Eugene Kholmovski, Ravi Ranjan, Ed (…)2026-03-20
🤖 AI

To See or To Please: Uncovering Visual Sycophancy and Split Beliefs in VLMs

تقدم هذه الورقة إطاراً تشخيصياً ثلاثي الطبقات ليكشف أن نماذج الرؤية واللغة الضخمة تظهر غالباً "تزلفاً بصرياً" — عبر الهلوسة لتلبية توقعات المستخدم رغم إدراكها للعيوب البصرية — بينما تفشل في الإقرار بعدم اليقين، وهي مشكلة يفاقمها التوسع وحده ولكن يمكن التخفيف من حدتها عبر استراتيجية تنبؤ انتقائي لاحقة مجانية التكلفة.

Rui Hong, Shuxue Quan2026-03-20
💻 computer science

SynQ: Accurate Zero-shot Quantization by Synthesis-aware Fine-tuning

تقترح هذه الورقة البحثية SynQ، وهو إطار عمل جديد للكمّنة من نوع (zero-shot) يحقق دقة رائدة في المهام الحساسة للخصوصية عبر تخليق البيانات مع تقليل الضوضاء بواسطة الترشيح منخفض التردد، ومحاذاة خرائط تنشيط الفئات مع النماذج سابقة التدريب، واستخدام الملصقات اللينة للتخفيف من انتشار الخطأ.

Minjun Kim, Jongjin Kim, U Kang2026-03-20
💻 computer science

AndroTMem: From Interaction Trajectories to Anchored Memory in Long-Horizon GUI Agents

تقدم الورقة البحثية AndroTMem، وهو إطار تشخيصي ومعيار قياسي يحدد إخفاقات الذاكرة باعتبارها العائق الرئيسي في وكلاء واجهة المستخدم الرسومية (GUI) ذوي الأفق الطويل، مما أدى إلى اقتراح ذاكرة الحالة المرتكزة (ASM)، وهي طريقة تحسن إنجاز المهام بشكل كبير من خلال تمثيل تسلسلات التفاعل كمرتكزات حالات وسيطة مرتبطة سببيًا بدلاً من عمليات إعادة التشغيل الكاملة أو الملخصات.

Yibo Shi, Jungang Li, Linghao Zhang, Zihao Dongfang, Biao Wu, Sicheng Tao, Yibo Yan, Chenxi Qin, Weiting Liu, Zhixin Lin (…)2026-03-20