💻 computer science

REALM: An MLLM-Agent Framework for Open World 3D Reasoning Segmentation and Editing on Gaussian Splatting

تقدم الورقة البحثية REALM، وهو إطار عمل لوكيل نموذج لغوي بصري كبير (MLLM-agent)، يتيح التجزئة والاستدلال ثلاثي الأبعاد في عالم مفتوح والتحرير على تقنية "Gaussian Splatting" من خلال توظيف استراتيجية ربط مكاني مبتكرة من "العالمي إلى المحلي" لسد الفجوة بين التعليمات البشرية المعقدة والتلاعب الدقيق بالأجسام ثلاثية الأبعاد دون الحاجة إلى تدريب لاحق مكثف خاص بالنماذج ثلاثية الأبعاد.

Changyue Shi, Minghao Chen, Yiping Mao, Chuxiao Yang, Xinyuan Hu, Jiajun Ding, Zhou Yu2026-03-12
🤖 AI

DeepEyesV2: Toward Agentic Multimodal Model

تقدم هذه الورقة البحثية DeepEyesV2، وهو نموذج متعدد الوسائط وكيل (agentic) يستخدم مسار تدريب ثنائي المراحل يجمع بين تنسيق بيانات البداية الباردة (cold-start) والتعلم التعزيزي لدمج الأدوات الخارجية بفعالية، مثل تنفيذ الكود والبحث في الويب، لمهام الاستدلال المعقدة في العالم الحقيقي.

Jack Hong, Chenxiao Zhao, ChengLin Zhu, Weiheng Lu, Guohai Xu, Xing Yu2026-03-12
🤖 AI

D-GAP: Improving Out-of-Domain Robustness via Dataset-Agnostic and Gradient-Guided Augmentation in Frequency and Pixel Spaces

تقترح الورقة البحثية طريقة D-GAP، وهي طريقة تعزيز مستقلة عن مجموعة البيانات وموجهة بالتدرج، تعمل على مزج سعات التردد وقيم البكسل بشكل تكيفي لتقليل انحيازات التعلم الخاصة بنطاق معين واستعادة التفاصيل المكانية، مما يؤدي إلى تحسين متانة النماذج في الرؤية الحاسوبية خارج النطاق بشكل كبير.

Ruoqi Wang, Haitao Wang, Shaojie Guo, Qiong Luo2026-03-12
💻 computer science

X-WIN: Building Chest Radiograph World Model via Predictive Sensing

تقدم الورقة البحثية X-WIN، وهو نموذج عالمي جديد لصور الأشعة السينية للصدر يقوم باستخلاص المعرفة الحجمية ثلاثية الأبعاد من فحوصات الأشعة المقطعية عبر تعلم التنبؤ بالإسقاطات ثنائية الأبعاد في الفضاء الكامن، مما يتغلب على القيود الهيكلية للأشعة السينية ثنائية الأبعاد ويحقق أداءً فائقاً في مهام تشخيص الأمراض وإعادة البناء ثلاثي الأبعاد.

Zefan Yang, Ge Wang, James Hendler, Mannudeep K. Kalra, Pingkun Yan2026-03-12
🤖 AI

CostNav: A Navigation Benchmark for Real-World Economic-Cost Evaluation of Physical AI Agents

تقدم هذه الورقة CostNav، وهو أول معيار للملاحة القائم على الفيزياء والذي يقيم الوكلاء المستقلين باستخدام بيانات اقتصادية من العالم الحقيقي ليكشف أن الأساليب الحالية، رغم تباينها في الأجهزة والبنية، تفشل جميعها في تحقيق الجدوى الاقتصادية بسبب هوامش المساهمة السلبية.

Haebin Seong, Sungmin Kim, Yongjun Cho, Myunchul Joe, Geunwoo Kim, Yubeen Park, Sunhoo Kim, Yoonshik Kim, Suhwan Choi, J (…)2026-03-12
💻 computer science

TEAR: Temporal-aware Automated Red-teaming for Text-to-Video Models

تقدم هذه الورقة TEAR، وهو إطار عمل آلي للاختبار الأحمر مدرك للزمن يستخدم عملية تحسين ثنائية المراحل لصياغة مطالبات بريئة تستغل التسلسلات الزمنية الديناميكية، مما يحقق معدلات نجاح في الهجوم تتجاوز 80% في كشف المخاطر الأمنية في نماذج تحويل النص إلى فيديو حيث تفشل أساليب التقييم الثابتة الحالية.

Jiaming He, Guanyu Hou, Hongwei Li, Zhicong Huang, Kangjie Chen, Yi Yu, Wenbo Jiang, Guowen Xu, Tianwei Zhang2026-03-12
🤖 AI

World Models That Know When They Don't Know - Controllable Video Generation with Calibrated Uncertainty

تقترح هذه الورقة البحثية C3، وهي طريقة مبتكرة لتقدير عدم اليقين تقوم بتدريب نماذج الفيديو القابلة للتحكم لتوليد خرائط حرارية للثقة عالية الدقة ومعايرة على مستوى شبه الرقعة (subpatch) من خلال تقدير عدم اليقين في الفضاء الكامن واستخدام قواعد تسجيل ملائمة تماماً، مما يتيح الكشف الموثوق عن الهلوسة وتحديد البيانات الخارجة عن التوزيع لتطبيقات الروبوتات.

Zhiting Mei, Tenny Yin, Micah Baker, Ola Shorinwa, Anirudha Majumdar2026-03-12
🔭 astrophysics

Pre-training vision models for the classification of alerts from wide-field time-domain surveys

تُثبت هذه الورقة أن اعتماد بنيات رؤية حاسوبية معيارية مُدربة مسبقاً على بيانات فلكية، لا سيما من مشروع "جالاكسي زو" (Galaxy Zoo)، يُحسّن بشكل كبير من أداء وكفاءة تصنيف التنبيهات في المسوحات الزمنية واسعة المجال مقارنة بالشبكات العصبية الالتفافية (CNNs) المخصصة التقليدية التي يتم تدريبها من الصفر.

Nabeel Rehemtulla, Adam A. Miller, Mike Walmsley, Ved G. Shah, Theophile Jegou du Laz, Michael W. Coughlin, Argyro Sasli (…)2026-03-12
🤖 AI

GTR-Turbo: Merged Checkpoint is Secretly a Free Teacher for Agentic VLM Training

تُعد GTR-Turbo طريقة تدريب عالية الكفاءة للوكلاء متعددي الوسائط، حيث تلغي الحاجة إلى نماذج المعلم الخارجية المكلفة عبر استخدام نقاط التفتيش المدمجة من التعلم التعزيزي المستمر كـ "معلم مجاني"، مما يؤدي إلى تحسين الدقة بنسبة 10-30% مع تقليل وقت التدريب وتكاليف الحوسبة بنسبة 50% و60% على التوالي.

Tong Wei, Yijun Yang, Changhao Zhang, Junliang Xing, Yuanchun Shi, Zongqing Lu, Deheng Ye2026-03-12
💻 computer science

AFTER: Mitigating the Object Hallucination of LVLM via Adaptive Factual-Guided Activation Editing

تقترح الورقة البحثية إطار عمل AFTER، وهو إطار تعديل تنشيط تكيفي موجه بالحقائق يتكون من توجيه التنشيط المعزز بالحقائق وتحسين الإزاحة المتكيف مع الاستعلام، للحد بفعالية من هلوسات الكائنات في النماذج اللغوية البصرية الكبيرة من خلال توجيه التنشيطات المنحازة صراحةً نحو الدلالات الواقعية.

Tianbo Wang, Yuqing Ma, Kewei Liao, Zhange Zhang, Simin Li, Jinyang Guo, Xianglong Liu2026-03-12