💻 computer science

Closing the Safety Gap: Surgical Concept Erasure in Visual Autoregressive Models

تقدم هذه الورقة VARE وS-VARE، وهما إطارا عمل مبتكران يُمكّنان من المحو الجراحي للمفاهيم في النماذج التوليدية ذاتية الانحدار البصرية عبر الاستفادة من الرموز البصرية المساعدة ودوال الخسارة المتخصصة للقضاء على المفاهيم غير الآمنة مع الحفاظ على جودة التوليد والأمانة الدلالية.

Xinhao Zhong, Yimin Zhou, Zhiqi Zhang, Junhao Li, Yi Sun, Bin Chen, Shu-Tao Xia, Xuan Wang, Ke Xu2026-02-03
💻 computer science

Learning Unified Representation of 3D Gaussian Splatting

تقترح هذه الورقة تمثيلاً تضمينياً مبتكراً لتقنية "Gaussian Splatting" ثلاثية الأبعاد يعتمد على حقول تحت-متشعبات مستمرة للتغلب على صعوبات التعلم الخاصة بمعاملات "Gaussian" الخام، وذلك من خلال ضمان التعيين الفريد، وتجانس القنوات، والحفاظ على البنى الهندسية واللونية الجوهرية.

Yuelin Xin, Yuheng Liu, Xiaohui Xie, Xinke Li2026-02-03
🤖 AI

GHOST: Hallucination-Inducing Image Generation for Multimodal LLMs

تقدم الورقة البحثية GHOST، وهي طريقة تلقائية تولد صوراً طبيعية المظهر وخالية من الأجسام عبر تحسين تضمينات الصور لاستحثاث وكشف ثغرات الهلوسة في النماذج اللغوية الكبيرة متعددة الوسائط بشكل نشط، محققةً معدلات نجاح أعلى بكثير من النهج السابقة، كما تعمل أيضاً كأداة لتحسين متانة النموذج من خلال الضبط الدقيق.

Aryan Yazdan Parast, Parsa Hosseini, Hesam Asadollahzadeh, Arshia Soltani Moakhar, Basim Azam, Soheil Feizi, Naveed Akht (…)2026-02-03
🤖 AI

HOI-R1: Exploring the Potential of Multimodal Large Language Models for Human-Object Interaction Detection

تقدم هذه الورقة البحثية HOI-R1، وهو نهج مبتكر يستفيد من قدرات الاستنتاج المتأصلة في النماذج اللغوية الكبيرة متعددة الوسائط المدربة باستخدام التعلم التعزيزي لتحقيق أداء رائد في كشف التفاعل بين الإنسان والأشياء عبر توليد النصوص الصرفة، مما يلغي الحاجة إلى وحدات كشف إضافية معقدة.

Junwen Chen, Peilin Xiong, Keiji Yanai2026-02-03
🤖 AI

SocialFusion: Addressing Social Degradation in Pre-trained Vision-Language Models

تقدم الورقة البحثية SocialFusion، وهو إطار عمل يخفف من "التدهور الاجتماعي" في النماذج الرؤيوية-اللغوية سابقة التدريب من خلال تعلم روابط دنيا بين المشفرات المجمدة والنماذج اللغوية، مما يتيح انتقالاً إيجابياً وأداءً فائقاً عبر مهام الإدراك الاجتماعي المتعددة.

Hamza Tahboub, Weiyan Shi, Gang Hua, Huaizu Jiang2026-02-03
🤖 AI

GuidNoise: Single-Pair Guided Diffusion for Generalized Noise Synthesis

يقترح GuidNoise إطار عمل انتشار موجه بزوج واحد، يقوم بتخليق صور مشوشة معممة وعالية الجودة باستخدام زوج واحد فقط من الصور المشوشة والنظيفة كإرشاد، مما يلغي الحاجة إلى بيانات الكاميرا الوصفية ويمكّن من التعزيز الذاتي الفعال لتحسين أداء إزالة التشويش في سيناريوهات ندرة البيانات.

Changjin Kim, HyeokJun Lee, YoungJoon Yoo2026-02-03
🤖 machine learning

On the Design of One-step Diffusion via Shortcutting Flow Paths

تقترح هذه الورقة إطار تصميم موحد لنماذج الانتشار أحادية الخطوة يعمل على فصل الأسس النظرية عن خيارات التنفيذ، مما يتيح تحسينات منهجية تحقق أداءً هو الأفضل في فئته على مجموعة بيانات ImageNet دون الحاجة إلى التدريب المسبق، أو التقطير، أو التعلم المنهجي.

Haitao Lin, Peiyan Hu, Minsi Ren, Zhifeng Gao, Zhi-Ming Ma, Guolin ke, Tailin Wu, Stan Z. Li2026-02-03
🤖 AI

Beyond Vision: Contextually Enriched Image Captioning with Multi-Modal Retrieval

تقترح هذه الورقة مساراً متعدد الوسائط يعزز وصف الصور من خلال استرجاع ومحاذاة الصور المتشابهة دلالياً واستخراج المعلومات السياقية من المقالات ذات الصلة لتعزيز الأوصاف البصرية الأساسية، مما يؤدي إلى توليد أوصاف أكثر ثراءً وإدراكاً للأحداث تم تقييمها على مجموعة بيانات OpenEvents v1.

Nguyen Lam Phu Quy, Pham Phu Hoa, Tran Chi Nguyen, Dao Sy Duy Minh, Nguyen Hoang Minh Ngoc, Huynh Trung Kiet2026-02-03
🤖 AI

UNIC: Learning Unified Multimodal Extrinsic Contact Estimation

تقدم هذه الورقة البحثية UNIC، وهو إطار عمل موحد متعدد الوسائط يتيح تقديرًا قويًا وغير معتمد على المعايرة للتلامس الخارجي من أجل المناولة الغنية بالتلامس، وذلك عبر دمج البيانات البصرية، والحسية الخاصة، واللمسية من خلال تمثيل خريطة إمكانات المشهد، محققًا دقة عالية وقدرة على التعميم على الأجسام غير المرئية وزوايا الرؤية الديناميكية.

Zhengtong Xu, Yuki Shirai2026-02-03
🤖 machine learning

VibrantSR: Sub-Meter Canopy Height Models from Sentinel-2 Using Generative Flow Matching

يُعد VibrantSR إطار عمل توليدي لرفع الدقة الفائقة يقوم بتقدير نماذج ارتفاع الغطاء الشجري بدقة تقل عن المتر من صور القمر الصناعي Sentinel-2 ذات الدقة 10 أمتار، محققاً دقة متفوقة مقارنة بالمعايير المرجعية الحالية للأقمار الصناعية، مما يتيح مراقبة مستمرة للغابات على نطاق واسع دون الاعتماد على عمليات الاستحواذ الجوية غير المتكررة.

Kiarie Ndegwa, Andreas Gros, Tony Chang, David Diaz, Vincent A. Landau, Nathan E. Rutenbeck, Luke J. Zachmann, Guy Bayes (…)2026-02-03