💻 computer science

UNBOX: Unveiling Black-box visual models with Natural-language

تقدم الورقة البحثية UNBOX، وهو إطار عمل مبتكر يسخر النماذج اللغوية الكبيرة ونماذج الانتشار من النص إلى الصورة لتشريح المصنفات البصرية ذات الصندوق الأسود تحت قيود خالية تماماً من البيانات ومن التدرج، حيث يقوم بتوليد واصفات نصية قابلة للتفسير البشري تكشف عن المفاهيم التي تعلمها النموذج والتحيزات المحتملة دون الحاجة إلى الوصول إلى بنيته الداخلية أو بيانات تدريبه.

Simone Carnemolla, Chiara Russo, Simone Palazzo, Quentin Bouniot, Daniela Giordano, Zeynep Akata, Matteo Pennisi, Concet (…)2026-03-10
💻 computer science

ImprovedGS+: A High-Performance C++/CUDA Re-Implementation Strategy for 3D Gaussian Splatting

تُعد ImprovedGS+ إعادة تنفيذ عالية الأداء بلغة C++/CUDA لتقنية 3D Gaussian Splatting ضمن إطار عمل LichtFeld-Studio، حيث تستفيد من نوى معالجة مُحسّنة عتادياً وجدولة تكيُّفية لتقليل وقت التدريب والتعقيد البارامتري بشكل كبير، مع تحقيق جودة إعادة بناء فائقة مقارنة بالنماذج المرجعية الرائدة.

Jordi Muñoz Vicente2026-03-10
💻 computer science

Talking Together: Synthesizing Co-Located 3D Conversations from Audio

تقدم هذه الورقة نظاماً جديداً ثنائي المسار يقوم بتخليق رسوم متحركة لوجه ثلاثي الأبعاد واقعية ومدركة مكانياً لمشاركين متواجدين في نفس الموقع من خلال صوت مختلط، وذلك عبر نمذجة علاقاتهما المكانية الديناميكية ونظراتهما المتبادلة، مدعوماً بمجموعة بيانات واسعة النطاق تضم أكثر من مليوني زوج حواري.

Mengyi Shan, Shouchieh Chang, Ziqian Bai, Shichen Liu, Yinda Zhang, Luchuan Song, Rohit Pandey, Sean Fanello, Zeng Huang2026-03-10
🤖 AI

Make VLM Recognize Visual Hallucination on Cartoon Character Image with Pose Information

تقترح هذه الورقة إطار عمل للتعلم البصري في السياق المدرك للوضعية (PA-ICVL) يعزز قدرة نماذج الرؤية واللغة على اكتشاف الهلوسات البصرية ذات البنية الدلالية في الصور الكرتونية غير الواقعية من خلال دمج معلومات الوضعية جنباً إلى جنب مع بيانات RGB، محققاً تحسينات كبيرة في الأداء مقارنة بالنماذج المرجعية التي تعتمد على RGB فقط.

Bumsoo Kim, Wonseop Shin, Kyuchul Lee, Yonghoon Jung, Sanghyun Seo2026-03-09
🤖 AI

FALCON: Future-Aware Learning with Contextual Object-Centric Pretraining for UAV Action Recognition

يُعد FALCON إطار عمل موحداً للتدريب المسبق ذاتي الإشراف للتعرف على أفعال الطائرات بدون طيار، والذي يتغلب على عدم التوازن المكاني في اللقطات الجوية من خلال الجمع بين الترميز التلقائي المقنع المدرك للأجسام وإعادة بناء المستقبل ثنائي الأفق المتمحور حول الأجسام، محققاً دقة فائقة واستدلالاً أسرع دون الحاجة إلى معالجة مسبقة إضافية في وقت الاختبار.

Ruiqi Xian, Xiyang Wu, Tianrui Guan, Xijun Wang, Boqing Gong, Dinesh Manocha2026-03-09
💻 computer science

AuthFace: Towards Authentic Blind Face Restoration with Face-oriented Generative Diffusion Prior

يُعد AuthFace إطار عمل مبتكر لترميم الوجوه بشكل أعمى، حيث يحقق نتائج واقعية للغاية من خلال الضبط الدقيق لنموذج انتشار (diffusion model) من النص إلى الصورة على مجموعة بيانات منسقة تضم 1500 صورة فوتوغرافية احترافية عالية الدقة مع تعليقات توضيحية موجهة بالتصوير الفوتوغرافي، بينما يستخدم فقدان ميزات وجه كامن مدرك للزمن لتقليل العيوب في المناطق الوجهية الحرجة.

Guoqiang Liang, Qingnan Fan, Bingtao Fu, Jinwei Chen, Hong Gu, Lin Wang2026-03-09
💬 NLP

Rethinking the Mixture of Vision Encoders Paradigm for Enhanced Visual Understanding in Multimodal LLMs

تقدم هذه الورقة البحثية LEO، وهي بنية نموذج لغوي كبير متعدد الوسائط ومبسطة تستخدم استراتيجية دمج خفيفة الوزن تعتمد على أجهزة عرض ما بعد التكيف، وتداخل التسلسل على مستوى البلاطات، والتقسيم الديناميكي للبلاطات لتعزيز الفهم البصري بشكل كبير عبر مختلف المعايير والمجالات المتخصصة مثل القيادة الذاتية.

Mozhgan Nasr Azadani, James Riddell, Sean Sedwards, Krzysztof Czarnecki2026-03-09
💻 computer science

FeatureGS: Eigenvalue-Feature Optimization in 3D Gaussian Splatting for Geometrically Accurate and Artifact-Reduced Reconstruction

يعزز GS المميز تقنية Gaussian Splatting ثلاثية الأبعاد من خلال إدخال حد خسارة هندسي قائم على القيم الذاتية يحسن الدقة الهندسية بشكل كبير، ويقلل من عيوب "العوامات" ومتطلبات التخزين بنسبة 90%، ويمكّن من إعادة بناء الشبكة مباشرة مع الحفاظ على جودة فوتومترية عالية.

Miriam Jäger, Markus Hillemann, Boris Jutzi2026-03-09
💻 computer science

PoI: A Filter to Extract Pixel of Interest from Novel Views for Scene Coordinate Regression

تقدم هذه الورقة إطار عمل PoI، الذي يعزز عملية "تراجع إحداثيات المشهد" (Scene Coordinate Regression) من أجل التحديد البصري للمواقع عبر الجمع بين تقنية "النمذجة بالنقاط الغاوسية ثلاثية الأبعاد" (3D Gaussian Splatting) والتحسين القائم على الانتشار، واستراتيجية تصفية تدريجية على مستوى البكسل لتوليد واستخدام مناظر جديدة موثوقة بشكل انتقائي لتدريب قوي.

Feifei Li, Qi Song, Chi Zhang, Hui Shuai, Rui Huang2026-03-09
🤖 AI

Transforming Science with Large Language Models: A Survey on AI-assisted Scientific Discovery, Experimentation, Content Generation, and Evaluation

تقدم هذه الدراسة نظرة شاملة على المنظومة الناشئة للنماذج اللغوية الكبيرة والأدوات التي تدعم الباحثين عبر الدورة العلمية بأكملها، حيث تغطي المهام الرئيسية بدءاً من البحث في الأدبيات وتوليد الأفكار وصولاً إلى إنشاء المحتوى والتجريب والتقييم، مع معالجة مجموعات البيانات والأساليب والقيود والمخاوف الأخية المرتبطة بها.

Steffen Eger, Yong Cao, Jennifer D'Souza, Andreas Geiger, Christian Greisinger, Stephanie Gross, Yufang Hou, Brigitte Kr (…)2026-03-09