💻 computer science

3DMedAgent: Unified Perception-to-Understanding for 3D Medical Analysis

تقدم الورقة البحثية 3DMedAgent، وهو وكيل موحد يستفيد من نموذج لغوي بصري كبير (MLLM) مرن وذاكرة هيكلية طويلة الأمد لتنسيق أدوات متباينة لتفكيك تحليل التصوير المقطعي المحوسب ثلاثي الأبعاد المعقد إلى مهام فرعية قابلة للتنفيذ تعتمد على البعد الثنائي، مما يتيح فهماً طبياً عاماً ثلاثي الأبعاد دون الحاجة إلى ضبط دقيق خاص بالنماذج ثلاثية الأبعاد.

Ziyue Wang, Linghan Cai, Chang Han Low, Haofeng Liu, Junde Wu, Jingyu Wang, Rui Wang, Lei Song, Jiang Bian, Jingjing Fu (…)2026-03-10
🤖 machine learning

Latent Equivariant Operators for Robust Object Recognition: Promise and Challenges

تُظهر هذه الورقة أن الشبكات العصبية التي تتعلم مؤثرات متكافئة في فضاء كامن يمكنها التعميم بفعالية على التحويلات المتناظرة خارج نطاق التوزيع على مجموعات بيانات بسيطة مثل MNIST المدوّرة، بينما تسلط الضົນ أيضاً على التحديات الكبيرة المنطوية في توسيع نطاق هذا النهج ليشمل بيانات أكثر تعقيداً.

Minh Dinh, Stéphane Deny2026-03-10
💻 computer science

Open-Vocabulary Domain Generalization in Urban-Scene Segmentation

تقدم هذه الورقة البحثية "التعميم النطاقي مفتوح المفردات في التجزئة الدلالية" (OVDG-SS)، وهو إطار عمل ومعيار جديد للقيادة الذاتية يعالج كلاً من النطاقات والفئات غير المرئية، وتقترح آلية S2-Corr، وهي آلية مدفوعة بحالة الفضاء لتنقية الارتباطات بين النص والصورة في نماذج الرؤية واللغة لتحقيق أداء قوي عبر البيئات الحضرية المتنوعة.

Dong Zhao, Qi Zang, Nan Pu, Wenjing Li, Nicu Sebe, Zhun Zhong2026-03-10
💻 computer science

InfScene-SR: Arbitrary-Size Image Super-Resolution via Iterative Joint-Denoising

يقترح إطار العمل InfScene-VF إطاراً قائماً على الانتشار لرفع دقة الصور لأحجام تعسفية، مما يقضي على عيوب الحدود ويسمح باستنتاج متوازٍ وفعال من حيث الذاكرة للصور ذات الدقة الجيجابكسلية عبر تقديم دمج مصحح التباين وتصحيح التباين المنفصل مكانياً لتحقيق إلغاء ضجيج مشترك مستمر مكانياً.

Shoukun Sun, Zhe Wang, Xiang Que, Jiyin Zhang, Xiaogang Ma2026-03-10
💻 computer science

Object-Scene-Camera Decomposition and Recomposition for Data-Efficient Monocular 3D Object Detection

تقترح هذه الورقة مخططاً للتلاعب بالبيانات عبر الإنترنت يقوم بتفكيك صور التدريب إلى مكونات مستقلة لكل من الكائن والمشهد والكاميرا، ثم يعيد تركيبها مع وضعيات مضطربة لتوليد بيانات تدريب متنوعة، مما يؤدي إلى تحسين كفاءة البيانات وأداء نماذج اكتشاف الأجسام ثلاثية الأبعاد أحادية العدسة في كل من بيئات الإشراف الكامل والجزئي.

Zhaonian Kuang, Rui Ding, Meng Yang, Xinhu Zheng, Gang Hua2026-03-10
💻 computer science

Cycle-Consistent Tuning for Layered Image Decomposition

تقدم هذه الورقة إطار عمل للضبط المتسق دورياً يستفيد من تكييف "LoRA" خفيف الوزن لنماذج الانتشار سابقة التدريب لتحقيق تفكيك طبقي للصور يتسم بالمتانة وعالي الدقة، وتحديداً لفصل الشعار عن الكائن في الحالات الصعبة، وذلك من خلال فرض اتساق إعادة البناء ثنائي الاتجاه وتحسين الأداء بشكل تكراري عبر عملية تحسين ذاتي تدريجية.

Zheng Gu, Min Lu, Zhida Sun, Dani Lischinski, Daniel Cohen-Or, Hui Huang2026-03-10
💻 computer science

Iterative Closed-Loop Motion Synthesis for Scaling the Capabilities of Humanoid Control

تقترح هذه الورقة إطار عمل تكراريًا ذا حلقة مغلقة يقوم تلقائيًا بتوليد بيانات حركة عالية الجودة ومتنوعة، ويزيد من صعوبة المهمة تدريجيًا، مما يمكن سياسات التحكم في الروبوتات البشرية من التفوق بشكل كبير على النماذج المرجعية باستخدام بيانات تدريب أقل بكثير.

Weisheng Xu, Qiwei Wu, Jiaxi Zhang, Tan Jing, Yangfan Li, Yuetong Fang, Jiaqi Xiong, Kai Wu, Rong Ou, Renjing Xu2026-03-10
💻 computer science

PackUV: Packed Gaussian UV Maps for 4D Volumetric Video

تقدم الورقة البحثية PackUV، وهو تمثيل وطريقة ملاءمة جديدة لـ Gaussian رباعي الأبعاد (4D Gaussian) تقوم بخرائط سمات الفيديو الحجمي إلى أطلس UV مهيكل من أجل تخزين وبث فعالين ومتوافقين مع برامج الترميز، مع إظهار اتساق زمني ودقة عرض متفوقة على مجموعة بيانات PackUV-2B واسعة النطاق والمقترحة حديثاً.

Aashish Rai, Angela Xing, Anushka Agarwal, Xiaoyan Cong, Zekun Li, Tao Lu, Aayush Prakash, Srinath Sridhar2026-03-10
💻 computer science

WildActor: Unconstrained Identity-Preserving Video Generation

تقدم هذه الورقة البحثية WildActor، وهو إطار عمل لتوليد فيديوهات بشرية غير مقيدة مع الحفاظ على الهوية، يستفيد من مجموعة بيانات Actor-18M واسعة النطاق وآليات انتباه مبتكرة للتغلب على القيود الحالية في الحفاظ على ثبات هويات الجسم الكامل عبر اللقطات الديناميكية، وزوايا الرؤية، والحركات المختلفة.

Qin Guo, Tianyu Yang, Xuanhua He, Fei Shen, Yong Zhang, Zhuoliang Kang, Xiaoming Wei, Dan Xu2026-03-10
💻 computer science

DeAR: Fine-Grained VLM Adaptation by Decomposing Attention Head Roles

تقترح الورقة البحثية إطار عمل DeAR، وهو إطار تكيف دقيق لنماذج الرؤية واللغة يقوم بتفكيك رؤوس الانتباه إلى أدوار وظيفية (السمات، والتعميم، والمختلطة) باستخدام مقييز "إنتروبيا المفهوم" لعزل تعلم المهام المحددة عن قدرات التعميم بشكل انتقائي، مما يحقق أداءً فائقاً عبر مهام متنوعة مع الحفاظ على متانة القدرة على التعلم الصفري.

Yiming Ma, Hongkun Yang, Lionel Z. Wang, Bin Chen, Weizhi Xian, Jianzhi Teng2026-03-10