💻 computer science

Object-Scene-Camera Decomposition and Recomposition for Data-Efficient Monocular 3D Object Detection

تقترح هذه الورقة مخططاً للتلاعب بالبيانات عبر الإنترنت يقوم بتفكيك صور التدريب إلى مكونات مستقلة لكل من الكائن والمشهد والكاميرا، ثم يعيد تركيبها مع وضعيات مضطربة لتوليد بيانات تدريب متنوعة، مما يؤدي إلى تحسين كفاءة البيانات وأداء نماذج اكتشاف الأجسام ثلاثية الأبعاد أحادية العدسة في كل من بيئات الإشراف الكامل والجزئي.

Zhaonian Kuang, Rui Ding, Meng Yang, Xinhu Zheng, Gang Hua2026-03-10
💻 computer science

Cycle-Consistent Tuning for Layered Image Decomposition

تقدم هذه الورقة إطار عمل للضبط المتسق دورياً يستفيد من تكييف "LoRA" خفيف الوزن لنماذج الانتشار سابقة التدريب لتحقيق تفكيك طبقي للصور يتسم بالمتانة وعالي الدقة، وتحديداً لفصل الشعار عن الكائن في الحالات الصعبة، وذلك من خلال فرض اتساق إعادة البناء ثنائي الاتجاه وتحسين الأداء بشكل تكراري عبر عملية تحسين ذاتي تدريجية.

Zheng Gu, Min Lu, Zhida Sun, Dani Lischinski, Daniel Cohen-Or, Hui Huang2026-03-10
💻 computer science

Iterative Closed-Loop Motion Synthesis for Scaling the Capabilities of Humanoid Control

تقترح هذه الورقة إطار عمل تكراريًا ذا حلقة مغلقة يقوم تلقائيًا بتوليد بيانات حركة عالية الجودة ومتنوعة، ويزيد من صعوبة المهمة تدريجيًا، مما يمكن سياسات التحكم في الروبوتات البشرية من التفوق بشكل كبير على النماذج المرجعية باستخدام بيانات تدريب أقل بكثير.

Weisheng Xu, Qiwei Wu, Jiaxi Zhang, Tan Jing, Yangfan Li, Yuetong Fang, Jiaqi Xiong, Kai Wu, Rong Ou, Renjing Xu2026-03-10
💻 computer science

PackUV: Packed Gaussian UV Maps for 4D Volumetric Video

تقدم الورقة البحثية PackUV، وهو تمثيل وطريقة ملاءمة جديدة لـ Gaussian رباعي الأبعاد (4D Gaussian) تقوم بخرائط سمات الفيديو الحجمي إلى أطلس UV مهيكل من أجل تخزين وبث فعالين ومتوافقين مع برامج الترميز، مع إظهار اتساق زمني ودقة عرض متفوقة على مجموعة بيانات PackUV-2B واسعة النطاق والمقترحة حديثاً.

Aashish Rai, Angela Xing, Anushka Agarwal, Xiaoyan Cong, Zekun Li, Tao Lu, Aayush Prakash, Srinath Sridhar2026-03-10
💻 computer science

WildActor: Unconstrained Identity-Preserving Video Generation

تقدم هذه الورقة البحثية WildActor، وهو إطار عمل لتوليد فيديوهات بشرية غير مقيدة مع الحفاظ على الهوية، يستفيد من مجموعة بيانات Actor-18M واسعة النطاق وآليات انتباه مبتكرة للتغلب على القيود الحالية في الحفاظ على ثبات هويات الجسم الكامل عبر اللقطات الديناميكية، وزوايا الرؤية، والحركات المختلفة.

Qin Guo, Tianyu Yang, Xuanhua He, Fei Shen, Yong Zhang, Zhuoliang Kang, Xiaoming Wei, Dan Xu2026-03-10
💻 computer science

DeAR: Fine-Grained VLM Adaptation by Decomposing Attention Head Roles

تقترح الورقة البحثية إطار عمل DeAR، وهو إطار تكيف دقيق لنماذج الرؤية واللغة يقوم بتفكيك رؤوس الانتباه إلى أدوار وظيفية (السمات، والتعميم، والمختلطة) باستخدام مقييز "إنتروبيا المفهوم" لعزل تعلم المهام المحددة عن قدرات التعميم بشكل انتقائي، مما يحقق أداءً فائقاً عبر مهام متنوعة مع الحفاظ على متانة القدرة على التعلم الصفري.

Yiming Ma, Hongkun Yang, Lionel Z. Wang, Bin Chen, Weizhi Xian, Jianzhi Teng2026-03-10
💻 computer science

Efficient Test-Time Optimization for Depth Completion via Low-Rank Decoder Adaptation

تقترح هذه الورقة طريقة خفيفة الوزن للتكيف عند وقت الاختبار لإكمال العمق بنمط الصفر (zero-shot)، والتي تحقق دقة وكفاءة في مستوى الحالة الراهنة من خلال تحديث فضاء فرعي لفك التشفير منخفض الأبعاد فقط، مما يتجنب التكاليف الحسابية للتحسين الكامل للشبكة أو التحسين القائم على الانتشار.

Minseok Seo, Wonjun Lee, Jaehyuk Jang, Changick Kim2026-03-10
🤖 machine learning

A Detection-Gated Pipeline for Robust Glottal Area Waveform Extraction and Clinical Pathology Assessment

تقدم هذه الورقة البحثية مساراً معالجياً يعتمد على التعلم العميق المعتمد على الكشف والمتميز بالكفاءة الحسابية، والذي يحقق أداءً رائداً في المتانة والتعميم عبر مجموعات البيانات المختلفة في عملية تقسيم المزمار من تنظير الفيديو عالي السرعة، مما يتيح استخراج المؤشرات الحيوية السريرية الموثوقة للتمييز بين الوظيفة الصوتية السليمة والمرضية.

Harikrishnan Unnikrishnan2026-03-10
💻 computer science

iGVLM: Dynamic Instruction-Guided Vision Encoding for Question-Aware Multimodal Understanding

تقترح الورقة البحثية iGVLM، وهو إطار عمل يتغلب على عقبة التمثيل في نماذج الرؤية واللغة الكبيرة من خلال تقديم بنية ثنائية الفرع منفصلة ذات تعديل بصري موجه بالتعليمات لتمكين الاستدلال الديناميكي الواعي بالمهام مع الحفاظ على الأولويات البصرية المدربة مسبقًا.

Hanpeng Liu, Yaqian Li, Zidan Wang, Shuoxi Zhang, Zihao Bo, Rinyoichi Takezoe, Kaiwen Long, Kun He2026-03-10
🤖 machine learning

OptiRoulette Optimizer: A New Stochastic Meta-Optimizer for up to 5.3x Faster Convergence

تقدم الورقة البحثية OptiRoulette، وهو مُحسِّن ميتا عشوائي (stochastic meta-optimizer) يختار قواعد التحديث ديناميكيًا من مجموعة محددة أثناء التدريب، مما يُظهر تقاربًا أسرع بكثير ودقة اختبار أعلى عبر العديد من معايير تصنيف الصور مقارنةً بأساس AdamW القياسي.

Stamatis Mastromichalakis2026-03-10