💻 computer science

LiveGesture Streamable Co-Speech Gesture Generation Model

تقدم الورقة البحثية LiveGesture، وهو أول إطار عمل قابل للبث بالكامل وبدون استباق (zero look-ahead) لتوليد إيماءات جسدية كاملة متنوعة ومتماسكة متزامنة مع الكلام في الوقت الفعلي، وذلك عبر الجمع بين مشفر كمي متجهي سببي ومحول تكراري هرمي تم تدريبه عبر التغطية الموجهة بعدم اليقين.

Muhammad Usama Saleem, Mayur Jagdishbhai Patel, Ekkasit Pinyoanuntapong, Zhongxing Qin, Li Yang, Hongfei Xue, Ahmed Helm (…)2026-04-15
💻 computer science

AmodalSVG: Amodal Image Vectorization via Semantic Layer Peeling

يقدم AmodalSVG إطار عمل مبتكرًا يحول الصور الطبيعية إلى ملفات SVG منظمة دلاليًا ومكتملة هندسيًا، وذلك عبر استخدام تقنية "تقشير الطبقات الدلالية" الموجهة بنماذج الرؤية واللغة (VLM) لإعادة بناء مناطق الأجسام المحجوبة في النطاق النقطي (raster domain)، متبوعًا بـ "التحويل الشعاعي الطبقي التكيفي" لإنشاء طبقات شعاعية مستقلة وقابلة للتعديل.

Juncheng Hu, Ziteng Xue, Guotao Liang, Anran Qi, Buyu Li, Sheng Wang, Dong Xu, Qian Yu2026-04-15
💻 computer science

Bootstrapping Video Semantic Segmentation Model via Distillation-assisted Test-Time Adaptation

تقدم هذه الورقة البحثية DiTTA، وهو إطار عمل مبتكر يحول نموذج تقسيم صور مدرب مسبقاً إلى نظام قوي لتقسيم الفيديو الدلالي من خلال استخلاص المعرفة الزمنية من SAM2 وإجراء تكيف فعال في وقت الاختبار، محققاً بذلك أداءً بمستوى الإشراف الكامل دون الحاجة إلى أي بيانات فيديو مشروحة.

Jihun Kim, Hoyong Kwon, Hyeokjun Kweon, Kuk-Jin Yoon2026-04-15
💻 computer science

Using Deep Learning Models Pretrained by Self-Supervised Learning for Protein Localization

تُظهر هذه الدراسة أن نماذج التعلم الخاضع للإشراف الذاتي، ولا سيما نماذج المحولات (ViTs) القائمة على خوارزمية DINO والمُدربة مسبقاً على مجموعات بيانات ضخمة خاصة بمجال محدد مثل HPA FOV، تتعمم بفعالية على مجموعات البيانات المجهرية الصغيرة لتحديد المواقع البروتينية، محققةً أداءً قوياً حتى في سيناريوهات التعلم الصفري (zero-shot) وتتحسن بشكل أكبر مع الضبط الدقيق.

Ben Isselmann, Dilara Göksu, Heinz Neumann, Andreas Weinmann2026-04-15
💻 computer science

ArtiCAD: Articulated CAD Assembly Design via Multi-Agent Code Generation

تقدم الورقة البحثية ArtiCAD، وهو نظام وكلاء متعددين مبتكر لا يتطلب تدريباً، يقوم بتوليد تجميعات CAD مفصلية وقابلة للتعديل من النصوص أو الصور عبر التنبؤ بعلاقات التجميع مبكراً بواسطة "موصل" (Connector) متخصص، وتوظيف التحقق عبر المراحل مع آليات التراجع، والاستفادة من مخزن خبرة ذاتي التطور للتغلب على القيود الحالية في الاستدلال المكاني للنماذج اللغوية الكبيرة.

Yuan Shui, Yandong Guan, Zhanwei Zhang, Juncheng Hu, Jing Zhang, Dong Xu, Qian Yu2026-04-15
💻 computer science

LumiMotion: Improving Gaussian Relighting with Scene Dynamics

تُعد LumiMotion أول طريقة تعتمد على تقنية Gaussian Splatting تستفيد من ديناميكيات المشهد كإشارة إشرافية لفصل الإضاءة عن خصائص المواد بفعالية في المشاهد الديناميكية التعسفية، مما يحسن بشكل كبير من تقدير الانعكاسية (albedo) وأداء إعادة الإضاءة مع تقديم معيار مرجعي اصطناعي جديد للتقييم.

Joanna Kaleta, Piotr Wójcik, Kacper Marzol, Tomasz Trzciński, Kacper Kania, Marek Kowalski2026-04-15
💻 computer science

TraversalBench: Challenging Paths to Follow for Vision Language Models

تقدم هذه الورقة TraversalBench، وهو معيار مرجعي مضبوط صُمم لتقييم قدرة نماذج الرؤية واللغة على تتبع المسارات البصرية المعقدة، مما يكشف أن التقاطعات الذاتية هي المصدر الرئيسي للصعوبة وأن النماذج تظهر انخفاضات حادة في الأداء عند حل استمرارية المسار عند نقاط التقاطع.

Clara Petrova, Zhuo Chen, Marin Soljačić2026-04-15
💻 computer science

UHD-GPGNet: UHD Video Denoising via Gaussian-Process-Guided Local Spatio-Temporal Modeling

تقدم هذه الورقة UHD-GPGNet، وهو إطار عمل موجه بعملية غاوسية يحقق إزالة ضوضاء فيديو بدقة 4K كاملة بكفاءة وفي الوقت الفعلي مع دقة عالية وتعميم قوي للضوضاء في العالم الحقيقي من خلال نمذجة إحصائيات التدهور المكاني والزماني المحلية صراحةً لتوجيه دمج الميزات التكيفي وإعادة بناء البنية واللون.

Weiyuan He, Chen Wu, Pengwen Dai, Wei Wang, Dianjie Lu, Guijuan Zhang, Linwei Fan, Yongzhen Wang, Zhuoran Zheng2026-04-15
💻 computer science

Test-time Scaling over Perception: Resolving the Grounding Paradox in Thinking with Images

تقدم هذه الورقة "التوسع عند وقت الاختبار عبر الإدراك" (TTSP)، وهو إطار عمل يحل "مفارقة التجذير" في الاستدلال متعدد الوسائط من خلال معاملة الإدراك كعملية استدلال تكرارية وقابلة للتوسع تولد وتصفي مسارات استكشافية متعددة لتوجيه جمع الأدلة البصرية بشكل قوي.

Zheng Jiang, Yiming Chen, Nan He, Jiahui Chen, Chaoyang Li, Houde Qian, Lifeng Sun2026-04-15
💻 computer science

EgoFun3D: Modeling Interactive Objects from Egocentric Videos using Function Templates

تقدم الورقة البحثية EgoFun3D، وهو عبارة عن مجموعة بيانات ومعيار جديد ومسار عمل مكون من أربع مراحل مصمم لإنشاء كائنات ثلاثية الأبعاد جاهزة للمحاكاة ذات قدرات وظيفية من فيديوهات منظور الشخص الأول، وذلك عبر الاستفادة من قوالب وظيفية مهيكلة لنمذجة التفاعلات بين الأجزاء بما يتجاوز مجرد المفاصل البسيطة.

Weikun Peng, Denys Iliash, Manolis Savva2026-04-15