💻 computer science

Skeleton-based Zero-Shot Spatio-Temporal Action Localization via Weakly-Supervised Pretraining

تقترح هذه الورقة إطار عمل جديد لتحديد موقع الأفعال زمانياً ومكانياً بناءً على الهيكل العظمي بنمط "التعلم من الصفر"، والذي يستفيد من التدريب المسبق للرؤية واللغة بضعف الإشراف والتعلم التبايني التمييزي المختلط بالمشهد لتحديد الأفعال غير المرئية بفعالية مع التغلب على تكاليف التوسيم العالية.

Koshiro Nagano, Fumiaki Sato, Ryo Hachiuma, Kazuki Tsutsukawa, Taiki Sekii2026-08-27
💻 computer science

Difficulty-Aware Sample Allocation for Adaptive Data Augmentation in Semantic Segmentation

تقدم هذه الورقة البحثية إطار "تخصيص العينات المدرك للصعوبة" (DASA)، وهو إطار عمل غير مرتبط ببنية معينة يعزز التجزئة الدلالية من خلال تخصيص تعزيز بيانات أقوى ديناميكيًا للعينات بناءً على درجة صعوبة متعددة العوامل تجمع بين غموض التنبؤ، وفقدان التدريب، وندرة الفئة، وتعقيد الحدود، مما يحقق أداءً فائقًا مقارنة بالطرق القياسية والطرق التكيفية أحادية الإشارة.

Olasimbo Ayodeji Arigbabu, Abimbola Ismail Arigbabu2026-08-27
💻 computer science

LongVU-TTT: Causal Test-Time Training for Visual Resampling in Long Video Understanding

يقدم LongVU-TTT مُعيد عينات سببي للتدريب أثناء وقت الاختبار مع أوزان سريعة تكيُّفية ومُنتقي هجين لضغط تسلسلات الفيديو الطويلة بفعالية مع الحفاظ على الأدلة الزمنية الحرجة، محققاً أداءً هو الأفضل في فئته عبر العديد من معايير فهم الفيديو.

Mahmoud Ahmed, Sameh Abdulah, Olatunji Ruwase, Sam Ade Jacobs, Mathis Bode, Mohamed Elhoseiny2026-08-27
💻 computer science

InteractGesture: Progressive Chunk Guidance for Continuous Streaming Co-Speech Gesture Control

تقدم الورقة البحثية InteractGesture، وهي طريقة مستقلة عن النموذج وتعمل في وقت الاستنتاج، تستخدم التوجيه التدريجي للقطع (Progressive Chunk Guidance) لتمكين توليد إيماءات مصاحبة للكلام دقيقة ومتحكم بها مكانياً في سيناريوهات البث المستمر، وذلك عبر نشر تدرجات التحكم عبر حدود القطع لمعالجة عدم الاتساق عند الحدود.

Ekkasit Pinyoanuntapong, Ajinkya Deogade, Paul Streli, Wenjing Zhang, Joanna Materzynska, Pu Wang, Vittorio Ferrari, Jie (…)2026-08-27
💻 computer science

Label-Free Foundational Model Selection for Medical Image Classification under Distribution Shift via Pseudo Label Discrepancy

تقترح هذه الورقة البحثية معيار AURCC، وهو معيار اختيار خالٍ من الملصقات يعتمد على تباين الملصقات الزائفة، والذي يعمل بفعالية على ترتيب النماذج التأسيسية لتصنيف الصور الطبية في ظل تغير التوزيع دون الحاجة إلى تسميات النطاق المستهدف أو الضبط الدقيق.

Juan Iñaki Larrea, Lucas Mansilla, Enzo Ferrante2026-08-27
💻 computer science

THA-Flow Generative Model: Prosthesis Geometry Prediction from Preoperative CT

يُعد THA-Flow نموذجاً توليدياً جديداً لـ "مطابقة التدفق الشرطي" يتنبأ بهندسة الطرف الاصطناعي ثلاثية الأبعاد من صور الأشعة المقطعية السابقة للجراحة لتخطيط عملية استبدال مفصل الورك الكامل، وذلك عبر نمذجة العلاقة المتأصلة "واحد إلى كثير" بين تشريح المريض وتكوينات الغرسات المعقولة سريرياً.

Yiping Wang, Jie Li, Jingyu Shen, Liao Wang2026-08-27
🔬 physics

Precipitation Downscaling Using Foundation Model-Conditioned Diffusion

تُثبت هذه الورقة أن تكييف نماذج الانتشار بناءً على المتنبئات الجوية واسعة النطاق عبر آلية الانتباه المتقاطع، ولا سيما باستخدام تمثيلات من نموذج التأسيس Prithvi-WxC المدرب مسبقاً، يحسن بشكل كبير من واقعية تقليل مقياس هطول الأمطار عالي الدقة — خاصة بالنسبة للأحداث المتطرفة وفي السيناريوهات محدودة البيانات — مقارنة بطرق الالتصاق التقليدية.

Victor Nascimento Ribeiro, Jorge Guevara, Jorge Sebastian Moraga, Chris Lucas, Natalie Lord, Andrew Taylor, Edward Lockh (…)2026-08-27
💻 computer science

Do Vision-Language Models Agree on the Affective Qualities of Shape? A Cross-Model Audit for Generative Design Interfaces

تُدقق هذه الورقة ستة نماذج للرؤية واللغة لتقييم اتساقها في ترتيب الأجسام ثلاثية الأبعاد وفقاً لواصفات "كانسي" (Kansei) العاطفية، كاشفةً أنه بينما تُظهر النماذج توافقاً جزئياً فوق مستويات الصدفة، فإن تقاربها يتفاوت بشكل كبير حسب فئة الأجسام والمواءمة الدلالية، مما يستدعي نموذجاً أولياً لواجهة مستخدم لتوجيه اختيار الضوابط الدلالية الموثوقة لواجهات التصميم التوليدي.

Luca Bux, Thiago Rios, Ingo Scholtes, Stefan Menzel2026-08-27
🤖 machine learning

FRAME: separating sampling variation from representational cause in medical imaging fairness

تقدم هذه الورقة إطار عمل FRAME، وهو إطار عمل مكون من خطوتين يميز بين التباين في أخذ العينات والتحيز التمثيلي الحقيقي في عدالة التصوير الطبي من خلال إنشاء مرجع للنموذج العادل واختبار الفروقات المتبقية، مما يكشف أن جزءاً كبيراً من التفاوتات المبلغ عنها بين المجموعات الفرعية يمكن إرجاعه إلى الضوضاء الإحصائية بدلاً من آليات النموذج.

Mahshad Lotfinia, Daniel Truhn, Andreas Maier, Soroosh Tayebi Arasteh2026-08-27
💻 computer science

Zero-WAM: In-Context World-Action Modeling from Human Videos for Open-Ended Task Generalization

يُعد Zero-WAM نموذجاً سببيّاً للفيديو والحركة يحقق تعميماً عبر المهام في مرحلة الصفر (zero-shot) في مجال المناولة الروبوتية من خلال الاستفادة من فيديوهات بشرية ضمن السياق كأوصاف للمهام، مدعوماً بمجموعة بيانات اصطناعية مكونة من 74.2 ألف زوج من البشر والروبوتات وهدف تنبؤ بالكتل المستقبلية لفرض الاعتماد على المحفزات البصرية.

Jiaming Zhou, Qihang Zhang, Gangwei Xu, Cunxin Fan, Yujie Zhao, Ruilin Wang, Yiming Luo, Shuai Yang, Xing Zhu, Yujun She (…)2026-08-27