💻 computer science

Efficient Test-Time Optimization for Depth Completion via Low-Rank Decoder Adaptation

تقترح هذه الورقة طريقة خفيفة الوزن للتكيف عند وقت الاختبار لإكمال العمق بنمط الصفر (zero-shot)، والتي تحقق دقة وكفاءة في مستوى الحالة الراهنة من خلال تحديث فضاء فرعي لفك التشفير منخفض الأبعاد فقط، مما يتجنب التكاليف الحسابية للتحسين الكامل للشبكة أو التحسين القائم على الانتشار.

Minseok Seo, Wonjun Lee, Jaehyuk Jang, Changick Kim2026-03-10
🤖 machine learning

A Detection-Gated Pipeline for Robust Glottal Area Waveform Extraction and Clinical Pathology Assessment

تقدم هذه الورقة البحثية مساراً معالجياً يعتمد على التعلم العميق المعتمد على الكشف والمتميز بالكفاءة الحسابية، والذي يحقق أداءً رائداً في المتانة والتعميم عبر مجموعات البيانات المختلفة في عملية تقسيم المزمار من تنظير الفيديو عالي السرعة، مما يتيح استخراج المؤشرات الحيوية السريرية الموثوقة للتمييز بين الوظيفة الصوتية السليمة والمرضية.

Harikrishnan Unnikrishnan2026-03-10
💻 computer science

iGVLM: Dynamic Instruction-Guided Vision Encoding for Question-Aware Multimodal Understanding

تقترح الورقة البحثية iGVLM، وهو إطار عمل يتغلب على عقبة التمثيل في نماذج الرؤية واللغة الكبيرة من خلال تقديم بنية ثنائية الفرع منفصلة ذات تعديل بصري موجه بالتعليمات لتمكين الاستدلال الديناميكي الواعي بالمهام مع الحفاظ على الأولويات البصرية المدربة مسبقًا.

Hanpeng Liu, Yaqian Li, Zidan Wang, Shuoxi Zhang, Zihao Bo, Rinyoichi Takezoe, Kaiwen Long, Kun He2026-03-10
🤖 machine learning

OptiRoulette Optimizer: A New Stochastic Meta-Optimizer for up to 5.3x Faster Convergence

تقدم الورقة البحثية OptiRoulette، وهو مُحسِّن ميتا عشوائي (stochastic meta-optimizer) يختار قواعد التحديث ديناميكيًا من مجموعة محددة أثناء التدريب، مما يُظهر تقاربًا أسرع بكثير ودقة اختبار أعلى عبر العديد من معايير تصنيف الصور مقارنةً بأساس AdamW القياسي.

Stamatis Mastromichalakis2026-03-10
🤖 machine learning

RECAP: Local Hebbian Prototype Learning as a Self-Organizing Readout for Reservoir Dynamics

تُعد RECAP طريقة لتصنيف الصور مستوحاة بيولوجياً، حيث تجمع بين ديناميكيات الخزان غير المدربة وقراءة نماذج نموذجية هيبية ذاتية التنظيم لتحقيق تعلم قوي خالٍ من الانتشار العكسي، قادر على التعميم على المدخلات المشوهة دون تعرض مسبق لها.

Heng Zhang2026-03-10
💻 computer science

PaLMR: Towards Faithful Visual Reasoning via Multimodal Process Alignment

يُعد PalMR إطار عمل مبتكر يعزز من موثوقية النماذج اللغوية الكبيرة متعددة الوسائط من خلال محاذاة كل من عملية الاستدلال والنتائج عبر طبقة بيانات متوافقة مع الإدراك ومخطط دمج مكافآت هرمي، مما يقلل بشكل كبير من الهلوسة البصرية مع تحقيق أداء رائد على المقاييس الرئيسية.

Yantao Li, Qiang Hui, Chenyang Yan, Kanzhi Cheng, Fang Zhao, Chao Tan, Huanling Gao, Jianbing Zhang, Kai Wang, Xinyu Dai (…)2026-03-10
💻 computer science

ASMIL: Attention-Stabilized Multiple Instance Learning for Whole Slide Imaging

تقدم الورقة البحثية إطار عمل موحد يُسمى ASMIL، يعالج ديناميكيات الانتباه غير المستقرة، والفرط في التخصيص (overfitting)، والتركيز المفرط للانتباه في التعلم متعدد الأمثلة القائم على الانتباه لصور الشرائح الكاملة، وذلك من خلال توظيف نموذج مرساة مع دالة سيجمويد طبيعية وإسقاط عشوائي للرموز (token random dropping)، مما أدى إلى تحسينات كبيرة في الأداء مقارنة بالطرق المتطورة الحالية.

Linfeng Ye, Shayan Mohajer Hamidi, Zhixiang Chi, Guang Li, Mert Pilanci, Takahiro Ogawa, Miki Haseyama, Konstantinos N. (…)2026-03-10
🤖 machine learning

HyperTokens: Controlling Token Dynamics for Continual Video-Language Understanding

تقدم الورقة البحثية HyperTokens، وهو مولد رموز يعتمد على المحولات ومعزز بمنظمات مستوحاة من الميتا (meta) وإشراف مساعد سببي لتمكين فهم مستمر وفعال للفيديو واللغة مع تقليل النسيان عبر إنتاج مطالبات ديناميكية خاصة بكل مهمة دون زيادة تكاليف الذاكرة.

Toan Nguyen, Yang Liu, Celso De Melo, Flora D. Salim2026-03-10
💻 computer science

Accelerating Video Generation Inference with Sequential-Parallel 3D Positional Encoding Using a Global Time Index

تقدم هذه الورقة تحسيناً للاستدلال على مستوى النظام لنماذج "ديفيوجن ترانسفورمر" (Diffusion Transformer) لتوليد الفيديو، والذي يستخدم آلية "كوزال-روبي" (Causal-RoPE) متوازية التسلسل ودمج العمليات للتغلب على اختناقات الذاكرة وزمن الاستجابة، محققةً سرعات تقارب الزمن الحقيقي وزمن استجابة للإطار الأول يقل عن ثانية واحدة على عنقود مكون من ثماني وحدات معالجة رسومية.

Chao Yuan, Pan Li2026-03-10
💻 computer science

Does Semantic Noise Initialization Transfer from Images to Videos? A Paired Diagnostic Study

تبحث هذه الورقة فيما إذا كان تهيئة الضجيج الدلالي، المعروفة بتحسين نماذج انتشار الصور، تنتقل إلى توليد النص إلى فيديو، حيث وجدت أنه بينما تظهر اتجاهاً إيجابياً طفيفاً في المقاييس الزمنية، إلا أنها لا تتفوق بشكل كبير على ضجيج غاوس القياسي بسبب الإشارات الضعيفة أو غير المستقرة في فضاء الضجيج.

Yixiao Jing, Chaoyu Zhang, Zixuan Zhong, Peizhou Huang2026-03-10