🤖 AI

VOILA: Value-of-Information Guided Fidelity Selection for Cost-Aware Multimodal Question Answering

يُعد VOILA إطار عمل مراعياً للتكلفة يختار ديناميكياً الدقة البصرية المثلى للإجابة على الأسئلة متعددة الوسائط من خلال التنبؤ بدقة الاسترجاع وتكاليفه، محققاً بذلك تخفيضات كبيرة في التكلفة مع الحفاظ على دقة عالية عبر مختلف مجموعات البيانات والنماذج.

Rahul Atul Bhope, K. R. Jayaram, Vinod Muthusamy, Ritesh Kumar, Vatche Isahagian, Nalini Venkatasubramanian2026-02-04
💻 computer science

Thinking inside the Convolution for Image Inpainting: Reconstructing Texture via Structure under Global and Local Side

تقترح هذه الورقة طريقة مبتكرة لترميم الصور تخفف من فقدان المعلومات أثناء عملية خفض العينة التلافيفية عبر الاستفيد من استراتيجية توجيه إعادة البناء المتبادل بين خرائط سمات الهيكل والنسيج من خلال التطبيع وإلغاء التطبيع الإحصائي، محققةً أداءً هو الأفضل في فئته عبر دقات عرض مختلفة.

Haipeng Liu, Yang Wang, Biao Qian, Yong Rui, Meng Wang2026-02-04
💻 computer science

MUSE: A Multi-agent Framework for Unconstrained Story Envisioning via Closed-Loop Cognitive Orchestration

تقدم هذه الورقة MUSE، وهو إطار عمل متعدد الوكلاء يعالج تحديات توليد القصص السمعية البصرية طويلة التنسيق من خلال توظيف عملية تنظيم معرفي مغلقة الحلقة للتخطيط والتنفيذ والتحقق والمراجعة بشكل تكراري، مما يضمن تماسك السرد واتساق الهوية عبر التسلسلات الممتدة.

Wenzhang Sun, Zhenyu Wang, Zhangchi Hu, Chunfeng Wang, Hao Li, Wei Chen2026-02-04
🤖 AI

Bongards at the Boundary of Perception and Reasoning: Programs or Language?

تقدم هذه الورقة نهجاً عصبياً رمزياً يجمع بين النماذج اللغوية الكبيرة لتوليد البرامج ذات المعلمات وبين التحسين البايزي لضبط المعلمات لحل مشكلات بونغارد، مما يسد الفجوة بين الإدراك البصري والاستدلال التجريدي.

Cassidy Langenfeld, Claas Beger, Gloria Geng, Wasu Top Piriyakulkij, Keya Hu, Yewen Pu, Kevin Ellis2026-02-04
🤖 AI

SAFE-KD: Risk-Controlled Early-Exit Distillation for Vision Backbones

يُعد SAFE-KD غلافاً عالمياً متعدد المخارج للنماذج الرؤيوية الأساسية، يجمع بين تقطير المعرفة الهرمي والتحكم في مخاطر التوافق لتمكين عمليات الخروج المبكرة والآمنة للاستدلال مع ضمان مستويات مخاطر التصنيف الخاطئ التي يحددها المستخدم.

Salim Khazem2026-02-04
🤖 AI

JRDB-Pose3D: A Multi-person 3D Human Pose and Shape Estimation Dataset for Robotics

تقدم هذه الورقة البحثية JRDB-Pose3D، وهي مجموعة بيانات شاملة تم التقاطها من منصة روبوتية متنقلة توفر توصيفات غنية لوضعية وشكل جسم الإنسان ثلاثي الأبعاد لمشاهد داخلية وخارجية معقدة ومتعددة الأشخاص، مما يعالج أوجه القصور في مجموعات البيانات الحالية المقتصرة على شخص واحد أو البيئات الخاضعة للتحكم لدعم تطبيقات الروبوتات في العالم الحقيقي بشكل أفضل.

Sandika Biswas, Kian Izadpanah, Hamid Rezatofighi2026-02-04
🤖 AI

Beyond Cropping and Rotation: Automated Evolution of Powerful Task-Specific Augmentations with Generative Models

تقدم هذه الورقة البحثية EvoAug، وهو مسار مؤتمت يجمع بين النماذج التوليدية وخوارزمية تطورية لتعلم عمليات تعزيز البيانات المثلى والهرمية والخاصة بمهام محددة، مما يظهر أداءً محسناً في سيناريوهات التصنيف دقيق التفاصيل والتعلم من عينات قليلة.

Judah Goldfeder, Shreyes Kaliyur, Vaibhav Sourirajan, Patrick Minwan Puma, Philippe Martin Wyder, Yuhang Hu, Jiong Lin (…)2026-02-04
🤖 machine learning

Feature, Alignment, and Supervision in Category Learning: A Comparative Approach with Children and Neural Networks

تستخدم هذه الدراسة تصميماً عادلاً بين الأنواع لمقارنة الأطفال والشبكات العصبية الالتفافية (CNNs) في تعلم الفئات شبه الموجه بلقطات قليلة، مما يكشف أنه بينما يستفيد كلا الطرفين من الإشراف، يُظهر الأطفال تحيزات محددة للميزات وحساسية تجاه المحاذاة، في حين تُظهر الشبكات العصبية الالتفافية تفاعلاً أكثر تعقيداً حيث تعمل المحاذاة وبنية الميزات على تعديل تأثير الملصقات الإضافية.

Fanxiao Wani Qiu, Oscar Leong2026-02-04
🤖 machine learning

Spectral Evolution Search: Efficient Inference-Time Scaling for Reward-Aligned Image Generation

تقدم هذه الورقة البحثية "البحث عن التطور الطيفي" (Spectral Evolution Search - SES)، وهو إطار عمل جاهز للاستخدام (plug-and-play) يعمل على تحسين كفاءة التوسع أثناء الاستدلال لتوليد الصور المتوافقة مع المكافأة، وذلك من خلال قصر البحث التطوري الخالي من التدرج على فضاء فرعي منخفض التردد، مما يتغلب على عدم الكفاءة الناجمة عن الانحياز الطيفي في تحسين الضوضاء عالية الأبعاد.

Jinyan Ye, Zhongjie Duan, Zhiwen Li, Cen Chen, Daoyuan Chen, Yaliang Li, Yingda Chen2026-02-04
💻 computer science

EventFlash: Towards Efficient MLLMs for Event-Based Vision

يقدم EventFlash نموذجاً لغوياً كبيراً متعدد الوسائط يعتمد على الأحداث بكفاءة، والذي يستفيد من التناثر الرمزي المكاني والزماني، مدعوماً بمجموعة بيانات جديدة واسعة النطاق ووحدات تكيفية، لتحقيق تحسينات كبيرة في معدل الإنتاجية وقدرات المعالجة طويلة المدى مع الحفاظ على أداء مماثل للنماذج المرجعية الحالية.

Shaoyu Liu, Jianing Li, Guanghui Zhao, Yunjian Zhang, Wen Jiang, Ming Li, Xiangyang Ji2026-02-04