💻 computer science

Generative AI for Video Trailer Synthesis: From Extractive Heuristics to Autoregressive Creativity

تستعرض هذه الورقة المسحية التحول النوعي في التوليد التلقائي للإعلات الترويجية للفيديو من الاستخراج القائم على القواعد التجريبية إلى التركيب التوليدي العميق، محللةً تطور البنى الهيكلية، والآثار الاقتصادية، والتحديات الأخلاقية، مع اقتراح تصنيف جديد لبناء السرد المتحكم فيه والموجه بنماذج التأسيس.

Abhishek Dharmaratnakar, Srivaths Ranganathan, Debanshu Das, Anushree Sinha2026-04-08
💻 computer science

StarVLA: A Lego-like Codebase for Vision-Language-Action Model Developing

تُعد StarVLA قاعدة كود برمجية شاملة ومفتوحة المصدر ونمطية، صُممت لتوحيد أبحاث نماذج الرؤية واللغة والعمل (VLA) من خلال دمج نماذج خلفية متنوعة ونماذج فك تشفير الأفعال مع استراتيجيات تدريب قابلة لإعادة الاستخدام وواجهة تقييم معيارية لتعزيز قابلية التكرار وتسريع تطوير الوكلاء المتجسدين العامين.

StarVLA Community2026-04-08
💻 computer science

R3PM-Net: Real-time, Robust, Real-world Point Matching Network

تقدم هذه الورقة البحثية شبكة R3PM-Net، وهي شبكة مطابقة نقاط خفيفة الوزن وتعمل في الوقت الفعلي، صُممت لسد الفجوة بين التدريب الاصطناعي والتطبيقات الصناعية في العالم الحقيقي من خلال تحقيق تسجيل سحابة نقاط عالي الدقة ومتين على مجموعات بيانات مقترحة حديثاً، مع تفوقها بشكل كبير على الأساليب الرائدة في السرعة.

Yasaman Kashefbahrami, Erkut Akdag, Panagiotis Meletis, Evgeniya Balmashnova, Dip Goswami, Egor Bondarau2026-04-08
💻 computer science

SVAgent: Storyline-Guided Long Video Understanding via Cross-Modal Multi-Agent Collaboration

يُعد SVAgent إطار عمل متعدد الوكلاء عابر للوسائط وموجَّه بالقصة، يعمل على تعزيز الإجابة على الأسئلة المتعلقة بالفيديو من خلال محاكاة التفكير السردي الشبيه بالبشر عبر وكلاء متعاونين يبنون قصصاً متطورة، ويُحسّنون اختيار الإطارات، ويُحاذون التنبؤات البصرية-النصية لتقديم نتائج قوية وقابلة للتفسير.

Zhongyu Yang, Zuhao Yang, Shuo Zhan, Tan Yue, Wei Pang, Yingfang Yuan2026-04-08
💻 computer science

Lightweight True In-Pixel Encryption with FeFET Enabled Pixel Design for Secure Imaging

تقدم هذه الورقة SecurePix، وهي بنية مستشعر صور مدمجة متوافقة مع تقنية CMOS تستخدم ترانزستورات التأثير المجالي الفيروكهربائية (FeFETs) لتنفيذ تشفير خفيف الوزن وحقيقي داخل البكسل، مما يؤمن البيانات المرئية بفعالية عند المصدر من خلال تقليل دقة التعرف للشبكة العصبية بشكل كبير مع الحفاظ على استهلاك منخفض للطاقة وتمكين الاسترداد المصرح به عبر مفاتيح متماثلة.

Md Rahatul Islam Udoy, Diego Ferrer, Wantong Li, Kai Ni, Sumeet Kumar Gupta, Ahmedullah Aziz2026-04-08
💻 computer science

Modality-Aware and Anatomical Vector-Quantized Autoencoding for Multimodal Brain MRI

تقدم الورقة البحثية NeuroQuant، وهو نموذج مشفر تلقائي متباين (VAE) ثلاثي الأبعاد يعتمد على التكميم المتجهي ومدرك للنمط ومرتبط تشريحياً، يستخدم انتباهاً متعدد المحاور مفككاً واستراتيجية ترميز ثنائية المسار لإعادة بناء صور الرنين المغناطيسي للدماغ متعددة الأنماط بفعالية من خلال فصل البنى التشريحية المشتركة عن المظاهر الخاصة بكل نمط.

Mingjie Li, Edward Kim, Yue Zhao, Ehsan Adeli, Kilian M. Pohl2026-04-08
💻 computer science

MIRAGE: Benchmarking and Aligning Multi-Instance Image Editing

تقدم هذه الورقة MIRAGE، وهو إطار عمل لا يتطلب تدريباً يستفيد من نماذج الرؤية واللغة وإزالة الضجيج المتوازي متعدد الفروع لحل تحديات الإفراط في التحرير وعدم المحاذاة المكانية في تحرير الصور متعددة العناصر، إلى جانب معيار جديد لتقييم هذا الاتساق دقيق التفاصيل.

Ziqian Liu, Stephan Alaniz2026-04-08
💻 computer science

LSRM: High-Fidelity Object-Centric Reconstruction via Scaled Context Windows

تقدم الورقة البحثية نموذج LSRM، وهو نموذج إعادة بناء ضخم متناثر (Large Sparse Reconstruction Model) يحقق إعادة بناء ثلاثية الأبعاد عالية الدقة ومركزة على الأجسام وإعادة عرض عكسي من خلال توسيع نوافذ سياق المحولات عبر الانتباه المتناثر، ومسار عمل من الخشن إلى الناعم، وتوجيه مكاني مدرك للبعد الثالث، مما يتفوق بشكل كبير على الأساليب الرائدة في كل من المقاييس الكمية واستعادة الأنسجة.

Zhengqin Li, Cheng Zhang, Jakob Engel, Zhao Dong2026-04-08
💻 computer science

Boxer: Robust Lifting of Open-World 2D Bounding Boxes to 3D

تقترح الورقة البحثية Boxer، وهو إطار عمل قائم على المحولات (transformer) يقوم برفع عمليات كشف الكائنات ذات المفردات المفتوحة ثنائية الأبعاد بمتانة إلى صناديق محيطة ثلاثية الأبعاد متسقة عالمياً وذات مقاييس مترية، وذلك عبر الاستفادة من كواشف ثنائية الأبعاد موجودة مسبقاً ودمج الانحدار الواعي بالشك مع مدخلات عمق متفرقة أو كثيفة، محققاً بذلك أداءً هو الأفضل في حالته في مجال التحديد ثلاثي الأبعاد في العالم المفتوح.

Daniel DeTone, Tianwei Shen, Fan Zhang, Lingni Ma, Julian Straub, Richard Newcombe, Jakob Engel2026-04-08
🧬 biology

Hierarchical Mesh Transformers with Topology-Guided Pretraining for Morphometric Analysis of Brain Structures

تقدم هذه الورقة إطار عمل لمحول شبكي هرمي مع تدريب مسبق موجه طوبولوجياً يوحد تحليل الشبكات الدماغية الحجمية والسطحية المتنوعة من خلال دمج الهياكل الهندسية متعددة المقاييس والميزات المورفومترية متغيرة الطول، محققاً أداءً هو الأفضل في حالته في مهام التصوير العصبي مثل تصنيف مرض الزهايمر وكشف خلل التنسج القشري البؤري.

Yujian Xiong, Mohammad Farazi, Yanxi Chen, Wenhui Zhu, Xuanzhao Dong, Natasha Lepore, Yi Su, Raza Mushtaq, Stephen Folde (…)2026-04-08