💻 computer science

Towards Realistic and Consistent Orbital Video Generation via 3D Foundation Priors

تقترح هذه الورقة طريقة مبتكرة لتوليد فيديوهات مدارية واقعية ومتسقة من صورة واحدة عبر الاستفادة من الميزات الكامنة متعددة المقاييس من نموذج توليدي تأسيسي ثلاثي الأبعاد كأولويات هيكلية، والتي يتم حقنها في نموذج فيديو أساسي عبر محول ثلاثي الأبعاد متعدد المقاييس للتغلب على قيود الانتباه على مستوى البكسل في استقراء الرؤية بعيدة المدى.

Rong Wang, Ruyi Zha, Ziang Cheng, Jiayu Yang, Pulak Purkait, Hongdong Li2026-04-15
💻 computer science

Cell Instance Segmentation via Multi-Task Image-to-Image Schrödinger Bridge

تقترح هذه الورقة إطار عمل "جسر شرويدر" (Schrödinger Bridge) متعدد المهام لتحويل الصور إلى صور، والذي يصيغ تقسيم مثيلات الخلايا كمسألة توليد قائمة على التوزيع مع إشراف مدرك للحدود، محققاً أداءً تنافسياً على مجموعتي بيانات PanNuke وMoNuSeg دون الاعتماد على التدريب المسبق لنموذج SAM أو المعالجة اللاحقة.

Hayato Inoue, Shota Harada, Shumpei Takezaki, Ryoma Bise2026-04-15
💻 computer science

Self-Adversarial One Step Generation via Condition Shifting

تقدم الورقة البحثية APEX، وهو إطار عمل خالٍ من المميز (discriminator-free) يستفيد من إشارات التصحيح التنافسي الداخلية عبر إزاحة الشرط (condition shifting) لتحقيق توليد صور من النصوص في خطوة واحدة بمستوى رائد (state-of-the-art) مع دقة وكفاءة تدريب فائقتين مقارنة بالطرق الحالية.

Deyuan Liu, Peng Sun, Yansen Han, Zhenglin Cheng, Chuyan Chen, Tao Lin2026-04-15
💻 computer science

HyperLiDAR: Adaptive Post-Deployment LiDAR Segmentation via Hyperdimensional Computing

يُعد HyperLiDAR إطار عمل خفيف الوزن لتجزئة بيانات ليدار (LiDAR) لما بعد النشر، يعتمد على الحوسبة فائقة الأبعاد، مما يتيح التكيف الفعال على الأجهزة للقيادة الذاتية من خلال الاستفيد من التعلم السريع واستراتيجية اختيار المخزن المؤقت للتغلب على القيود الحسابية والتحولات البيئية.

Ivannia Gomez Moreno, Yi Yao, Ye Tian, Xiaofan Yu, Flavio Ponzina, Michael Sullivan, Jingyi Zhang, Mingyu Yang, Hun Seok (…)2026-04-15
🤖 machine learning

All in One: A Unified Synthetic Data Pipeline for Multimodal Video Understanding

تقترح هذه الورقة البحثية مساراً موحداً لتوليد البيانات الاصطناعية يقوم تلقائياً بإنشاء تسميات توضيحية متنوعة ومتعددة المهام للفيديو لتدريب النماذج اللغوية الكبيرة متعددة الوسائط، مما يثبت أن النماذج التي تتدرب بشكل أساسي على هذه البيانات الاصطناعية يمكنها التعميم بفعالية، وغالباً ما تتفوق على نظيراتها المدربة على بيانات من العالم الحقيقي، عبر مهام مثل عد الأشياء، والإجابة عن الأسئلة البصرية، والتجزئة.

Tanzila Rahman, Renjie Liao, Leonid Sigal2026-04-15
💻 computer science

CoLA: A Choice Leakage Attack Framework to Expose Privacy Risks in Subset Training

تتحدى هذه الورقة الافتراض القائل بأن التدريب على مجموعات فرعية يقلل من مخاطر الخصوصية من خلال تقديم CoLA، وهو إطار عمل يوضح أن عملية اختيار البيانات نفسها تخلق أسطح هجوم جديدة (هجمات استدلال العضوية للتدريب وهجمات استدلال المشاركة في الاختيار) قادرة على تسريب معلومات حساسة حول كل من بيانات التدريب وسلسلة التوريد الأوسع للبيانات والنماذج.

Qi Li, Cheng-Long Wang, Yinzhi Cao, Di Wang2026-04-15
💻 computer science

Combating Pattern and Content Bias: Adversarial Feature Learning for Generalized AI-Generated Image Detection

تقترح هذه الورقة إطار عمل "تعلم الميزات التنافسية متعدد الأبعاد" (MAFL)، الذي يستخدم آلية تدريب تنافسية لتثبيط انحيازات النمط والمحتوى، مما يعزز بشكل كبير من قدرة التعميم عبر النماذج وكفاءة البيانات في الكشف عن الصور المولدة بواسطة الذكاء الاصطناي.

Haifeng Zhang, Qinghui He, Xiuli Bi, Bo Liu, Chi-Man Pun, Bin Xiao2026-04-15
💻 computer science

OmniFood8K: Single-Image Nutrition Estimation via Hierarchical Frequency-Aligned Fusion

تقدم هذه الورقة البحثية OmniFood8K، وهي مجموعة بيانات متعددة الوسائط شاملة تعالج نقص بيانات المطبخ الصيني، إلى جانب مجموعة بيانات اصطناعية واسعة النطاق وإطار عمل متكامل (end-to-end) يستفيد من تقدير العمق والدمج المتوافق ترددياً لتحقيق تقدير دقيق للمغذيات من صورة واحدة.

Dongjian Yu, Weiqing Min, Qian Jiang, Xing Lin, Xin Jin, Shuqiang Jiang2026-04-15
💻 computer science

Modality-Agnostic Prompt Learning for Multi-Modal Camouflaged Object Detection

تقترح هذه الورقة إطار عمل جديد لتعلم التلقين غير المرتبط بنمط معين، يعمل على تكييف نموذج "Segment Anything Model" (SAM) للكشف عن الأجسام المموهة متعدد الوسائط من خلال توليد تلقينات موحدة من وسائط مساعدة متنوعة وتحسين التنبؤات باستخدام وحدة قناع خفيفة الوزن، مما يحقق أداءً فائقاً وقدرة على التعميم عبر معايير RGB-Depth وRGB-Thermal وRGB-Polarization.

Hao Wang, Jiqing Zhang, Xin Yang, Baocai Yin, Lu Jiang, Zetian Mi, Huibing Wang2026-04-15
💻 computer science

Dual-Modality Anchor-Guided Filtering for Test-time Prompt Tuning

تقترح هذه الورقة إطار عمل للترشيح الموجه بالمرتكزات ثنائي الأنماط لضبط المطالبات في وقت الاختبار، والذي يستفيد من المرتكزات النصية والمرتكزات الصورية التكيفية لترشيح المشاهد المعلوماتية وتوفير إشراف مستقر، مما يتغلب على قيود الترشيح القائم على الإنتروبيا ويحقق أداءً رائدًا عبر 15 مجموعة بيانات مرجعية.

Jungwon Choi, Eunwoo Kim2026-04-15