💻 computer science

PICS: Pairwise Image Compositing with Spatial Interactions

تقدم الورقة البحثية إطار عمل PICS، وهو إطار عمل للتعلم الذاتي يحسن عملية دمج صورتين ثنائيتين من خلال توظيف محول تفاعلي (Interaction Transformer) مع خليط خبراء موجه بالقناع (mask-guided Mixture-of-Experts) ودمج تكيفي لنمذجة التفاعلات المكانية صراحةً والحفاظ على الاتساق الفيزيائي بين الأشياء والخلفيات.

Hang Zhou, Xinxin Zuo, Sen Wang, Li Cheng2026-03-10
🤖 machine learning

Learning From Design Procedure To Generate CAD Programs for Data Augmentation

تقترح هذه الورقة نموذجاً جديداً لتعزيز البيانات يستفيد من النماذج اللغوية الكبيرة لتوليد برامج تصميم بمساعدة الحاسوب (CAD) متنوعة ومحاكية للصناعة، وذلك عبر تكييفها بناءً على أسطح مرجعية وإجراءات نمذجة، مما يعالج ندرة البيانات الهندسية المعقدة القائمة على المنحنيات (spline-based) في مجموعات التدريب الحالية.

Yan-Ying Chen, Dule Shu, Matthew Hong, Andrew Taber, Jonathan Li, Matthew Klenk2026-03-10
🤖 machine learning

Conditional Unbalanced Optimal Transport Maps: An Outlier-Robust Framework for Conditional Generative Modeling

تقدم هذه الورقة خرائط النقل الأمثل الشرطي غير المتوازن (CUOTM)، وهو إطار توليدي شرطي متين يخفف من حساسية القيم المتطرفة التي تعيب النقل الأمثل الشرطي الكلاسيكي عبر تخفيف قيود مطابقة التوزيع بواسطة عقوبات تباعد تشيزار، مع الحفاظ على الهوامش الشرطية من خلال بارامتريز لـ تحويل cc مثلثي مبرر نظرياً.

Jiwoo Yoon, Kyumin Choi, Jaewoong Choi2026-03-10
💻 computer science

T2SGrid: Temporal-to-Spatial Gridification for Video Temporal Grounding

تقترح الورقة البحثية إطار عمل T2SGrid، وهو إطار عمل مبتكر يعيد صياغة تحديد المواقع الزمني للفيديو كمسألة فهم مكاني عبر ترتيب إطارات الفيديو في صور شبكية مركبة بواسطة نوافذ منزلقة متداخلة، مما يتغلب على قيود طرق الترميز الزمني الحالية ويحقق أداءً فائقاً في المعايير القياسية.

Chaohong Guo, Yihan He, Yongwei Nie, Fei Ma, Xuemiao Xu, Chengjiang Long2026-03-10
💻 computer science

MipSLAM: Alias-Free Gaussian Splatting SLAM

يُعد MipSLAM إطار عمل جديد لتقدير الموقع ورسم الخرائط (SLAM) باستخدام تقنية Gaussian Splatting ثلاثية الأبعاد، حيث يحقق رندرة عالية الدقة ومضادة للتمزق (anti-aliased) وتقديرًا قويًا للوضعية من خلال دمج خوارزمية مضادة للتمزق تكيفية إهليلجية، ووحدة تحسين مخطط الرسم البياني للوضعية مدركة للطيف، وفقدان إدراكي محلي في النطاق الترددي للتغلب على عيوب التمزز وانحراف المسار.

Yingzhao Li, Yan Li, Shixiong Tian, Yanjie Liu, Lijun Zhao, Gim Hee Lee2026-03-10
💻 computer science

AdaGen: Learning Adaptive Policy for Image Synthesis

يقدم AdaGen إطارًا عامًا وقابلًا للتعلم يستخدم التعلم المعزز مع مكافأة تنافسية لتكييف المعلمات الخاصة بكل خطوة ديناميكيًا أثناء عملية التخليق المتكرر للصور، مما يتغلب على قيود الجداول الزمنية الثابتة والمصممة يدويًا ويحقق أداءً فائقًا عبر مختلف النماذج التوليدية مع تقليل تكاليف الاستدلال.

Zanlin Ni, Yulin Wang, Yeguo Hua, Renping Zhou, Jiayi Guo, Jun Song, Bo Zheng, Gao Huang2026-03-10
💻 computer science

Two Frames Matter: A Temporal Attack for Text-to-Video Model Jailbreaking

تقدم هذه الورقة البحثية إطار عمل TFM، وهو إطار هجوم زمني يستغل ثغرات نماذج تحويل النص إلى فيديو لإنشاء محتوى ضار من خلال توفير ظروف حدية متفرقة فقط (الإطارات الأولى والأخيرة) واستبدال الإشارات الحساسة بشكل ضمني، مما يؤدي إلى تجاوز فلاتر السلامة الحالية وزيادة معدلات نجاح كسر الحماية بشكل كبير.

Moyang Chen, Zonghao Ying, Wenzhuo Xu, Quancheng Zou, Deyue Zhang, Dongdong Yang, Xiangzheng Zhang2026-03-10
💻 computer science

TIQA: Human-Aligned Text Quality Assessment in Generated Images

تقدم هذه الورقة مهمة ومجموعة بيانات TIQA لتقييم جودة النصوص المتوافقة مع البشر للصور المولدة، إلى جانب طريقة ANTIQA التي تتفوق بشكل كبير على المقاييس الحالية القائمة على التعرف الضوئي على الحروف (OCR) ونماذج الرؤية واللغة الكبيرة (VLM) في التنبؤ بدقة عرض النصوص وتحسين اختيار التوليد في المهام اللاحقة.

Kirill Koltsov, Aleksandr Gushchin, Dmitriy Vatolin, Anastasia Antsiferova2026-03-10
💻 computer science

PDD: Manifold-Prior Diverse Distillation for Medical Anomaly Detection

تقترح الورقة البحثية إطار عمل PDD، وهو إطار عمل مبتكر يوحد الأولويات السياقية العالمية والهيكلية المحلية من مشفرين مجمدين مزدوجين في متشعب مشترك لتقطير معارف متنوعة في شبكات طالب متكاملة، محققاً أداءً هو الأفضل في فئته في اكتشاف الشذوذ في الصور الطبية عبر مجموعات بيانات متعددة.

Xijun Lu, Hongying Liu, Fanhua Shang, Yanming Hui, Liang Wan2026-03-10
💻 computer science

CanoVerse: 3D Object Scalable Canonicalization and Dataset for Generation and Pose

تقدم الورقة البحثية CanoVerse، وهي مجموعة بيانات ضخمة تضم 320 ألف كائن ثلاثي الأبعاد معيار (canonicalized) وإطار عمل عالي الإنتاجية يعمل على حل الغموض الاتجاهي لتحسين استقرار التوليد ثلاثي الأبعاد، والاسترجاع عبر الوسائط، وتقدير التوجه في حالة الصفر (zero-shot) بشكل كبير.

Li Jin, Yuchen Yang, Weikai Chen, Yujie Wang, Dehao Hao, Tanghui Jia, Yingda Yin, Zeyu Hu, Runze Zhang, Keyang Luo, Li Y (…)2026-03-10