💻 computer science

FACT-GS: Frequency-Aligned Complexity-Aware Texture Reparameterization for 2D Gaussian Splatting

يعزز FACT-GS تقنية 2D Gaussian Splatting من خلال تقديم إطار عمل لإعادة تمثيل الأنسجة متوافق مع التردد ومدرك للتعقيد، يستخدم مجال تشويه قابل للتعلم لتخصيص كثافة أخذ عينات غير منتظمة بناءً على التردد البصري المحلي، مما يؤدي إلى تحسين استعادة التفاصيل عالية التردد وكفاءة مساحة الأنسجة دون المساس بالأداء في الوقت الفعلي.

Tianhao Xie, Linlian Jiang, Xinxin Zuo, Yang Wang, Tiberiu Popa2026-04-07
🤖 AI

Low-Bitrate Video Compression through Semantic-Conditioned Diffusion

تقترح الورقة البحثية DiSCo، وهو إطار عمل لضغط الفيديو الدلالي يقوم بنقل تمثيلات متعددة الوسائط مدمجة (نص، وفيديو متدهور، ورسومات تخطيطية اختيارية) إلى نموذج انتشار شرطي من أجل إعادة بناء عالية الجودة، مما يتفوق بشكل كبير على برامج الترميز التقليدية في الجودة الإدراكية عند معدلات البت شديدة الانخفاض.

Lingdong Wang, Guan-Ming Su, Divya Kothandaraman, Tsung-Wei Huang, Mohammad Hajiesmaili, Ramesh K. Sitaraman2026-04-07
🤖 AI

ToG-Bench: Task-Oriented Spatio-Temporal Grounding in Egocentric Videos

تقدم هذه الورقة ToG-Bench، وهو أول معيار لتقييم ربط الفيديو الزماني المكاني الموجه نحو المهام للفيديوهات من منظور الشخص الأول (egocentric)، والذي يعالج أوجه القصور في النهج الحالية المتمحورة حول الأشياء من خلال تقديم سيناريوهات ربط موجهة نحو المهام، وثنائية صريحة-ضمنية، ومتعددة لواحد، وذلك لتقييم وتطوير الذكاء المتجسد بشكل أفضل.

Qi'ao Xu, Tianwen Qian, Yuqian Fu, Kailing Li, Yang Jiao, Jiacheng Zhang, Xiaoling Wang, Liang He2026-04-07
💻 computer science

VideoCoF: Unified Video Editing with Temporal Reasoner

يقدم VideoCoF إطار عمل موحداً لتحرير الفيديو يستخدم نهج "رؤية، ثم استنتاج، ثم تحرير" المتسلسل عبر الإطارات للتنبؤ بالكميات الكامنة لمنطقة التحرير كرموز استنتاج صريحة، مما يحقق محاذاة دقيقة بين التعليمات والمنطقة واتساقاً في الحركة دون الحاجة إلى أقنعة يقدمها المستخدم مع الحفاظ على كفاءة عالية باستخدام الحد الأدنى من بيانات التدريب.

Xiangpeng Yang, Ji Xie, Yiyuan Yang, Yue Ma, Yan Huang, Min Xu, Qiang Wu2026-04-07
💻 computer science

VABench: A Comprehensive Benchmark for Audio-Video Generation

تقدم الورقة البحثية VABench، وهو إطار عمل مرجعي شامل متعدد الأبعاد مصمم لتقييم قدرات توليد الصوت والفيديو المتزامنة بشكل منهجي عبر ثلاثة أنواع من المهام، وسبع فئات من المحتوى، و15 بُعداً للتقييم، وذلك لمعالجة النقص في التقييمات المقنعة في المعايير المرجعية الحالية لتوليد الفيديو.

Daili Hua, Xizhi Wang, Bohan Zeng, Xinyi Huang, Hao Liang, Junbo Niu, Xinlong Chen, Quanqing Xu, Wentao Zhang2026-04-07
🤖 AI

Agile Deliberation: Concept Deliberation for Subjective Visual Classification

تقدم هذه الورقة البحثية "المداولة الرشيقة" (Agile Deliberation)، وهو إطار عمل يعتمد على وجود الإنسان في الحلقة، يساعد المستخدمين على تنقيح المفاهيم البصرية الغامضة أو الذاتية من خلال تحديد النطاق المنظم والتعرض المتكرر للحالات الحدية، مما يؤدي إلى أداء أعلى بكثير للمصنف وجهد معرفي أقل مقارنة بالنماذج المرجعية الحالية.

Leijie Wang, Otilia Stretcu, Wei Qiao, Thomas Denby, Krishnamurthy Viswanathan, Enming Luo, Chun-Ta Lu, Tushar Dogra, Ra (…)2026-04-07
💻 computer science

Stream-DiffVSR: Low-Latency Streamable Video Super-Resolution via Auto-Regressive Diffusion

يُعد Stream-DiffVSR إطار عمل للانتشار (diffusion) يعتمد على التكييف السببي وإطار بإطار، ويحقق دقة فائقة للفيديو عبر الإنترنت بزمن انتقال منخفض وجودة عالية من خلال دمج مُزيل ضجيج مُقطّر من أربع خطوات، ووحدة توجيه زمني ذاتية الانحدار، وفك تشفير مدرك للزمن، مما يقلل وقت الاستدلال من آلاف الثواني إلى أقل من 0.33 ثانية مع التفوق بشكل كبير على الأساليب الحالية المتصلة بالإنترنت في الجودة الإدراكية.

Hau-Shiang Shiu, Chin-Yang Lin, Zhixiang Wang, Chi-Wei Hsiao, Po-Fan Yu, Yu-Chih Chen, Yu-Lun Liu2026-04-07
💻 computer science

GaMO: Geometry-aware Multi-view Diffusion Outpainting for Sparse-View 3D Reconstruction

يُعد GaMO إطار عمل للانتشار متعدد الرؤى، يعتمد على تقنية التعلم الصفري ويدرك الهندسة، حيث يعمل على تحسين إعادة البناء ثلاثي الأبعاد من مشاهد قليلة عن طريق توسيع مجال الرؤية من وضعيات الكاميرا الموجودة لضمان الاتساق الهندسي وتغطية أوسع للمشهد، مع تقليل وقت التشغيل الحسابي بشكل كبير مقارنة بالطرق الحالية.

Yi-Chuan Huang, Hao-Jen Chien, Chin-Yang Lin, Ying-Huan Chen, Yu-Lun Liu2026-04-07
🤖 AI

Circuit Mechanisms for Spatial Relation Generation in Diffusion Transformers

تستخدم هذه الورقة البحثية التفسير الآلي للكشف عن أنه بينما يمكن لنماذج محولات الانتشار (Diffusion Transformers) تحقيق دقة تقارب الكمال في توليد العلاقات المكانية، فإن آليات الدوائر الكامنة تختلف اختلافاً جذرياً اعتماداً على ما إذا كانت مشفرات النصوص عشوائية أو مدربة مسبقاً، حيث يقوم النوع الأخير بدمج المعلومات في رمز واحد (token) ويُظهر متانة مختلفة تجاه الاضطرابات خارج النطاق.

Binxu Wang, Jingxuan Fan, Xu Pan2026-04-07
🤖 machine learning

Improving Multimodal Learning with Dispersive and Anchoring Regularization

تقترح هذه الورقة \regName، وهو إطار عمل للتنظيم الوعي بالهندسة، خفيف الوزن وقابل للتوصيل والتشغيل، يعمل على تحسين التعلم متعدد الوسائط من خلال فرض التنوع داخل الوسيط الواحد والاتساق المحدود بين الوسائط للتخفيف من انهيار التمثيل وعدم الاتساق عبر الوسائط.

Zixuan Xia, Hao Wang, Pengcheng Weng, Yanyu Qian, Yangxin Xu, William Dan, Fei Wang2026-04-07