💻 computer science

DROID-SLAM in the Wild

تقدم هذه الورقة البحثية DROID-SLAM in the Wild، وهو نظام RGB SLAM قوي وفي الوقت الفعلي يحقق أداءً رائدًا في التتبع وإعادة البناء في البيئات الديناميكية المزدحمة من خلال الاستفيد من الضبط الحزمي القابل للتفاضل والمدرك لعدم اليقين لتقدير عدم اليقين لكل بكسل من عدم الاتساق في الميزات متعددة الرؤى.

Moyang Li, Zihan Zhu, Marc Pollefeys, Daniel Barath2026-03-20
💻 computer science

TAU-R1: Visual Language Model for Traffic Anomaly Understanding

تقدم هذه الورقة البحثية Roundabout-TAU، وهي مجموعة بيانات جديدة لمقاطع فيديو واقعية لدوارات مع تعليقات توضيحية شاملة، وتقترح TAU-R1، وهو إطار عمل رؤية ولغة ثنائي الطبقات تم تدريبه باستراتيجية متخصصة مكونة من مرحلتين لفهم واستنتاج حالات الشذوذ المروري بفعالية لأنظمة النقل الذكية.

Yuqiang Lin, Kehua Chen, Sam Lockyer, Arjun Yadav, Mingxuan Sui, Shucheng Zhang, Yan Shi, Bingzhang Wang, Yuang Zhang, M (…)2026-03-20
💻 computer science

Revisiting Autoregressive Models for Generative Image Classification

تقترح هذه الورقة طريقة جديدة لتصنيف الصور توليدية تستفيد من النماذج ذات الترتيب الذاتي لأي ترتيب لتقدير التنبؤات الهامشية للترتيب، مما يتغلب على قيود الترتيب الثابت للرموز ويحقق دقة وكفاءة متفوقتين مقارنة بكل من المصنفات القائمة على الانتشار والنماذج التمييزية الحديثة.

Ilia Sudakov, Artem Babenko, Dmitry Baranchuk2026-03-20
💻 computer science

ADAPT: Attention Driven Adaptive Prompt Scheduling and InTerpolating Orthogonal Complements for Rare Concepts Generation

تقترح الورقة البحثية إطار عمل ADAPT، وهو إطار عمل لا يتطلب تدريباً يقوم بتخطيط جداول زمنية للمطالبات ومواءمتها دلالياً بشكل حتمي باستخدام درجات الانتباه والمكونات المتعامدة لتحسين التوليد التركيبي للمفاهيم النادرة في تخليق الصور من النصوص بشكل كبير دون المساس بالسلامة البصرية.

Kwanyoung Lee, Hyunwoo Oh, SeungJu Cha, Sungho Koh, Dong-Jin Kim2026-03-20
💻 computer science

Adaptive Auxiliary Prompt Blending for Target-Faithful Diffusion Generation

تقدم هذه الورقة البحثية إطار عمل "مزج المطالبات المساعدة التكيفي" (AAPB)، وهو إطار عمل لا يتطلب تدريباً يستخدم معاملًا تكيفيلاً ذا صيغة مغلقة يستند إلى هوية "تودي" (Tweedie's identity) للموازنة ديناميكيًا بين المطالبات المرجعية المساعدة والمطالبات المستهدفة، مما يضمن توليد صور دقيقة دلاليًا وأمينة بنيويًا للمفاهيم النادرة ومهام التحرير في نماذج الانتشار.

Kwanyoung Lee, SeungJu Cha, Yebin Ahn, Hyunwoo Oh, Sungho Koh, Dong-Jin Kim2026-03-20
⚡ electrical engineering

Few-shot Acoustic Synthesis with Multimodal Flow Matching

تقدم هذه الورقة البحثية FLAC، وهو إطار عمل احتمالي لمطابقة التدفق يقوم بتخليق استجابات نبض الغرفة المستمرة مكانياً من سياق مشهد أدنى، متفوقاً على النماذج المرجعية الحالية ذات العينات القليلة مع التقاط عدم اليقين الصوتي وتقديم مقياس تقييم جديد متسق هندسياً.

Amandine Brunetto2026-03-20
💻 computer science

Tinted Frames: Question Framing Blinds Vision-Language Models

تكشف هذه الورقة أن نماذج الرؤية واللغة تظهر عمىً انتقائياً من خلال تقليل الانتباه البصري تحت أطر الأسئلة المقيدة، وتقترح طريقة خفيفة الوزن لضبط المطالبات باستخدام رموز قابلة للتعلم لاستعادة التأسيس البصري القوي وتحسين الأداء عبر أساليب الصياغة المختلفة.

Wan-Cyuan Fan, Jiayun Luo, Declan Kutscher, Leonid Sigal, Ritwik Gupta2026-03-20
🤖 machine learning

DreamPartGen: Semantically Grounded Part-Level 3D Generation via Collaborative Latent Denoising

يُعد DreamPartGen إطار عمل مبتكرًا يحقق توليدًا ثلاثي الأبعاد على مستوى الأجزاء ومؤصلًا دلاليًا من خلال توظيف "كامنات الأجزاء المزدوجة" (Duplex Part Latents) و"كامنات العلاقات الدلالية" (Relational Semantic Latents) ضمن عملية إزالة ضجيج متزامنة لضمان الدقة الهندسية والمحاذاة القوية مع الأوصاف النصية.

Tianjiao Yu, Xinzhuo Li, Muntasir Wahed, Jerry Xiong, Yifan Shen, Ying Shen, Ismini Lourentzou2026-03-20
💻 computer science

LVOmniBench: Pioneering Long Audio-Video Understanding Evaluation for Omnimodal LLMs

لمعالجة الفجوة في تقييم النماذج اللغوية الكبيرة متعددة الوسائط (omnimodal) على المحتوى طويل التنسيق، تقدم هذه الورقة LVOmniBench، وهو معيار جديد يتكون من 275 فيديو (تتراوح مدتها بين 10 إلى 90 دقيقة) و1,014 زوجاً من الأسئلة والأجوبة يكشف أن النماذج الحالية تعاني في الاستيعاب السمعي البصري الممتد، حيث حققت دقة أقل من 35% للنماذج مفتوحة المصدر وما يصل إلى 65% لنموذج Gemini 3 Pro.

Keda Tao, Yuhua Zheng, Jia Xu, Wenjie Du, Kele Shao, Hesong Wang, Xueyi Chen, Xin Jin, Junhan Zhu, Bohan Yu, Weiqiang Wa (…)2026-03-20
🤖 machine learning

Spectrally-Guided Diffusion Noise Schedules

تقدم هذه الورقة طريقة قائمة على الطيف وممنهجة لتصميم جداول ضوضاء تكييفية في نماذج الانتشار البكسلية، والتي تقضي على الخطوات الزائدة وتحسن الجودة التوليدية، لا سيما في أنظمة الخطوات المنخفضة، من خلال وضع حدود نظرية لمستويات الضوضاء الفعالة وأخذ عينات مشروطة للجداول أثناء الاستدلال.

Carlos Esteves, Ameesh Makadia2026-03-20