💻 computer science

ORMOT: A Dataset and Framework for Omnidirectional Referring Multi-Object Tracking

تقدم هذه الورقة البحثية مهمة ORMOT، وهي مهمة جديدة توسع نطاق تتبع الكائنات متعددة المراجع إلى الصور شاملة الاتجاهات للتغلب على قيود مجال الرؤية، مدعومة بمجموعة بيانات ORSet التي تم إنشاؤها حديثاً وإطار عمل نموذج الرؤية واللغة الكبير ORTrack.

Sijia Chen, Zihan Zhou, Yanqiu Yu, En Yu, Wenbing Tao2026-03-06
🤖 AI

SAIL: Similarity-Aware Guidance and Inter-Caption Augmentation-based Learning for Weakly-Supervised Dense Video Captioning

تقترح هذه الورقة إطار عمل SAIL، وهو إطار عمل لوصف الفيديو الكثيف تحت الإشراف الضعيف يعمل على تحسين التحديد الزمني والوصف من خلال بناء أقنعة مدركة دلالياً عبر المحاذاة عبر الوسائط وتعزيز إشارات التدريب باستخدام تعليقات توضيحية اصطناعية ناتجة عن نماذج اللغات الكبيرة عبر آلية القناع البيني.

Ye-Chan Kim, SeungJu Cha, Si-Woo Kim, Minju Jeon, Hyungee Kim, Dong-Jin Kim2026-03-06
🤖 AI

Planning in 8 Tokens: A Compact Discrete Tokenizer for Latent World Model

تقدم الورقة البحثية CompACT، وهو مُجزئ رموز (tokenizer) منفصل ومدمج يقوم بضغط الملاحظات إلى 8 رموز فقط لتمكين التخطيط لاتخاذ القرار في الوقت الفعلي وبكفاءة حوسبية عالية داخل نماذج العالم مع الحفاظ على أداء تنافسي.

Dongwon Kim, Gawon Seo, Jinsung Lee, Minsu Cho, Suha Kwak2026-03-06
💻 computer science

EdgeDAM: Real-time Object Tracking for Mobile Devices

يُعد EdgeDAM إطار عمل خفيف الوزن لتتبع كائن واحد في الوقت الفعلي للأجهزة المحمولة، والذي يحقق أداءً قويًا تحت ظروف الاحتجاب وتداخل المشتتات من خلال تقديم آلية ذاكرة ثنائية المخزن مؤقت مدركة للمشتتات واستراتيجية تبديل مدفوعة بالثقة مع تثبيت الصندوق المحتجز.

Syed Muhammad Raza, Syed Murtaza Hussain Abidi, Khawar Islam, Muhammad Ibrahim, Ajmal Saeed Mian2026-03-06
💻 computer science

HALP: Detecting Hallucinations in Vision-Language Models without Generating a Single Token

تقدم هذه الورقة البحثية HALP، وهي طريقة تكتشف الهلوسة في نماذج الرؤية واللغة قبل توليد النص من خلال تحليل التمثيلات الداخلية، محققةً دقة عالية عبر بنيات متنوعة وممكنةً لتدخلات السلامة الفعالة مثل الامتناع المبكر.

Sai Akhil Kogilathota, Sripadha Vallabha E G, Luzhe Sun, Jiawei Zhou2026-03-06
💻 computer science

Towards 3D Scene Understanding of Gas Plumes in LWIR Hyperspectral Images Using Neural Radiance Fields

تقترح هذه الورقة نهجاً جديداً لمجال الإشعاع العصبي (NeRF) معززاً بخسارة متوسط مربع الخطأ (MSE) ذات أوزان تكيفية لإعادة بناء المشاهد ثلاثية الأبعاد من صور طيفية بالأشعة تحت الحمراء طويلة الموجة شحيحة، مما يثبت فعاليتها في تحسين أداء كشف سحابة الغاز مقارنة بالطرق القياسية.

Scout Jarman, Zigfried Hampel-Arias, Adra Carr, Kevin R. Moon2026-03-06
💻 computer science

Towards Multimodal Lifelong Understanding: A Dataset and Agentic Baseline

تقدم هذه الورقة MM-Lifelong، وهو عبارة عن مجموعة بيانات واسعة النطاق من لقطات الحياة اليومية الطبيعية وغير المكتوبة التي تمتد لفترة تصل إلى شهر، وتقترح الوكيل متعدد الوسائط المتكرر (ReMA) للتغلب على قيود الذاكرة العاملة والتحديد الموضعي للنماذج الحالية في الفهم متعدد الوسائط طويل الأمد.

Guo Chen, Lidong Lu, Yicheng Liu, Liangrui Dong, Lidong Zou, Jixin Lv, Zhenquan Li, Xinyi Mao, Baoqi Pei, Shihao Wang, Z (…)2026-03-06
⚛️ quantum physics

Schrödinger's Camera: First Steps Towards a Quantum-Based Privacy Preserving Camera

تقترح هذه الورقة نظام كاميرا مبتكرًا يعتمد على الكم للحفاظ على الخصوصية، يقوم بتخزين صور منخفضة الدقة في حالات كمومية قابلة للعكس ويستخدم خوارزمية التعلم العميق لـ Q المزدوجة للموازنة ديناميكيًا بين الخصوصية والمنفعة قبل عملية القياس، مما يثبت جدوى التحكم في كلا الجانبين في المحاكاة.

Hannah Kirkland, Sanjeev J. Koppal2026-03-05
🤖 AI

Learning to Generate Conditional Tri-plane for 3D-aware Expression Controllable Portrait Animation

تقدم هذه الورقة Export3D، وهي طريقة لتحريك الصور الشخصية ثلاثية الأبعاد بلمحة واحدة (one-shot) تعتمد على الوعي ثلاثي الأبعاد، وتستخدم إطار تدريب مسبق تبايني ومولد ثلاثي المستويات (tri-plane generator) لتحقيق توليد صور قابل للتحكم في التعبيرات ومتغير من حيث زوايا الرؤية، مع القضاء بفعالية على عمليات تبديل المظهر غير المرغوب فيها أثناء نقل التعبيرات عبر الهويات المختلفة.

Taekyung Ki, Dongchan Min, Gyeongsu Chae2026-03-05
💻 computer science

FireANTs: Adaptive Riemannian Optimization for Multi-Scale Diffeomorphic Matching

تقدم الورقة البحثية FireANTs، وهي خوارزمية تحسين ريماني تكيفية متعددة المقاييس، معززة بوحدة معالجة الرسومات وغير معتمدة على التدريب، تحقق مطابقة صور تباينية (diffeomorphic) كثيفة أسرع بكثير وأكثر كفاءة في استهلاك الذاكرة من كل من الطرق التقليدية ونهج التعلم العميق، مع الحفاظ على تعميم قوي عبر مختلف الأنماط والتركيبات التشريحية.

Rohit Jena, Pratik Chaudhari, James C. Gee2026-03-05