💻 computer science

SceneStreamer: Continuous Scenario Generation as Next Token Group Prediction

يُعد SceneStreamer إطار عمل موحداً يعتمد على المحولات ذات التوليد الذاتي (autoregressive transformer)، يقوم بتوليد سيناريوهات مرورية مستمرة وطويلة الأمد عبر التنبؤ بتسلسلات من الرموز (tokens) التي تمثل عناصر ديناميكية مثل الوكلاء وإشارات المرور، مما يتيح إنشاء بيئات واقعية ومتنوعة وتكيفية تعمل على تحسين متانة وقدرة سياسات القيادة الذاتية على التعميم بشكل كبير.

Zhenghao Peng, Yuxin Liu, Bolei Zhou2026-03-04
💻 computer science

MMTok: Multimodal Coverage Maximization for Efficient Inference of VLMs

تُعد MMTok طريقة مبتكرة تعزز كفاءة الاستدلال لنماذج الرؤية واللغة عبر صياغة اختيار رموز الرؤية كمسألة تغطية قصوى، وذلك من خلال الاستفرد بالمعلومات متعددة الوسائط المتكاملة من كل من الرؤية والنص لتقليص الرموز الزائدة مع الحفاظ على الأداء العالي.

Sixun Dong, Juhua Hu, Mian Zhang, Ming Yin, Yanjie Fu, Qi Qian2026-03-04
🤖 AI

ConEQsA: Concurrent and Asynchronous Embodied Questions Scheduling and Answering

تقدم هذه الورقة ConEQsA، وهو إطار عمل ومعيار وكيل جديد مصمم لمعالجة تحديات الإجابة المتزامنة وغير المتزامنة على الأسئلة المجسدة من خلال الاستفادة من الذاكرة المشتركة والجدولة الواعية بالاستعجال للتفوق على النهج التسلسلي التقليدي في سيناريوهات الأسئلة المتعددة الواقعية.

Haisheng Wang, Dong Liu, Weiming Zhi2026-03-04
🤖 AI

SiNGER: A Clearer Voice Distills Vision Transformers Further

تقدم الورقة البحثية SiNGER، وهو إطار عمل مبتكر لتقطير المعرفة يستخدم إعادة تخصيص الطاقة الموجهة بالفضاء الصفري المنفرد عبر محول قائم على LoRA لتثبيط العيوب ذات القيم الطبيعية العالية في نماذج Vision Transformer المعلمة مع الحفاظ على الإشارات المعلوماتية، مما يمكن النماذج الطالبة من تحقيق أداء رائد وتمثيلات أكثر وضوحًا.

Geunhyeok Yu, Sunjae Jeong, Yoonyoung Choi, Jaeseung Kim, Hyoseok Hwang2026-03-04
💻 computer science

Reasoning as Representation: Rethinking Visual Reinforcement Learning in Image Quality Assessment

تكشف هذه الورقة أن تعميم نماذج تقييم جودة الصور القائمة على التعلم المعزز ينبع من تحويلها للبيانات المرئية إلى تمثيلات نصية مدمجة، مما أدى إلى اقتراح RALI، وهو خوارزمية خفيفة الوزن تعمل على محاذاة الصور مباشرة مع هذه التمثيلات لتحقيق أداء مماثل بتكاليف حوسبة أقل بكثير.

Shijie Zhao, Xuanyu Zhang, Weiqi Li, Junlin Li, Li Zhang, Tianfan Xue, Jian Zhang2026-03-04
🤖 AI

Inpainting the Red Planet: Diffusion Models for the Reconstruction of Martian Environments in Virtual Reality

تقترح هذه الورقة نموذج انتشار غير مشروط تم تدريبه على خرائط ارتفاع HiRISE معززة لإعادة بناء بيانات تضاريس المريخ المفقودة في الواقع الافتراضي، مما يظهر دقة فائقة وتشابهاً إدراكياً مقارنة بطرق الاستيفاء التقليدية.

Giuseppe Lorenzo Catalano, Agata Marta Soccini2026-03-04
💻 computer science

Audio-sync Video Instance Editing with Granularity-Aware Mask Refiner

تقدم الورقة البحثية AVI-Edit، وهو إطار عمل مبتكر يحقق تحريراً دقيقاً لمقاطع الفيديو المتزامنة صوتياً من خلال توظيف مُحسِّن قناع مدرك للدرجة (granularity-aware mask refiner) من أجل الدقة المكانية، وعميل صوتي ذي تغذية راجعة ذاتية (self-feedback audio agent) للتحكم الزمني، ومجموعة بيانات ضخمة تم إنشاؤها حديثاً.

Haojie Zheng, Shuchen Weng, Jingqi Liu, Siqi Yang, Boxin Shi, Xinlong Wang2026-03-04
🤖 machine learning

CHAMMI-75: Pre-training multi-channel models with heterogeneous microscopy images

تقدم الورقة البحثية CHAMMI-75، وهي مجموعة بيانات متنوعة ومفتوحة الوصول تتكون من 75 دراسة مجهرية متعددة القنوات وغير متجانسة، مما يتيح تدريب نماذج تعلم آلي متكيفة مع القنوات للتغلب على قيود النهج المتخصصة أحادية النمط في قياس المورفولوجيا الخلوية.

Vidit Agrawal, John Peters, Tyler N. Thompson, Mohammad Vali Sanian, Chau Pham, Nikita Moshkov, Arshad Kazi, Aditya Pill (…)2026-03-04
🤖 AI

Hot-Start from Pixels: Low-Resolution Visual Tokens for Chinese Language Modeling

تُثبت هذه الورقة أن المدخلات البصرية منخفضة الدقة (بصغر يصل إلى 8×8 بكسل) يمكن أن تحل بفعالية محل الرموز التقليدية القائمة على الفهرسة في نمذجة اللغة الصينية، محققةً دقة مماثلة مع إظهار مرحلة تعلم "بداية ساخنة" أسرع بشكل ملحوظ.

Shuyang Xiang, Hao Guan2026-03-04
🤖 machine learning

Graph Recognition via Subgraph Prediction

تقدم هذه الورقة البحثية GraSP، وهي طريقة موحدة وقابلة للنقل للتعرف البصري على الرسوم البيانية تتنبأ بالرسوم البيانية الفرعية للتغلب على قيود الحلول الحالية المخصصة لمهام معينة عبر أنواع وسياقات متنوعة من الرسوم البيانية.

André Eberhard, Gerhard Neumann, Pascal Friederich2026-03-04