🤖 machine learning

APQF: Agentic Profiling-Guided Structured Pruning and Mixed-Precision Quantization with Adaptive Fine-Tuning

إن APQF هو إطار عمل مؤتمت وموجه بنماذج لغوية كبيرة، يدمج بين التقليم المهيكل القائم على التوصيف والكمية مختلطة الدقة مع الضبط الدقيق التكيفي لتقليل التكاليف الحسابية بشكل كبير مع الحفاظ على دقة عالية عبر مختلف النماذج الرؤية على الأجهزة ذات الموارد المحدودة.

Sadegh Jafari, Mohiuddin Bilwal, Fan Zhou, Brian Gelder, Ali Jannesari2026-08-07
💬 NLP

From Sports to Safety: Benchmarking Proactive Risk Inference in MLLMs

تقدم هذه الورقة SPRINT، وهو معيار شامل لمقاطع فيديو رياضية من العالم الحقيقي مصمم لتقييم قدرات الاستدلال الاستباقي للمخاطر لدى النماذج اللغوية الكبيرة متعددة الوسائط (MLLMs)، كاشفاً أنه في حين تتفوق النماذج الحالية في اكتشاف المخاطر، فإنها تعاني في تحديد أسبابها الكامنة وتصدر إنذارات كاذبة بشكل متكرر، مما يسلط الضوء على فجوة حرجة في السلامة الاستباقية الموثوقة للبيئات الفيزيائية الديناميكية.

Jiawei Qiu, Yichen Xu, Jianzhe Ma, Mingyang Yu, Wenbin Zhu, Yang Han, Pinzheng Lv, Wenxuan Wang2026-08-07
💻 computer science

ChronoVision: Temporal Reasoning via Latent State Reconstruction

تُعد ChronoVision إطار عمل متعدد الوسائط يعزز الاستدلال الزمني في النماذج اللغوية الكبيرة من خلال محاذاة المنطق البصري مع إعادة بناء الحالة الكامنة والتعلم المعزز، محققةً أداءً هو الأفضل حالياً في مجموعة بيانات Vbvr-VQA المستحدثة ومعيار IntPhys2 الصعب.

Yifan Shen, Jian Xu, Boyi Li, Yuner Zhang, Tianjiao Yu, Bingxuan Li, Houze Yang, Rushi Wang, Xu Cao2026-08-07
💻 computer science

Vorch-IR: Long-Form Unified Multimodal Identity Replacement Video Generation

يُعد Vorch-IR إطار عمل موحداً متعدد الوسائط مبنياً على LTX2 يتيح استبدال الهوية بمرونة لشخص واحد أو شخصين مع إمكانية تحرير الخلفية في مقاطع الفيديو طويلة المدى من خلال التكييف المشترك مع فيديوهات القيادة، والصور المرجعية، والتعليمات النصية، مع التغلب على ندرة البيانات عبر مسار توليد تلقائي وتوسيع النطاق ليشمل عمليات توليد تمتد لدقيقة كاملة عبر استراتيجية استدلال زمني متداخل.

Yaole Wang, Xiaoyu Chen, Xin Ma, Yang Ding, Gang Yue, Jingjing Chen, Lin Ma, Yaohui Wang2026-08-07
💻 computer science

Vorch-Streamer: Extending Human Audio-Visual Generation to Real-Time Long-Form Streaming

يُعد Vorch-Streamer إطار عمل لما بعد التدريب يتيح البث المباشر للنصوص إلى الصوت والفيديو طويل التنسيق، وذلك عبر الجمع بين مولد سببي تم تدريبه باستراتيجيات إجبار مختلطة، وتقطير DMD لتحقيق الاستقرار طويل الأمد، ونموذج لغوي خارجي لتخطيط الكلام، بهدف تحقيق توليد سريع ومتزامن ومتسق للأفاتار.

Menglin Han, Yang Ding, Yulei Lu, Haoran Yu, Xin Ma, Junyi Chen, Zhangkai Ni, Lin Ma, Yaohui Wang2026-08-07
🤖 AI

A Unified Framework for Trajectory Prediction with Explicit Planning and Reaction Decomposition

تقترح الورقة البحثية إطار عمل INTraJ، وهو إطار موحد للتنبؤ بالمسار يقوم بتفكيك التأثير الاجتماعي إلى مرحلة تخطيط لتوليد مسارات مرجعية ومرحلة استجابة للتعديلات المحلية، محققاً أداءً هو الأفضل في فئته عبر معايير متعددة من خلال إثبات الدور الحاسم للنمذجة الاجتماعية المرحلية.

Jiaheng Chen, Jiaxing Li, Tinghe Zhang, Chaopeng Guo2026-08-07
🤖 AI

DistMedVL: Distributional Vision-Language Alignment for Uncertainty-Aware Medical Image Segmentation

يُعد DistMedVL إطاراً خفيف الوزن واحتمالياً للرؤية واللغة، يعالج عدم اليقين في تقسيم الصور الطبية من خلال تقديم محول عبر-نماذج احتمالي مع وحدات محاذاة ماهالانوبيس وتدفق التوزيع لنمذجة عدم اليقين التمثيلي بشكل صريح، مما يحقق متانة وقدرة فائقة على التعميم عبر مجموعات البيانات السريرية المتنوعة مقارنة بالطرق الحتمية الحالية.

Jiaxuan Li, Qing Xu, Xiangjian He, Yue Li, Daokun Zhang, Fiseha B. Tesema, Rong Qu2026-08-07
💻 computer science

StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding

تقدم هذه الورقة StreamArena، وهو معيار شامل لفهم الفيديو التفاعلي على نطاق الساعة يكشف عن محدودية النماذج الحالية في الذاكرة طويلة المدى والإدراك في الوقت الفعلي، إلى جانب StreamMind، وهو بنية ذات مستويين توازن بفعالية بين التفاعل المستمر والذاكرة متعددة الوسائط المستمرة للتفوق على النماذج المرجعية الحالية.

Xichen Zhang, Guankai Li, Yinghao Zhu, Shijian Wang, Sitong Wu, Shaozuo Yu, Meng Chu, Yuan Lu, Jiaya Jia2026-08-07
💻 computer science

LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models

تقترح الورقة البحثية LAWM-3D، وهو إطار عمل مبتكر يتغلب على قيود نماذج الأفعال الكامنة القائمة على ثنائية الأبعاد من خلال تقديم ترميز متعدد الرؤى غير متغير، وقيود محاذاة هندسية، وإعادة بناء غير حقانية لبيانات (RGB-D) لتعلم أفعال كامنة مدركة ثلاثية الأبعاد من فيديوهات بشرية، مما يعزز بشكل كبير من قدرة التعميم والاتساق الفيزيائي لنماذج العالم الروبوتية.

Jiarui Yang, Jiale Zhange, Jiawei Li, Hang Guo, Wen Huang, Jinpeng Wang, Peidong Liu, Shu-Tao Xia2026-08-07
💻 computer science

Iterative Hybrid Discrete-Continuous Viewpoint Planning for UAV Photogrammetry

تقترح هذه الورقة طريقة هجينة تكرارية تجمع بين المتغيرات المنفصلة والمستمرة تعمل على تحسين مسارات طيران الطائرات بدون طيار بناءً على عمليات إعادة البناء التقريبية والاستدلالات الفوتوغرامترية لتوليد مجموعات نقاط رؤية مثالية تعمل على تحسين دقة واكتمال عمليات إعادة البناء ثلاثية الأبعاد بشكل كبير مقارنة بنهج التخطيط التقليدية.

Alan Grech, Daniel Pisani, Andre Grima, Carl James Debono, Saviour Formosa, Dylan Seychell2026-08-07