💻 computer science

Semi-Supervised Adaptation of Vision-Language Models for Image Classification

تقدم هذه الورقة SE-CLIP، وهو إطار عمل شبه مُشرف يعزز نماذج الرؤية واللغة لتصنيف صور الاستشعار عن بُعد من خلال توظيف مسار ثنائي المراحل مع تنقيب تكراري متوازن للفئات للتغلب على ندرة التوسيم والتفوق على الأساليب الحالية في معايير UCM وNWPU.

Mohamed L. Mekhalfi, Mohamad M. Al Rahhal, Yakoub Bazi, Salah E. Khenfer, Mingdeng Shi, Hua Zou, Mansour Zuair2026-08-27
💻 computer science

SMART: MLLM-guided Temporal Alignment for Unifying Sign Language Recognition and Spotting

تقترح الورقة البحثية إطار عمل SMART، وهو إطار موحد يستفيد من أوصاف الحركة المولدة بواسطة نماذج اللغات الكبيرة متعددة الوسائط (MLLM) ومهايئ زمني متعدد المقاييس لتعزيز التعرف المستمر على لغة الإشارة وتحديد مواضعها من خلال محاذاة فعالة بين الفيديو والنص في دفعات صغيرة وتحديد المواقع الزمنية المشتركة.

Eunjee Choi, JungHoon Sung, Seongwhan Cho, Chu Xin, Younggeun Choi2026-08-27
💻 computer science

Pose-Anchored Optical Flow for Low-Latency Human Action Anticipation in Human-Robot Teaming

تقدم هذه الورقة البحثية PoseOFF، وهو تمثيل للتدفق البصري المرتكز على الوضعية يلتقط ديناميكيات الحركة الموضعية حول مفاصل الإنسان لتمكين التنبؤ بدقة وبزمن انتقال منخفض بالأفعال البشرية في فرق العمل بين الإنسان والروبوت دون التكلفة الحسابية لمعالجة الإطار الكامل.

Lewis de Zoete Grundy, Chris McCarthy, Christopher Fluke2026-08-27
💻 computer science

Video-IFBench: Evaluating Instruction Following of Multimodal LLMs in Video Understanding Scenarios

تقدم هذه الورقة البحثية Video-IFBench، وهو معيار مرجعي شامل يضم 1.5 ألف عينة وتصنيفاً متنوعاً للتعليمات لتقييم القدرة غير المستكشفة كفايةً لنماذج اللغات الكبيرة متعددة الوسائط في اتباع القيود المعقدة والمحددة من قبل المستخدم في سيناريوهات فهم الفيديو، مما يكشف أن النماذج الحالية تعاني بشكل كبير مع التعليمات متعددة القيود والشرطية.

Hongbo Liu, Peixian Chen, Sihan Liu, Peiyuan Zhang, Kai Zou, Dian Zheng, Xiaoxing Hu, Yuhao Dong, Mengdan Zhang, Yunhang (…)2026-08-27
💻 computer science

CrossMambaTuning: Synergistic Spatial and Cross-Layer Adaptation for Machine Vision Compression

يُعد CrossMambaTuning إطار عمل جديد للضبط الدقيق الكفء للمعلمات، يدمج نماذج فضاء الحالة مع مُهايئ عبر الطبقات ثابت المقياس لالتقاط الاعتمادات المحلية والعالمية بشكل تآزري، محققاً أداءً رائدًا في ضغط الرؤية الآلية مع تقليل عبء المعلمات بنسبة 72% مقارنة بالطرق الحالية.

Haobo Xiong, Shaobo Liu, Kai Liu, Chongyang Ding2026-08-27
💻 computer science

V-Rubrics: Visual Faithfulness via Rubric-Based Reinforcement Learning

تقدم هذه الورقة البحثية V-Rubrics، وهو إطار عمل للتعلم المعزز يعمل على تعزيز الدقة البصرية لنماذج الرؤية واللغة من خلال تفكيك الاستجابات إلى قضايا ذرية لتقديم تقييم مهيكل بنظام الدرجات الجزئية عبر مجالات التأسيس البصري، والاستدلال، واتباع التعليمات، مما يتغلب بذلك على قيود مكافآت النتيجة القياسية.

Shulin Tian, Minglun Li, Yuhao Dong, Hao Ding, Jiarui Yao, Haiwen Diao, Jingkang Yang, Hongyuan Zhu, Ziwei Liu2026-08-27
💻 computer science

A Dual-Transformer for Multi-Camera View Recommendation

تقترح هذه الورقة بنية "ترانسفورمر مزدوج" (Dual-Transformer) مبتكرة مع آلية "الانتباه المتقاطع" (Cross-Attention) تتفوق بشكل كبير على النماذج الرائدة في مجال التوصية بمشاهد الكاميرات المتعددة من خلال فصل ترميز التاريخ الزمني عن تقييم المشاهد المرشحة، محققةً معياراً جديداً بنسبة 56.60% في دقة (Precision@0.5)، ومظهرةً إمكانات قوية للتخصيص عالي الكفاءة في استهلاك البيانات لأنماط التحرير.

Josep Cabacas-Maso, Carles Ventura, Ismael Benito-Altamirano2026-08-27
💻 computer science

When Should a Network Emit Geometry, and When Should It Detect It? Readout, Reconciliation, and Representation in Floorplan Vectorization

تقارن هذه الورقة بين انبعاث التسلسل ذاتي الانحدار مقابل مخرجات الكشف عبر الخرائط الحرارية لمتجهات المخططات الأرضية، حيث وجدت أن الكشف يتفوق عمومًا على الانبعاث في عمليات المسح الواقعية بينما يتفوق فك التشفير التسلسلي في الرسوم المتجهة النظيفة، مما يثبت في النهاية أن الدمج الحتمي لكلا النهجين يحقق أعلى دقة وأن تمثيل المخرجات يقل أهمية عما كان يُفترض سابقًا عند تطبيق وصفات تدريب المصالحة والمطابقة.

He Zhang2026-08-27
💻 computer science

On the Separation of Human and AI-Generated Images in CLIP Embedding Space

تتقصى هذه الورقة البحثية الانفصال التلقائي غير المفسر بين اللوحات البشرية وتلك المولدة بواسطة الذكاء الاصطناعي ضمن فضاء تضمين CLIP، كاشفةً من خلال تقنيات التفسير والانعكاس أن هذا التمايز يعتمد على بنيات صورية متعددة المقاييس دقيقة وغير محسوسة بدلاً من السمات البصرية الواضحة، مما يسلط الض الضوء على تباعد جوهري بين الإدراك البصري الاصطنا_ي والبشري.

Andrea Asperti2026-08-27
💬 NLP

Plans You Can Check: Verifier-Grounded Learning of an Open-Weight Planner for Executable Video-Editing

تقدم هذه الورقة RefineCut، وهو مخطط مفتوح الأوزان لتحرير الفيديو القابل للتنفيذ يستفيد من مُحقِّق حتمي لاستخلاص إصلاحات متعددة المعلمين وتحسين التفضيلات، مما يمكّن نموذجاً بحجم 8 مليار بارامتر من التفوق على المعلمين الرائدين في معيار مرجعي جديد دون الحاجة إلى استدعاء المعلمين أثناء الاستدلال.

Haoyu Wang, Cheng Feng, Liuyang Bian, Ruiyang Huang, Lei Wei, Yafei Wen, Xiaoxin Chen, Xiaoying Tang2026-08-27