🤖 machine learning

Person Identification from Egocentric Human-Object Interactions using 3D Hand Pose

تقدم هذه الورقة إطار عمل I2S، وهو إطار عمل خفيف الوزن ويعمل في الوقت الفعلي، يحقق مستوى رائدًا في تحديد هوية المستخدم (بدرجة F1 تبلغ 97.52%) في الأنظمة الأمنية القائمة على الواقع المعزز من خلال تحليل وضعيات اليد ثلاثية الأبعاد والتفاعلات بين الإنسان والأشياء عبر عملية استخراج ميزات متعددة المراحل ومبتكرة.

Muhammad Hamza, Danish Hamid, Muhammad Tahir Akram2026-03-03
💻 computer science

QuadGPT: Native Quadrilateral Mesh Generation with Autoregressive Models

تقدم هذه الورقة البحثية QuadGPT، وهو أول إطار عمل تلقائي التكرار (autoregressive) متكامل من البداية إلى النهاية يولد شبكات رباعية الأضلاع أصلية ذات جودة هندسية وطوبولوجية فائقة عبر توظيف طريقة ترميز موحدة للطوبولوجيا المختلطة واستراتيجية ضبط دقيق متخصصة بالتعلم التعزيزي.

Jian Liu, Chunshi Wang, Song Guo, Haohan Weng, Zhen Zhou, Zhiqi Li, Jiaao Yu, Yiling Zhu, Jing Xu, Biwen Lei, Zhuo Chen (…)2026-03-03
💻 computer science

Customizing Visual Emotion Evaluation for MLLMs: An Open-vocabulary, Multifaceted, and Scalable Approach

تتناول هذه الورقة أوجه القصور في أساليب تقييم العواطف البصرية الحالية للنماذج اللغوية الكبيرة متعددة الوسائط (MLLMs) من خلال اقتراح إطار عمل مفتوح المفردات وتلقائي للحكم على العبارات العاطفية، والذي يكشف عن نقاط قوة النماذج الحالية في التفسير القائم على السياق، ولكنه يسلط الضوء على فجوات كبيرة في فهم الإدراك الذاتي مقارنة بالبشر.

Daiqing Wu, Dongbao Yang, Sicheng Zhao, Can Ma, Yu Zhou2026-03-03
⚡ electrical engineering

COMPASS: Robust Feature Conformal Prediction for Medical Segmentation Metrics

تقدم الورقة البحثية COMPASS، وهو إطار عمل قوي يولد فترات تنبؤ توافقية فعالة وصالحة لمقاييس التجزئة الطبية من خلال المعايرة مباشرة في فضاء الميزات الخاص بالنموذج بدلاً من معاملة مسار التجزئة إلى المقياس كصندوق أسود.

Matt Y. Cheung, Ashok Veeraraghavan, Guha Balakrishnan2026-03-03
💻 computer science

CircuitSense: A Hierarchical MLLM Benchmark Bridging Visual Comprehension and Symbolic Reasoning in Engineering Design Process

تقدم الورقة البحثية "CircuitSense"، وهو معيار هرمي يضم أكثر من 8,000 مسألة في الدوائر الكهربائية، والذي يقيم النماذج اللغوية الكبيرة متعددة الوسائط عبر مهام الإدراك والتحليل والتصميم، كاشفاً عن فجوة أداء حرجة حيث تتفوق النماذج في التعرف البصري لكنها تعاني بشكل كبير في استنباط المعادلات الرمزية وإجراء الاستدلال الرياضي الضروري للتصميم الهندسي.

Arman Akbari, Jian Gao, Yifei Zou, Mei Yang, Jinru Duan, Dmitrii Torbunov, Yanzhi Wang, Yihui Ren, Xuan Zhang2026-03-03
💬 NLP

EditReward: A Human-Aligned Reward Model for Instruction-Guided Image Editing

تقدم الورقة البحثية EditReward، وهو نموذج مكافأة متوافق مع التفضيلات البشرية تم تدريبه على مجموعة بيانات تفضيلات بشرية جديدة واسعة النطاق يحقق أداءً هو الأفضل في فئته في تقييم تحرير الصور الموجه بالتعليمات ويقوم بفلترة البيانات عالية الجودة بفعالية لتحسين تدريب نماذج التحرير مفتوحة المصدر بشكل كبير.

Keming Wu, Sicong Jiang, Max Ku, Ping Nie, Minghao Liu, Wenhu Chen2026-03-03
💻 computer science

Stylos: Multi-View 3D Stylization with Single-Forward Gaussian Splatting

يُعد Stylos إطار عمل ثلاثي الأبعاد يعتمد على التوزيعات الغاوسية (Gaussian) في تمريرة أمامية واحدة، ويحقق نقلًا للنمط ثلاثي الأبعاد مدركًا للهندسة ومتسقًا بين الرؤى على محتوى غير محدد الوضعية عبر الاستفادة من بنية "ترانسفورمر" (Transformer) ذات مسارات انتباه مزدوجة وفقدان نمط ثلاثي الأبعاد قائم على الفوكسل (voxel)، مما يتيح أسلوبًا عالي الجودة من التنميط الصفري دون الحاجة إلى تحسين لكل مشهد أو وضعيات محتسبة مسبقًا.

Hanzhou Liu, Jia Huang, Mi Lu, Srikanth Saripalli, Peng Jiang2026-03-03
🤖 AI

Culture In a Frame: C3^3B as a Comic-Based Benchmark for Multimodal Culturally Awareness

تقدم هذه الورقة البحثية C3^3B، وهو معيار مرجعي جديد متعدد اللغات والثقافات يعتمد على القصص المصورة لتقييم النماذج اللغوية الكبيرة متعددة الوسائط عبر ثلاث مهام متدرجة الصعوبة، مما يكشف عن فجوات كبيرة في الأداء بين النماذج الحالية والقدرات البشرية في الوعي الثقافي.

Yuchen Song, Andong Chen, Wenxin Zhu, Kehai Chen, Xuefeng Bai, Muyun Yang, Tiejun Zhao2026-03-03
📊 statistics

LVTINO: LAtent Video consisTency INverse sOlver for High Definition Video Restoration

تقدم هذه الورقة البحثية LVTINO، وهو حل عكسي جديد بنمط "zero-shot" يستفيد من نماذج اتساق الفيديو (Video Consistency Models) لتحقيق ترميم فيديو عالي الدقة مع اتساق زمني وكفاءة حوسبية متفوقين مقارنة بالطرق الحالية القائمة على الصور لكل إطار على حدة.

Alessio Spagnoletti, Andrés Almansa, Marcelo Pereyra2026-03-03
💬 NLP

TTOM: Test-Time Optimization and Memorization for Compositional Video Generation

يُعد TTOM إطار عمل خالٍ من التدريب يعمل على تعزيز توليد الفيديو التركيبي من خلال تحسين معلمات جديدة مسترشدة بأهداف انتباه التخطيط وتوظيف آلية ذاكرة معلمية للاستدلال المتدفق، مما يحقق محاذاة فائقة بين النص والصورة وتعميماً أفضل دون تدخل مباشر في الفضاء الكامن.

Leigang Qu, Ziyang Wang, Na Zheng, Wenjie Wang, Liqiang Nie, Tat-Seng Chua2026-03-03