💻 computer science

CARI4D: Category Agnostic 4D Reconstruction of Human-Object Interaction

يقدم CARI4D أول إطار عمل غير مرتبط بفئة معينة يعيد بناء تفاعلات الإنسان والشيء رباعية الأبعاد، المتسقة مكانياً وزمانياً وبالمقياس المتري، من فيديوهات RGB أحادية العدسة عبر الاستفيد من النماذج التأسيسية ونموذج "الرندرة والمقارنة" القابل للتعلم للتغلب على غموض العمق والانسداد، محققاً أداءً هو الأفضل في مجاله على كل من مجموعات البيانات الموزعة داخلياً وغير المرئية.

Xianghui Xie, Bowen Wen, Yan Chang, Hesam Rabeti, Jiefeng Li, Ye Yuan, Gerard Pons-Moll, Stan Birchfield2026-04-21
💻 computer science

TimeColor: Flexible Reference Colorization via Temporal Concatenation

يعد TimeColor نموذجاً مرناً لتلوين الفيديو القائم على الرسم، يعمل على تعزيز دقة الألوان، واتساق الهوية، والاستقرار الزمني من خلال ترميز مراجع غير متجانسة ومتغيرة العدد كإطارات كامنة متصلة زمنياً مع تعيين مناطق صريح وانتباه مقنع بالارتباط المكاني والزماني.

Bryan Constantine Sadihin, Yihao Meng, Michael Hua Wang, Matteo Jiahao Chen, Hang Su2026-04-21
💬 NLP

Enabling Stroke-Level Structural Analysis of Hieroglyphic Scripts without Language-Specific Priors

تقدم هذه الورقة HieroSA، وهو إطار عمل قابل للتعميم يُمكّن النماذج اللغوية الكبيرة متعددة الوسائط من استخراج تمثيلات هيكلية قابلة للتفسير على مستوى الضربات (stroke-level) تلقائياً من صور الرموز الهيروغليفية واللوغاريثمية دون الاعتماد على مسبقات لغوية محددة أو بيانات مصممة يدوياً.

Fuwen Luo, Zihao Wan, Ziyue Wang, Yaluo Liu, Pau Tong Lin Xu, Xuanjia Qiao, Xiaolong Wang, Peng Li, Yang Liu2026-04-21
💬 NLP

Measuring Social Bias in Vision-Language Models with Face-Only Counterfactuals from Real Photos

تقدم هذه الورقة نموذج تقييم مضاد للواقع يعتمد على الوجه فقط، ومجموعة بيانات FOCUS المقابلة، ومعيار REFLECT، وذلك لقياس التحيز الاجتماعي في نماذج الرؤية واللغة بدقة من خلال عزل التأثيرات الديموغرافية عن المربكات البصرية في الصور الواقعية.

Haodong Chen, Qiang Huang, Jiaqi Zhao, Qiuping Jiang, Xiaojun Chang, Jun Yu2026-04-21
🤖 AI

VideoThinker: Building Agentic VideoLLMs with LLM-Guided Tool Reasoning

يعالج VideoThinker تحدي فهم مقاطع الفيديو طويلة المدى من خلال تدريب نموذج لغوي مرئي (VideoLLM) وكيل على مجموعة بيانات اصطناعية واسعة النطاق، حيث يقوم نموذج لغوي قوي بتوليد مسارات استدلال متعددة الخطوات باستخدام الأدوات في فضاء الوصف النصي والتي يتم ربطها لاحقاً بالإطارات المرئية، مما يتيح استكشافاً زمنياً تكيفياً وأداءً فائقاً دون الحاجة إلى فهم مسبق لمقاطع الفيديو طويلة المدى.

Chenglin Li, Qianglong Chen, Feng Han, Yikun Wang, Xingxi Yin, Yan Gong, Ruilin Li, Yin Zhang, Jiaqi Wang2026-04-21
💬 NLP

GeoRC: A Benchmark for Geolocation Reasoning Chains

تقدم هذه الورقة البحثية GeoRC، وهو أول معيار لتقييم سلاسل الاستدلال الجغرافي المستمدة من الخبراء، والذي يكشف أنه في حين تضاهي نماذج الرؤية واللغة المتطورة دقة البشر في التنبؤ بالمواقع، إلا أنها تتخلف عن البشر بشكل كبير في توليد تفسيرات قابلة للتدقيق وقائمة على الأدلة بسبب القيود في استخراج السمات البصرية دقيقة التفاصيل.

Mohit Talreja, Joshua Diao, Jim Thannikary James, Radu Casapu, Tejas Santanam, Ethan Mendes, Alan Ritter, Wei Xu, James (…)2026-04-21
💻 computer science

Sub-metre Lunar DEM Generation and Validation from Chandrayaan-2 OHRC Multi-View Imagery Using an Open-Source Pipeline

تقدم هذه الورقة الجيل الأول من نماذج الارتفاع الرقمية القمرية ذات الدقة دون المتر من صور الرؤية المتعددة لمرآة التصوير عالي الدقة (OHRC) التابعة لمهمة تشاندرايان-2 باستخدام مسار معالجة مفتوح المصدر حصرياً، محققةً جذر متوسط مربع خطأ (RMSE) رأسي قدره 5.85 متر ودقة أفقية ضمن نطاق بكسل واحد من خلال تحليل هندسي صارم وتحقق مقابل بيانات مستطلع القمر (LRO).

Aaranay Aadi, Jai Singla, Nitant Dube, Oleg Alexandrov2026-04-21
💻 computer science

Deep Learning for Virtual Reality User Identification: A Benchmark

تقدم هذه الورقة أول تقييم مرجعي شامل لمختلف بنيات التعلم العميق، بما في ذلك نماذج فضاء الحالة الناشئة، لتحديد هوية المستخدم باستخدام بيانات تتبع الحركة من مجموعة بيانات "Who is Alyx VR" واسعة النطاق، بهدف وضع مقاييس أداء أساسية للمصادقة الآمنة والمحافظة على الخصوصية في بيئات التصنيع.

Davide Frizzo, Fabrizio Genilotti, David Petrovic, Arianna Stropeni, Francesco Borsatti, Davide Dalle Pezze, Riccardo De (…)2026-04-21
🤖 AI

CSF: Black-box Fingerprinting via Compositional Semantics for Text-to-Image Models

تقدم هذه الورقة "البصمة الدلالية التركيبية" (CSF)، وهي طريقة "الصندوق الأسود" المبتكرة التي تعزو نماذج تحويل النص إلى صورة المضبوطة بدقة إلى أصولها المحمية من خلال اختبارها بطلبات تركيبية نادرة، مما يتيح إنفاذ حقوق الملكية الفكرية في عمليات النشر عبر واجهات برمجة التطبيقات التجارية دون الحاجة إلى الوصول إلى النموذج داخلياً أو وضع علامات مائية قبل النشر.

Junhoo Lee, Mijin Koo, Nojun Kwak2026-04-21
💬 NLP

Brain-CLIPLM: Decoding Compressed Semantic Representations in EEG for Language Reconstruction

يقترح نموذج Brain-CLIPLM فرضية ضغط دلالي لفك تشفير إشارات الدماغ (EEG)، حيث يثبت أن إطار عمل ثنائي المراحل يستخرج الركائز الدلالية عبر التعلم التبايني ويعيد بناء الجمل باستخدام نموذج لغوي كبير قائم على الاسترجاع، يتفوق بشكل كبير على فك التشفير المباشر من خلال مواءمة تعقيد إعادة البناء مع السعة المعلوماتية الجوهرية لإشارات الدماغ غير الغازية.

Xiaoli Yang, Huiyuan Tian, Yurui Li, Jianyu Zhang, Shijian Li, Gang Pan2026-04-21