💻 computer science

Learning human joint torques from pixels

تقدم هذه الورقة البحثية VID، وهي مجموعة بيانات ومعيار مرجعي واسع النطاق يعتمد على الرؤية الحاسوبية لتقدير عزم دوران المفاصل البشرية مباشرة من صور RGB أحادية العدسة، إلى جانب نموذج VID-Network الذي يتفوق بشكل كبير على النماذج المرجعية الحالية من خلال الاستفادة من الميزات المكانية والزمانية لتمكين التحليل الميكانيكي الحيوي في سيناريوهات العالم الحقيقي.

Chen Chen, Rui Cheng2026-08-11
💻 computer science

SI-Edit: Toward Sketch-Instruction Guided Local Image Editing with Pixel-Level Precision

للتغلب على نقص المعايير المرجعية عالية الجودة لتحرير الصور القائم على الرسم بكسل بمستوى البكسل، تقدم هذه الورقة مجموعة بيانات SI-Data وإطار عمل SI-Edit، اللذين يستفيدان من النماذج اللغوية الكبيرة متعددة الوسائط لتخليق رباعيات مدفوعة بالتعليمات وتحقيق تشوهات محلية دقيقة ومتوافقة دلاليًا من خلال نهج تعلم مكاني-دلالي تعاوني.

Weixin Ye, Wei Wang, Hongguang Zhu, Xuecheng Nie2026-08-11
🤖 machine learning

Contrastive Mask Fidelity: Reference-Free Auditing of Ground-Truth Masks in Remote Sensing Semantic Segmentation

تقدم هذه الورقة مقياس "دقة القناع التبايني" (CMF)، وهو مقياس خالي من التدريب وخالٍ من المراجع، يقوم بمراجعة أقنعة الحقيقة الأرضية في التجزئة الدلالية للاستشعار عن بعد عبر تقييم توافقها مباشرة مع أدلة الصورة، مما يكشف عن تشوهات التوسيم المنهجية ويُمكّن من تحسين النقل عبر المجالات من خلال التحكيم القائم على البيانات.

Shuaishuai Cao, Shuwei Peng, Meng Tang, Min Huang, Youjin Wang, Jie Chen, Jing Ouyang, Zhiwei Zhai2026-08-11
💻 computer science

View-Adaptive Renderer for View-Consistent 2D-to-3D Generation

تقترح هذه الورقة إطار عمل للرندرة العصبية متكيف مع الرؤية يحقق إعادة بناء ثلاثية الأبعاد قوية ومتسقة من حيث الرؤية من صور مفردة عبر توظيف رندرات مستقلة لتصحيح الأخطاء ووحدة دمج تعتمد على الانتباه الذاتي، مما يقدم أداءً يقارب أحدث ما توصلت إليه التقنيات بكفاءة عالية ودون الاعتماد على الإشراف القائم على الانتشار.

U-Chae Jun, Jaeeun Ko, Jiwoo Kang2026-08-11
🤖 AI

Visual Distortion Detection in UGC Images Using Large Multimodal Models

تقترح الورقة البحثية إطار عمل VIGIL، وهو إطار عمل مبتكر يستفيد من النماذج اللغوية الكبيرة متعددة الوسائط مع كواشف ميزات متعددة المستويات ومجموعة بيانات منسقة بدقة تضم 140 ألف عينة لمعالجة أوجه القصور في النهج الحالية القائمة على النصوص وسد فجوة التعميم من الاصطناعي إلى الأصيل في اكتشاف التشوه البصري.

Ziheng Jia, Yingji Liang, Jiaying Qian, Xiongkuo Min2026-08-11
⚡ electrical engineering

Bright-Channel Retinex Enhancement with a Conditional Overdispered-Noise Analysis

تقدم هذه الورقة طريقة لتعزيز الإضاءة المنخفضة خالية من التدريب تجمع بين تقدير الإضاءة للقناة الساطعة المحلية مع قسمة ريتيكس وإزالة الضجيج مع الحفاظ على الحواف، مستخدمةً تحليل العد الكاذب لثنائي الحدين الشرطي لتوصيف الضجيج متباين التباين، مما يحقق أداءً رائدًا على مجموعة بيانات LOL-v1 مع سرعة معالجة عالية على وحدة المعالجة المركزية.

Jongpil Jeong2026-08-11
💻 computer science

RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection

يُعد RefineAny3D نموذجاً لغوياً بصرياً يعمل على تحسين الكشف عن الأجسام ثلاثية الأبعاد أحادية العدسة عبر إعادة صياغة تحسين العمق كمسألة محاذاة بصرية، وذلك باستخدام رموز إجراء لتصحيح أحجام الصناديق المحيطة بناءً على الأدلة البصرية بدلاً من التنبؤ بقيم عمق عددية.

Zhihao Zhang, Gengwei Zhang, Tianlong Chen, Xiaoming Liu2026-08-11
🤖 AI

Not All Visual Tokens Are Equally Safe to Remove:Consequence-Sensitive Visual Token Compression

تقدم هذه الورقة طريقة لضغط الرموز البصرية الحساسة للتبعات لنماذج الرؤية واللغة، والتي تخصص الموارد الحسابية ديناميكيًا بناءً على التكلفة المحتملة للأخطاء، مما يقلل بشكل كبير من الأخطاء عالية المخاطر ومعدلات الخطأ الإجمالية المرجحة بالتكلفة مقارنة باستراتيجيات التخصيص المعتمدة على المحتوى أو التخصيص الموحد التقليدية.

Jingbo Wen, Liang He, Mingyu Cao, Haoyu Wang, Minxuan Hu, Kangning Cui, Xilu Wang2026-08-11
💻 computer science

BAG: Budget-Aware Gating for Diffusion Caching

تقدم الورقة البحثية BAG (البوابات الواعية بالميزانية)، وهي سياسة تخزين مؤقت مبتكرة لنماذج محولات الانتشار (Diffusion Transformers) تستخدم شبكة بوابات خفيفة الوزن يتم تدريبها عبر تقطير المجدول لموازنة قيود الميزانية العالمية مع إعادة استخدام الميزات المتكيفة مع الحالة ديناميكيًا، مما يؤدي إلى التفوق على الأساليب الحالية في تسريع نماذج الانتشار مثل FLUX.1-dev و Wan2.1.

Tong Zhao, Mingkun Lei, Yucheng Han, Chi Zhang2026-08-11
🤖 machine learning

DreOPD: Degraded-Reference Extrapolative On-Policy Distillation for Flow-matching Models

تقترح الورقة البحثية DreOPD، وهي طريقة استخلاص (distillation) جديدة قائمة على السياسة (on-policy) لنماذج مطابقة التدفق (flow-matching models)، تقوم بتحويل استقراء المكافأة الضمنية إلى انحدار سرعة ذي صيغة مغلقة وتستفيد من مرجع متدهور لتحقيق تدريب لاحق مستقر وعالي الأداء يتفوق على كل من الاستخلاص القياسي القائم على السياسة وخطوط الأساس لتعلم التعزيز متعدد المهام.

Mingfeng Lin, Chengfei Cai, Lin Xu, Yuxiang Wei, Liang Han2026-08-11