📊 statistics

Iterative Erasure Count Is Not an Affine-Invariant Concept Dimension

تُثبت هذه الورقة أن أعداد المحو التكرارية المستخدمة لتقدير أبعاد المفهوم ليست ثابتة تآلفياً، وبالتالي فهي تعتمد على إجراء القياس المحدد وهندسة التمثيل بدلاً من كونها تعكس خاصية دلالية جوهرية للتمثيل العصبي.

Tingan Jin, Shuhang Dong, Haosong Li, Chung-Hsien Chou2026-08-12
💻 computer science

A HamNoSys-Guided Dataset and Baselines for Fine-Grained Isolated Handshape Recognition in Sign Language

تقدم هذه الورقة مجموعة بيانات مرجعية واسعة النطاق موجهة بنظام HamNoSys، تتكون من 144,000 صورة RGB من 15 مشاركاً لـ 160 فئة من أشكال اليد، مما يؤسس لخطوط أساس تعتمد على المشارك وتترك مشاركاً واحداً خارج الاختبار باستخدام نماذج تعلم عميق متنوعة لتطوير التعرف الدقيق على أشكال اليد المنفردة وتكنولوجيا لغة الإشارة.

Ushnish Sarkar, Suvajit Patra, Bhaswar Chattopadhyay, Pranab Singha Roy, Tapas Samanta2026-08-12
💻 computer science

π\pi-SUB: A Physics-Informed Synthetic Underwater Benchmark Dataset for Underwater Image Enhancement

تقدم هذه الورقة π\pi-SUB، وهي مجموعة بيانات مرجعية اصطناعية مستوحاة من الفيزياء تعمل على جسر الفجوة بين البيئة الاصطناعية والواقعية لتحسين الصور تحت الماء من خلال دمج عوامل بيئية متقدمة، مما يظهر واقعية فائقة وقدرة على التعميم عبر نماذج متعددة من أحدث التقنيات مقارنة بمجموعات البيانات الحالية.

Namritha Lasyapriya Maddali, Rajini Makam, Suresh Sundaram, Narasimhan Sundararajan2026-08-12
🤖 machine learning

BooST: Bridging Semantics and Motions for Efficient Skill Transfer

يُعد BooST إطار عمل ثنائي المراحل يربط بين القصد الدلالي عالي المستوى وديناميكيات الحركة منخفضة المستوى عبر نموذج VQ-VAE متعدد الوسائط لإنشاء تمثيل مهارة موحد، مما يتيح التكيف الفعال بمثلة قليلة، والنقل عبر المجالات، والمتانة للنشر الروبوتي في العالم الحقيقي.

Jusuk Lee, Daesol Cho, Jonghun Shin, Seungyeon Yoo, Jonghae Park, Taekbeom Lee, H. Jin Kim2026-08-12
💻 computer science

Gaussian Sculpting: End-to-End Controllable Surface Reconstruction via Field Optimization

تقدم الورقة البحثية "النحت الغاوسي" (Gaussian Sculpting)، وهو إطار عمل كامل القابلية للتفاضل من البداية إلى النهاية يربط غاوسيات ثلاثية الأبعاد بمجال مسافة إشارية متطور، ويستخدم استراتيجية تدريب ثنائية المستوى لتحقيق إعادة بناء للأسطح عالية الجودة وقابلة للتحكم مع تحسين الدقة الهندسية وكفاءة الذاكرة، حتى في ظل محدودية زوايا الرؤية.

Ke Jiaxin, Juncheng Liu, Yi Wang, Zhouhui Lian, Bin Liu, Shengfa Wang, Xiangjia He2026-08-12
💬 NLP

InSight-doc: Agentic Visual Perception for Long-Document Understanding

يُعد InSight-doc إطار عمل إدراكي بصري وكيلّي يقوم بالتكبير التكيفي للمناطق عالية الدقة في المستندات الطويلة لتحسين الدقة بشكل كبير، وتقليل الهلوسة، وخفض زمن استجابة الاستدلال دون الاعتماد على مسترجعات خارجية.

Kaican Li, Weiyan Xie, Lewei Yao, Jiannan Wu, Lanqing Hong, Yongxiang Huang, Nevin L. Zhang2026-08-12
💬 NLP

DistilVDR: A Compact End-to-End Visual Document Retriever via Dual-Student Distillation

يُعد DistalVDR مسترجع وثائق مرئية مدمجاً وشاملاً بـ 524 مليون معلمة، يستخدم تقنية التقطير ثنائي الطالب من معلم مجمد بسعة 8 مليارات معلمة لتحقيق أداء استرجاع عالٍ وفهرسة أسرع وأصغر حجماً بشكل ملحوظ دون الحاجة إلى تسميات صلة أو تدريب تبايني.

Zhuchenyang Liu, Ziyi Wang, Yao Zhang, Yu Xiao2026-08-12
💻 computer science

PolypVision: A Three-Stage Hierarchical Deep Learning Framework for Classification and Segmentation of Colorectal Polyps

تقدم هذه الورقة PolypVision، وهو إطار عمل للتعلم العميق هرمي ثلاثي المراحل ومستقل عن الجهاز، يدمج بنيتي EfficientNetV2 وUNet++ لتحقيق أداء فائق في تصنيف وتجزئة وتحليل الأنواع الفرعية لسلائل القولون عبر مجموعات بيانات عامة متعددة.

Hamidreza Bolhasani, Hamidreza Rastad, Amir Mohammad Akbari, Mohammad Tashakoripour, Parnian Asadollahi, Ata Khodami, Mo (…)2026-08-12
💻 computer science

Chartography: A Benchmark for Professional Chart Understanding

تقدم الورقة البحثية Chartography، وهو معيار مرجعي جديد يضم 100 مهمة منسقة باحترافية في تنسيقات رسوم بيانية متخصصة في مجالات معينة، والذي يكشف عن قصور كبير في قدرة النماذج الرائدة الحالية على إجراء الاستدلال البصري المعقد والالتزام بالاتفاقيات الخاصة بكل مجال، حيث حققت أفضل التكوينات دقة تبلغ 45% فقط مقارنة بنسبة التشبع التي تتراوح بين 80-90% في المعايير المرجعية الحالية.

Suhaas Garre, Chris Mutty, Sushant Mehta, Edwin Chen2026-08-12
💻 computer science

Embedding Rotation Invariance for Provable Multi-Oriented Scene Text Recognition

تقترح هذه الورقة البحثية RISTER، وهي شبكة للتعرف على نصوص المشاهد ثابتة الدوران من طرف إلى طرف ومضمونة نظرياً، تقوم بدمج استخراج ميزات متكافئ في المشفر مع فك تشفير انتباه تقاطعي مثبت ثباته تجاه الدوران لتحقيق أداء رائد في التعرف على النصوص متعددة الاتجاهات دون الاعتماد على تقدير صريح للاتجاه أو تكاليف استدلال إضافية.

Zhibin Ma, Pengwen Dai, Yi Liu, Xugong Qin, Chenyun Yu, Xiaochun Cao2026-08-12