🤖 AI

Partition the Support, Reconstruct the Residual: Training-Free Sparse Attention for Video Generation and World Models

تُعد SparsePR طريقة انتباه متناثرة لا تتطلب تدريباً لإنتاج الفيديو ونماذج العالم، وهي تجمع بين التقسيم المقترن بالاستجابة وإعادة البناء المتبقي الملائم للمسبار لتسريع الاستدلال بشكل كبير مع الحفاظ على جودة التوليد من خلال تقليل خطأ إعادة بناء الانتباه.

Pardis Taghavi, Reza Langari, Gaurav Pandey2026-08-20
💻 computer science

DyG2^2T: Modeling Object Dynamics with 3D Gaussian Temporal-Spatial Particle Graph Transformer

تقترح الورقة البحثية إطار عمل DyG2^2T، وهو إطار عمل مبتكر يعزز التنبؤ بمسار حركة الأجسام من خلال إثراء النقاط الرئيسية (Key Points) مكانيًا بتفاصيل الجسيمات الخام، وفك الارتباط الزمني لتباينات الإطارات لالتقاط التطور المميز، والاستفادة من محول رسوم بيانية للجسيمات (Particle Graph Transformer) لنمذجة التفاعل متعدد المقاييس بمتانة.

Yansong Wang, Zhaobo Qi, Xinyan Liu, Beichen Zhang, Shuhui Wang, Weigang Zhang, Qingming Huang2026-08-20
💻 computer science

Cross-Modal MRI Ovary Segmentation in Endometriosis Using Unpaired TVUS Prototype Priors

تقترح هذه الورقة إطار عمل ثنائي المسار يستفيد من الأولويات النموذجية المستمدة من التصوير بالموجات فوق الصوتية عبر الرحم (TVUS) لمحاذاة الميزات عبر الأنماط المختلفة، مما يحسن بشكل كبير المهمة الصعبة المتمثلة في تقسيم المبيض عبر الوسائط في رنين التصوير المغناطيسي لبطانة الرحم مقارنة بالأسالاًف الحالية.

Xingjian Kang, Lina Felsner, Dominik Perrin, Daiqi Liu, Jasmin Arjomandi, Franziska Mathis-Ullrich, Alexandra Stoll, Kat (…)2026-08-20
🤖 AI

OptiModNet: A UNet-Transformer Hybrid with Grouped-Query and Channel Attention for Optic Disc and Cup Segmentation

تقدم الورقة البحثية OptiModNet، وهي بنية هجينة خفيفة الوزن تجمع بين UNet وTransformer وتتضمن آليات استعلام مجمعة وانتباه القنوات إلى جانب فقد هرمي مجمع، والتي تحقق أداءً هو الأفضل في فئته في تقسيم قرص العصب البصري والقعرة على مجموعة بيانات REFUGE2 مع الحفاظ على كفاءة حوسبية عالية.

Soumili Ghosh, Debapriya Roy, Aryan Das, Bikash Santra2026-08-20
💻 computer science

StateTrace: An Object-Centric Framework for Hidden-State Spatiotemporal Reasoning in Long Videos

تقدم الورقة البحثية StateTrace، وهو إطار عمل متمحور حول الكائنات يزود نماذج الفيديو اللغوية الكبيرة (VideoLLMs) بذاكرة مكانية زمانية مهيكلة للاستدلال صراحةً حول حالات الكائنات الخفية خلال الفترات غير المرئية في الفيديوهات الطويلة، مما يحسن الأداء بشكل كبير في اختبار HSR-Bench المقترح حديثاً وفي الاختبارات المرجعية الحالية.

Yu Han, Wenhao Li, Yichao Cao, Hongyan Xu, Shuo Yang, Shan You, Xiu Su2026-08-20
💻 computer science

SemanticSlider3D: Training-Free Continuous Semantic Editing for 3D Objects

تُعد SemanticSlider3D تقنية خالية من التدريب تتيح التحرير الدلالي المستمر ودقيق التفاصيل للأجسام ثلاثية الأبعاد عبر بناء اتجاهات خاصة بالسمات في الفضاء الكامن لنموذج توليد ثلاثي الأبعاد، مما يتغلب على تحديات مثل السلامة الهندسية والتماسك عبر الرؤى لتتفوق على النماذج المرجعية الحالية القائمة على البعد الثنائي.

Ru Wang, Rahul Jain, Koichiro Niinuma, Aakar Gupta2026-08-20
💻 computer science

SPARC: Subspace Position-Aware Robust Few-Shot Calibration for Distribution-Shifted Industrial Anomaly Detection

تُعد SPARC طريقة معايرة قليلة العينات وخالية من التدرج، تعمل على تعزيز متانة كواشف الشذوذ الصناعية ضد انزياحات التوزيع عبر تطبيق إسقاطات تحت فضاءات لكل خلية لإزالة الميزات المزعجة من تضمينات الرقع باستخدام عدد قليل فقط من الصور الطبيعية.

Seokhee Han, Seungjun Chu, Mateusz Nowak, Peter Chin2026-08-20
🤖 AI

OmniHandwritingOCR: A Diagnostic Benchmark for Evaluating Multimodal LLMs in Handwritten OCR Scenarios

تقدم الورقة البحثية OmniHandwritingOCR، وهو معيار تشخيصي شامل يتكون من 77.57 ألف صورة مصنفة عبر سيناريوهات متنوعة للكتابة اليدوية، لتقييم وكشف القصور الكبير لنماذج اللغات الكبيرة متعددة الوسائط الحالية في النسخ الدقيق للنصوص المكتوبة بخط اليد والتعبيرات الرياضية المعقدة ومتعددة اللغات وعرضة للخطأ.

Zinuo Guo, Min Zhang, Bo Jiang2026-08-20
💻 computer science

FD-CanKD: Frequency-Decoupled Cross-Attention Distillation as a Refinement Prior for Compact Object Detectors

تقدم هذه الورقة البحثية FD-CanKD، وهو إطار عمل لتقطير المعرفة عبر الانتباه المتقاطع وفصل الترددات، يعمل على تعزيز كواشف الكائنات المدمجة من خلال نقل معرفة النموذج المعلم عبر تنبؤات مستوى الرأس، وعلاقات السياق غير الموضعية، والمحاذاة المدركة للتردد، محققاً أداءً هو الأفضل في فئته على مجموعة بيانات COCO مع الحفاظ على البنية الأصلية وعدد المعلمات لنموذج الطالب.

YoungJae Cheong, Jhonghyun An2026-08-20