💻 computer science

Towards Adaptive Super-Resolution and Quality Assessment via Test-Time Adaptation

يقترح هذا البحث الدكتوراه إطار عمل موحداً للتكيف في وقت الاختبار يعزز دقة وضوح الفيديو وتقييم جودته في ظل تدهور حقيقي وغير معروف، وذلك عبر دمج التوجيه الإدراكي غير المرجعي، والبنيات القائمة على المحولات، واستراتيجيات الصقل القائمة على المناطق دون الحاجة إلى حقيقة أرضية عالية الدقة.

Ajeet Kumar Verma2026-08-11
💻 computer science

Rethinking Attention Locality in Spiking Transformers

تقدم هذه الورقة البحثية آلية الانتباه المحلي المتصل مكانيًا مع مسار استمرارية الحدود (SCLA-BCP)، وهي طريقة مبتكرة تعالج نقص الموضعية المكانية في المحولات النبضية (Spiking Transformers) من خلال الجمع بين الانتباه المحلي غير المتداخل ومسار خفيف الوزن عبر الحدود واستراتيجية نشر هرمية، مما يحقق مكاسب كبيرة في الأداء عبر مختلف المهام البصرية بأقل قدر من التكاليف الإضافية.

Zeqi Zheng, Zizheng Zhu, Yuping Yan, Wenxuan Pan, Zhaofei Yu, Yaochu Jin2026-08-11
🤖 machine learning

MotionCraft: Latent World Modeling with Sparse Attention for Visual Upscaling

يُعد MotionCraft إطار عمل للتحسين الفائق للفيديو القابل للتحكم، والذي يستفيد من التنبؤ بالحالة الكامنة المدركة للحركة والانتباه المتناثر التكيفي لتحقيق عمليات إعادة بناء عالية الدقة ومتسقة زمنياً مع موازنة التفاصيل المحلية، والارتباطات طويلة المدى، والكفاءة الحسابية.

Rong Fu, Chunlei Meng, Yangchen Zeng, Xiaowen Ma, Yongtai Liu, Wangyu Wu, Shuo Yin, Zijian Zhang, Sicheng Li, Yingrui Ji (…)2026-08-11
💬 NLP

OpenVisTool: An Open Recipe for Synthesizing Instructive Visual Tool-Use Trajectories

تقدم الورقة البحثية OpenVisTool، وهو إطار عمل يعمل على تخليق مسارات استخدام أدوات إرشادية من خلال التصفية بناءً على كل من صحة الإجابة والمساهمة السببية لملاحظات الأدوات، مما ينتج عنه مجموعة بيانات ومعيار مرجعي يحسنان بشكل كبير أداء الوكلاء متعددي الوسائط عبر تعليم النماذج ربط استخدام الأدوات بالأدلة بدلاً من مجرد محاكاة أنماط الاستدعاء.

Changhao Xiang, Shilin Zhang, Zheng Ma, Kanzhi Cheng, Ruize Ma, Yi Feng, Jianbing Zhang, Zhi Wang, Zhen Wu, Xinyu Dai, L (…)2026-08-11
💻 computer science

RobustDefect-LLM: Explainable and Robustness-Aware Industrial Surface Defect Classification with Decision Support and AI-Assisted Reporting

تقدم هذه الورقة RobustDefect-LLM، وهو إطار عمل متكامل لفحص عيوب الأسطح الصناعية يجمع بين التصنيف عالي الدقة باستخدام MobileNetV3-Large مع توجيه المراجعة البشرية القائم على الثقة وإعداد التقارير بمساعدة الذكاء الاصطناعي لتقديم سير عمل لمراقبة الجودة يتسم بالمتانة والقابلية للتفسير والتتبع، مع الإقرار صراحةً بحساسية أدائه تجاه التدهور الشديد في الصور.

Nazlıcan Düşünmez, Halûk Gümüşkaya2026-08-11
🤖 machine learning

Population-Scalable Multi-Agent World Modeling

تقدم الورقة البحثية "خورا" (Khora)، وهو نموذج عالم متعدد الوكلاء وقابل للتوسع يتغلب على قيود التدريب ذي العدد الثابت من السكان عبر فصل تطور حالة العالم عن التصيير البصري، مما يتيح التوسع في وقت الاستدلال إلى أعداد تعسفية من الوكلاء مع الحفاظ على الاتساق عبر الرؤى والجودة البصرية.

Renjie Zhao, Yuxiang Wu, Mingyu Zhang, Jiaxin Li, Sisi Li, Yimin Sheng, Tianxi Tan, Zhenkai Zhang, Jianyi Zhu, Yong-Lu L (…)2026-08-11
💻 computer science

VADER: Adaptive Debiasing for Hallucination Mitigation in Video Large Language Models

تقترح الورقة البحثية إطار عمل VADER، وهو إطار عمل لا يتطلب تدريباً يعمل على الحد من الهلوسة في نماذج اللغة الكبيرة للفيديو من خلال إعادة تخصيص الانتباه ديناميكياً للأدلة المرئية ومسح الرموز البصرية بشكل انتقائي لبناء فرع فك تشفير تبايني قوي.

Dong Xing, Jiaxin Chen, Hang Yang, Peixun Liu, Qiushi Yang, Yuqing Wang2026-08-11
💻 computer science

VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling

يقدم VLZip إطار عمل موحداً يضغط تسلسلات بصرية ونصية متداخلة هرمياً إلى بادئات ناعمة مدمجة داخل نموذج Transformer نقي، مما يتيح استدلالاً عالي الدقة على سياقات فائقة الطول تصل إلى 2 مليون توكن مع تقليل استهلاك الذاكرة بشكل كبير والتفوق على الأساليب الحالية.

Yuqi Zhang, Cheng Chen, Yuyu Guo, Wenjie Yang, Lingchen Meng, Peng Di, Hang Yu, Zuxuan Wu, Yu-Gang Jiang2026-08-11
💻 computer science

JSGS: JPEG State-Guided Supervision for 3D Gaussian Splatting from Mixed-Quality Views

تقترح الورقة البحثية JSGS، وهي طريقة مبتكرة تستفيد من جداول تكميم JPEG لإنشاء مؤثرات ملاحظة خاصة بالمنظور وإشراف واعٍ بالتردد، مما يقلل بفعالية من عيوب الضغط ويحسن جودة إعادة البناء لتقنية 3D Gaussian Splatting المدربة على صور JPEG مختلطة الجودة.

Jinhua Cui, Anhong Wang, Kai Hu, Donghan Bu, Peihao Li, Tammam Tillo, Hao Jing, Shiao Xu2026-08-11
💻 computer science

A Dynamic-Semantics Framework for Grounding Human Referring Expressions in Visual Perceptual Data

تقدم هذه الورقة إطاراً للدلالات الديناميكية يعمل على إخراج التلازم المعجمي إلى مجموعات ربط صريحة ودمجها مع مسار محاذاة إدراكي لربط التعبيرات المرجعية البشرية بالبيانات المرئية بنجاح، محققةً دقة تبلغ 83.56% في أفضل 5 نتائج على مجموعة بيانات لعبة المرجع المتكرر من ستانفورد، مع تقديم نظام شفاف وقابل للتدقيق لتحليل تحليل المرجع.

Joseph Bingham2026-08-11