🤖 AI

GRASP: Granularity-Aware Region Alignment and Semantic Prototype Learning for Fine-Grained Cross-Modal Understanding in Drone Views

تقترح الورقة البحثية إطار عمل GRASP، وهو إطار عمل مبتكر يعالج تحديات الفوضى في الخلفية والتماثل البصري في الفهم عبر الوسائط متعددة الأنماط دقيق التفاصيل من منظور الطائرات بدون طيار، وذلك من خلال المحاذاة المرتكزة على المناطق من أجل المطابقة المتمحورة حول الأشياء، والمطابقة المعززة بالاضطراب الدلالي من أجل التعلم الدلالي التمييزي، محققاً أداءً تنافسياً في الاختبارات المرجعية الجوية.

Jiahui Cui, Yan Zhao, Kan Wei, Enze Zhu, Peirong Zhang, Lei Wang, Yiru Wang2026-08-11
🤖 AI

UniDFKD: A Unified Semantic Prior Framework for Architecture-Agnostic Data-Free Knowledge Distillation

تقترح الورقة البحثية إطار عمل موحد يُدعى UniDFKD، والذي يستبدل الأولويات الإحصائية الخاصة بالبنية المعمارية بأولويات دلالية صريحة ومستقلة عن البنية عبر ثلاثة أبعاد للتغلب على قيود أساليب تقطير المعرفة الخالية من البيانات الحالية في البنيات الحديثة مثل محولات الرؤية (Vision Transformers)، محققاً أداءً هو الأفضل في فئته مع تحسن يتجاوز 20%.

Xuewan He, Tong Chu, Zihan Cheng, Yuchen Su, Qianxin Xia, Guoming Lu, Jielei Wang, Wen Li2026-08-11
💻 computer science

Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation

تقدم هذه الورقة البحثية نموذج VLM-hyster، وهو أول نموذج للرؤية واللغة لتقسيم المشاهد الجراحية في تنظير الرحم، والذي يستفيد من المطالبات النصية والتقطير المقنع للتغلب على التحديات البصرية مثل الشوائب وتشابه الآفات، محققاً أداءً هو الأفضل في فئته تم التحقق منه عبر مجموعة بيانات ضخمة متعددة المراكز تضم 4,020 صورة مشروحة.

Jun Huang, Meiyi Chen, Zijie Yue, Yuhang Xiao, Fang Li, Hanli Wang, Xiaowen Tong, Yi Guo, Miaojing Shi2026-08-11
💻 computer science

MemeMind: Reference-Guided Trace Construction for Offline Context Optimization

يُعد MemeMind إطار عمل لتحسين السياق غير متصل بالإنترنت وموجهاً بالمرجع، يقوم بإعادة بناء مسارات استخدام الأدوات الناجحة من الإجابات المرجعية لتعزيز بيانات التكيف، مما يحسن بشكل كبير من أداء تفسير الميمات متعدد الوسائط على معيار MemeX من خلال تمكين النماذج المجمدة من تعلم استراتيجيات اكتساب الأدلة الفعالة حتى عندما تفشل عمليات التشغيل الأصلية.

Run Yang, Weihang Wang, Boheng Sheng, Yuchen He, Jielei Zhang, Pengyu Chen, Zhiyu Wu, Qiang Sun, Huyang Sun, Longwen Gao2026-08-11
🤖 AI

GeoPhysAdapter: Scale-Matched Geophysical Adaptation for Cross-Domain Landslide Mapping with Vision Foundation Models

تقترح الورقة البحثية GeoPhysAdapter، وهو إطار عمل للتكيف متوافق القياس يدمج قيود التضاريس والمواد وهطول الأمطار على مستويي البكسل وجسم الانهيار الأرضي لتقليل الإيجابيات الكاذبة عبر النطاقات بشكل كبير وتحسين دقة رسم خرائط الانهيارات الأرضية عند الاستفادة من نماذج الرؤية التأسيسية للاستجابة للطوارئ.

Zhihang Liu, Mei-Po Kwan, Jinlin Wu, Hao Li2026-08-11
💻 computer science

Revisiting the Current Frame: Physical-Trace-Guided Network Output Correction for Video Restoration

تقترح الورقة البحثية إطار عمل ANCHOR، وهو إطار عمل غير مرتبط بنموذج محدد يعمل على تحسين استعادة الفيديو من خلال استخدام الإطار الحالي كمرتكز (anchor) متوافق زمنياً لتقدير حقل ثقة مكاني من الآثار الفيزيائية، مما يؤدي إلى تصحيح أخطاء إعادة البناء بشكل تكيفي والموازنة بين مقترحات الاستعادة والملاحظات الأصلية.

Yifeng Lin, Liuxiang Qiu, Guangming Ren, Tiesong Zhao2026-08-11
💻 computer science

Preserve More Details: Mitigating Content Drift in Real-World Image Super-Resolution

تقدم الورقة البحثية FSP-Diff، وهو نموذج انتشار جديد بخطوة واحدة ذو بنية مسار مزدوج مصمم للحد من انحراف المحتوى والحفاظ على التفاصيل الدقيقة في عملية تحسين دقة الصور في العالم الحقيقي من خلال الموازنة بفعالية بين استعادة التفاصيل الهيكلية والتوجيه الدلالي.

Chunxiao Liu, Wei Liu, Anbin Xiong, Erli Meng2026-08-11
🤖 machine learning

Imaginative Generative AI: Crossing the Entropy Wall into Worlds Beyond Imitation

تقدم هذه الورقة البحثية الذكاء الاصطناً التوليدي الخيالي (IGA)، وهو إطار عمل يستخدم إنتروبيا فون نيومان لتعريف "جدار الإنتروبيا" الذي يفصل بين إصلاح التنوع والاستقراء الخيالي، مما يتيح طريقة تسمى "توجيه IGA" تعمل أثناء الاستدلال دون الحاجة لإعادة التدريب للتحكم في التنوع الطيفي للنماذج التوليدية بما يتجاوز حدود بيانات تدريبها.

Hossein Goli, Farzan Farnia, Amin Gohari2026-08-11
💻 computer science

Efficient Human-Contact Representation for Human-Scene Interaction

تقدم هذه الورقة تمثيلاً فعالاً للتلامس البشري باستخدام أقنعة تلامس متفرقة وعوامل متفرقة لتقليل تكرار البيانات بشكل كبير وتسريع الحوسبة، محققةً دقةً هي الأفضل في فئتها وتسارعاً بمقدار 12 ضعفاً في مهام التفاعل بين الإنسان والمشهد عبر معايير متعددة.

Nghia Vu, Tuong Do, Binh X. Nguyen, Erman Tjiputra, Anh Nguyen2026-08-11
💻 computer science

CableDex: Cable Length Estimation on Industrial Reels Using a Handheld Device

يُعد CableDex نظاماً للرؤية الحاسوبية يستخدم الهاتف المحمول لتقدير أطوال بكرات الكابلات الصناعية بدقة من خلال صورة فوتوغرافية واحدة، محققاً متوسط خطأ مئوي مطلق بنسبة 4.90% عبر الجمع بين معايرة الكاميرا، وتجزئة المثيل، والحساب الحجمي.

Francisco Guillén, Ricardo Almeida, Bruno Silva, João C. Neves2026-08-11