💻 computer science

Results of the 1st Asynchronous CASTLE Challenge at the Joint Egocentric Vision Workshop in Conjunction with CVPR 2026

تلخص هذه الورقة المساهمات والنتائج الخاصة بتحدي CASTLE الأول غير المتزامن، والذي عُقد في ورشة عمل الرؤية من منظور الشخص الأول (Egocentric Vision) بالاقتران مع مؤتمر CVPR 2026.

Luca Rossetto, Werner Bailer, Cathal Gurrin, Graham Healy, Omar Shahbaz Khan, Stevan Rudinac, Klaus Schöffmann, Allie Tr (…)2026-08-25
💻 computer science

Quality Inspection of Printed Circuit Board Pin Insertion via Semantic Segmentation and Board-Level Feature Extraction

تقترح هذه الورقة طريقة مؤتمتة لفحص جودة إدخال دبابيس لوحات الدوائر المطبوعة تجمع بين التجزئة الدلالية القائمة على شبكة U-Net واستخراج الميزات المشتقة من المحيط والانحدار اللوجستي، محققةً دقة تصنيف تقارب الكمال على كل من مجموعات البيانات الصناعية والعامة مع تفوقها على أساليب كشف الشذوذ وتجزئة المثيلات الحديثة.

Nils Rabeneck, André Kiunke, Nicole Hoess, Wolfgang Mauerer2026-08-25
💻 computer science

WADE: A Reasoning-Annotated Benchmark for Multi-Instance Floating-Waste Grounding with Compact Vision-Language Models

تقدم هذه الورقة البحثية WADE، وهو معيار مرجعي مُعلق بالاستنتاج يضم 2,167 صورة لنفايات عائمة في ريف بنغلاديش مع قواعد بصرية مفصلة، لتقييم وتحسين أداء نماذج الرؤية واللغة المدمجة في تحديد مواقع، وعدّ، وتفسير النفايات متعددة الحالات تحت ظروف صعبة.

Md. Asaduzzaman Shuvo, Ahsan Farabi, Md. Abdul Ahad Minhaz, Mahedi Hasan, Israt Khandaker, Ibrahim Khalil Shanto, Muhamm (…)2026-08-25
🤖 AI

WildHandBench: A Benchmark for Handwritten Text Understanding that Challenges MLLMs and Humans

تقدم الورقة البحثية WildHandBench، وهو معيار شامل لفهم النصوص المكتوبة بخط اليد، والذي يكشف أن النماذج اللغوية الكبيرة متعددة الوسائط الحالية تتخلف بشكل كبير عن الأداء البشري وتظهر اعتماداً منهجياً على الأولويات اللغوية بدلاً من الأدلة المرئية، وهو عيب لا يمكن كشفه بواسطة مقاييس الدقة التقليدية.

Jun Zhang, Qiao Zhao, Cheng Cui, Jianying Qu, Zhongkai Sun, Jianwen Yang, Changda Zhou, ZhuoXin Liu, Shubin Han2026-08-25
💻 computer science

Simplified Cross-Modal Calibration for Heterogeneous Event-RGB Stereo Systems

تقترح هذه الورقة إطار عمل مبسط للمعايرة عبر الوسائط بدون حركة لأنظمة الرؤية المجسمة (stereo) غير المتجانسة المكونة من أحداث وصور RGB، والتي تستخدم هدف ChArUco مدمجاً ومعدلاً زمنياً على شاشات استهلاكية لتحقيق أخطاء إعادة إسقاط أقل بكثير وقيود مزامنة مخفضة مقارنة بالطرق القائمة على الحركة وغير القائمة على الحركة الموجودة حالياً.

Nico Hessenthaler, Adam T. Müller, Nicolaj C. Stache2026-08-25
💻 computer science

AnaDiffusion: Anatomically CompositionalLatent Diffusion for Controllable 3D Brain MRI Generation

تُعد AnaDiffusion إطار عمل للانتشار الكامن ذو تكوين تشريحي، يقوم بتوليد صور رنين مغناطيسي ثلاثية الأبعاد للدماغ قابلة للتحكم عبر تفكيك العملية إلى أجزاء إقليمية متميزة وإعادة تجميعها مع تحسين شامل، مما يحقق دقة تشريحية فائقة وقابلية تعديل محلية دون الحاجة إلى خرائط تجزئة خاصة بكل حالة.

Huiwen Han, Lulin Liu, Bangya Liu, Yuanhao Cai, Nuo Chen, Xiaoqing Wang, Ziqian Xie, Chenyu You, Shuiwang Ji, Degui Zhi (…)2026-08-25
💻 computer science

Loopy: Seamless Video Loop Generation via Anchored Looping Shift of Positional Embedding

يُعد Loopy إطار عمل مبتكرًا يحقق توليد فيديوهات حلقية عالية الجودة وسلسة من خلال تقديم استراتيجية إزاحة لتمثيل الموضع المثبت ضمن نماذج محولات الانتشار (Diffusion Transformers)، والتي تستفيد من التحكم الزمني الخاص بكل طبقة لتحويل الإدراك الزمني الخطي إلى إدراك دائري.

Haotian Dong, Wenjing Wang, Chen Li, Jing Lyu, Xin Wang, Di Lin2026-08-25
💻 computer science

Training-Free Pseudo-Fusion for Composed Image Retrieval with Diffusion Models and Multimodal Large Language Models

تقدم هذه الورقة PeFuse، وهو إطار عمل لا يتطلب تدريباً لاسترجاع الصور المركبة، يستفيد من نماذج الانتشار مسبقة التدريب والنماذج اللغوية الكبيرة متعددة الوسائط لتحويل الاستعلامات التركيبية إلى مهام استرجاع أحادية الوسيط عبر التحويل التوليدي، محققاً أداءً تنافسياً دون الحاجة إلى تدريب مخصص للمهمة.

Fan Xu, Luis A. Leiva2026-08-25
💻 computer science

A Simulator-Grounded Framework For Constructing Verifiable Muscle-Grounded QA From 3D Tongue Meshes

تقدم هذه الورقة 3DTongueQA، وهو إطار عمل قائم على المحاكاة يولد مجموعات بيانات للأسئلة والأجوبة قابلة للتحقق وموجهة بالعضلات من نماذج ثلاثية الأبعاد للسان باستخدام نموذج ArtiSynth Badin، مما يثبت أن مثل هذه الإشراف الاصطناعي يدعم بفعالية كلاً من التنبؤ الميكانيكي الحيوي المهيكل والأسئلة والأجوبة باللغة الطبيعية عبر لغات متعددة.

Seungho Eum, Unsang Park2026-08-25
💬 NLP

CaRGo-T: Causal Reasoning Graph-of-Thought improves Multimodal Humor Comprehension

تقدم الورقة البحثية CaRGo-T، وهو إطار عمل لـ "رسم بياني للأفكار" يعتمد على الاستدلال السببي، والذي يعزز فهم وكشف الفكاهة متعددة الوسائط من خلال تمثيل العلاقات المعقدة بين الكيانات والسياق كبنية رسم بياني خفيفة الوزن قائمة على الكود، مما يظهر تحسينات كبيرة في الأداء مقارنة بالنماذج المرجعية الحالية عبر مجموعات بيانات متنوعة.

Abhilash Nandy, Rahul Seetharaman, Aman Bansal, Rounak Saha, Manav Nitin Kapadnis, Millon Madhur Das, Pawan Goyal, Niloy (…)2026-08-25