💻 computer science

Anatomical Token Uncertainty for Transformer-Guided Active MRI Acquisition

تقترح هذه الورقة إطار عمل جديد للاستحواذ النشط على التصوير بالرنين المغناطيسي يستفيد من إنتروبيا الرموز (token entropy) المستمدة من مشفر صور طبية مسبق التدريب ومحول كامن لتوجيه أخذ عينات فضاء k الأمثل، مما يظهر أداءً متفوقاً على النماذج المرجعية الحالية في المقاييس الإدراكية والمستندة إلى الميزات على مجموعات بيانات fastMRI.

Lev Ayzenberg, Shady Abu-Hussein, Raja Giryes, Hayit Greenspan2026-03-31
💻 computer science

LITTA: Late-Interaction and Test-Time Alignment for Visually-Grounded Multimodal Retrieval

إنَّ LITTA هو إطار عمل للمحاذاة في وقت الاختبار يعزز استرجاع المستندات متعدد الوسائط المرتكز بصرياً من خلال توليد متغيرات متعددة للاستعلام عبر نموذج لغوي كبير وتجميع نتائجها عبر دمج الرتب المتبادل، مما يحسن المتانة والدقة دون الحاجة إلى إعادة تدريب المسترجع.

Seonok Kim2026-03-31
⚡ electrical engineering

Stress Classification from ECG Signals Using Vision Transformer

تقترح هذه الورقة نهجًا يعتمد على محول الرؤية (Vision Transformer) من طرف إلى طرف يقوم بتحويل إشارات تخطيط كهربية القلب (ECG) الخام إلى مخططات طيفية ثنائية الأبعاد لمعالجة التباين بين الأفراد بفعالية، محققةً دقة هي الأفضل في مجالها في التصنيف متعدد المستويات للتوتر على مجموعتي بيانات WESAD وRML.

Zeeshan Ahmad, Naimul Khan2026-03-31
💻 computer science

Contextual inference from single objects in Vision-Language models

تتقصى هذه الورقة كيفية استنتاج نماذج الرؤية واللغة لسياق المشهد من خلال كائنات مفردة، كاشفةً أنه في حين تحقق هذه النماذج أداءً أعلى من مستوى الصدفة يتأثر بخصائص الكائنات الشبيهة بالبشر، فإن الآليات الكامنة تتضمن تمثيلات قابلة للفصل جزئياً حيث يتم تشفير هوية المشهد دقيقة التفاصيل عبر الشبكة بأكملها بينما لا يظهر السياق العام إلا في مرحلة متأخرة أو لا يظهر على الإطلاق.

Martina G. Vilas, Timothy Schaumlöffel, Gemma Roig2026-03-31
💻 computer science

Steering Sparse Autoencoder Latents to Control Dynamic Head Pruning in Vision Transformers (Student Abstract)

تقترح هذه الورقة إطار عمل مبتكر يدمج المشفرات التلقائية المتفرقة مع تقليم الرؤوس الديناميكي في محولات الرؤية لتوليد سياسات تقليم قابلة للتفسير وخاصة بكل فئة، والتي تعمل في آن واحد على تحسين دقة النموذج وتقليل العبء الحسابي.

Yousung Lee, Dongsoo Har2026-03-31
💻 computer science

From Diffusion To Flow: Efficient Motion Generation In MotionGPT3

تقدم هذه الورقة دراسة تجريبية منضبطة ضمن إطار عمل MotionGPT3، تُظهر أن استبدال أهداف الانتشار (diffusion objectives) بالتدفق المصحح (rectified flow) يحسن بشكل كبير من تقارب التدريب وكفاءة الاستدلال مع الحفاظ على جودة توليد الحركة أو تعزيزها على مجموعة بيانات HumanML3D.

Jaymin Ban, JiHong Jeon, SangYeop Jeong2026-03-31
💻 computer science

Survey on Remote Sensing Scene Classification: From Traditional Methods to Large Generative AI Models

تتتبع هذه الدراسة الشاملة تطور تصنيف مشاهد الاستشعار عن بعد من الميزات التقليدية المصممة يدويًا إلى أنظمة التعلم العميق والذكاء الاصطناد التوليدي الحديثة، مع تحليل التحولات المنهجية الرئيسية، والتحديات الراهنة، واتجاهات البحث المستقبلية لتطبيقات مراقبة الأرض.

Qionghao Huang, Can Hu2026-03-31
💻 computer science

Generating Synthetic Wildlife Health Data from Camera Trap Imagery: A Pipeline for Alopecia and Body Condition Training Data

تقدم هذه الورقة مساراً لتوليد بيانات تدريب اصطناعية تصور حالات فقدان الشعر وسوء الحالة البدنية من صور حقيقية لآلات التصوير الخفية، مما يُمكّن نماذج فحص صحة الحياة البرية المؤتمتة بنجاح من تحقيق أداء قوي (0.85 AUROC) عند تدريبها حصرياً على مجموعة البيانات الاصطناعية.

David Brundage2026-03-31
💻 computer science

Tiny-ViT: A Compact Vision Transformer for Efficient and Explainable Potato Leaf Disease Classification

تقترح الورقة البحثية نموذج Tiny-ViT، وهو نموذج "ترانسفورمر رؤية" (Vision Transformer) مدمج وقابل للتفسير يحقق دقة حالة متقدمة (99.85%) وموثوقية عالية في تصنيف أمراض أوراق البطاطس (اللفحة المبكرة، واللفحة المتأخرة، والسليمة) مع الحفاظ على تكاليف حوسبة منخفضة مناسبة للتطبيقات ذات الموارد المحدودة والوقت الفعلي.

Shakil Mia, Umme Habiba, Urmi Akter, SK Rezwana Quadir Raisa, Jeba Maliha, Md. Iqbal Hossain, Md. Shakhauat Hossan Sumon2026-03-31
💻 computer science

A Near-Raw Talking-Head Video Dataset for Various Computer Vision Tasks

تقدم هذه الورقة البحثية مجموعة بيانات ضخمة لفيديوهات الرؤوس المتحدثة شبه الخام، تضم 847 تسجيلاً غير فاقد للجودة من مشاركين وأجهزة متنوعة، مُعلقاً عليها بمقاييس الجودة الإدراكية ومُنسقة في مجموعة فرعية للاختبار المرجعي بهدف دفع عجلة البحث في ضغط الفيديو وتحسينه من أجل الاتصالات في الوقت الفعلي.

Babak Naderi, Ross Cutler2026-03-31