🤖 machine learning

HamVision: Hamiltonian Dynamics as Inductive Bias for Medical Image Analysis

يقدم HamVision إطار عمل لتحليل الصور الطبية يستفيد من المتذبذب التوافقي المخمد كتحيز استقرائي مهيكل لتوليد تمثيلات متميزة للموقع والزخم والطاقة، محققاً أداءً هو الأفضل في فئته في مهام التجزئة والتصنيف عبر عشر معايير دون الحاجة إلى تعديلات خاصة بالمهام في الديناميكيات الجوهرية.

Mohamed A Mabrok2026-03-24
💻 computer science

Uncertainty-Aware Knowledge Distillation for Multimodal Large Language Models

تقترح هذه الورقة البحثية تقنية "تقطير المعرفة الموزونة ببيتا" (Beta-weighted Knowledge Distillation - Beta-KD)، وهي إطار عمل مدرك لعدم اليقين يعمل على موازنة البيانات والإشراف من جانب المعلم بشكل تكيفي عبر تفسير توجيه المعلم كـ "توزيع جيبس القبلي" (Gibbs prior) من منظور بايزي، مما يؤدي إلى تحسين أداء نماذج الرؤية واللغة متعددة الوسائط في اختبارات تقييم الأسئلة البصرية (VQA).

Jingchen Sun, Shaobo Han, Deep Patel, Wataru Kohno, Can Jin, Changyou Chen2026-03-24
💻 computer science

Image-Based Structural Analysis Using Computer Vision and LLMs: PhotoBeamSolver

تقدم هذه الورقة PhotoBeamSolver، وهو نظام قائم على الرؤية الحاسوبية والنماذج اللغوية الكبيرة (LLM) يقوم بحل نماذج العوارض الإنشائية المثالية من الرسوم التخطيطية المرسومة يدوياً، مع تحليل التحديات والقيود والتطبيقات الأوسع لدمج الذكاء الاصطناعي البصري في الهندسة المدنية.

Altamirano-Muñiz Emilio Fernando2026-03-24
💻 computer science

EpiMask: Leveraging Epipolar Distance Based Masks in Cross-Attention for Satellite Image Matching

تُعد EpiMask شبكة مطابقة صور شبه كثيفة مصممة لصور الأقمار الصناعية، تعمل على تحسين الدقة من خلال دمج تقريبات الكاميرا الأفينية على مستوى الرقع، واستخدام أقنعة انتباه قائمة على المسافة الاندماجية (epipolar distance) لفرض القيود الهندسية، وصقل المشفرات التأسيسية، مما يحقق أداءً أفضل بنسبة تصل إلى 30% من النماذج الأرضية على مجموعة بيانات SatDepth.

Rahul Deshmukh, Aditya Chauhan, Avinash Kak2026-03-24
💻 computer science

Parameter-efficient Prompt Tuning and Hierarchical Textual Guidance for Few-shot Whole Slide Image Classification

تقترح هذه الورقة البحثية إطار عمل HIPSS، وهو إطار عمل جديد لتصنيف صور الشرائح الكاملة في ظروف التعلم من أمثلة قليلة، يجمع بين طريقة ضبط المحفزات الموفرة للمعلمات والتوجيه النصي الهرمي المرن للتغلب على قيود التكاليف الحسابية وفقدان المعلومات في مناهج نماذج الرؤية واللغة الحالية، محققاً تحسينات كبيرة في الأداء عبر أنواع متعددة من السرطانات.

Jayanie Bogahawatte, Sachith Seneviratne, Saman Halgamuge2026-03-24
⚡ electrical engineering

Unregistered Spectral Image Fusion: Unmixing, Adversarial Learning, and Recoverability

تقترح هذه الورقة إطار عمل غير خاضع للإشراف يجمع بين فك الارتباط الطيفي المقترن والتعلم التنافسي في الفضاء الكامن لرفع الدقة المكانية للصور فائقة الطيف ومتعددة الأطياف غير المسجلة مكانياً في آن واحد، مع تقديم أول ضمانات نظرية حول إمكانية الاسترداد لمثل هذه المهام من الدمج غير المسجل.

Jiahui Song, Sagar Shrestha, Xiao Fu2026-03-24
💻 computer science

VIGIL: Part-Grounded Structured Reasoning for Generalizable Deepfake Detection

يُعد VIGIL إطار عمل للاستدلال الهيكلي القائم على الأجزاء، والذي يعمل على تحسين كشف التزييف العميق القابل للتعميم من خلال فصل تخطيط أجزاء الوجه عن فحص الأدلة عبر آلية حقن مرحلية ومرحلية التدريب، محققاً أداءً فائقاً على معيار OmniFake المنشأ حديثاً.

Xinghan Li, Junhao Xu, Jingjing Chen2026-03-24
💻 computer science

Revisiting Weakly-Supervised Video Scene Graph Generation via Pair Affinity Learning

تقترح هذه الورقة إطار عمل جديد لتوليد الرسوم البيانية لمشاهد الفيديو تحت الإشراف الضعيف، والذي يقدم تعلم وتقييم تقارب الأزواج (PALS) والمطابقة الواعية بالعلاقات (RAM) لتصفية أزواج الكائنات المشوشة وحل غموض الفئات بفعالية، مما يحقق أداءً هو الأفضل في فئته على مجموعة بيانات Action Genome.

Minseok Kang, Minhyeok Lee, Minjung Kim, Jungho Lee, Donghyeong Kim, Sungmin Woo, Inseok Jeon, Sangyoun Lee2026-03-24
🤖 machine learning

CataractSAM-2: A Domain-Adapted Model for Anterior Segment Surgery Segmentation and Scalable Ground-Truth Annotation

تقدم الورقة البحثية CataractSAM-2، وهو نموذج متكيف مع النطاق يعتمد على نموذج Segment Anything Model 2، يتيح التجزئة في الوقت الفعلي وعالية الدقة لمقاطع فيديو جراحة الساد (الماء الأبيض) ويسهل عملية ترميز الحقيقة الأرضية القابلة للتوسع من خلال إطار عمل تفاعلي، بينما يُظهر قدرة قوية على التعميم الصفري (zero-shot generalization) للإجراءات العينية الأخرى.

Mohammad Eslami, Dhanvinkumar Ganeshkumar, Saber Kazeminasab, Michael G. Morley, Michael V. Boland, Michael M. Lin, John (…)2026-03-24
💻 computer science

Rethinking Visual Privacy: A Compositional Privacy Risk Framework for Severity Assessment with VLMs

تقترح هذه الورقة "تصنيف مخاطر الخصوصية التركيبي" (CPRT)، وهو إطار عمل يتجاوز تقييمات الخصوصية الثنائية لتقييم الشدة المتدرجة بناءً على الجمع بين السمات البصرية، وتُظهر أنه بينما تعاني النماذج اللغوية البصرية الكبيرة (VLMs) الرائدة من المخاطر التركيبية، فإن نموذجاً متخصصاً بحجم 8 مليار معلمة ومضبوطاً بدقة يمكنه سد هذه الفجوة بفعالية.

Efthymios Tsaprazlis, Tiantian Feng, Anil Ramakrishna, Sai Praneeth Karimireddy, Rahul Gupta, Shrikanth Narayanan2026-03-24