💻 computer science

Does Your VFM Speak Plant? The Botanical Grammar of Vision Foundation Models for Object Detection

تُثبت هذه الورقة أن هندسة الأوامر المنهجية والخاصة بالنماذج تعزز بشكل كبير أداء كشف الأشياء بنمط "الصفر من الأمثلة" لنماذج الرؤية التأسيسية في المشاهد الزراعية المعقدة، مما يثبت أن الأوامر المثلى المستمدة من البيانات الاصطناعية يمكن أن تنتقل بفعالية إلى التطبيقات الواقعية دون الحاجة إلى توصيف يدوي.

Lars Lundqvist, Earl Ranario, Hamid Kamangir, Heesup Yun, Christine Diepenbrock, Brian N. Bailey, J. Mason Earles2026-04-15
💻 computer science

BLPR: Robust License Plate Recognition under Viewpoint and Illumination Variations via Confidence-Driven VLM Fallback

تقدم هذه الورقة BLPR، وهو إطار عمل قوي ثنائي المراحل للتعرف على لوحات الأرقام في بوليفيا يجمع بين كاشف YOLO المدرب على بيانات اصطناعية ونموذج Gemma3 للرؤية واللغة الذي يعمل كبديل مدفوع بالثقة، محققاً دقة بنسبة 89.6% في التعرف على الحروف في البيانات الواقعية مع معالجة التحديات الناجمة عن تغيرات زاوية الرؤية والإضاءة.

Guillermo Auza Banegas, Diego Calvimontes Vera, Sergio Castro Sandoval, Natalia Condori Peredo, Edwin Salcedo2026-04-15
💻 computer science

Unmixing-Guided Spatial-Spectral Mamba with Clustering Tokens for Hyperspectral Image Classification

تقترح هذه الورقة إطار عمل "مامبا" (Mamba) مكاني-طيفي مبتكر موجه بفك الاختلاط، يدمج شبكة فك اختلاط طيفي، واستراتيجية اختيار الرموز (tokens) التكيفية من نوع (Top-K)، ومخطط تعلم متعدد المهام لمعالجة تأثيرات الاختلاط الطيفي والتباين المكاني-الطيفي بفعالية، مما يحقق أداءً فائقاً في تصنيف الصور فائقة الطيف.

Yimin Zhu, Lincoln Linlin Xu2026-04-15
💻 computer science

Revisiting the Scale Loss Function and Gaussian-Shape Convolution for Infrared Small Target Detection

تتناول هذه الورقة تحديات عدم استقرار التدريب وعدم كفاية الانتباه المكاني في اكتشاف الأهداف الصغيرة بالأشعة تحت الحمراء من خلال اقتراح فقدان مقياس يعتمد على الفرق (diff-based) رتيب تماماً، وتلافيف ذو شكل غاوسي قابل للتعلم مع قناع "عجلة الطاحونة" (pinwheel) مدور، مما يحقق أداءً هو الأفضل حالياً عبر العديد من المعايير المرجعية.

Hao Li, Man Fung Zhuo2026-04-15
💻 computer science

SwinTextUNet: Integrating CLIP-Based Text Guidance into Swin Transformer U-Nets for Medical Image Segmentation

تقدم الورقة البحثية SwinTextUNet، وهو إطار عمل متعدد الوسائط يدمج تضمينات نصية مشتقة من CLIP في شبكة Swin Transformer U-Net عبر الانتباه المتقاطع والدمج التلافيفي لتعزيز دقة تقسيم الصور الطبية، محققاً درجة "دايس" (Dice score) تبلغ 86.47% على مجموعة بيانات QaTaCOV19.

Ashfak Yeafi, Parthaw Goswami, Md Khairul Islam, Ashifa Islam Shamme2026-04-15
💻 computer science

SinkTrack: Attention Sink based Context Anchoring for Large Language Models

تُعد SinkTrack طريقةً لا تتطلب تدريباً وتعمل بمجرد التوصيل والتشغيل، حيث تعمل على الحد من الهلوسة ونسيان السياق في النماذج اللغوية الكبيرة عبر الاستفادة من ظاهرة "مصب الانتباه" الجوهرية لترسيخ تركيز النموذج على سياق المدخلات الأولي طوال عملية التوليد.

Xu Liu, Guikun Chen, Wenguan Wang2026-04-15
💻 computer science

Prompt Relay: Inference-Time Temporal Control for Multi-Event Video Generation

تُعد "برومبت ريلي" (Prompt Relay) طريقة جاهزة للتشغيل تعمل أثناء مرحلة الاستدلال لتعزيز توليد الفيديو متعدد الأحداث عبر إدخال عقوبة في آلية الانتباه المتقاطع لفرض محاذاة زمنية صارمة بين أجزاء مطالبات معينة وإطارات الفيديو، مما يؤدي إلى القضاء على التشابك الدلالي دون الحاجة إلى تغييرات هيكلية أو عبء حسابي إضافي.

Gordon Chen, Ziqi Huang, Ziwei Liu2026-04-15
💻 computer science

Intra-finger Variability of Diffusion-based Latent Fingerprint Generation

تقيم هذه الورقة بشكل منهجي التباين داخل الإصبع الواحد للبصمات الاصبعية الكامنة الاصطناعية الناتجة عن نموذج انتشار متطور، كاشفةً أنه في حين يتم الحفاظ على الهوية إلى حد كبير، فإن العملية تُدخل عدم اتساق في التفاصيل الدقيقة المحلية وهلوسات في الخطوط العرضية العالمية عندما لا تتطابق تضمينات الأسلوب مع الصور المرجعية، مما يسلط الضوء على الحاجة إلى نماذج محسنة توازن بين التنوع واتساق الهوية.

Noor Hussein, Anil K. Jain, Karthik Nandakumar2026-04-15
💻 computer science

On The Application of Linear Attention in Multimodal Transformers

تُثبت هذه الورقة أن دمج الانتباه الخطي (Linear Attention) في نماذج المحولات متعددة الوسائط (Multimodal Transformers) يقلل بشكل كبير من التعقيد الحسابي من التربيعي إلى الخطي مع الحفاظ على أداء تنافسي والالتزام بقوانين القياس القياسية عبر مختلف البنيات المدربة على مجموعات بيانات واسعة النطاق.

Armin Gerami, Seyedehanita Madani, Ramani Duraiswami2026-04-15
💻 computer science

Active Diffusion Matching: Score-based Iterative Alignment of Cross-Modal Retinal Images

تقترح هذه الورقة البحثية طريقة "المطابقة الانتشارية النشطة" (ADM)، وهي طريقة تكرارية قائمة على الدرجة (score-based) تعمل على محاذاة صور قاع العين القياسية وصور الشبكية واسعة المجال بفعالية من خلال التقدير المشترك للتحويلات العالمية والمحلية، مما يحقق دقة هي الأفضل في فئتها ويمكّن من تحسين التحليل السريري.

Kanggeon Lee, Su Jeong Song, Soochahn Lee, Kyoung Mu Lee2026-04-15