💻 computer science

Who Handles Orientation? Investigating Invariance in Feature Matching

تتقصى هذه الورقة المرحلة المثلى لدمج عدم التباين الدوراني في مسارات مطابقة الميزات المتفرقة، كاشفةً أن تعلمه ضمن الوصف يمنح أداءً مماثلاً للتعامل معه في المطابق مع تمكين استدلال أسرع، ومثبتةً أن توسيع نطاق بيانات التدريب يحسن بشكل كبير من القدرة على التعميم في الصور المدورة دون المساس بالأداء في الصور المستقيمة.

David Nordström, Johan Edstedt, Fredrik Kahl, Georg Bökman2026-04-15
💻 computer science

A Workflow to Efficiently Generate Dense Tissue Ground Truth Masks for Digital Breast Tomosynthesis

تقدم هذه الورقة سير عمل يوفر الوقت والجهد لإنشاء أقنعة الحقيقة الأرضية للأنسجة الكثيفة لتصوير الثدي الرقمي بالحزمة ثلاثية الأبعاد، وذلك من خلال اشتراط تعليق المستخدم على شريحة مركزية فقط مع نشر العتبات وتعديلها خوارزمياً عبر الحجم، مما يحقق توافقاً عالياً بين القراء ودقة تم التحقق منها باستخدام مجموعة بيانات DBTex.

Tamerlan Mustafaev, Oleg Kruglov, Margarita Zuley, Luana de Mero Omena, Guilherme Muniz de Oliveira, Vitor de Sousa Fran (…)2026-04-15
💻 computer science

EigenCoin: sassanid coins classification based on Bhattacharyya distance

تقدم هذه الورقة EigenCoin، وهي طريقة تصنيف تستخدم بناء المتشعبات ومسافة باتاتشاريا لمعالجة تحديات قواعد البيانات غير المتوازنة في التعرف على العملات الساسانية بفعالية، محققةً تحسينات في الدقة تتراوح بين 9.45% و21.75% مقارنة بالخوارزميات الحالية مع الحد من الإفراط في التخصيص.

Rahele Allahverdi, Mohammad Mahdi Dehshibi, Azam Bastanfard, Daryoosh Akbarzadeh2026-04-15
💬 NLP

INDOTABVQA: A Benchmark for Cross-Lingual Table Understanding in Bahasa Indonesia Documents

تقدم الورقة البحثية INDOTABVQA، وهي مجموعة بيانات مرجعية عابرة للغات لمهام الإجابة البصرية على الأسئلة المتعلقة بالجداول في وثائق اللغة الإندونيسية، والتي تقيم وتُظهر مكاسب أداء كبيرة لنماذج الرؤية واللغة من خلال الضبط الدقيق المستهدف ودمج الأولويات المكانية.

Somraj Gautam, Anathapindika Dravichi, Gaurav Harit2026-04-15
🔬 optics

Ultra-low-light computer vision using trained photon correlations

تقدم هذه الورقة إطار عمل هجين للرؤية الحاسوبية ضوئياً وإلكترونياً يسمى التدريب المدرك للارتباط (CAT)، والذي يعمل على تحسين مصدر إضاءة فوتوني مترابط قابل للتدريب ونموذج خلفي من نوع "ترانسفورمر" بشكل مشترك لتحقيق تحسن يصل إلى 15 نقطة مئوية في دقة التعرف على الأشياء في ظروف الإضاءة المنخفضة للغاية والضوضاء مقارنة بالإضاءة التقليدية غير المترابطة.

Mandar M. Sohoni, Jérémie Laydevant, Mathieu Ouellet, Shi-Yuan Ma, Ryotatsu Yanagimoto, Benjamin A. Ash, Tatsuhiro Onode (…)2026-04-15
💻 computer science

TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment

تقدم هذه الورقة البحثية TIPSv2، وهي عائلة جديدة من نماذج الرؤية واللغة التي تعزز بشكل كبير المحاذاة بين الرقع (patch) والنصوص بكثافة من خلال تقنيات مبتكرة تشمل التقطير على مستوى الرقعة، وهدف تدريب مسبق محسّن لـ iBOT++، ووصفات تعلم مُحسّنة، محققةً أداءً هو الأفضل في فئته عبر مهام متنوعة لاحقة.

Bingyi Cao, Koert Chen, Kevis-Kokitsi Maninis, Kaifeng Chen, Arjun Karpur, Ye Xia, Sahil Dua, Tanmaya Dabral, Guangxing (…)2026-04-15
🤖 AI

Spatial Atlas: Compute-Grounded Reasoning for Spatial-Aware Research Agent Benchmarks

تقدم هذه الورقة البحثية "Spatial Atlas"، وهو إطار عمل لوكيل بحثي يستخدم الاستدلال القائم على الحوسبة لحل المشكلات المكانية الفرعية بشكل حتمي عبر رسوم بيانية للمشاهد مهيكلة قبل توليد النموذج اللغوي، محققاً بذلك دقة وتفسيرية تنافسية في معايير FieldWorkArena متعددة الوسائط وMLE-Bench الخاصة بالهندسة البرمجية لتعلم الآلة.

Arun Sharma2026-04-15
💻 computer science

Nucleus-Image: Sparse MoE for Image Generation

يُعد Nucleus-Image نموذج محول انتشار (diffusion transformer) من نوع خليط الخبراء المتناثر (Mixture-of-Experts) مفتوح المصدر بالكامل، يمتلك 17 مليار معلمة ويحقق جودة توليد صور هي الأفضل في فئتها باستخدام 2 مليار معلمة نشطة فقط لكل تمريرة أمامية من خلال ابتكارات معمارية مثل توجيه اختيار الخبراء (Expert-Choice Routing) وتعديل الخطوات الزمنية المنفصل (decoupled timestep modulation)، وكل ذلك دون الاعتماد على تحسين ما بعد التدريب.

Chandan Akiti, Ajay Modukuri, Murali Nandan Nagarapu, Gunavardhan Akiti, Haozhe Liu2026-04-15
💻 computer science

BarbieGait: An Identity-Consistent Synthetic Human Dataset with Versatile Cloth-Changing for Gait Recognition

تقدم هذه الورقة BarbieGait، وهي مجموعة بيانات اصطناعية تحافظ على هوية المشية مع محاكة تغييرات الملابس المتنوعة، وتقترح GaitCLIF، وهو نموذج قوي يتعلم بفعالية سمات ثابتة تجاه الملابس لتحسين أداء التعرف على المشية عبر الملابس المختلفة بشكل كبير.

Qingyuan Cai, Saihui Hou, Xuecai Hu, Yongzhen Huang2026-04-15
⚡ electrical engineering

Physics-Grounded Monocular Vehicle Distance Estimation Using Standardized License Plate Typography

تقدم هذه الورقة إطار عمل فيزيائيًا لا يتطلب تدريبًا لتقدير مسافة المركبات أحادي العين، يستفيد من الخطوط الطباعية القياسية للوحات ترخيص السيارات في الولايات المتحدة كأولويات هندسية لحل غموض المقياس، محققًا دقة عالية ومتانة في ظروف إضاءة متنوعة مع التفوق على النماذج المرجعية للتعلم العميق دون الحاجة إلى مستشعرات باهظة الثمن أو بيانات خاضعة للإشراف.

Manognya Lokesh Reddy, Zheng Liu2026-04-15