💻 computer science

Detection of Hate and Threat in Digital Forensics: A Case-Driven Multimodal Approach

تقدم هذه الورقة إطار عمل متعدد الوسائط مدفوعاً بالحالات من أجل الأدلة الجنائية الرقمية، والذي يعزز الكشف عن خطاب الكراهية والتهديد عبر الاختيار الديناميكي بين تحليل النصوص، أو الدمج متعدد الوسائط، أو الاستدلال القائم على الصور فقط بناءً على التكوين المحدد للأدلة غير المتجانسة، مما يضمن إمكانية التتبع الجنائي ويتجنب افتراضات الوسائط غير المبررة.

Ponkoj Chandra Shill2026-04-13
💻 computer science

WildDet3D: Scaling Promptable 3D Detection in the Wild

تقدم هذه الورقة البحثية WildDet3D، وهي بنية موحدة مدركة للهندسة قادرة على التعامل مع أنماط متنوعة من المطالبات وإشارات العمق المساعدة، إلى جانب إنشاء WildDet3D-Data، أكبر مجموعة بيانات مفتوحة للكشف ثلاثي الأبعاد حتى الآن، مما يضع معاً أداءً جديداً هو الأفضل في فئته في مجال الكشف عن الأجسام ثلاثية الأبعاد أحادية العدسة في العالم المفتوح.

Weikai Huang, Jieyu Zhang, Sijun Li, Taoyang Jia, Jiafei Duan, Yunqian Cheng, Jaemin Cho, Mattew Wallingford, Rustin Sor (…)2026-04-13
🤖 machine learning

VOLTA: The Surprising Ineffectiveness of Auxiliary Losses for Calibrated Deep Learning

تقدم هذه الورقة VOLTA، وهو إطار عمل للتعلم العميق خفيف الوزن وحتمي يحقق معايرة فائقة ودقة تنافسية عبر مختلف مجموعات البيانات وتحولات التوزيع من خلال الاعتماد فقط على مشفر عميق، ونماذج أولية قابلة للتعلم، وتدرج درجة الحرارة اللاحق، مما يثبت أن الخسائر المساعدة المعقدة غالبًا ما تكون غير ضرورية للتقدير الفعال لعدم اليقين.

Rahul D Ray, Utkarsh Srivastava2026-04-13
💻 computer science

Unified Multimodal Uncertain Inference

تقدم هذه الورقة البحثية الاستدلال الموحد لعدم اليقين متعدد الوسائط (UMUI)، وهو مهمة جديدة تتطلب استدلالاً احتماليًا معايرًا عبر الوسائط النصية والصوتية والمرئية، وتقترح نموذج CLUE الذي يحقق أداءً هو الأفضل في فئته بمعلمات أقل بكثير من النماذج المرجعية الحالية.

Dengjia Zhang, Alexander Martin, William Jurayj, Kenton Murray, Benjamin Van Durme, Reno Kriz2026-04-13
💻 computer science

RS-OVC: Open-Vocabulary Counting for Remote-Sensing Data

تقدم هذه الورقة البحثية نموذج RS-OVC، وهو أول نموذج عدّ مفتوح المفردات لصور الاستشعار عن بعد، والذي يتيح الكشف والعد الدقيق لفئات كائنات جديدة وغير مرئية باستخدام التكييف النصي أو البصري فقط، مما يتغلب على قيود الطرق التقليدية المقتصرة على مجموعات كائنات محددة مسبقاً.

Tamir Shor, George Leifman, Genady Beryozkin2026-04-13
🤖 AI

Deep Learning-Based Tracking and Lineage Reconstruction of Ligament Breakup

تقدم هذه الورقة إطار عمل للتعلم العميق مكون من مرحلتين يجمع بين شبكة Faster R-CNN للكشف عن الأجسام ونموذج MLP معزز بآلية المحولات (Transformer) للنمذجة الزمنية لتتبع تكسر الأربطة تلقائياً، وإعادة بناء سلالات الأصل والفرع، وقياس إحصائيات التجزؤ في تفكك الصفائح السائلة، متجاوزةً بذلك قيود طرق التتبع التقليدية في التعامل مع أحداث التجزؤ من نوع "واحد إلى كثير".

Vrushank Ahire, Vivek Kurumanghat, Mudasir Ganaie, Lipika Kabiraj2026-04-13
💻 computer science

SIC3D: Style Image Conditioned Text-to-3D Gaussian Splatting Generation

إن SIC3D هو مسار توليد من نص إلى ثلاثي الأبعاد مكون من مرحلتين، يعتمد على الصور كشرط، ويستخدم تقنية Gaussian Splatting ثلاثية الأبعاد لتعزيز الدقة الهندسية والالتزام بالنمط عبر تقديم فقدان تباين الأنماط المتغير (Variational Stylized Score Distillation) المبتكر لنقل أنماط الصور المرجعية بفعالية مع التخفيف من صراعات الهندسة والمظهر.

Ming He, Zhixiang Chen, Steve Maddock2026-04-13
💻 computer science

State Space Models are Effective Sign Language Learners: Exploiting Phonological Compositionality for Vocabulary-Scale Recognition

تقدم الورقة البحثية PHONSSM، وهو نموذج فضاء الحالة (State Space Model) يستفيد من التركيب الفونولوجي للغات الإشارة من خلال انتباه رسومي مرتكز تشريحياً وتحليل صريح للتغلب على إخفاقات توسع المفردات، محققاً أداءً هو الأفضل في فئته على مجموعات بيانات لغة الإشارة الأمريكية واسعة النطاق مع قدرات فائقة في نقل التعلم في حالات التعلم بلقطات قليلة والتعلم الصفري.

Bryan Cheng, Austin Jin, Jasper Zhang2026-04-13
⚡ electrical engineering

PSIRNet: Deep Learning-based Free-breathing Rapid Acquisition Late Enhancement Imaging

تقدم هذه الورقة البحثية PSIRNet، وهي طريقة للتعلم العميق تعمل على إعادة بناء صور رنين مغناطيسي للقلب بجودة تشخيصية لتعزيز الغادولينيوم المتأخر أثناء التنفس الحر من خلال عملية استحواذ واحدة مدتها نبضتان قلبيتان، مما يحقق اختزالاً في وقت الفحص يتراوح بين 8 إلى 24 ضعفاً مع إظهار جودة صورة متفوقة أو مكافئة للطرق التقليدية المصححة للحركة.

Arda Atalik, Hui Xue, Rhodri H. Davies, Thomas A. Treibel, Daniel K. Sodickson, Michael S. Hansen, Peter Kellman2026-04-13
🤖 machine learning

R2G: A Multi-View Circuit Graph Benchmark Suite from RTL to GDSII

تقدم الورقة البحثية R2G، وهي مجموعة معيارية شاملة لتقييم رسوم الدوائر متعددة الرؤى، والتي توحد خمس تمثيلات مدركة للمراحل عبر 30 نواة ملكية فكرية مفتوحة المصدر لفصل خيارات التمثيل عن اختيار النموذج، مما يكشف أن اختيار الرؤية وعمق وحدة فك التشفير أكثر أهمية من بنية الشبكة العصبية الرسومية (GNN) لتحقيق دقة عالية في مهام التصميم الفيزيائي.

Zewei Zhou, Jiajun Zou, Jiajia Zhang, Ao Yang, Ruichao He, Haozheng Zhou, Ao Liu, Jiawei Liu, Leilei Jin, Shan Shen, Day (…)2026-04-13