💻 computer science

Beyond Mortality: Advancements in Post-Mortem Iris Recognition through Data Collection and Computer-Aided Forensic Examination

تتناول هذه الورقة العوائق في التعرف على قزحية العين بعد الوفاة من خلال تقديم مجموعة بيانات جديدة واسعة النطاق للمتوفين، وتقييم أداء طرق التعرف الحالية عبر مختلف الفئات الديموغرافية، وتطوير نموذج للكشف عن صور ما بعد الوفاة كأشكال من هجمات التقديم، وإصدار أداة جنائية مفتوحة المصدر ذات ميزات قابلة للتفسير.

Rasel Ahmed Bhuiyan, Parisa Farmanifard, Renu Sharma, Andrey Kuehlkamp, Aidan Boyd, Patrick J Flynn, Kevin W Bowyer, Aru (…)2026-03-31
💻 computer science

RealBirdID: Benchmarking Bird Species Identification in the Era of MLLMs

يقدم معيار RealBirdID إطار تقييم صارم لتحديد أنواع الطيور دقيقة التفاصيل يتطلب من النماذج اللغوية الكبيرة متعددة الوسائط إما تحديد الأنواع بشكل صحيح أو الامتناع عن الإجابة مع تقديم مبررات قائمة على الأدلة في الحالات غير القابلة للإجابة، مما يكشف أن النماذج المتطورة الحالية تعاني من صعوبة في تحقيق كل من الدقة العالية والامتناع المعاير.

Logan Lawrence, Mustafa Chasmai, Rangel Daroya, Wuao Liu, Seoyun Jeong, Aaron Sun, Max Hamilton, Fabien Delattre, Oindri (…)2026-03-31
💻 computer science

VIRST: Video-Instructed Reasoning Assistant for SpatioTemporal Segmentation

يُعد VIRST إطار عمل متكاملًا يوحد بين الاستدلال العالمي للفيديو والتنبؤ بالقناع على مستوى البكسل من خلال الاندماج المكاني الزماني ومحدث مرساة ديناميكي زمني، محققًا أداءً رائدًا في تقسيم كائن الفيديو المرجعي عبر التعامل بفعالية مع تحديات الحركة المعقدة والاستدلال متعدد الخطوات.

Jihwan Hong, Jaeyoung Do2026-03-31
💬 NLP

ChartNet: A Million-Scale, High-Quality Multimodal Dataset for Robust Chart Understanding

تقدم هذه الورقة البحثية ChartNet، وهو مجموعة بيانات متعددة الوسائط عالية الجودة بمقياس المليون، تم إنشاؤها عبر مسار عمل موجه بالبرمجيات يعمل على مواءمة كود الرسم، والصور، وجداول البيانات، والملخصات، وأسئلة الاستنتاج لتعزيز قدرات فهم الرسوم البيانية والاستدلال لنماذج الرؤية واللغة بشكل كبير.

Jovana Kondic, Pengyuan Li, Dhiraj Joshi, Isaac Sanchez, Ben Wiesel, Shafiq Abedin, Amit Alfassy, Eli Schwartz, Daniel C (…)2026-03-31
💻 computer science

Structural Graph Probing of Vision-Language Models

تقدم هذه الورقة البحثية أسلوب "سبر الرسوم البيانية الهيكلية" (structural graph probing) لتحليل نماذج الرؤية واللغة عبر تمثيل الطبقات كرسوم بيانية للارتباط، مما يكشف أن مجموعة مدمجة من الخلايا العصبية المركزية المتكررة تشكل طوبولوجيا ذات معنى سلوكي تترسخ عبر مختلف الوسائط والعمق، مما يوفر مقياساً وسيطاً قابلاً للتتبع للتفسير بين العزو المحلي واستعادة الدائرة الكاملة.

Haoyu He, Yue Zhuo, Yu Zheng, Qi R. Wang2026-03-31
💻 computer science

SceneExpander: Expanding 3D Scenes with Free-Form Inserted Views

يعالج SceneExpander تحدي توسيع المشاهد ثلاثية الأبعاد من خلال إدراج مناظر حرة التشكيل عبر توظيف التكيف في وقت الاختبار على نموذج إعادة بناء بارامتري ذي تغذية أمامية، مستخدماً التقطير الذاتي للمرساة والمناظر المدرجة للحفاظ على الاتساق العالمي متعدد المناظر رغم عدم المحاذاة الهندسية والمحتوى المتخيل.

Zijian He, enjie Liu, Yihao Wang, Weizhi Zhong, Huan Yuan, Kun Gai, Guangrun Wang, Guanbin Li2026-03-31
💻 computer science

EFlow: Fast Few-Step Video Generator Training from Scratch via Efficient Solution Flow

يُعد EFlow إطار عمل مبتكر يتيح التدريب الفعال من الصفر لمولدات الفيديو ذات الخطوات القليلة عبر تقديم آلية "الانتباه المحلي-العالمي المبوّب" (Gated Local-Global Attention) لتقليل الحوسبة لكل خطوة، ووصفة تدريب "توجيه إسقاط المسار" (Path-Drop Guided training recipe) مع منظم "إضافة متوسط السرعة" (Mean-Velocity Additivity regularizer) لخفض زمن انتقال الاستدلال بشكل جذري مع الحفاظ على أداء تنافسي.

Dogyun Park, Yanyu Li, Sergey Tulyakov, Anil Kag2026-03-31
💻 computer science

SJD-VP: Speculative Jacobi Decoding with Verification Prediction for Autoregressive Image Generation

تقترح هذه الورقة البحثية طريقة SJD-VP، وهي طريقة "توصيل وتشغيل" (plug-and-play) تعمل على تسريع التوليد التلقائي للصور من خلال الاستفادة من ملاحظة أن الرموز ذات الاحتمالات المتزايدة عبر التكرارات تكون أكثر عرضة للقبول، مما يؤدي بالتالي إلى تحسين كفاءة فك التشفير التخميني وجودة الصورة.

Bingqi Shan, Baoquan Zhang, Xiaochen Qi, Xutao Li, Yunming Ye, Liqiang Nie2026-03-31
💻 computer science

The Geometry of Robustness: Optimizing Loss Landscape Curvature and Feature Manifold Alignment for Robust Finetuning of Vision-Language Models

تقترح الورقة البحثية إطار عمل GRACE، وهو إطار توحيد لضبط النماذج اللغوية الرؤية بدقة، والذي يعالج المقايضة بين دقة التوزيع الداخلي، والتعميم خارج التوزيع، والمتانة ضد الهجمات العدائية من خلال تنظيم انحناء فضاء المعلمات وثبات فضاء الميزات بشكل مشترك لتحقيق نهايات صغرى أكثر تسطحاً وتمثيلات مستقرة.

Shivang Chopra, Shaunak Halbe, Chengyue Huan, Brisa Maneechotesuwan, Zsolt Kira2026-03-31
💻 computer science

DiffSoup: Direct Differentiable Rasterization of Triangle Soup for Extreme Radiance Field Simplification

يقدم DiffSoup تمثيلاً جديداً لمجال الإشعاع باستخدام مجموعة صغيرة من المثلثات ذات الأنسجة العصبية والشفافية الثنائية، وهو تمثيل قابل للتفاضل مباشرة عبر القناع العشوائي لتمكين التدريب المستقر والرندرة السلسة في الوقت الفعلي على الأجهزة الاستهلاكية من خلال خطوط معالجة الرسوميات القياسية.

Kenji Tojo, Bernd Bickel, Nobuyuki Umetani2026-03-31