💻 computer science

Learning Adaptive Pseudo-Label Selection for Semi-Supervised 3D Object Detection

تقترح هذه الورقة إطار عمل جديد للكشف عن الأجسام ثلاثية الأبعاد بنظام التعلم شبه المُشرف، والذي يستخدم وحدة تسمية مستعارة قابلة للتعلم لاختيار التسميات المستعارة عالية الجودة بشكل تكيفي عبر دمج الدرجات وتحديد عتبات مدركة للسياق، مما يتغلب على قيود طرق العتبة اليدوية أو الثابتة.

Taehun Kong, Tae-Kyun Kim2026-04-06
🤖 AI

SAGA: Source Attribution of Generative AI Videos

تقدم الورقة البحثية SAGA، وهو إطار عمل مبتكر يستفيد من استراتيجية "الPretrain-and-Attribute" (التعلم المسبق والنسب) الموفرة للبيانات وبصمات الانتباه الزمني (Temporal Attention Signatures) لتحقيق أفضل النتائج في نسبة المصدر متعددة الحبيبات لفيديوهات الذكاء الاصطناعي التوليدي، وتحديد نماذج ومطورين محددين بأقل قدر من البيانات المصنفة مع توفير رؤى جنائية قابلة للتفسير.

Rohit Kundu, Vishal Mohanty, Hao Xiong, Shan Jia, Athula Balachandran, Amit K. Roy-Chowdhury2026-04-06
🤖 AI

DePT3R: Joint Dense Point Tracking and 3D Reconstruction of Dynamic Scenes in a Single Forward Pass

يُعد DePT3R إطار عمل مبتكر يقوم بتتبع النقاط الكثيفة وإعادة البناء ثلاثي الأبعاد للمشاهد الديناميكية من صور متعددة في تمريرة أمامية واحدة دون الحاجة إلى أوضاع الكاميرا، محققاً قدرة فائقة على التكيف وكفاءة في الذاكرة مقارنة بالطرق الحالية.

Vivek Alumootil, Tuan-Anh Vu2026-04-06
🤖 machine learning

Reward-Forcing: Autoregressive Video Generation with Reward Feedback

تقدم هذه الورقة البحثية "التحفيز بالمكافأة" (Reward-Forcing)، وهي طريقة لتوليد الفيديو ذاتية الانحدار تستخدم إشارات المكافأة لتوجيه عملية التدريب، مما يتيح مخرجات عالية الدقة ومتسقة زمنياً تضاهي أو تتفوق على النماذج ثنائية الاتجاه دون الاعتماد على بنيات معلمة تقييدية.

Jingran Zhang, Ning Li, Yuanhao Ban, Andrew Bai, Justin Cui2026-04-06
🤖 machine learning

Parameter-Efficient Fine-Tuning of DINOv2 for Large-Scale Font Classification

تقدم هذه الورقة البحثية GoogleFontsBench، وهو أول معيار مرجعي عام لخطوط الويب مفتوحة المصدر يتميز بمجموعة بيانات اصطناعية واسعة النطاق ومقياس تقييم مرجح بالشدة، مما يثبت أن الضبط الدقيق لنموذج DINOv2 باستخدام تقنية LoRA الموفرة للمعلمات يحقق دقة تصل إلى 99.0% مع تدريب 1% فقط من معلمات النموذج.

Daniel Chen, Zaria Zinn, Marcus Lowe2026-04-06
🤖 machine learning

LiME: Lightweight Mixture of Experts for Efficient Multimodal Multi-task Learning

يُعدُّ LiME إطار عمل خفيف الوزن لخليط الخبراء (Mixture of Experts) من أجل تعلم متعدد الوسائط ومتعدد المهام بكفاءة، حيث يحقق تخصص الخبراء من خلال تعديل المخرجات والتوجيه صفري المعلمات، مما يقلل بشكل كبير من المعلمات القابلة للتدريب ووقت التدريب مع الحفاظ على أداء تنافسي عبر 47 مهمة متنوعة.

Md Kowsher, Haris Mansoor, Nusrat Jahan Prottasha, Ozlem Garibay, Victor Zhu, Zhengping Ji, Chen Chen2026-04-06
🤖 AI

Internalized Reasoning for Long-Context Visual Document Understanding

تقدم هذه الورقة البحثية مساراً لبيانات اصطناعية يقوم بتوليد واستيعاب آثار الاستدلال لفهم الوثائق المرئية ذات السياق الطويل عبر دمج النماذج منخفض القوة، مما يمكّن النماذج الأصغر مثل Qwen3 VL 32B من التفوق بشكل كبير على نظيراتها الأكبر حجماً مع تقليل استخدام الرموز المخرجة بشكل جذري.

Austin Veselka2026-04-06
🤖 AI

LumiVideo: An Intelligent Agentic System for Video Color Grading

إن LumiVideo هو نظام وكيل ذكي يحاكي سير العمل المعرفي لخبراء تلوين الألوان المحترفين لتوليد تدرجات لونية سينمائية ذاتياً من لقطات (log) الخام، وذلك عبر دمج استدلال النماذج اللغوية الكبيرة (LLM) مع التوليد المعزز بالاسترجاع (RAG)، ليخرج بتكوينات ASC-CDL و3D LUT متوافقة مع المعايير الصناعية لضمان نتائج قابلة للتفسير، ومتسقة زمنياً، وقابلة للتحكم التكراري.

Yuchen Guo, Junli Gong, Hongmin Cai, Yiu-ming Cheung, Weifeng Su2026-04-06
⚡ electrical engineering

Managing Diabetic Retinopathy with Deep Learning: A Data Centric Overview

تقدم هذه الورقة مراجعة شاملة وتحليلاً مقارناً لمجموعات بيانات صور قاع العين لإدارة اعتلال الشبكية السكري، حيث تقيم قابليتها للاستخدام عبر مهام سريرية متنوعة، وتحدد الفجوات الحرجة مثل عدم اتساق التوصيفات ومحدودية التنوع، وتقدم توصيات لتطوير مجموعات بيانات أكثر قوة ومعيارية لدعم حلول التعلم العميق الموثوقة.

Shramana Dey, Zahir Khan, T. A. PramodKumar, B. Uma Shankar, Ashis K. Dhara, Ramachandran Rajalakshmi, Rajiv Raman, Sush (…)2026-04-06
🤖 AI

Generating Satellite Imagery Data for Wildfire Detection through Mask-Conditioned Generative AI

تُثبت هذه الورقة أن نموذج التأسيس القائم على الانتشار، EarthSynth، يمكنه بفعالية تخليق صور أقمار صناعية واقعية لما بعد حرائق الغابات من خلال التكييف مع أقنعة الحرق عبر مسار معالجة لإعادة الرسم (inpainting)، مما يعالج ندرة البيانات المصنفة لأنظمة الكشف عن حرائق الغابات القائمة على التعلم العميق.

Valeria Martin, K. Brent Venable, Derek Morgan2026-04-06