💻 computer science

Gaze-to-text Generation: Beyond Categorical Decoding of Human Attention

تقدم هذه الورقة Gazette، وهو إطار عمل مبتكر يسخر النماذج اللغوية الكبيرة متعددة الوسائط ونصوص "التفكير بصوت عالٍ" الاصطناعية لفك تشفير مسارات حركة العين البشرية إلى أوصاف لغوية طبيعية وحرة للأهداف، متجاوزاً بذلك فك التشفير الفئوي التقليدي لالتقاط الفروق الدقيقة المفتوحة للنوايا البشرية.

Sounak Mondal, Dimitris Samaras, Gregory Zelinsky, Minh Hoai2026-07-28
💻 computer science

Development of Vision-Language Model-based GNSS Spoofing Detection for Autonomous Vehicle Navigation

تقدم هذه الورقة أول إطار عمل قائم على نماذج الرؤية واللغة للكشف عن هجمات تزييف نظام الملاحة العالمي (GNSS) في المركبات ذاتية القيادة من خلال دمج البيانات المرئية وبيانات الاستشعار عبر عملية ضبط دقيق مكونة من ثلاث مراحل، محققةً درجات F1 تتراوح بين 94-95% على مجموعة بيانات جديدة من الواقع مع تقليل العبء الحسابي بشكل كبير عبر سياسة استدلال تكيفية.

Mohammed Aldeen, Muhammad Sami Irfan, Sagar Dasgupta, Long Cheng, Mizanur Rahman, Mashrur Chowdhury2026-07-28
💻 computer science

Low-light Image Enhancement via Multi-scale Attention combined with Fourier Transform

تقترح هذه الورقة البحثية نموذج MSFT، وهو شبكة تعلم عميق أحادية المرحلة وخاضعة للإشراف تدمج الانتباه متعدد المقاييس مع دمج سعة تحويل فوريه لتعزيز تفاصيل الأنسجة والسياق العالمي بفعالية في الصور ذات الإضاءة المنخفضة، محققةً أداءً هو الأفضل في فئته عبر مجموعات بيانات مرجعية متعددة.

Wenbin Du, Jian Long, Zhu Cao2026-07-28
💬 NLP

Bigger or Cheaper? Scale and Quantization Effects on Uncertainty Signals in Vision-Language Models Under Image Degradation

تُثبت هذه الورقة أنه بالنسبة لنماذج الرؤية واللغة التي تعمل ضمن ميزانية ذاكرة ثابتة، فإن اختيار نموذج مكمّم أكبر حجماً على نموذج أصغر بدقة كاملة هو الخيار الأمثل لأن الحجم يحسن بشكل كبير من الكشف عن عدم اليقين الداخلي بينما يحافظ التكميم على الدقة، رغم تدهور إشارات الثقة اللفظية.

M M Asif Ferdous2026-07-28
🔭 astrophysics

A Modern ConvNet for Solar Filament Detection

تقدم هذه الورقة نموذج التعلم العميق MORDEN، المدعوم بمجموعة بيانات MHAS المشروحة حديثاً وتقنيات ما بعد المعالجة مثل DenseCRF وDBSCAN، لتوليد مجموعة بيانات AHAS عالية الجودة وتحقيق أداء رائد في الكشف الآلي عن الخيوط الشمسية.

J. R. Hu, Q. Hao, Z. Zheng, P. F. Chen, C. Li, Y. Meng2026-07-28
💬 NLP

Evidence Attribution in Visual Document Understanding without Coordinates or Region Labels

تُثبت هذه الورقة أن استبدال مخرجات الصناديق المحيطة القائمة على الإحداثيات بواجهة نصية تعتمد على "الاقتباس والاسترجاع" يقلل بشكل كبير من هلوسة الإسناد ويحسن استدعاء الأدلة في فهم المستندات المرئية، مع تمكين التدريب الفعال أيضاً دون الحاجة إلى تسميات مكلفة على مستوى المنطقة.

Zhuchenyang Liu, Yao Zhang, Yu Xiao2026-07-28
🤖 machine learning

MMOE: Modernizing Diffusion Transformers with Efficient Expert Design

تقدم الورقة البحثية ModernMOE (MMOE)، وهي بنية محوّلة انتشار حديثة (modernized diffusion transformer architecture) تطوع مبادئ توسيع النماذج اللغوية الكبيرة (LLM) الفعالة — مثل الخبراء الموجهين (routed experts)، والخبراء المشتركين خفيفي الوزن (shared lightweight experts)، والتوجيه المتبقي (residual routing) — لتحقيق تقارب أسرع وتوازن فائق بين الجودة والتكلفة في توليد المحتوى الناتج عن الذكاء الاصطناًعي التوليدي (AIGC) مقارنة بالنماذج الكثيفة والأساسية المتفرقة التقليدية، وكل ذلك ضمن ميزانية تدريب متاحة على جهاز واحد.

Yanhao Jia, Jiepeng Wang, Haibin Huang, Chi Zhang, Erik Cambria, Xuelong Li2026-07-28
🤖 machine learning

Co-Learning for Missing Arbitrary Modalities in Multi-modal Classification

تقدم هذه الورقة إطار عمل للتعلم المشترك متعدد الوسائط مصمم للتعامل مع فقدان أي وسائط عشوائية في مهام التصنيف من خلال إعطاء الأولوية للتعاون بين الوسائط على الدمج، مقدمةً نهجين متكاملين يظهران مكاسب ملحوظة في المتانة عبر درجات متفاوتة من غياب الوسائط.

Francisco Mena, Dino Ienco, Roberto Interdonato, Cassio F. Dantas, Simon Besnard2026-07-28
🤖 machine learning

Rethinking Classifier-Free Guidance in On-Policy Diffusion Distillation

تحدد هذه الورقة نمط فشل يُسمى "عدم التماثل في الفرع السالب" (Negative Branch Asymmetry) في عملية تقطير الانتشار داخل السياسة (on-policy diffusion distillation) تحت توجيه خالي من المصنف (classifier-free guidance)، حيث يتسبب مطابقة السرعة الساذجة في أخطاء فرعية متضادة، وتقترح "مطابقة الاتجاه الإيجابي" (Positive-Direction Matching) كهدف مدرك للفرع لتمكين نقل المعرفة القوي.

Bingnan Li, Haozhe Wang, Haozhong Xiong, Fangtai Wu, Jinpeng Yu, Yang Shi, Jiaming Liu, Ruihua Huang2026-07-28
💻 computer science

TDiR: Transformer based Diffusion for Image Restoration Tasks

تقدم هذه الورقة البحثية نموذج TDiR، وهو نموذج انتشار قائم على المحولات (transformer) يتفوق على 18 تقنية من أحدث التقنيات في خمس معايلات في مجالات تحسين الصور تحت الماء، وإزالة الضجيج، وإزالة المطر، مما يعمل بفعالية على استعادة جودة الصور المتدهورة للمهام اللاحقة.

Abbas Anwar, Ibrahim Radwan, Ali Arshad Nasir, Mudassir Masood, Saeed Anwar2026-07-27