🤖 machine learning

EventTSF: Event-Aware Non-Stationary Time Series Forecasting

يُعد EventTSF إطار عمل انتشار ذاتي الانحدار يعمل على تحسين التنبؤ بالسلاسل الزمنية غير المستقرة من خلال دمج البيانات النصية للأحداث عبر خطوات مطابقة التدفق الواعية بالأحداث، مما يعالج تحديات التفاعل متعدد الوسائط وصعوبة إزالة الضجيج غير المتوازنة ليتفوق بشكل كبير على النماذج المرجعية الحالية.

Yunfeng Ge, Ming Jin, Yiji Zhao, Hongyan Li, Bo Du, Chang Xu, Shirui Pan2026-05-12
🤖 machine learning

Multimodal Representation Learning Conditioned on Semantic Relations

تقترح هذه الورقة البحثية "التعلم متعدد الوسائط المشروط بالعلاقات" (RCML)، وهو إطار عمل يولد تضمينات متعددة الوسائط مدركة للسياق مشروطة بعلاقات دلالية من اللغة الطبيعية للتفوق على النماذج التقليدية غير المشروطة بالعلاقات مثل (CLIP) في مختلف مهام الاسترجاع والتصنيف.

Yang Qiao, Yuntong Hu, Bowen Zhu, Hasibul Haque, Liang Zhao2026-05-12
🤖 AI

GUARD: Guideline Upholding Test through Adaptive Role-play and Jailbreak Diagnostics for LLMs

تقدم الورقة البحثية GUARD، وهو إطار عمل للاختبار يعمل على تحويل المبادئ التوجيهية الأخلاقية الحكومية رفيعة المستوى إلى أسئلة قابلة للتنفيذ ويدمج تشخيصات كسر الحماية (jailbreak) لتقييم والتقرير بشكل منهجي عن الامتثال ومتانة السلامة للنماذج اللغوية الكبيرة والنماذج اللغوية البصرية.

Haibo Jin, Ruoxi Chen, Peiyan Zhang, Andy Zhou, Zelei Cheng, Haohan Wang2026-05-12
🤖 AI

Scam2Prompt: A Scalable Framework for Auditing Malicious Scam Endpoints in Production LLMs

تقدم الورقة البحثية Scam2Prompt، وهو إطار عمل قابل للتوسع يكشف عن ثغرة أمنية حرجة ومتفاقمة في النماذج اللغوية الكبيرة المستخدمة في الإنتاج، حيث تنجح المطالبات المؤتمتة المستمدة من مواقع الاحتيال الخبيثة في تحفيز توليد كود ضار في ما يصل إلى 47.3% من الحالات عبر نماذج متعددة، مما يجعل تدابير السلامة الحالية مثل الحواجز الوقائية وتوليد المحتوى المدعوم بالاسترجاع (RAG) غير كافية.

Zhiyang Chen, Tara Saba, Xun Deng, Xujie Si, Fan Long2026-05-12✓ Author reviewed
📊 statistics

Top-H Decoding: Adapting the Creativity and Coherence with Bounded Entropy in Text Generation

تقدم هذه الورقة البحثية "Top-H decoding"، وهي خوارزمية أخذ عينات مبتكرة تعتمد على إطار عمل لتعظيم الكتلة المقيد بالإنتروبيا، توازن بفعالية بين الإبداع والتماسك في النماذج اللغوية الكبيرة، متفوقةً بذلك على الأساليب الرائدة مثل "min-p sampling" في اختبارات الكتابة الإبداعية مع الحفاظ على المتانة في المهام الواقعية.

Erfan Baghaei Potraghloo, Seyedarmin Azizi, Souvik Kundu, Massoud Pedram2026-05-12
⚡ electrical engineering

AU-Harness: An Open-Source Toolkit for Holistic Evaluation of Audio LLMs

تقدم هذه الورقة AU-Harness، وهي مجموعة أدوات مفتوحة المصدر مصممة للتغلب على عدم الكفاءة والافتقار إلى المعايير في تقييمات النماذج اللغوية الصوتية الكبيرة (LALM) الحالية من خلال تقديم إطار عمل قابل للتوسع، أسرع بنسبة 151%، مع دعم قوي للحوار متعدد الأدوار للتقييم المنهجي والعادل للنماذج.

Hoang Nguyen, Sidharth Surapaneni, Akshay Kalkunte, Jash Mehta, Aman Tiwari, Oluwanifemi Bamgbose, Khyati Mahajan, Jash (…)2026-05-12
🤖 machine learning

RL Fine-Tuning Heals OOD Forgetting in SFT

تتحدى هذه الورقة المفهوم القائل بأن "الضبط الدقيق الخاضع للإشراف (SFT) يحفظ، بينما التعلم المعزز (RL) يعمم" من خلال إثبات، عبر تحليلات نقطة التحقق والتحليل الطيفي، أن الضبط الدقيق الخاضع للإشراف غالبًا ما يسبب نسيانًا للبيانات خارج التوزيع، وهو ما يتم استعادته لاحقًا بواسطة التعلم المعزز، وهي عملية استعادة مرتبطة بدوران المتجهات المنفردة وليس بتغيرات في القيم المنفردة.

Hangzhan Jin, Sitao Luan, Tianwei Ni, Sicheng Lyu, Guillaume Rabusseau, Reihaneh Rabbany, Doina Precup, Mohammad Hamdaqa2026-05-12
🤖 AI

Positional Encoding via Token-Aware Phase Attention

تقدم هذه الورقة البحثية "انتباه الطور المدرك للرموز" (TAPA)، وهو أسلوب جديد للترميز الموضعي يتغلب على قيود نمذجة المدى الطويل المتأصلة في (RoPE) من خلال دمج دالة طور قابلة للتعلم، مما يحقق تفوقاً في الأداء من حيث الحيرة (perplexity) والاسترجاع في سيناريوهات السياق الطويل مع حد أدنى من التدريب الإضافي.

Yu Wang, Sheng Shen, Rémi Munos, Hongyuan Zhan, Yuandong Tian2026-05-12
🤖 machine learning

GLAI: GreenLightningAI for Accelerated Training through Knowledge Decoupling

تقدم GreenLightningAI (GLAI) كتلة معمارية مبتكرة تفصل بين المعرفة الهيكلية والكمية من خلال تثبيت أنماط التنشيط المستقرة لتحسين الأوزان العددية فقط، مما يؤدي إلى تسريع التدريب بنسبة 40% تقريبًا مع الحفاظ على الدقة أو تحسينها مقارنة بالشبكات العصبية متعددة الطبقات (MLPs) التقليدية.

Jose I. Mestre, Alberto Fernández-Hernández, Cristian Pérez-Corral, Manuel F. Dolz, Jose Duato, Enrique S. Quintana-Ortí2026-05-12
🤖 AI

You Have Been LaTeXpOsEd: A Systematic Analysis of Information Leakage in Preprint Archives Using Large Language Models

تقدم هذه الورقة البحثية "LaTeXpOsEd"، وهي عملية تدقيق أمني منهجي واسعة النطاق لأكثر من 100,000 من مساهمات arXiv التي تكشف عن تسريب واسع النطاق للمعلومات في ملفات المصدر والتعليقات، بما في ذلك بيانات الاعتماد الحساسة، ومعلومات الهوية الشخصية، والمراسلات السرية، وذلك عبر الاستفادة من إطار عمل مبتكر يدمج بين مطابقة الأنماط والنماذج اللغوية الكبيرة.

Richard A. Dubniczky, Bertalan Borsos, Tamas Bisztray, Norbert Tihanyi2026-05-12