🤖 machine learning

Exploration-Driven Personalized Federated Reinforcement Learning via Intrinsic Motivation

تقترح هذه الورقة إطار عمل EDPFRL-IM، وهو إطار عمل جديد للتعلم التعزيزي الاتحادي المخصص الذي يعزز الاستكشاف في بيئات المكافآت الشحيحة من خلال دمج التحفيز الجوهري (RND) لدى العملاء وتبادل ملخصات الحداثة الدنيا فقط مع الخادم، مما يؤدي إلى تحسين تخصيص السياسة وكفاءة العينات مع الحفاظ على خصوصية البيانات.

Md Rafid Islam, Rafsan Jany, Zahid Hasan, Ratun Rahman2026-08-12
💻 computer science

SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning

يُعد SafeCap إطار عمل للتعلم المعزز يعمل على تعزيز سلامة النماذج اللغوية البصرية الكبيرة ضد هجمات الاختراق عبر تدريب النماذج على توليد أوصاف صور ذات صلة بالسلامة توجه النموذج اللغوي الكبير المجمد نحو قرارات متوافقة، مما يجعله يتفوق على أساليب محاذاة السلامة الحالية مع الحفاظ على المنفعة البصرية.

Caoyuan Ma, Wenpu Liu, Weichu Xie, Tian Gu, Shilei Zhao, Lingxi Min, Shuai Dong, Yuqi Xu, Ji Zhao, Ziyue Wang, Wenzheng (…)2026-08-12
📊 statistics

Improving TensorSketch Using Complex Random Variables

تقدم هذه الورقة نوعاً جديداً من خوارزمية TensorSketch يستفيد من المتغيرات العشوائية المركبة لتحقيق حد تباين متفوق قدره 2p/D2^p/D لنواة كثيرات الحدود عالية الأبعاد، مع الحفاظ على وقت تشغيل مدخلات التناثر الفعال للطريقة الأصلية.

Amit Sharma, Mohammad Azhar Khan, Rameshwar Pratap, Keegan Kang2026-08-12
💻 computer science

Dynamic Context Adapters: Efficiently Infusing History into Vision-and-Language Models

تقدم الورقة البحثية "المُكيِّف السياقي الديناميكي" (Dynamic Context Adapter - DCA)، وهي طريقة مبتكرة تقوم بكفاءة بحقن السياق التاريخي المضغوط في نماذج الرؤية واللغة سابقة التدريب باستخدام ذاكرة ثابتة الحجم، مما يتغلب على القيود الحسابية وقيود الذاكرة الناتجة عن دمج الإطارات المباشر، مع تحسين الأداء بشكل كبير في مهام اتخاذ القرار المتسلسلة طويلة المدى.

Yuhang Song, Bor-Jiun Lin, Jiaxu Liu, Te-Chuan Chiu, Anh Nguyen, Chun-Yi Lee2026-08-12
🤖 machine learning

Coordinating the Unknown Lipschitz Constant in Multiplayer Bandits

تتناول هذه الورقة البحثية مسألة "المقامرين" (bandits) التعاونيين متعددين الوكلاء في فضاءات عمل مستمرة ذات ثوابت ليبشيتز (Lipschitz constants) مجهولة، وذلك عبر اقتراح خوارزميات تمكن اللاعبين اللامركزيين من الاتفاق بشكل مستقل على تقطيع مشترك للفعل الجماعي من خلال بنيات معلوماتية متنوعة، مما يحقق ضمانات مثلى للندم دون الحاجة إلى تواصل ما بعد التعلم.

Ricardo Parada, Chenzhang Zhao, William Chang2026-08-12
🤖 machine learning

Robust Multi-Agent Bandits with Heavy-Tailed Rewards and Information Asymmetry

تقترح هذه الورقة خوارزميات لامركزية متينة لـ "المتعدد الأذرع متعدد الوكلاء" في ظل مكافآت ذات ذيول ثقيلة وثلاثة أنظمة متميزة من عدم تماثل المعلومات، محققةً ضمانات للندم تقترب من معدلات المركزية مع التحقق من الأداء من خلال تجارب على بيئات ذات توزيع "باريتو".

Daphne Feng, Ricardo Parada, Lily Jiang, Sophia Yi, William Chang2026-08-12
💻 computer science

On Understanding, Identifying, and Mitigating Vulnerabilities in Agentic Large Language Models

تقدم هذه الورقة مراجعة منهجية للأدبيات حول أمن النماذج اللغوية الكبيرة الوكيلية، كاشفةً عن اختلال كبير حيث تهيمن أبحاث الهجوم على جهود الدفاع وتتم المبالغة في تمثيل ثغرات طبقة الإدراك مقارنة بتهديدات طبقة الإجراءات عالية المخاطر، مقترحةً في النهاية تصنيفاً رباعي الطبقات ومحددةً الاقتران المعماري كسبب جذري لعدم الأمان.

Md Jafrin Hossain, Mohammad Arif Hossain, Nirwan Ansari2026-08-12
🤖 machine learning

Measuring Semantic Abstractness of SAE Features via Nonlocality

تقدم هذه الورقة البحثية "اللا-محلية للميزات" (Feature Nonlocality - FNL)، وهي مقياس غير معتمد على التسميات (label-free) يعتمد على إنتروبيا التنشيط، والتي تقيس بفعالية التجريد الدلالي لميزات المشفّر التلقائي المتناثر (Sparse Autoencoder)، مما يتيح التمييز بين الاستدلال عالي المستوى وميزات الرموز (token features) منخفضة المستوى لتحسين التفسير الآلي والتدخلات اللاحقة مثل الحد من عمليات كسر الحماية (jailbreak mitigation) والاستدلال الرياضي.

Chuqiao Lin, Shivaji Sondhi, Xiao-Liang Qi2026-08-12
🤖 machine learning

Retrieval-Corrected Conformal Prediction for Time Series

تقدم هذه الورقة التنبؤ المطابق المصحح بالاسترجاع (RCCP)، وهو طريقة قابلة للتوسع للتقدير الكمي لعدم اليقين في السلاسل الزمنية تجمع بين استرجاع البواقي الماضية المتشابهة وتصحيح مطابق قياسي لتحقيق التغطية المستهدفة وتقليل عرض فترات التنبؤ عبر مختلف المعايك المرجعية.

Sangjin Jin, Kangmin Kim, Junhyeong Lee, Yongjae Lee2026-08-12
💻 computer science

Agentic Instruction Data Selection: Let DataMaster Interpret Your Intent

تقدم هذه الورقة DataMaster، وهو وكيل مؤتمت يفسر قصد المستخدم عبر اللغة الطبيعية لصياغة استراتيجيات اختيار بيانات تعليمات مثالية بشكل مستقل، مما يلغي الحاجة إلى التصميم اليدوي للقواعد الاستدلالية ويتفوق على النماذج المرجعية الثابتة عبر مجالات متنوعة.

Fanqi Zhou, Qiaosheng Chen, Zixian Huang, Gong Cheng2026-08-12