🤖 machine learning

Variational Speculative Decoding: Rethinking Draft Training from Token Likelihood to Sequence Acceptance

تقدم هذه الورقة البحثية "فك التشفير الطيفي التبايني" (Variational Speculative Decoding - VSD)، وهو إطار عمل مبتكر يعيد صياغة تدريب المسودة كاستدلال تبايني لتعظيم قبول تسلسل النموذج المستهدف، محققاً بذلك تسريعاً كبيراً في عملية الاستنتاج مقارنة بالطرق الحالية من خلال معالجة التفاوت بين التدريب وفك التشفير عبر إجراء "توقع-تعظيم" (Expectation-Maximization) مع أوزان تنظيمية وتكيفية.

Xiandong Zou, Jianshu Li, Jing Huang, Pan Zhou2026-08-13
⚛️ quantum physics

Learning to Coordinate via Quantum Entanglement in Multi-Agent Reinforcement Learning

تقدم هذه الورقة إطار عمل مبتكر لتعلم التعزيز متعدد الوكلاء يتيح للوكلاء التنسيق عبر التشابك الكمي المشترك، مبرهنةً من خلال كل من الألعاب ذات الصندوق الأسود ونماذج عمليات ماركوف لاتخاذ القرار تحت عدم اليقين الجزئي (Dec-POMDPs) أن هذا النهج يمكنه تحقيق أداء تنسيقي متفوق لا يمكن بلوغه عبر العشوائية المشتركة الكلاسيكية وحدها.

John Gardiner, Orlando Romero, Brendan Tivnan, Nicolò Dal Fabbro, George J. Pappas2026-08-13
🤖 machine learning

TMRL: Diffusion Timestep-Modulated Pretraining Enables Exploration for Efficient Policy Finetuning

تقدم هذه الورقة البحثية إطار عمل TMRL، وهو إطار موحد يربط بين الاستنساخ السلوكي والتعلم التعزيزي من خلال استخدام "الما قبل التدريب الممهد بالسياق" لحقن ضجيج الانتشار من أجل تغطية واسعة للأفعال، و"التعلم التعزيزي المعدل بالخطوات الزمنية" للتحكم ديناميكياً في الاستكشاف، مما يحسن كفاءة العينات بشكل كبير ويمكّن من الضبط الدقيق الناجح لسياسة الروبوت في العالم الحقيقي في أقل من ساعة واحدة.

Matthew M. Hong, Jesse Zhang, Anusha Nagabandi, Abhishek Gupta2026-08-13
💬 NLP

RedditPersona: A Modular Framework for Community-Conditioned LLM Adaptation from Reddit

تقدم الورقة البحثية RedditPersona، وهو إطار عمل معياري يوحد عمليات جمع البيانات، وتوصيف المستخدمين، والتقييم من أجل تكييف النماذج اللغوية الكبيرة مع المجتمعات المشروطة، حيث أثبتت من خلال تجارب على 112 من مجتمعات "ريديت" (subreddits) المتعلقة بالرفاهية الحضرية أن قابلية تحديد الهوية السلوكية تتوافق مع الاتفاق بين الاستراتيجية والمجتمع، بينما تكشف عن مقايضة ثابتة بين قابلية تحديد الهوية والتشابه التوزيعي للنصوص.

Amirhossein Ghaffari, Ali Goodarzi, Huong Nguyen, Simo Hosio, Lauri Lovén, Ekaterina Gilman2026-08-13
⚡ electrical engineering

Cloud-Boosted Low-Compute Multi-Channel Speech Enhancement

تقترح هذه الورقة إطار عمل تعاوني بين السحابة والحافة يعزز تحسين الكلام متعدد القنوات منخفض الحوسبة على الأجهزة القابلة للارتداء من خلال دمج مخرجات الخادم المتأخرة، وتعزيز الميزات على مستوى الطبقات، ومرشح وينر التعاوني متعدد القنوات لتحسين الأداء بشكل كبير مع حد أدنى من العبء الحسابي.

Xulin Fan, Juan Azcarreta, Ashutosh Pandey, Jesus Alvarez, Ke Tan, Jacob Donley, Ritwik Giri, Buye Xu2026-08-13
🤖 AI

MaSRead: Content-Addressed Reading of Replicated Latent Stores

تُمكِّن تقنية MasRead الوكلاء المستقلين من استرجاع أجزاء محددة بشكل موثوق من مخزن كامن مكرر خالٍ من التعارض عبر توجيه الاستعلامات من خلال مجموعات وسوم مشتقة من المحتوى وفك تشفير الأجزاء المختارة تحت قناع انتباه صارم، مما يتغلب على مشكلات التداخل الناتجة عن التوضع المشترك ويسمح بالقراءة الموجهة بالمحتوى وقابلة للتوسع بغض النظر عن حجم المخزن أو ترتيب التسليم.

Carlos Baquero, Luís Brito, João Resende2026-08-13
🤖 AI

From Monolithic to Modular: Segment-level Automatic Prompt Optimization

تقدم هذه الورقة SAPO، وهي طريقة تحسين تلقائي للمطالبات على مستوى القطع تعمل على تفكيك المطالبات إلى مكونات متميزة لاستهداف نقاط ضعف محددة، وتتفوق على النهج الموحدة الحالية عبر مختلف المعايير.

Nikita Kulin, Viktor Zhuravlev, Artur Khairullin, Sergey Muravyov, Ilya Makarov, Daniil Sukhorukov, Ekaterina Averkova2026-08-13
🤖 AI

Forecasting Side Effects of Activation Steering

تُثبت هذه الورقة أنه بينما يتسبب توجيه التنشيط في النماذج اللغوية في كثير من الأحيان في آثار جانبية غير مقصودة وهيكلية وغير متماثلة على سلوكيات أخرى، إلا أنه يمكن التنبؤ بهذه الآثار بدقة قبل التطبيق من خلال تحليل تمثيلات النموذج غير الموجهة، مما يتيح التدقيق الاستباقي للسلامة والنشر الأكثر أماناً.

Chong Yong Ong, Alson Wei Jie Sim, Peixin Zhang, Jun Sun2026-08-13
🤖 AI

The Off-Support Barrier: Why Semantic Safety Constraints Are Not Learning-Problem Invariants, and What Follows for Prior Design, Containment, and Verification

تجادل هذه الورقة بأن قيود السلامة الدلالية هي كائنات "خارج نطاق الدعم" (off-support) تقع خارج ثبات نظرية التعلم المنفرد، مما يفسر حدود اختراق المكافأة والحد من الآثار بناءً على المعرفة المسبقة، وتدعو في الوقت ذاته إلى نهج هجين يجمع بين التحقق الرسمي للثوابت الصارمة في هيكل النظام وبين الاستعدادات اللينة داخل النموذج.

Yoshinori Watanabe2026-08-13
🤖 AI

Towards Sustainable Learning in Online Education: A Reinforcement Learning Approach

تقدم هذه الورقة البحثية AI-Tutor، وهو نموذج قائم على التعلم التعزيزي يعمل على تحسين كل من اكتساب المعرفة على المدى القصير والمشاركة طويلة الأمد للمتعلم ليتفوق على النماذج المرجعية المتطورة في مجال التعليم عبر الإنترنت المخصص، كما أظهرت التقييمات التجريبية على 23 مليون سجل تعليمي.

Chaofan Zhai, Yicheng Song, Ravi Bapna, Junyao Ye2026-08-13