🤖 machine learning

Minimizing Collateral Damage in Activation Steering

تقدم هذه الورقة إطاراً منهجياً لتقليل الأضرار الجانبية في توجيه التنشيط من خلال صياغته كمسألة تحسين مقيدة تأخذ في الاعتبار التكاليف غير الموحدة للاضطرابات عبر اتجاهات الميزات باستخدام مصفوفة العزم الثاني التجريبية للتنشيطات.

Tam Nguyen, Tu Anh Nguyen, Sina Alemohammad, Richard G. Baraniuk2026-05-05
🤖 machine learning

A Theory of Generalization in Deep Learning

تقدم هذه الورقة نظرية غير تقاربية لتعميم التعلم العميق بناءً على تقسيم نواتج فضاء المخرجات بواسطة نواتج التانغنت العصبية التجريبية، والتي تفسر ظواهر مثل الإفراط الحميد في التخصيص والتدقيق (grokking)، مع تقديم مسبق شرطة عملي يعتمد على نسبة الإشارة إلى الضجيج (SNR) يعمل على تسريع التدريب وكبح الحفظ دون الحاجة إلى بيانات التحقق.

Elon Litman, Gabe Guo2026-05-05
🤖 machine learning

Focus and Dilution: The Multi-stage Learning Process of Attention

تكشف هذه الورقة عن دورة تكرارية من تخفيف التركيز في ديناميكيات تدريب نماذج المحولات (Transformer)، مما يفسر كيف يتقدم تعلم الانتباه على البيانات الماركوفية عبر مراحل متميزة من تكثيف الرتبة، والتركيز المدفوع بالتردد، وإعادة توزيع الكتلة، وكسر التماثل لبدء دورات تعلم لاحقة.

Zheng-An Chen, Pengxiao Lin, Zhi-Qin John Xu, Tao Luo2026-05-05
🤖 machine learning

Local Hessian Spectral Filtering for Robust Intrinsic Dimension Estimation

تقدم هذه الورقة البحثية البعد الطيفي لهسيان الموضع (LHSD)، وهي طريقة قابلة للتوسع تعمل على تقدير البعد الجوهري الموضعي بمتانة في الفضاءات عالية الأبعاد من خلال تطبيق تصفية طيفية على هسيان كثافة اللوغاريتم للتمييز بين الاتجاهات المماسية والضجيج، مما يتيح الكشف الفعال عن الحفظ في نماذج الانتشار واسعة النطاق.

Genki Osada2026-05-05
🤖 machine learning

Arbitrarily Conditioned Hierarchical Flows for Spatiotemporal Events

تقدم هذه الورقة البحثية تدفقات هرمية مشروطة تعسفياً (ARCH)، وهو إطار عمل للتدفق الهرمي يتغلب على قيود نماذج العمليات النقطية ذات الترتيب الذاتي الحالية من خلال تمكين التكييف المرن مع الأحداث المرصودة التعسفية لتوحيد وتحسين الأداء عبر مهام التنبؤ المكاني الزماني، والاستدلال العكسي، واستعادة المسار.

Keyan Chen, Qiwei Yuan, Zhitong Xu, Bin Shen, Shandian Zhe2026-05-05
🤖 machine learning

Attention Sinks in Massively Multilingual Neural Machine Translation:Discovery, Analysis, and Mitigation

تحدد هذه الورقة وتخفف من أثر "مصب الانتباه" (attention sink) المنهجي في نماذج الترجمة الآلية العصبية متعددة اللغات، حيث تمتص الرموز غير المحتوية على محتوى كتلة الانتباه المتقاطع بشكل غير متناسب، وذلك عبر تقديم منهجية تصفية تكشف عن أنماط لغوية كانت محجوبة سابقاً وتحسن بشكل كبير من موثوقية تحليلات التفسير القائمة على الانتباه.

Hillary Mutisya, John Mugane2026-05-05
🤖 machine learning

CombinationTS: A Modular Framework for Understanding Time-Series Forecasting Models

تقدم الورقة البحثية CombinationTS، وهو إطار احتمالي معياري يعمل على تفكيك نماذج التنبؤ بالسلاسل الزمنية ليكشف أن تضمينات البيانات وتحويلات المدخلات المصممة جيداً غالباً ما تحقق أداءً واستقراراً متفوقين مقارنة بهياكل المشفرات المعقدة، مما يتحدى ضرورة زيادة تعقيد النموذج.

Xiaorui Wang, Fanda Fan, Chenxi Wang, Yuxuan Yang, Rui Tang, Kuoyu Gao, Simiao Pang, Yuanfeng Shang, Zhipeng Liu, Wanlin (…)2026-05-05
🤖 machine learning

Rhamba: Region-Aware Hybrid Attention-Mamba Framework for Self-Supervised Learning in Resting-State fMRI

يُعد Rhamba إطار عمل مبتكر للتدريب المسبق ذاتي الإشراف لصور الرنين المغناطيسي الوظيفي في حالة الراحة، حيث يدمج بين الحجب الموجه تشريحيًا وبنيات Attention-Mamba الهجينة لتحقيق أداء فائق في تصنيف الفصام واضطراب نقص الانتباه مع فرط النشاط (ADHD) مع تحقيق التوازن بين القابلية للتفسير وقابلية التوسع.

Ruthwik Reddy Doodipala, Pankaj Pandey, Pratheek Eranki, Carolina Torres-Rojas, Manob Jyoti Saikia, Ranganatha Sitaram2026-05-05
🤖 machine learning

S^3-R1: Learning to Retrieve and Answer Step-by-Step with Synthetic Data

يُعد S^3-R1 إطار عمل يعزز التعلم المعزز للإجابة على الأسئلة القائمة على البحث من خلال الجمع بين مسار بيانات اصطناعية لتوليد أسئلة متعددة الخطوات متوسطة الصعوبة وبين هيكل مكافأة كثيف يقيم جودة البحث وصحة الإجابة النهائية، مما يؤدي إلى تحسين التعميم واستراتيجيات البحث.

Harsh Goel, Akhil Udathu, Susmija Jabireddy, Pradnesh Kalkar, Atharva Parulekar2026-05-05
🤖 machine learning

New Bounds for Kernel Sums via Fast Spherical Embeddings

تقدم هذه الورقة نظرية تضمين كروي سريعة جديدة لإرساء حدود زمن استعلام محسنة قدرها O~(d+εΔ2+1/ε3)\tilde O(d+\varepsilon\Delta^2+1/\varepsilon^3) لتقدير متوسطات نواة غاوس، متفوقة بذلك على النتائج السابقة في النطاقات ذات الخطأ الصغير وقطر البيانات المتوسط.

Tal Wagner2026-05-05