💬 NLP

Where Does Toxicity Live? Mechanistic Localization and Targeted Suppression in Language Models

تقدم هذه الورقة Meow2X وTRNE، وهما إطاران عمل لا يتطلبان إعادة التدريب يعملان على تحديد موقع السمية في طبقات MLP المبكرة لبعض النماذج اللغوية عبر تحليل التنشيط، وكبحها من خلال التوسع أثناء الاستدلال أو تعديلات طفيفة في الأوزان، مما يحقق تحسينات مستمرة في السلامة دون المساس بجودة اللغة.

Himanshu Beniwal, Mayank Singh2026-05-28
🤖 machine learning

Learning Compositional Latent Structure with Vector Networks

تقدم هذه الورقة الشبكات المتجهية (VN)، وهي بنية متكررة هرمية تستبدل مصفوفات الأوزان الثابتة بمكتبات من ذرات الأوزان القابلة لإعادة الاستخدام من الرتبة 1 لتمكين تكوين أوزان متفرقة ومحددة للمدخلات، مما يحقق تحسناً كبيراً في التعميم خارج نطاق التوزيع في المهام التركيبية مقارنة بالشبكات العميقة القياسية.

Niclas Pokel, Benjamin F. Grewe2026-05-28
🤖 AI

Zipping the Thought: When and How Compressed Reasoning Data Works in LLM Post-Training

تقدم هذه الورقة تصنيفاً لسلاسل التفكير المضغوطة (الصريحة، والمؤلفة، والضمنية)، وتثبت من خلال تجارب منضبطة أنه بينما يتطلب الاستنتاج الأكثر خشونة المزيد من البيانات ويظهر سلوكيات تميز وتذكر مختلفة، فإن التعلم المعزز اللاحق باستخدام مكافآت قابلة للتحقق يمكن أن يفكك بفعالية هذه الخطوات المضغوطة التي تم تعلمها أثناء الضبط الدقيق الخاضع للإشراف.

Kohsei Matsutani, Gouki Minegishi, Takeshi Kojima, Yusuke Iwasawa, Yutaka Matsuo2026-05-28
💬 NLP

MemGuard: Preventing Memory Contamination in Long-Term Memory-Augmented Large Language Models

يُعد MemGuard إطار عمل للذاكرة مدركاً للأنواع يمنع تلوث الذاكرة غير المتجانس في النماذج اللغوية الكبيرة المعززة بالذاكرة طويلة الأمد من خلال تعيين أدوار وظيفية صريحة للذكريات وتكوين الأدلة بشكل انتقائي، مما يحسن الموثوقية وكفاءة الاسترجاع بشكل كبير.

Hyeonjeong Ha, Jeonghwan Kim, Cheng Qian, Jiayu Liu, William M. Campbell, Yue Wu, Yuji Zhang, Kathleen McKeown, Dilek Ha (…)2026-05-28
💬 NLP

ROSD: Reflective On-Policy Self-Distillation for Language Model Reasoning across Domains

تقدم هذه الورقة البحثية إطار عمل "التقطير الذاتي الانعكاسي داخل السياسة" (ROSD)، وهو إطار يعزز قدرة النماذج اللغوية على الاستنتاج عبر مختلف المجالات باستخدام عاكس ذاتي لتحديد مواضع الأخطاء وتوجيه عملية تقطير مستهدفة ومحددة للأخطاء، مما يتغلب على قيود الإفراط في التخصيص وضعف التعميم التي تعاني منها أساليب التقطير الذاتي الحالية داخل السياسة.

Ziqi Zhao, Xinyu Ma, Liu Yang, Yujie Feng, Daiting Shi, Jingzhou He, Xin Xin, Zhaochun Ren, Xiao-Ming Wu2026-05-28
🤖 machine learning

AOE: Exhaustive Out-of-Distribution Detection via Recalibrating Outlier Labels

تقترح هذه الورقة طريقة "التعرض للقيم المتطرفة بالثقة التكيفية" (AOE)، وهي طريقة جديدة للكشف عن البيانات خارج التوزيع، تعمل على تحسين النهج الحالية باستخدام قياس درجة الحرارة لتوليد تسميات ناعمة تكيفية للقيم المتطرفة، مما يحافظ على العلاقات الدلالية مع فئات البيانات داخل التوزيع مع توسيع هامش القرار بفعالية لكبح التنبؤات مفرطة الثقة.

Fengqiang Wan, Qing-Yuan Jiang, Yang Yang2026-05-28
🤖 machine learning

SPARD: Defending Harmful Fine-Tuning Attack via Safety Projection with Relevance-Diversity Data Selection

تقترح الورقة البحثية إطار عمل SPARD، وهو إطار دفاعي يجمع بين التحسين التناوبي المسقط على السلامة (Safety-Projected Alternating optimization) واختيار البيانات القائم على الوعي بالارتباط والتنوع (Relevance-Diversity aware data selection) للتخفيف بفعالية من هجمات الضبط الدقيق الضارة مع الحفاظ على أداء المهمة.

Shuhao Chen, Weisen Jiang, Yeqi Gong, Shengda Luo, Chengxiang Zhuo, Zang Li, James T. Kwok, Yu Zhang2026-05-28
🤖 machine learning

On the Learnability of Test-Time Adaptation: A Recovery Complexity Perspective

تضع هذه الورقة البحثية أول إطار نظري للتكيف في وقت الاختبار (TTA) من خلال تقديم تعقيد الاسترداد (ϵ,δ)(\epsilon,\delta) وقابلية تعلم التكيف في وقت الاختبار (ϵ,ρ)(\epsilon,\rho) لتوصيف الحدود الجوهرية، والمقايضات بين القدرة على التكيف والمعلومات، والموثوقية طويلة الأمد لتكييف النماذج مع تدفقات الاختبار غير المستقرة.

Zhi Zhou, Ming Yang, Shi-Yu Tian, Kun-Yang Yu, Lan-Zhe Guo, Yu-Feng Li2026-05-28
🤖 machine learning

PINE: Pruning Boosted Tree Ensembles with Conformal In-Distribution Prediction Equivalence

تقدم الورقة البحثية PINE، وهي طريقة تقليم مبتكرة لمجموعات الأشجار (tree ensembles)، والتي تستفيد من المعايرة المطابقة (conformal calibration) لضمان تكافؤ التنبؤ ضمن منطقة محكومة داخل التوزيع، محققةً نسب ضغط أعلى بنسبة تصل إلى 30% مقارنة بتقنيات التقليم الأمينة الحالية مع الحفاظ على دقة تنبؤ مماثلة.

Haruki Yajima, Yusuke Matsui2026-05-28
🤖 machine learning

Measure-to-measure Regression with Transformers

تقدم هذه الورقة صياغة رسمية للانحدار غير الخطي من مقياس إلى مقياس، وتقترح نهجين قائمين على المحولات (transformer) وقابلين للتوسع —الخرائط الساكنة وحقول السرعة الديناميكية— لتعلم التحويلات بين التوزيعات الاحتمالية، مما يثبت فعاليتها في التنبؤ بالتطور السكاني عبر مجموعات بيانات اصطناعية وفيزيائية وبيولوجية.

Matthew Vandergrift, Martha White, Yury Polyanskiy, Philippe Rigollet, Lazar Atanackovic2026-05-28