💬 NLP

Response-Based Knowledge Distillation for Multilingual Jailbreak Prevention Unwittingly Compromises Safety

تُظهر هذه الورقة أن تطبيق تقنية تقطير المعرفة القائمة على الاستجابة من نموذج معلم مملوك ومرتكز على اللغة الإنجليزية إلى نماذج طلابية مفتوحة المصدر ومتعددة اللغات يمكن أن يؤدي دون قصد إلى تقويض السلامة من خلال زيادة معدلات نجاح عمليات الاختراق (jailbreak)، لا سيال في السياقات غير الإنجليزية، وذلك بسبب فقدان الرفض الدقيق للحدود.

Max Zhang, Derek Liu, Kai Zhang, Joshua Franco, Haihao Liu2026-04-27
💬 NLP

AdaptEvolve: Improving Efficiency of Evolutionary AI Agents through Adaptive Model Selection

تقدم الورقة البحثية AdaptEvolve، وهو إطار عمل يعمل على تحسين كفاءة وكلاء الذكاء الاصطناعي التطوري من خلال الاختيار الديناميكي لأنسب نموذج لغوي كبير لكل خطوة صقل بناءً على ثقة التوليد الجوهرية، مما يقلل تكاليف الاستدلال بنسبة تقارب 38% مع الحفاظ على دقة عالية.

Pretam Ray, Pratik Prabhanjan Brahma, Zicheng Liu, Emad Barsoum2026-04-27
💬 NLP

LATMiX: Learnable Affine Transformations for Microscaling Quantization of LLMs

تقدم هذه الورقة LATMiX، وهي طريقة توظف تحويلات تآلفية عكسية قابلة للتعلم لتحسين توزيعات التنشيط من أجل التكميم المجهري (MX)، مما يحسن بشكل كبير من دقة النماذج اللغوية الكبيرة ذات البتات المنخفضة مقارنة بالأساليب القائمة على الدوران أو هادامارد.

Ofir Gordon, Lior Dikstein, Arnon Netzer, Idan Achituve, Hai Victor Habi2026-04-27
💬 NLP

Shared Lexical Task Representations Explain Behavioral Variability In LLMs

تُظهر الورقة البحثية أن حساسية التلقين في النماذج اللغوية الكبيرة يمكن تفسيرها من خلال مستويات تنشيط "رؤوس المهام المعجمية" —وهي آليات داخلية مشتركة تمثل المهمة بغض النظر عما إذا كان التلقين يستخدم تعليمات أو أمثلة— وأن تباين الأداء ينبع من مدى قوة تحفيز هذه الرؤوس أو تخفيفها بواسطة التمثيلات المتنافسة.

Zhuonan Yang, Jacob Xiaochen Li, Francisco Piedrahita Velez, Eric Todd, David Bau, Michael L. Littman, Stephen H. Bach (…)2026-04-27
💬 NLP

Source-Modality Monitoring in Vision-Language Models

تتقصى هذه الورقة البحثية "مراقبة نمط المصدر" —وهي قدرة النماذج اللغوية البصرية على تحديد ما إذا كانت المعلومات نابعة من النصوص أم الصور— لتجد أن النماذج تعتمد على كل من الإشارات النحوية والدلالية لحل مشكلة الربط هذه، مع بروز الهيمنة للإشارات الدلالية عندما تكون الأنماط متباينة للغاية.

Etha Tianze Hua, Tian Yun, Ellie Pavlick2026-04-27
💬 NLP

Lightweight Retrieval-Augmented Generation and Large Language Model-Based Modeling for Scalable Patient-Trial Matching

تقترح هذه الورقة إطار عمل خفيف الوزن لمطابقة المرضى بالتجارب السريرية بشكل قابل للتوسع، يجمع بين التوليد المعزز بالاسترجاع لاستخراج المقاطع السريرية ذات الصلة من السجلات الصحية الإلكترونية الطويلة مع النمذجة القائمة على النماذج اللغوية الكبيرة والمتنبئات خفيفة الوزن، محققاً أداءً يضاهي النهج الشامل والمكلف حاسوبياً للنماذج اللغوية الكبيرة بتكلفة أقل بكثير.

Xiaodi Li, Yang Xiao, Munhwan Lee, Konstantinos Leventakos, Young J. Juhn, David Jones, Terence T. Sio, Wei Liu, Maria V (…)2026-04-27
💬 NLP

Outcome Rewards Do Not Guarantee Verifiable or Causally Important Reasoning

توضح هذه الورقة أنه بينما يعمل التعلم المعزز من خلال المكافآت القابلة للتحقق (RLVR) على تحسين دقة المهام، فإنه لا يضمن أن استدلال النموذج هو في الواقع مهم سببيًا أو كافيًا للوصول إلى الإجابة، رغم إمكانية التخفيف من هذه المشكلة من خلال الضبط الدقيق الموجه (SFT) أو المكافآت المساعدة.

Qinan Yu, Alexa Tartaglini, Peter Hase, Carlos Guestrin, Christopher Potts2026-04-27
🤖 machine learning

PrivUn: Unveiling Latent Ripple Effects and Shallow Forgetting in Privacy Unlearning

تقدم الورقة البحثية PrivUn، وهو إطار تقييم يكشف أن أساليب نسيان النماذج اللغوية الكبيرة الحالية تعاني من "النسيان الضحل" و"تأثيرات التموج المدفوعة بالتدرج"، وتقترح استراتيجيات جديدة تتضمن الاختيار المدرك للارتباط والتدخل متعدد الطبقات لتحقيق نسيان خصوصية أكثر عمقاً ومتانة.

Xiaoyi Chen, Haoyuan Wang, Siyuan Tang, Sijia Liu, Liya Su, XiaoFeng Wang, Haixu Tang2026-04-27
🤖 AI

Spontaneous Persuasion: An Audit of Model Persuasiveness in Everyday Conversations

تقدم هذه الورقة مفهوم "الإقناع العفوي" لتدقيق كيفية استخدام النماذج اللغوية الكبيرة لاستراتيجيات إقناع غير مقصودة —تتمثل أساساً في المنطق والأدلة— خلال التفاعلات اليومية، لتجد أنه بينما تقنع النماذج اللغوية الكبيرة بشكل أكثر تكراراً وموضوعية من البشر، فإنها تعتمد على تكتيكات نفسية مختلفة عن الأساليب القائمة على التأثير الاجتماعي التي يستخدمها البشر.

Nalin Poungpeth, Nicholas Clark, Tanu Mitra2026-04-27
🤖 machine learning

PermaFrost-Attack: Stealth Pretraining Seeding(SPS) for planting Logic Landmines During LLM Training

تقدم الورقة البحثية "PermaFrost-Attack"، وهي طريقة مبتكرة لبذر التمهيد الخفي (SPS) تقوم بدمج "ألغام منطقية" كامنة في النماذج اللغوية الكبيرة عبر توزيع حمولات مسمومة صغيرة تبدو حميدة عبر الويب ليتم امتصاصها أثناء التدريب، وتقترح مجموعة من التشخيصات الهندسية للكشف عن هذه الثغرات الكامنة.

Harsh Kumar, Rahul Maity, Tanmay Joshi, Aman Chadha, Vinija Jain, Suranjana Trivedy, Amitava Das2026-04-27