💬 NLP

Stop the Flip-Flop: Context-Preserving Verification for Fast Revocable Diffusion Decoding

تقدم هذه الورقة COVER، وهي طريقة تحقق حافظة للسياق تقضي على تذبذبات الـ flip-flop في فك التشفير الانتشاري سريع الإلغاء من خلال استخدام تجاوزات ذاكرة التخزين المؤقت لـ KV وآلية تسجيل تعتمد على الاستقرار لتمكين توليد الرموز المتوازي عالي الجودة والكفء.

Yanzheng Xiang, Lan Wei, Yizhen Yao, Qinglin Zhu, Hanqi Yan, Chen Jin, Philip Alexander Teare, Dandan Zhang, Lin Gui, Am (…)2026-06-01
💬 NLP

A Behavioural and Representational Evaluation of Goal-Directedness in Language Model Agents

تقترح هذه الورقة إطار عمل يجمع بين الاختبار السلوكي وتحليل القابلية للتفسير لتقييم التوجه نحو الأهداف في وكلاء النماذج اللغوية، مبرهنةً من خلال دراسة حالة في عالم الشبكة (grid-world) أنه بينما يُظهر الوكلاء أداءً قويًا، فإن تمثيلاتهم الداخلية للخرائط المكانية وخطط العمل تخضع لإعادة تنظيم غير خطية أثناء عملية الاستنتاج، مما يسلط الضوء على ضرورة الفحص الاستبطاني لما يتجاوز مجرد الملاحظة السلوكية.

Raghu Arghal, Fade Chen, Niall Dalton, Evgenii Kortukov, Calum McNamara, Angelos Nalmpantis, Moksh Nirvaan, Gabriele Sar (…)2026-06-01
💻 computer science

Social Reasoning in Machines: Investigating Collective Truth-Seeking Dynamics in Large Language Model Debate

تُثبت هذه الورقة أن محاكاة نظرية الحوار الاستدلالي من خلال مناظرات متعددة الوكلاء بين نماذج لغوية كبيرة متنوعة تعزز بشكل كبير أداء البحث عن الحقيقة الجماعي، وتوفر منهجية قياس ديناميكية مبتكرة لتقييم الخصائص الجوهرية للنماذج مثل الهلوسة.

Tom Pecher2026-06-01
💬 NLP

Domain Adaptation and Reasoning Frameworks in Language Models: A Controlled Experiment with Historical Cosmology

تُظهر هذه التجربة المنضبطة أن التكيف مع النطاق في النماذج اللغوية يعيد تشكيل الأطر التفسيرية اللغوية المستخدمة في التوليد بشكل أساسي، حيث تبرز التحولات في الموقف الكوني كأثر ثانوي لهذه التغييرات الهيكلية بدلاً من كونها ناتجة عن تعديل مباشر لمعتقدات النموذج الأساسية.

Francesco De Bernardis2026-06-01
💬 NLP

Cross-Lingual Steering for Figurative Language Generation

تُثبت هذه الورقة أن اتجاهات توجيه التنشيط للغة المجازية التي تم تعلمها في لغة واحدة ليست فعالة داخل تلك اللغة فحسب، بل تنتقل أيضاً عبر اللغات، مما يكشف عن إشارة عابرة للغات قابلة لإعادة الاستخدام ولكنها تعتمد على الهدف لتوليد اللغة المجازية في النماذج اللغوية الكبيرة متعددة اللغات.

Linfeng Liu, Tiffany Zhan, Louie Hong Yao, Saptarshi Ghosh, Tianyu Jiang2026-06-01
🤖 machine learning

Bounded Behavioral Indistinguishability for Black-Box LLM Distillation

تقدم هذه الورقة مفهوم عدم التمييز السلوكي المحدود لتوضيح أنه في حين أن تقطير "LoRA" يحسن التشابه الدلالي بين النماذج اللغوية الكبيرة (LLMs) "المعلمة" و"الطالبة" ذات الصندوق الأسود، إلا أنه يفشل في القضاء تماماً على الاختلافات السلوكية القابلة للكشف في الأسلوب والمتانة والمجالات التقنية، مما يستلزم تحولاً من مطابقة المخرجات إلى التقييم التنافسي المدرك للفئات.

Munawar Hasan2026-06-01
💬 NLP

Configurable Reward Model for Balanced Safety Alignment

تقدم الورقة البحثية نموذج مكافأة السلامة القابل للضبط (CSRM)، وهو نهج مبتكر يستفيد من تعزيز البيانات المستهدف للإعدادات لإنشاء نموذج مكافأة قادر على التكيف مع متطلبات السلامة المتباينة والمتطورة، مما يحقق أداءً هو الأفضل في فئته على معايير السلامة القابلة للضبط ويحسن بشكل كبير المقايضة بين الفائدة والسلامة في النماذج اللغوية الكبيرة المتوافقة.

Zhengping Jiang, Mehran Khodabandeh, Akash Bharadwaj, Manik Bhandari, Mayur Srungarapu, Anqi Liu, Benjamin Van Durme, Li (…)2026-06-01
💬 NLP

Linear Ensembles Wash Away Watermarks: On the Fragility of Distributional Perturbations in LLMs

تُثبت هذه الورقة أن الاضطرابات الإحصائية التي تسببها العلامات المائية لنماذج اللغات الكبيرة يمكن تحييدها بفعالية من خلال متوسط توزيعات المخرجات لثلاثة إلى خمسة نماذج متباينة فقط، وهي تقنية تُسمى WASH لا تجعل مخططات العلامات المائية الحالية غير قابلة للكشف فحسب، بل تعمل أيضاً على تحسين جودة النص وسرعة التوليد.

Zhihao Wu, Gracia Gong, Qinglin Zhu, Yudong Chen, Runcong Zhao2026-06-01
🤖 machine learning

MAAT: Multi-phase Adapter-Aware Targeted Unlearning

تقدم هذه الورقة 5WBENCH، وهو معيار متوازن يكشف أن أساليب نسيان الآلة الحالية تفشل في الإجابة على أسئلة "لماذا" السببية بسبب الاستدلال متعدد القفزات وتخفيف التدرج، وتقترح MAAT، وهو إطار عمل جديد ثلاثي المراحل يعتمد على الوعي بالمهايئ ويحقق مستويات عالية من النسيان والاحتفاظ بالمعرفة السببية لأول مرة.

Suryash Yagnik, Shubham Gaur, Saksham Thakur, Vinija Jain, Aman Chadha, Amitava Das2026-06-01
🤖 machine learning

Measuring, Localizing, and Ablating Alignment Signatures in LLMs

تُثبت هذه الورقة أن مرحلة ما بعد التدريب تُدخل بصمات أسلوبية "شبيهة بالذكاء الاصطناعي" قابلة للقياس وموضعية في النماذج اللغوية، وتقدم منهجية PASTA، وهي طريقة لا تتطلب إعادة تدريب تنجح في استئصال اتجاهات التنشيط المحددة هذه لتقليل معدلات كشف الذكاء الاصطناعي مع الحفاظ على تماسك النص.

Aniket Anand, Janvijay Singh, Zhewei Sun, Dilek Hakkani-Tür, Nick Feamster2026-06-01