💬 NLP

Over-Refusal and Representation Subspaces: A Mechanistic Analysis of Task-Conditioned Refusal in Aligned LLMs

تقدم هذه الورقة تحليلاً آلياً يكشف أنه بينما يخضع الرفض الضار لمتجه عالمي واحد، فإن الإفراط في الرفض ينشأ من فضاءات فرعية ذات أبعاد أعلى تعتمد على المهمة ضمن مجموعات المهام الحميدة، مما يفسر فشل الاستئصال العالمي ويستلزم تدخلات هندسية خاصة بكل مهمة.

Utsav Maskey, Mark Dras, Usman Naseem2026-03-31
⚛️ lattice

PRBench: End-to-end Paper Reproduction in Physics Research

تقدم الورقة البحثية PRBench، وهو معيار مرجعي صارم يتكون من 30 مهمة في الفيزياء تم إعدادها من قبل خبراء لتقييم قدرات إعادة الإنتاج الشاملة للوكلاء الاصطناعيين، كاشفةً أن النماذج الحالية تعاني بشكل كبير من حيث صحة الكود، ودقة البيانات، وتحقيق إعادة إنتاج ناجحة رغم قدراتها المتقدمة في التفكير.

Shi Qiu, Junyi Deng, Yiwei Deng, Haoran Dong, Jieyu Fu, Mao Li, Zeyu Li, Zhaolong Zhang, Huiwen Zheng, Leidong Bao, Anqi (…)2026-03-31
💬 NLP

Budget-Xfer: Budget-Constrained Source Language Selection for Cross-Lingual Transfer to African Languages

تقدم الورقة البحثية Budget-Xfer، وهو إطار عمل يعمل على تحسين اختيار اللغة المصدر وتخصيص البيانات في ظل ميزانية تعليق ثابتة، كاشفاً أن النقل متعدد المصادر يتفوق بشكل كبير على النقل أحادي المصدر بالنسبة للغات الأفريقية، مع إثبات أن تشابه التضمين ليس مؤشراً موثوقاً به عالمياً للاختيار.

Tewodros Kederalah Idris, Roald Eiselen, Prasenjit Mitra2026-03-31
💬 NLP

Can Large Language Models Simulate Human Cognition Beyond Behavioral Imitation?

تقدم هذه الورقة معياراً مرجعياً جديداً يعتمد على المسارات النشرية الطولية لـ 217 من باحثي الذكاء الاصطناعي لتقييم ما إذا كانت النماذج اللغوية الكبيرة تحاكي حقاً الأنماط المعرفية البشرية الفردية أم أنها تكتفي بمحاكة السلوكيات السطحية، وذلك باستخدام إعداد الإزاحة الزمنية عبر المجالات ومقياس محاذاة متعدد الأبعاد لتقييم النماذج الحالية وتقنيات التحسين.

Yuxuan Gu, Lunjun Liu, Xiaocheng Feng, Kun Zhu, Weihong Zhong, Lei Huang, Bing Qin2026-03-31
💬 NLP

KAT-Coder-V2 Technical Report

يُعد KAT-Coder-V2 نموذجاً برمجياً وكيلياً طورته شركة Kuaishou، يعتمد على نموذج "التخصص ثم التوحيد" لتدريب خمسة مجالات خبيرة قبل دمجها في نموذج واحد، محققاً أداءً هو الأفضل في فئته على معايير مثل SWE-bench Verified وPinchBench من خلال ابتكارات مثل بنية KwaiEnv واستقرار MCLA.

Fengxiang Li, Han Zhang, Haoyang Huang, Jinghui Wang, Jinhua Hao, Kun Yuan, Mengtong Li, Minglei Zhang, Pengcheng Xu, We (…)2026-03-31
💬 NLP

Retromorphic Testing with Hierarchical Verification for Hallucination Detection in RAG

تقدم هذه الورقة RT4CHART، وهو إطار عمل للاختبار الرجعي (retromorphic) يستخدم التحقق الهرمي على مستوى الادعاء لتحقيق أفضل النتائج في الكشف عن الهلوسة دقيقة التفاصيل في أنظمة التوليد المعزز بالاسترجاع، بينما تكشف أيضاً أن المعايير المرجعية الحالية تقلل بشكل كبير من تقدير مدى انتشار الهلوسة.

Boxi Yu, Yuzhong Zhang, Liting Lin, Lionel Briand, Emir Muñoz2026-03-31
💬 NLP

TailNLG: A Multilingual Benchmark Addressing Verbalization of Long-Tail Entities

تقدم هذه الورقة TailNLG، وهو معيار جديد متعدد اللغات يكشف عن انحياز أداء مستمر في النماذج اللغوية الكبيرة ضد كيانات الذيل الطويل أثناء توليد النصوص من البيانات، مما يسلط الضف على الحاجة إلى أطر تقييم أكثر موثوقية لمعالجة هذه الفجوة.

Lia Draetta, Michael Oliverio, Virginia Ramón-Ferrer, Pier Felice Balestrucci, Flaviana Corallo, Carlos Badenes-Olmedo (…)2026-03-31
💬 NLP

Conversational Agents and the Understanding of Human Language: Reflections on AI, LLMs, and Cognitive Science

تستعرض هذه الورقة تطور نماذج معالجة اللغات الطبيعية وعلاقتها بنظريات القدرة اللغوية البشرية، وتخلص إلى أنه على الرغم من القدرات المثيرة للإعجاب لنماذج اللغات الكبيرة الحديثة، فإن تطويرها لم يساهم بشكل كبير في تعزيز فهمنا لكيفية معالجة العقل البشري للغة الطبيعية.

Andrei Popescu-Belis2026-03-31
🤖 machine learning

KVSculpt: KV Cache Compression as Distillation

يقدم KVSculpt طريقة مبتكرة لضغط ذاكرة التخزين المؤقت لـ KV تعمل على تحسين أزواج KV غير المقيدة في فضاء التضمين المستمر عبر الحلول المتبادلة لـ L-BFGS والمربعات الصغرى، المعززة بتخصيص ميزانية تكيفي، لتقليل تباعد KL بشكل كبير والحفاظ على سلوك الانتباه مقارنة بنهج الاختيار أو الدمج الحالية.

Bo Jiang, Sian Jin2026-03-31
💬 NLP

Improving Clinical Diagnosis with Counterfactual Multi-Agent Reasoning

تقترح هذه الورقة إطار عمل متعدد الوكلاء قائم على التفكير المقابل (counterfactual) يعزز التشخيص السريري من خلال اختبار الفرضيات صراحةً عبر تعديل الأدلة وقياس تحولات الثقة، مما يؤدي إلى تحسين دقة التشخيص وقابلية تفسير الاستدلال عبر مختلف المعايلات والنماذج اللغوية الكبيرة.

Zhiwen You, Xi Chen, Aniket Vashishtha, Simo Du, Gabriel Erion-Barner, Hongyuan Mei, Hao Peng, Yue Guo2026-03-31