💬 NLP

Persona-Model Collapse in Emergent Misalignment

تقدم هذه الورقة مفهوم "انهيار الشخصية النموذجية" لتفسير سوء المحاذاة الناشئ، مُبرهنةً من خلال مقاييس سلوكية للقابلية الأخلاقية والمتانة على أن الضبط الدقيق للنماذج اللغوية الكبيرة على بيانات ضارة يؤدي إلى تدهور شديد في قدرتها على التمييز والمحاكاة المتسقة للشخصيات، وهو تأثير لم يُلاحظ في مجموعات الضبط الآمنة المتطابقة.

Davi Bastos Costa, Renato Vicente2026-05-14
🤖 AI

Beyond Cooperative Simulators: Generating Realistic User Personas for Robust Evaluation of LLM Agents

تقدم هذه الورقة "سياسات الشخصية" (PPol)، وهو إطار عمل قائم على البحث التطوري يولد شخصيات مستخدم متنوعة وشبيهة بالبشر للتغلب على الانحياز التعاوني لمحاكيات النماذج اللغوية الكبيرة القياسية، مما يحسن بشكل كبير من متانة ودقة تقييم وكلاء النماذج اللغوية الكبيرة في سيناريوهات التفاعل الواقعية.

Harshita Chopra, Kshitish Ghate, Aylin Caliskan, Tadayoshi Kohno, Chirag Shah, Natasha Jaques2026-05-14
💬 NLP

When Do LLMs Generate Realistic Social Networks? A Multi-Dimensional Study of Culture, Language, Scale, and Method

تُظهر هذه الدراسة أن النماذج اللغوية الكبيرة تُنشئ شبكات اجتماعية واقعية تتشكل خصائصها البنيوية وتحيزاتها الديموغرافية بشكل كبير من خلال تصميم الأوامر، والتأطير الثقافي، واللغة، وحجم النموذج، مما يكشف أن هذه الخيارات التقنية تعمل كمتغيرات سوسيولوجية جوهرية بدلاً من كونها مجرد تفاصيل تنفيذية.

Sai Hemanth Kilaru, Sriram Theerdh Manikyala, Raghav Upadhyay, Sri Sai Kumar Ramavath, Srivika Nunavathu, Dalal Alharthi2026-05-14
💬 NLP

CommonWhy: A Dataset for Evaluating Entity-Based Causal Commonsense Reasoning in Large Language Models

تقدم هذه الورقة CommonWhy، وهي مجموعة بيانات تضم 15,000 سؤال من نوع "لماذا" القائم على الكيانات، والتي تُقيّم قدرات النماذج اللغوية الكبيرة في الاستنتاج السببي للمنطق العام والقدرة على التفسير الاستنباطي، مما يكشف عن قصور كبير في النماذج الحالية رغم توفر المعرفة الداعمة في Wikidata.

Armin Toroghi, Faeze Moradi Kalarde, Scott Sanner2026-05-14
💬 NLP

ATD-Trans: A Geographically Grounded Japanese-English Travelogue Translation Dataset

تقدم هذه الورقة البحثية ATD-Trans، وهي مجموعة بيانات لترجمة أدب الرحلات من اليابانية إلى الإنجليزية ذات أساس جغرافي، صُممت لتقييم جودة الترجمة الآلية على المستويين العام ومستوى الكيانات الجغرافية، مما يكشف أن النماذج المعززة باللغة اليابانية تؤدي بشكل أفضل بينما تشكل الكيانات الجغرافية المحلية تحديات ترجمة أكبر.

Shohei Higashiyama, Hiroki Ouchi, Atsushi Fujita, Masao Utiyama2026-05-14
🤖 machine learning

From Instance Selection to Fixed-Pool Data Recipe Search for Supervised Fine-Tuning

تقدم هذه الورقة AutoSelection، وهو إطار عمل مبتكر يعيد صياغة عملية اختيار بيانات الضبط الدقيق الخاضع للإشراف كمسألة بحث عن وصفة لمجمع ثابت، وذلك باستخدام حلّال ثنائي الطبقات لاكتشاف وصفات التنسيق المثلى بكفاءة من مجمع تعليمات خام دون توليد عينات جديدة، مما يؤدي إلى التفوق على طرق ترتيب العينات التقليدية والتدريب على البيانات الكاملة عبر نماذج ومهام متعددة.

Haodong Wu, Jiahao Zhang, Lijie Hu, Yongqi Zhang2026-05-14
💬 NLP

Leveraging Speech to Identify Signatures of Insight and Transfer in Problem Solving

تُظهر هذه الدراسة أن المشاركين الذين يحلون سلسلة من مسائل حساب أعواد الثقاب المتشابهة يُظهرون تحسناً أسرع وزيادة في التعبير اللفظي عن تصنيف المسائل مقارنة بأولئك الذين يواجهون مسائل متنوعة، مما يشير إلى أن الرؤى القابلة للنقل تتميز بكونها متاحة من خلال الكلام العفوي.

Linas Nasvytis, Judith E. Fan2026-05-14
💬 NLP

Understanding and Accelerating the Training of Masked Diffusion Language Models

تحدد هذه الورقة البحثية انحياز الموضعية في اللغة كسبب رئيسي لبطء التدريب في نماذج الانتشار المقنعة، وتقترح استراتيجية أخذ عينات زمنية على شكل جرس تسرع التدريب بمقدار يصل إلى 4 أضعاف مع الحفاظ على الأداء أو تحسينه عبر مختلف المعايير المرجعية.

Chunsan Hong, Sanghyun Lee, Chieh-Hsin Lai, Satoshi Hayakawa, Yuhta Takida, Yuki Mitsufuji, Seungryong Kim, Jong Chul Ye2026-05-14
💬 NLP

Adaptive Steering and Remasking for Safe Generation in Diffusion Language Models

تقترح هذه الورقة إطار عمل دفاعي عند وقت الاستدلال، يعمل بنظام "التوصيل والتشغيل" لنماذج لغة الانتشار، يجمع بين الكشف القائم على اتجاه السلامة التبايني وبين التوجيه التكيفي وإعادة قناع الرموز (token remasking) للتخفيف بفعالية من الثغرات الأمنية أثناء عملية إزالة الضجيج المتكررة مع الحفاظ على جودة التوليد.

Yejin Lee, Yo-Sub Han2026-05-14
💬 NLP

Large Language Models Lack Temporal Awareness of Medical Knowledge

تقدم هذه الورقة TempoMed-Bench، وهو أول معيار لتقييم الوعي الزمني للنماذج اللغوية الكبيرة في المجال الطبي، والذي يكشف أن النماذج الحالية تعاني من صعوبة في المعرفة التاريخية، وتظهر تدهوراً تدريجياً في الأداء بدلاً من الانقطاع الحاد، وتفشل في الحفاظ على الاتساق الزمني حتى عند تعزيزها بأدوات البحث.

Zihan Guan, Qiao Jin, Guangzhi Xiong, Fangyuan Chen, Mengxuan Hu, Qingyu Chen, Yifan Peng, Zhiyong Lu, Anil Vullikanti2026-05-14