🤖 AI

Hypothesis Generation and Inductive Inference in Children and Language Models

تقارن هذه الورقة بين الأطفال البشر والوكلاء القائمين على النماذج اللغوية الكبيرة في مهمة استدلال استقرائي، كاشفةً أنه بينما يتكيف كلاهما بشكل مماثل مع عدم اليقين البيئي وموثوقية الأدلة من خلال آليات حوسبية متميزة، تُظهر النماذج اللغوية الكبيرة نزعات فريدة نحو الإفراط في الملاحظة والامتثال للتعليمات مقارنة بالأطفال.

Jeffrey Qin, Wasu Top Piriyakulki, Zhuangfei Gao, Mia Radovanovic, Jessica Sommerville, Kevin Ellis, Marta Kryven2026-05-26
💬 NLP

Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval

تقترح هذه الورقة البحثية Unveil، وهو إطار عمل مبتكر يدمج الميزات البصرية والنصية لاسترجاع المستندات متعدد الوسائط بشكل قوي، ويوظف تقنية تقطير المعرفة لنقل هذه القدرة إلى نموذج بصري فقط يتسم بالكفاءة ولا يتطلب عملية تحليل.

Hao Sun, Yingyan Hou, Jiayan Guo, Bo Wang, Chunyu Yang, Jinsong Ni, Yan Zhang2026-05-26
💬 NLP

Generating Legal Commentaries from Case Databases via Retrieval, Clustering, and Generation

تقدم هذه الورقة مساراً مؤتمتاً بالكامل يحول 4,555 قراراً من قرارات المحكمة الاتحادية للعدل الألمانية إلى شروح قانونية مهيكلة لأقسام محددة من القانون المدني عبر استخراج وتجميع وتوليف التعليلات القضائية باستخدام النماذج اللغوية الكبيرة، مما يثبت جدوى توليد تقارير قانونية محدثة ومنخفضة التكلفة مع الإقرار بالقيود المتعلقة بمصادر المادة والصبغة المعيارية للاستدلال القانوني.

Max Prior, Niklas Wais, Matthias Grabmair2026-05-26
🤖 AI

Jailbreak to Protect: Buffering and Reinforcing via Temporary Jailbreaking for Safe Fine-Tuning in Large Language Models

تقترح هذه الورقة إطار عمل للضبط الدقيق يعتمد على "التخزين المؤقت والتعزيز" (Buffer-and-Reinforce)، والذي يستخدم محولات كسر الحماية المؤقتة لتخزين التدرجات الضارة مؤقتاً ثم تعزيز محاذاة السلامة عبر الدمج القائم على تفكيك القيم المفردة (QR decomposition)، مما يحمي النماذج اللغوية الكبيرة من هجمات الضبط الدقيق الضارة دون الحاجة إلى بيانات سلامة إضافية أو عبء حوسبي كبير.

Seokil Ham, Jaehyuk Jang, Wonjun Lee, Changick Kim2026-05-26
💬 NLP

The Multilingual Curse at the Retrieval Layer: Evidence from Amharic

تُثبت هذه الورقة أن نماذج الاسترجاع متعددة اللغات ذات التعلم الصفري (zero-shot) تظهر أداءً أقل بكثير من النماذج أحادية اللغة للغة الأمهرية، وتجادل بأن الوصول العادل للمعلومات للغات الممثلة تمثيلاً ناقصاً والغنية صرفياً يتطلب تقييماً وتكيفاً داخل اللغة نفسها بدلاً من الاعتماد على معايير القياس متعددة اللغات الإجمالية.

Yosef Worku Alemneh, Kidist Amde Mekonnen, Maarten de Rijke2026-05-26
🤖 machine learning

Polymorphism Is Rotation: Operational Mechanistic Interpretability from a Two-Layer Transformer to Pythia-70m

تُثبت هذه الورقة أن نماذج المحولات (transformers) المدربة بشكل مستقل تحسب دوالاً متطابقة باستخدام إحداثيات داخلية غير مفهومة متبادلاً ومرتبطة بدوران عشوائي منتظم، وهي ظاهرة تُسمى "تعدد الأشكال" (polymorphism) يمكن حلها عبر عملية مطابقة "بروكرستس" متعامدة واحدة لتمكين النقل المباشر لقواميس الميزات ومتجهات التوجيه دون الحاجة لإعادة التدريب.

Jordan F. McCann2026-05-26
📊 statistics

An Effective-Rank Audit of Alignment-Induced Activation Shifts: Confound Control, Constructive Calibration, and Limits

تُدقق هذه الورقة البحثية في انزياحات التنشيط الناجمة عن المحاذاة في ثلاثة نماذج لغوية كبيرة مضبوطة بالتعليمات، وذلك عبر تقديم مقياس للرتبة الفعالة محكوم بالمربكات لعزل اتجاهات الرفض، مما يثبت أنه بينما يؤدي تعظيم الرتبة الطفيف إلى تحسين المتانة، فإن المقياس نفسه ليس خاصاً بالسلامة ويفشل في توفير حد أدنى مطابق بسبب القيود الهيكلية في فرضيات الفجوة الطيفية.

Yuki Nakamura2026-05-26
🤖 AI

GlobalDentBench: A Multinational Benchmark for Evaluating LLM Clinical Reasoning in Dentistry with Expert Calibration

تقدم هذه الورقة GlobalDentBench، وهو أول معيار مرجعي لطب الأسنان متعدد الجنسيات يضم 8,978 سؤالاً تم التحقق من صحتها من قبل خبراء عبر 14 تخصصاً وثلاثة مستويات من الاستنتاج، والذي يكشف أن النماذج اللغوية الكبيرة الحالية تظهر تدهوراً كبيراً في الأداء في الاستنتاج السريري المعقد وتشكل مخاطر سلامة جسيمة، بما في ذلك معدل 31.01% من التوصيات غير الآمنة.

Junjie Zhao, Jingyi Liang, Zhenyang Cai, Jiaming Zhang, Zhenwei Wen, Shuzhi Deng, Wenjing Yi, Chunfeng Luo, Hexian Zhang (…)2026-05-26
💬 NLP

Know You Before You Speak: User-State Modeling for LLM Personalization in Multi-Turn Conversation

تقدم هذه الورقة البحثية إطار عمل PUMA، وهو إطار قائم على مبدأ الطاقة الحرة يعمل على تعزيز تخصيص النماذج اللغوية الكبيرة من خلال نمذجة حالات المستخدم الكامنة واختيار إجراءات الحوار عبر اتخاذ القرار في ظل قابلية الملاحظة الجزئية، مما ينقل العملية من مجرد استرجاع سلبي للذاكرة إلى إدارة استباقية لتطور المستخدم في المحادثات متعددة الأدوار.

Jiani Luo, Xiaoyan Zhao, Yang Zhang, Shuyi Miao, Bingbing Xu, Stefan Konigorski, Tat-Seng Chua2026-05-26
🤖 AI

Measuring Reasoning Quality in LLMs: A Multi-Dimensional Behavioral Framework

تقدم هذه الورقة إطاراً سلوكياً موحداً متعدد الأبعاد يقيم استدلال النماذج اللغوية الكبيرة عبر ستة أبعاد متميزة — الصحة، والاتساق، والمتانة، والتماسك المنطقي، والكفاءة، والاستقرار — للكشف عن رؤى نقدية ومنع أخطاء التصنيف التي تغفلها مقاييس الدقة التقليدية التي تقتصر على الدقة فقط.

Ali Şenol, Garima Agrawal, Huan Liu2026-05-26✓ Author reviewed