💬 NLP

Hallucination as Commitment Failure: Larger LLMs Misfire Despite Knowing the Answer

تتحدى هذه الورقة البحثية الرأي القائل بأن الهلوسة تنبع حصرياً من نقص المعرفة، كاشفةً أن النماذج اللغوية الكبيرة الضخمة المضبوطة بالتعليمات غالباً ما تهلوس لأنها تفشل في الالتزام بمفهوم صحيح موجود بالفعل في توزيع الاحتمالات الخاص بها، بدلاً من تشتيت الكتلة الاحتمالية عبر البدائل نتيجة آلية شحذ تعتمد على الحجم تقود كلاً من الفائدة والأخطاء الواثقة.

Jewon Yeom, Jaewon Sok, Heejun Kim, Seonghyeon Park, Jeongjae Park, Taesup Kim2026-05-22
💬 NLP

FlyRoute: Self-Evolving Agent Profiling via Data Flywheel for Adaptive Task Routing

يُعد FlyRoute إطار عمل للتوصيف ذاتي التطور يستفيد من حلقة بيانات دوارة لتحديث أوصاف قدرات الوكيل ديناميكياً من حركة المرور الواقعية، مما يحسن دقة توجيه المهام التكيفي بشكل كبير مقارنة بالنماذج المرجعية الثابتة من خلال الاستكشاف المستهدف وتقطير الأدلة.

Rongjun Li, Ziyu Zhou, Yihang Wu2026-05-22
💬 NLP

Ishigaki-IDS-Bench: A Benchmark for Generating Information Delivery Specification from BIM Information Requirements

تقدم هذه الورقة Ishigaki-IDS-Bench، وهو معيار تقييم ثنائي اللغة يتكون من 166 مثالاً تم التحقق منها من قبل خبراء، لتقييم قدرة النماذج اللغوية الكبيرة على توليد مواصفات تسليم المعلومات (IDS) بتنسيق XML المتوافق مع المعايير من متطلبات نمذجة معلومات البناء (BIM)، مما يكشف أن النماذج الحالية تواجه صعوبة في تلبية قيود كل من بنية XML والمفردات المتخصصة بشكل متسق.

Ryo Kanazawa, Koyo Hidaka, Teppei Miyamoto, Takayuki Kato, Tomoki Ando, Chenguang Wang, Dayuan Jiang, Naofumi Fujita, Sh (…)2026-05-22
💬 NLP

A Comparative Study of Language Models for Khmer Retrieval-Augmented Question Answering

تقدم هذه الورقة دراسة مقارنة لنظام توليد مدعوم بالاسترجاع للمستندات الخاصة بقطاع الاتصالات باللغة الخميرية، حيث حددت نموذج BGE-M3 كأفضل نموذج استرجاع، وأثبتت أنه في حين لا يهيمن نموذج توليد واحد على جميع مقاييس الأداء، إلا أن النماذج المختلفة تتفوق في مجالات محددة مثل الأمانة، أو الصحة الواقعية، أو التشابه الدلالي.

Sereiwathna Ros, Phannet Pov, Ratanaktepi Chhor, Kimleang Ly, Wan-Sup Cho, Saksonita Khoeurn2026-05-22
💬 NLP

Cross-Lingual Consensus: Aligning Multilingual Cultural Knowledge via Multilingual Self-Consistency

تقترح هذه الورقة إطار عمل جديداً للتعلم الذاتي يستفيد من الاتساق والتقييم الذاتي متعدد اللغات لسد الفجوات المعرفية عبر اللغات، مما يحسن بشكل كبير من التوافق الثقافي في النماذج اللغوية الكبيرة من خلال إظهار ونقل المعرفة الثقافية الكامنة من اللغات المحلية إلى اللغة الإنجليزية دون الاعتماد على بيانات خارجية.

Andrew Ivan Soegeng, Patrick Sutanto, Tan Sang Nguyen2026-05-22
💬 NLP

Efficient Agentic Reasoning Through Self-Regulated Simulative Planning

تقترح هذه الورقة إطار عمل SR2^2AM، الذي يعزز كفاءة الاستدلال الوكيل عبر تفكيك عملية اتخاذ القرار إلى التخطيط المحاكاتي، والتنفيذ التفاعلي، وآلية تنظيم ذاتي متعلمة تحدد ديناميكيًا متى وكيف يتم التخطيط بعمق، محققةً أداءً تنافسيًا بعدد أقل بكثير من رموز الاستدلال مقارنة بالنماذج الأكبر حجمًا.

Mingkai Deng, Jinyu Hou, Lara Sá Neves, Varad Pimpalkhute, Taylor W. Killian, Zhengzhong Liu, Eric P. Xing2026-05-22
💬 NLP

IdioLink: Retrieving Meaning Beyond Words Across Idiomatic and Literal Expressions

تقدم الورقة البحثية IdioLink، وهو معيار استرجاع واسع النطاق يضم أكثر من 10,000 وثيقة و2,000 استعلام، صُمم لتقييم وكشف أوجه القصور في نماذج التضمين الحالية في ربط التعبيرات الاصطلاحية بمعانيها الحرفية أو شرحها الموازي من الناحية المفاهيمية.

Kai Golan Hashiloni, Daniel Fadlon, Lior Livyatan, Ofri Hefetz, Jiahuan Pei, Kfir Bar2026-05-22
💬 NLP

TransitLM: A Large-Scale Dataset and Benchmark for Map-Free Transit Route Generation

تقدم هذه الورقة TransitLM، وهي مجموعة بيانات ومعيار واسع النطاق يحتوي على أكثر من 13 مليون سجل نقل، مما يمكّن النماذج اللغوية الكبيرة من توليد مسارات نقل عام صالحة هيكلياً وخالية من الخرائط مباشرة من معلومات نقطة الأصل والوجهة دون الاعتماد على البنية التحتية التقليدية للخرائط.

Hanyu Guo, Jiedong Yang, Chao Chen, Longfei Xu, Kaikui Liu, Xiangxiang Chu2026-05-22
💬 NLP

Modeling Pathology-Like Behavioral Patterns in Language Models Through Behavioral Fine-Tuning

تُثبت هذه الورقة أن الضبط الدقيق للنماذج اللغوية الكبيرة على مجموعات بيانات اصطناعية تمثل أنماطًا سلوكية غير تكيفية، مثل الاكتئاب والبارانويا، يؤدي إلى تحولات مستقرة وعامة في السياق في توزيعاتها التوليدية واختيارها للأفعال، مما يؤكد صلاحية النماذج اللغوية الكبيرة كأنظمة قائمة على السياسات قابلة للتحكم لدراسة العلاقة بين القيود السلوكية والتمثيلات المعرفية الناشئة.

Nicola Milano, Davide Marocco2026-05-22
💬 NLP

Boundary-targeted Membership Inference Attacks on Safety Classifiers

تقدم هذه الورقة استراتيجية لهجوم استنتاج العضوية يستهدف الحدود، يستغل التنبؤات منخفضة الثقة لتحسين استعادة البيانات الحساسة للتدريب بشكل كبير من مصنفات السلامة، مما يثبت أن مثل هذه النماذج معرضة لانتهاكات الخصوصية رغم وجود التصفية القائمة على المحتوى، وإن كانت استراتيجيات الضجيج الحالية يمكنها تخفيف هذه المخاطر بفعالية.

Anthony Hughes, Alexander Goldberg, Prince Jha, Adam Perer, Nikolaos Aletras, Niloofar Mireshghallah2026-05-22