💬 NLP

LATTE: Forecasting Peer Anchored Preference Trajectories for Personalized LLM Generation

إن LATTE هو إطار عمل يعزز التوليد المخصص للنماذج اللغوية الكبيرة من خلال التنبؤ بمسار تفضيلات المستخدم المرتكزة على الأقران وحقن الحالة المتوقعة في نموذج مجمد عبر رمز ناعم واحد، مما يجعله يتفوق على أساليب التخصيص الحالية الثابتة والقائمة على الاسترجاع.

Jinze Li, Xiaoyan Yang, Shuo Yang, Jinfeng Xu, Yue Shen, Jian Wang, Jinjie Gu, Edith Cheuk-Han Ngai2026-05-27
💬 NLP

Granuscore: A Reference-Free Measure of Granularity for Text Analysis and Question Answering

تقدم هذه الورقة Granuscore، وهو مقياس غير مرجعي يعتمد على هياكل التضمين الهرمية يقيس دقة النص بفعالية، ويتحقق من فائدته عبر سياقات الخطاب، ويطبقه لتحليل مجموعات بيانات الأسئلة والأجوبة وسلوكيات النماذج.

Lukas Ellinger, Alexander Fichtl, Miriam Anschütz, Georg Groh2026-05-27
💬 NLP

Bounded Path Context: A Controlled Study of Visible Path History in LLM-Based Knowledge Graph Question Answering

تقدم هذه الورقة البحثية "سياق المسار المحدود" (BPC)، وهي طريقة تحد من تاريخ المسار المرئي للنماذج اللغوية الكبيرة أثناء الإجابة على الأسئلة المتعلقة بالرسوم البيانية للمعرفة ليقتصر فقط على القفزات الأخيرة، مما يثبت أن هذا النهج لا يقلل من عدد الرموز المدخلة فحسب، بل يطابق أو يتجاوز أداء التلقين بكامل التاريخ في معايير WebQSP وCWQ.

Xihang Shan, Ye Luo2026-05-27
🤖 AI

UnityMAS-O: A General RL Optimization Framework for LLM-Based Multi-Agent Systems

يُعد UnityMAS-O إطار عمل عام للتعلم المعزز يعمل على تحسين الأنظمة متعددة الوكلاء القائمة على النماذج اللغوية الكبيرة من خلال معاملة سير العمل بأكمله كوحدة تدريب، وفصل الأدوار المنطقية عن معلمات النموذج عبر تجريد مرن رباعي الكائنات، وإظهار مكاسب أداء كبيرة عبر مهام متنوعة مثل الإجابة على الأسئلة وتوليد الأكواد البرمجية.

Yiqun Chen, Wei Yang, Erhan Zhang, Shijie Wang, Qi Liu, Zechun Niu, Bin Zhang, Haitao Li, Rui Li, Lingyong Yan, Jinyuan (…)2026-05-27
💬 NLP

Why Prompt Optimization Works, and Why It Sometimes Doesn't: A Causal-Inspired Edit-Level Analysis

تستخدم هذه الورقة تحليلاً مستوحى من الاستدلال السببي للكشف عن أن التعميم غير المتسق لطرق تحسين الأوامر المؤتمتة ينبع من تفاعلات منهجية بين أنماط تعديل محددة (مثل التعديلات التي تزيد من التعقيد) وخصائص المهام، بدلاً من كونه ناتجاً عن عشوائية في عملية التحسين.

Shuzhi Gong, Hechuan Wen2026-05-27
💰 quantitative finance

AI evaluation may bias perceptions: The importance of context in interpreting academic writing

تُثبت هذه الورقة أن استخدام المعايير المجمعة للكشف عن النصوص المُنشأة بواسطة الذكاء الاصطناعي في الكتابة الأكاديمية يُدخل تحيزات كبيرة عبر مختلف الدول والمجالات، وتجادل بأن المعايير الخاصة بالسياق ضرورية للتقييم الدقيق والعادل.

Shang Wu, Randol Yao2026-05-27
💬 NLP

Evidence Absence Is Not Evidence Insufficiency: Diagnosing NEI Construction Artifacts in Fact Verification

تقدم هذه الورقة بروتوكول NEI-CAP، وهو بروتوكول تشخيصي يكشف أن نماذج التحقق من الحقائق غالباً ما تفشل في تعميم كفاءة "عدم كفاية المعلومات" عبر طرق بناء الأدلة المختلفة لأن الدرجات الإجمالية يمكن أن تحجب الاعتماد الكامن على الإشارات المختصرة والسمات الخاصة بعملية البناء.

Jingxi Qiu, Zeyu Han, Cheng Huang2026-05-27
💬 NLP

NestedKV: Nested Memory Routing for Long-Context KV Cache Compression

تُعد NestedKV طريقة لضغط ذاكرة التخزين المؤقت (KV cache) تعتمد على المفاتيح فقط ولا تتطلب تدريباً، وهي توظف استراتيجية توجيه ذاكرة متعددة المقاييس باستخدام ركائز عالمية، وركائز على مستوى الكتلة، وركائز نافذة منزلقة لتتفوق بشكل كبير على النماذج المرجعية الحالية في النماذج اللغوية ذات السياق الطويل، لا سيما في ظل قيود الذاكرة الصارمة.

Hong Chen, Xiang Liu, Yubo Gao, Yuxuan Fan, Bo Wang, Yuanlin Chu, Yuanguo Lin, Xuming Hu2026-05-27
💬 NLP

PRISM: A Multi-Dimensional Benchmark for Evaluating LLM Peer Reviewers

تقدم الورقة البحثية PRISM، وهو معيار متعدد الأبعاد يكشف أنه بينما يمكن للمراجعين النظراء القائمين على النماذج اللغوية الكبيرة أن يضاهوا أو يتفوقوا على الأداء البشري في مجالات محددة مثل التحقق من الجدة وتحديد أولويات العيوب، إلا أنهم يفتقرون إلى الخبرة المتسقة والمتوازنة عبر جميع أبعاد المراجعة المطلوبة ليعملوا كبدائل مستقلة للمراجعين البشر.

Ngoc Phan Phuoc Loc, Toan Huynh La Viet, Thanh Tran Khanh, Duy A Nguyen, Tuan Anh Nguyen Pham, Thanh Nguyen, Nitesh V. C (…)2026-05-27
🤖 AI

It's Not the Capability: Harness Sensitivity Is Non-Monotone Across LLM Agent Tiers

تُفند هذه الورقة الافتراض القائل بأن تعقيد أدوات التقييم الأمثل يتناقص رتيباً مع قدرة النموذج، حيث كشفت من خلال تجربة مكونة من 432 تشغيلاً أن حساسية أدوات التقييم غير رتيبة وتعتمد بشكل حاسم على نوع النموذج، إذ تعيق الهياكل الإسهابية نماذج الدردشة الرائدة بينما تفيد التوجيهات الصارمة نماذج الاستدلال الرائدة.

Yong-eun Cho2026-05-27