🤖 AI

Easy to Complete, Hard to Choose: Investigating LLM Performance on the ProverbIT Benchmark

تقدم هذه الورقة ProverbIT، وهو معيار تقييم للأمثال الإيطالية يكشف أن النماذج اللغوية الكبيرة تواجه صعوبة في التمييز بين نهايات الأمثال الصحيحة والمرادفات الحرفية في مهام الاختيار من متعدد، مما يشير إلى أن أداءها يعتمد على الأنماط المحفوظة أكثر من الفهم الدلالي العميق للغة المجازية المتجذرة ثقافياً.

Enrico Mensa, Lorenzo Zane, Calogero Jerik Scozzaro, Matteo Delsanto, Tommaso Milani, Daniele Paolo Radicioni2026-08-06
💬 NLP

Simile Understanding in Text-to-Image Models: An Evaluation Framework

تقترح هذه الورقة إطار عمل تقييمي قابل للتوسع لتقييم وتشخيص الفشل المستمر لنماذج تحويل النص إلى صورة في تفسير التشبيهات بشكل صحيح، مما يكشف عن فجوة بين فهم اللغة المجازية والتجسيد البصري من خلال مجموعات بيانات محكومة، ومقاييس كشف تلقائية، وتحليل لطبقات الترميز.

Luecheng Wang, Shintaro Ozaki, Hidetaka Kamigaito, Katsuhiko Hayashi, Jingun Kwon, Manabu Okumura, Taro Watanabe2026-08-06
🤖 AI

InsightEmb: Learning Action-Intent Embeddings for Agentic Insight Retrieval

تقدم الورقة البحثية InsightEmb، وهو إطار عمل للتمثيل التبايني (contrastive embedding framework) يتعلم هندسة استرجاع قابلة للنقل وموجهة نحو التقدم من بيانات الاستدلال الرياضي لتمكين الوكلاء من استرجاع رؤى قابلة للتنفيذ بفعالية تحل اختناقات اتخاذ القرار عبر مجالات متنوعة دون الحاجة إلى تدريب خاص بالبيئة.

Tsz Ting Chung, Jiangnan Li, Jie Zhou, Mo Yu2026-08-06
💬 NLP

Skill-Use: Can LLMs Actually Use Skills in Agentic Harnesses?

تقدم الورقة البحثية "Skill-Use"، وهو معيار تقييمي يختبر ما إذا كان بإمكان وكلاء النماذج اللغوية الكبيرة التعرف بشكل مستقل على المهارات المهيكلة وتطبيقها بشكل صحيح في بيئات معزولة، مما يكشف أن الاستخدام الموثوق للمهارات لا يزال يمثل تحديًا كبيرًا يعتمد بشكل كبير على حاصرة الوكيل (agent harness) المحددة بدلاً من كونه قدرة متأصلة في النموذج.

Jinyi Han, Yuanjian Xu, Ying Liao, Xinyi Wang, Zishang Jiang, Zixiang Di, Fanyang Lu, Zhichao Hu, Yanghua Xiao2026-08-06
💬 NLP

Do Language Models Know Their Slang? Queer Slang Understanding in User-Generated Content

تقدم هذه الورقة Slang-Q، وهي مجموعة بيانات وتصنيف تم تنسيقهما يدويًا لـ 118 مصطلحًا من المصطلحات العامية لمجتمع الكوير (queer)، لتقييم قدرة النماذج اللغوية على فهم وتعريف هذه اللغة الخاصة بهذا المجتمع غير الممثل كفاية بدقة.

Arianna Denitto, Beatrice Savoldi2026-08-06
🤖 AI

A-SR: Self-Evolving Agentic LLMs for Symbolic Regression via Hierarchical Coordination

يُعد A-SR إطار عمل وكيلًا ذاتي التطور يعزز الانحدار الرمزي عبر استبدال حلقات الاقتراح الموحدة بتنسيق هرمي مشروط بالأدوار وتوجيه ذاكرة تكيفي، محققًا تحسينات كبيرة في الدقة مقارنة بالطرق الحالية الموجهة بنماذج اللغات الكبيرة في كل من مهام الاكتشاف العلمي الاصطناعية والواقعية.

Wenxiao Zhao, Dong Liu, Kaiyi Xu, Feng Liu, Zhen Zhao, Fei Ben, Shu Wang, Wenhao Li, Yingnian Wu, Fenghua Ling, Haobo Li (…)2026-08-06
💬 NLP

Evaluating the Diagnostic Robustness of Vision-Language Models Under Visual and Textual Perturbations

تكشف هذه الدراسة أن نماذج الرؤية واللغة تظهر عدم استقرار تشخيصي وانحيازاً مفرطاً كبيراً تحت تأثير الاضطرابات البصرية والنصية في تحليل رنين الدماغ المغناطيسي، مما يثبت أن مقاييس الدقة القياسية تفشل في رصد إخفاقات الموثوقية الحرجة اللازمة للنشر السريري الآمن.

Ali Khoramfar, Mohammad Javad Dousti, Alireza Mohamadian, Heshaam Faili2026-08-06
💬 NLP

Evaluation Pitfalls and Sparsity Limitations in LLM-based Confidence Estimates for Classification

تكشف هذه الورقة أن الندرة الشديدة في تقديرات الثقة اللفظية في النماذج اللغوية الكبيرة تؤثر بشكل حرج على مقاييس التقييم مثل AUARC اعتماداً على طرق الاستيفاء، وتقترح نهج "الاحتمالات اللوغاريتمية للفظ" (verbalization logprobs) الخالي من التكلفة والذي يخفف من هذه الندرة لتحقيق أداء متفوق وأكثر عدلاً في التصنيفات.

Elena Merdjanovska, Omar Zaidan, Andreas Rücklé2026-08-06
🤖 machine learning

Consistency-Driven Co-Evolution for Self-Supervised Cross-Representation Learning

تقدم هذه الورقة CoCoEvolve، وهو إطار عمل للتعلم الذاتي غير الخاضع للإشراف يعزز الفهم المتبادل بين التمثيلات المختلفة للمخططات والجداول والأكواد من خلال تحديد توافقات صريحة بنسبة واحد لواحد وتحسين الاتساق عبر عملية تطور مشترك أثناء التدريب والاستدلال على حد سواء، مما يلغي الحاجة إلى التوسيمات المكلفة مع تحسين الأداء عبر معايير قياس متعددة.

Xuehang Guo, Pengyuan Li, Tom Hope, Tirthankar Ghosal, Manling Li, Qingyun Wang2026-08-06