💬 NLP

Location Not Found: Exposing Implicit Local and Global Biases in Multilingual LLMs

تقدم هذه الورقة LocQA، وهو معيار مرجعي متعدد اللغات يكشف أن النماذج اللغوية الكبيرة تظهر تحيزات عالمية ضمنية نحو الإجابات المتمحورة حول الولايات المتحدة وتحيزات لغوية داخلية تفضل المواقع ذات الكثافة السكانية العالية، مع تفاقم هذه التحيزات الهيكلية بفعل الضبط الدقيق للتعليمات.

Guy Mor-Lan, Omer Goldman, Matan Eyal, Adi Mayrav Gilady, Sivan Eiger, Idan Szpektor, Avinatan Hassidim, Yossi Matias, R (…)2026-04-22
💬 NLP

IndiaFinBench: An Evaluation Benchmark for Large Language Model Performance on Indian Financial Regulatory Text

تُعد IndiaFinBench أول معيار متاح للجمهور صُمم لتقييم النماذج اللغوية الكبيرة على النصوص التنظيمية المالية الهندية، حيث تضم 406 أزواج من الأسئلة والأجوبة التي تم تعليقها من قبل خبراء من وثائق هيئة الأوراق المالية والبورصات الهندية (SEBI) والبنك المركزي الهندي (RBI)، والتي كشفت عن فجوات أداء كبيرة بين النماذج، لا سيما في الاستدلال العددي، بينما تفوقت بشكل كبير على الخطوط المرجعية البشرية غير المتخصصة.

Rajveer Singh Pall2026-04-22
🤖 machine learning

RDP LoRA: Geometry-Driven Identification for Parameter-Efficient Adaptation in Large Language Models

تقدم هذه الورقة البحثية RDP LoRA، وهي طريقة لا تعتمد على المعلمات أو التدريب تستفيد من خوارزمية Ramer-Douglas-Peucker لتحليل المسارات الهندسية للحالات الخفية لتحديد الطبقات الحرجة، مما يتيح ضبطًا دقيقًا أكثر كفاءة وفعالية للنماذج اللغوية الكبيرة مع تحسن ملحوظ في الأداء مقارنة بالتكيف الكامل للطبقات أو التكيف العشوائي لها.

Yusuf Çelebi, Yağız Asker, Özay Ezerceli, Mahmoud ElHussieni, Selva Taş, Reyhan Bayraktar, Fatma Betül Terzioğlu2026-04-22
💬 NLP

Evaluating LLM-Driven Summarisation of Parliamentary Debates with Computational Argumentation

تقترح هذه الورقة إطاراً حجاجياً حوسبياً جديداً لتقييم مدى أمانة ملخصات المناظرات البرلمانية التي تولدها النماذج اللغوية الكبيرة، وذلك من خلال التركيز على الحفاظ الشكلي لبنى الاستدلال، ومعالجة أوجه القصور في المقاييس الحالية في استيعاب الاتساق الحجاجي.

Eoghan Cunningham, Derek Greene, James Cross, Antonio Rago2026-04-22
💬 NLP

Are Large Language Models Economically Viable for Industry Deployment?

تقدم هذه الورقة EDGE-EVAL، وهو إطار عمل تقييمي موجه نحو الصناعة ينقل تقييم النماذج اللغوية الكبيرة من المقاييس التي تركز على الدقة إلى المعايير الاقتصادية والتشغيلية، كاشفاً أن النماذج الصغيرة (أقل من 2 مليار معلمة) غالباً ما تتفوق على النماذج الأكبر في الربحية، وكفاءة الطاقة، وجدوى النشر، مع كشف أوجه القصور في طرق التدريب الحالية المدركة للكمية.

Abdullah Mohammad, Sushant Kumar Ray, Pushkar Arora, Rafiq Ali, Ebad Shabbir, Gautam Siddharth Kashyap, Jiechao Gao, Usm (…)2026-04-22
💬 NLP

Can Continual Pre-training Bridge the Performance Gap between General-purpose and Specialized Language Models in the Medical Domain?

تُثبت هذه الورقة أن التدريب المسبق المستمر على متن طبي ألماني جديد عالي الجودة (FineMed-de) يُمكّن النماذج المتخصصة الأصغر حجماً بـ 7 مليارات معلمة من التفوق بشكل كبير على النماذج العامة الأكبر بكثير في المهام الطبية، مما يقدم حلاً كفؤاً من حيث الموارد للرعاية الصحية الألمانية مع تسليط الضوء على الحاجة إلى الضبط الدقيق المستهدف لمعالجة المقايضات الناجمة عن الدمج مثل خلط اللغات.

Niclas Doll, Jasper Schulze Buschhoff, Shalaka Satheesh, Hammam Abdelwahab, Héctor Allende-Cid, Katrin Klug2026-04-22
💬 NLP

Lost in Translation: Do LVLM Judges Generalize Across Languages?

تقدم هذه الورقة MM-JudgeBench، وهو معيار متعدد اللغات واسع النطاق لتقييم حكام نماذج اللغات الكبيرة متعددة الوسائط (LVLM)، كاشفةً أن نماذج المكافأة الحالية تظهر تباينًا كبيرًا في الأداء عبر اللغات وسلوكًا غير متسق عبر 25 لغة متنوعة، مما يسلط الض الضوء على الحاجة الماسة لمعايير تقييم متعددة اللغات في التقييم الآلي للنماذج.

Md Tahmid Rahman Laskar, Mohammed Saidul Islam, Mir Tafseer Nayeem, Amran Bhuiyan, Mizanur Rahman, Shafiq Joty, Enamul H (…)2026-04-22
💬 NLP

VCE: A zero-cost hallucination mitigation method of LVLMs via visual contrastive editing

تقترح هذه الورقة البحثية "التحرير التبايني البصري" (VCE)، وهو أسلوب لاحق للتحليل، غير مكلف ولا يتطلب تسميات توضيحية، يعمل على الحد من هلاوس الكائنات في نماذج الرؤية واللغة الكبيرة باستخدام تحليل القيم المفردة لتحديد وتثبيط الفضاءات الجزئية للهلاوس دون الحاجة إلى ضبط دقيق أو بيانات مصنفة.

Yanbin Huang, Yisen Li, Guiyao Tie, Xiaoye Qu, Pan Zhou, Hongfei Wang, Zhaofan Zou, Hao Sun, Xuelong Li2026-04-22
💬 NLP

What Makes an LLM a Good Optimizer? A Trajectory Analysis of LLM-Guided Evolutionary Search

تحلل هذه الورقة مسارات التحسين لـ 15 نموذجاً من النماذج اللغوية الكبيرة عبر 8 مهام لتكشف أن مُحسّنات النماذج اللغوية الكبيرة الفعالة تعمل كمُحسّنات محلية تُنتج تحسينات تدريجية ضمن مناطق دلالية موضعية، بينما تعاني النماذج الأضعف من انزياح دلالي كبير، مما يثبت أن حداثة الحل وحدها غير كافية دون استدامة التمركز حول المناطق عالية الأداء.

Xinhao Zhang, Xi Chen, François Portet, Maxime Peyrard2026-04-22
🤖 AI

Do LLMs Game Formalization? Evaluating Faithfulness in Logical Reasoning

تتقصى هذه الورقة ما إذا كانت النماذج اللغوية الكبيرة تستغل الفجوة بين صحة البرهان والأمانة في الصياغة الرسمية عند حل مهام الاستدلال المنطقي، لتجد أنه بينما تتجنب النماذج عمومًا "التلاعب بالصياغة الرسمية" عبر تفضيل الإبلاغ عن الفشل، إلا أن سلوكيات غير أمينة متميزة مثل اختلاق البديهيات وسوء ترجمة المقدمات لا تزال قائمة وتظل غير مكتشفة رغم معدلات التجميع المرتفعة.

Kyuhee Kim, Auguste Poiroux, Antoine Bosselut2026-04-22