🤖 machine learning

A Unified Benchmark for Evaluating Knowledge Graph Construction Methods and Graph Neural Networks

تقدم هذه الورقة معياراً موحداً وقابلاً لإعادة الإنتاج في المجال الحيوي الطبي، يقيم بشكل مشترك متانة الشبكات العصبية الرسومية على الرسوم البيانية المستمدة من النصوص والمشوبة بالضجيج، وفعالية طرق بناء الرسوم البيانية المعرفية المختلفة من خلال مقارنتها بمرجع عالي الجودة تم إعداده من قبل خبراء.

Othmane Kabal, Mounira Harzallah, Fabrice Guillet, Hideaki Takeda, Ryutaro Ichise2026-05-08
💬 NLP

FinRAG-12B: A Production-Validated Recipe for Grounded Question Answering in Banking

يُعد FinRAG-12B إطار عمل بـ 12 مليار معلمة، تم التحقق من كفاءته في بيئة الإنتاج وهو فعال من حيث البيانات، حيث يجمع بين مسار تدريب متخصص وآليات رفض مُعايرة لتقديم إجابات على الأسئلة عالية الدقة والموثوقية ومنخفضة التكلفة لأكثر من 40 مؤسسة مالية، متفوقاً بذلك على GPT-4.1 في جودة الاستشهاد وحل الاستعلامات مع تقليل زمن الاستجابة والتكاليف التشغيلية بشكل كبير.

Denys Katerenchuk, Pablo Duboue, Keelan Evanini, David Gondek, Nithin Govindugari, Olivier Allauzen, Joshua Baptiste, Da (…)2026-05-08
💬 NLP

ReaComp: Compiling LLM Reasoning into Symbolic Solvers for Efficient Program Synthesis

تقدم الورقة البحثية ReaComp، وهو إطار عمل يقوم بتجميع آثار استدلال النماذج اللغوية الكبيرة (LLM) إلى أدوات حل رمزية قابلة لإعادة الاستخدام وبصفر توكن، والتي تحقق دقة تضاهي أحدث ما توصل إليه العلم في معايير قياس تخليق البرامج، وتقلل بشكل كبير من استخدام التوكنات عند دمجها مع النماذج اللغوية الكبيرة، وتنتقل بنجاح إلى المهام اللغوية الواقعية.

Atharva Naik, Yash Mathur, Prakam, Carolyn Rose, David Mortensen2026-05-08
💬 NLP

Belief Memory: Agent Memory Under Partial Observability

تقدم الورقة البحثية BeliefMem، وهو إطار عمل للذاكرة الاحتمالية لوكلاء النماذج اللغوية الكبيرة (LLM) يعمل على التخفيف من الأخطاء ذاتية التعزيز في البيئات ذات الإدراك الجزئي من خلال الاحتفاظ بعدة استنتاجات مرشحة مع احتمالات محدثة بدلاً من الالتزام باستنتاجات حتمية منفردة، مما يحقق أداءً فائقاً في اختبارات السياق الطويل.

Junfeng Liao, Qizhou Wang, Jianing Zhu, Bo Du, Rui Yan, Xiuying Chen2026-05-08
💬 NLP

The Cost of Context: Mitigating Textual Bias in Multimodal Retrieval-Augmented Generation

تحدد هذه الورقة البحثية وتعالج "إعادة التشويه" (recorruption)، وهي نمط فشل في نماذج التوليد المعزز بالاسترجاع متعدد الوسائط حيث يتسبب السياق الدقيق في تخلي النماذج عن التنبؤات الصحيحة بسبب العمى البصري والتحيز الموضعي، وذلك عبر اقتراح إطار عمل "تدخل انتباه عنق الزجاجة للاسترداد" (BAIR) الخالي من المعلمات لاستعادة البروز البصري وتحسين موثوقية التشخيص دون الحاجة لإعادة التدريب.

Hoin Jung, Xiaoqian Wang2026-05-08
💬 NLP

Architecture Matters: Comparing RAG Systems under Knowledge Base Poisoning

تُثبت هذه الورقة أن بنية "توليد المخرقات المعزز بالاسترجاع" (RAG) تؤثر بشكل كبير على المتانة ضد تسميم قاعدة المعرفة، كاشفةً أنه في حين أن التصاميم المتقدمة مثل النماذج اللغوية التكرارية تقلل بشكل جذري من معدلات نجاح الهجمات مقارنة بمسارات العمل التقليدية، فإن الثغرة الأساسية تكمن في مرحلة الاستدلال على المحتوى حيث يقوض التأطير العدائي تقييم المصداقية بدلاً من كونها في تحسين عملية الاسترجاع.

Samuel Korn2026-05-08
💬 NLP

Negative Before Positive: Asymmetric Valence Processing in Large Language Models

تُثبت هذه الورقة أن النماذج اللغوية الكبيرة تعالج التكافؤ العاطفي من خلال آليات داخلية متميزة، وسببية، وقابلة للتوجيه، حيث تتركز النتائج السلبية في الطبقات المبكرة وتصل النتائج الإيجابية إلى ذروتها في الطبقات المتوسطة والمتأخرة، بدلاً من الاعتماد فقط على مطابقة الرموز السطحية.

Sohan Venkatesh2026-05-08
💬 NLP

XL-SafetyBench: A Country-Grounded Cross-Cultural Benchmark for LLM Safety and Cultural Sensitivity

تقدم هذه الورقة البحثية XL-SafetyBench، وهو معيار اختبار عابر للثقافات يتكون من 5,500 حالة اختبار مرتبطة بالدول عبر 10 أزواج لغوية، يكشف عن وجود فجوة بين متانة مقاومة كسر الحماية والحساسية الثقافية في النماذج الرائدة، بينما يظهر أن السلامة الظاهرية للنماذج المحلية تنبع في الغالب من إخفاقات في التوليد بدلاً من المحاذاة الحقيقية.

Dasol Choi, Eugenia Kim, Jaewon Noh, Sang Seo, Eunmi Kim, Myunggyo Oh, Yunjin Park, Brigitta Jesica Kartono, Josef Pichl (…)2026-05-08
💬 NLP

Decodable but Not Corrected by Fixed Residual-Stream Linear Steering: Evidence from Medical LLM Failure Regimes

تُثبت هذه الورقة أنه بينما يمكن فك تشفير نمط فشل "الإفراط في التفكير" المحدد في النماذج اللغوية الكبيرة الطبية خطياً من الحالات الخفية، إلا أنه لا يمكن تصحيحه عبر التوجيه الخطي الثابت بسبب التشابك التمثيلي مع الحسابات الحرجة للمهمة، رغم أن المسبار نفسه يظل فعالاً في اكتشاف حالات الفشل لتمكين الامتناع الانتقائي.

Ming Liu2026-05-08
💬 NLP

More Is Not Always Better: Cross-Component Interference in LLM Agent Scaffolding

تُثبت هذه الورقة أن إضافة المزيد من مكونات السقالات (scaffolding) إلى وكلاء النماذج اللغوية الكبيرة (LLM agents) غالبًا ما يؤدي إلى تداخل مدمر بين المكونات، مما يثبت أن الاختيار الفرعي المحدد للمهام يتفوق على نهج "الكل في واحد" التقليدي، وأن طرق الاختيار الجشعة غير موثوقة بسبب الانتهاكات المتكررة لخاصية التناقص (submodularity).

Ming Liu2026-05-08