💬 NLP

Beyond BLEU: A Semantic Evaluation Method for Code Translation

تقترح هذه الورقة منهجية تقييم دلالي مبتكرة لترجمة الكود البرمجي تستخدم اختبار المترجم (compiler testing) لقياس صحة التنفيذ، مما يثبت أن أدوات فك التجميع (decompilers) القائمة على النماذج اللغوية الكبيرة تتفوق بشكل كبير على النهج الاستدلالي، في حين تفشل المقاييس النحوية التقليدية مثل BLEU في الارتباط بالدقة الوظيفية.

Julius Näumann, Sven Keidel, Amir Molzam Sharifloo, Mira Mezini2026-05-08
💬 NLP

Counterargument for Critical Thinking as Judged by AI and Humans

تُظهر هذه الدراسة التدخلية أن الطلاب يوظفون التفكير النقدي بفعالية من خلال كتابة حجج مضادة للمحتوى المُنشأ بواسطة الذكاء الاصطناعي، وتؤكد أن النماذج اللغوية الكبيرة الرائدة، عندما يتم توجيهها بمعايير تقييم واضحة، يمكنها تقييم هذا العمل المكتوب بشكل موثوق وعلى نطاق واسع مع توافق متوسط مع التقييمات البشرية.

Tosin Adewumi, Marcus Liwicki, Foteini Simistira Liwicki, Lama Alkhaled, Hamam Mokayed, Esra Sümer-Arpak2026-05-08
💬 NLP

ZAYA1-8B Technical Report

تقدم الورقة البحثية نموذج ZAYA1-8B، وهو نموذج استدلال من نوع (MoE) بـ 8 مليارات معلمة يتميز بكفاءة عالية، تم تدريبه بالكامل على بنية تحتية من شركة AMD، ويحقق أداءً هو الأفضل في فئته على معايير الرياضيات والبرمجة من خلال تسلسل تعزيز تعلم رباعي المراحل وطريقة حساب وقت الاختبار (RSA) الماركوفية المبتكرة، مما يقلص الفجوة بفعالية مع النماذج الأكبر حجماً بكثير.

Robert Washbourne, Rishi Iyer, Tomas Figliolia, Henry Zheng, Ryan Lorig-Roach, Sungyeon Yang, Pritish Yuvraj, Quentin An (…)2026-05-08
💬 NLP

SLAM: Structural Linguistic Activation Marking for Language Models

تُعدُّ SLAM (الوسم بالنشاط اللغوي الهيكلي) مخطط وسم مائي جديد من النوع "الصندوق الأبيض" يحقق دقة كشف تقترب من المثالية مع حد أدنى من فقدان الجودة عبر توجيه الاتجاهات الهيكلية المحددة بواسطة المشفر التلقائي المتناثر في تيار البواقي، مما يحافظ على أخذ العينات المعجمية والدلالات مع تقديم ملف قوة متكامل مع طرق توزيع الرموز التقليدية.

Fabrice Harel-Canada, Amit Sahai2026-05-08
🤖 machine learning

A Unified Benchmark for Evaluating Knowledge Graph Construction Methods and Graph Neural Networks

تقدم هذه الورقة معياراً موحداً وقابلاً لإعادة الإنتاج في المجال الحيوي الطبي، يقيم بشكل مشترك متانة الشبكات العصبية الرسومية على الرسوم البيانية المستمدة من النصوص والمشوبة بالضجيج، وفعالية طرق بناء الرسوم البيانية المعرفية المختلفة من خلال مقارنتها بمرجع عالي الجودة تم إعداده من قبل خبراء.

Othmane Kabal, Mounira Harzallah, Fabrice Guillet, Hideaki Takeda, Ryutaro Ichise2026-05-08
💬 NLP

FinRAG-12B: A Production-Validated Recipe for Grounded Question Answering in Banking

يُعد FinRAG-12B إطار عمل بـ 12 مليار معلمة، تم التحقق من كفاءته في بيئة الإنتاج وهو فعال من حيث البيانات، حيث يجمع بين مسار تدريب متخصص وآليات رفض مُعايرة لتقديم إجابات على الأسئلة عالية الدقة والموثوقية ومنخفضة التكلفة لأكثر من 40 مؤسسة مالية، متفوقاً بذلك على GPT-4.1 في جودة الاستشهاد وحل الاستعلامات مع تقليل زمن الاستجابة والتكاليف التشغيلية بشكل كبير.

Denys Katerenchuk, Pablo Duboue, Keelan Evanini, David Gondek, Nithin Govindugari, Olivier Allauzen, Joshua Baptiste, Da (…)2026-05-08
💬 NLP

ReaComp: Compiling LLM Reasoning into Symbolic Solvers for Efficient Program Synthesis

تقدم الورقة البحثية ReaComp، وهو إطار عمل يقوم بتجميع آثار استدلال النماذج اللغوية الكبيرة (LLM) إلى أدوات حل رمزية قابلة لإعادة الاستخدام وبصفر توكن، والتي تحقق دقة تضاهي أحدث ما توصل إليه العلم في معايير قياس تخليق البرامج، وتقلل بشكل كبير من استخدام التوكنات عند دمجها مع النماذج اللغوية الكبيرة، وتنتقل بنجاح إلى المهام اللغوية الواقعية.

Atharva Naik, Yash Mathur, Prakam, Carolyn Rose, David Mortensen2026-05-08
💬 NLP

Belief Memory: Agent Memory Under Partial Observability

تقدم الورقة البحثية BeliefMem، وهو إطار عمل للذاكرة الاحتمالية لوكلاء النماذج اللغوية الكبيرة (LLM) يعمل على التخفيف من الأخطاء ذاتية التعزيز في البيئات ذات الإدراك الجزئي من خلال الاحتفاظ بعدة استنتاجات مرشحة مع احتمالات محدثة بدلاً من الالتزام باستنتاجات حتمية منفردة، مما يحقق أداءً فائقاً في اختبارات السياق الطويل.

Junfeng Liao, Qizhou Wang, Jianing Zhu, Bo Du, Rui Yan, Xiuying Chen2026-05-08
💬 NLP

The Cost of Context: Mitigating Textual Bias in Multimodal Retrieval-Augmented Generation

تحدد هذه الورقة البحثية وتعالج "إعادة التشويه" (recorruption)، وهي نمط فشل في نماذج التوليد المعزز بالاسترجاع متعدد الوسائط حيث يتسبب السياق الدقيق في تخلي النماذج عن التنبؤات الصحيحة بسبب العمى البصري والتحيز الموضعي، وذلك عبر اقتراح إطار عمل "تدخل انتباه عنق الزجاجة للاسترداد" (BAIR) الخالي من المعلمات لاستعادة البروز البصري وتحسين موثوقية التشخيص دون الحاجة لإعادة التدريب.

Hoin Jung, Xiaoqian Wang2026-05-08
💬 NLP

Architecture Matters: Comparing RAG Systems under Knowledge Base Poisoning

تُثبت هذه الورقة أن بنية "توليد المخرقات المعزز بالاسترجاع" (RAG) تؤثر بشكل كبير على المتانة ضد تسميم قاعدة المعرفة، كاشفةً أنه في حين أن التصاميم المتقدمة مثل النماذج اللغوية التكرارية تقلل بشكل جذري من معدلات نجاح الهجمات مقارنة بمسارات العمل التقليدية، فإن الثغرة الأساسية تكمن في مرحلة الاستدلال على المحتوى حيث يقوض التأطير العدائي تقييم المصداقية بدلاً من كونها في تحسين عملية الاسترجاع.

Samuel Korn2026-05-08