💬 NLP

GhanaNLP Parallel Corpora: Comprehensive Multilingual Resources for Low-Resource Ghanaian Languages

تعالج مبادرة GhanaNLP ندرة البيانات اللغوية الرقمية للغات الغانية ذات الموارد المنخفضة من خلال إصدار مجموعة بيانات منسقة تضم 41,513 زوجاً من الجمل المتوازية المترجمة احترافياً عبر خمس لغات محلية واللغة الإنجليزية، وذلك بهدف النهوض بالترجمة الآلية، وتقنيات الكلام، والحفاظ على اللغة.

Lawrence Adu Gyamfi, Paul Azunre, Stephen Edward Moore, Joel Budu, Akwasi Asare, Mich-Seth Owusu, Jonathan Ofori Asiamah2026-03-17
💬 NLP

APEX-Searcher: Augmenting LLMs' Search Capabilities through Agentic Planning and Execution

تقدم الورقة البحثية APEX-Searcher، وهو إطار عمل وكيل جديد ثنائي المراحل يعزز قدرات البحث لنماذج اللغات الكبيرة في المهام المعقدة متعددة الخطوات من خلال فصل العملية إلى تخطيط استراتيجي مُحسَّن عبر التعلم التعزيزي وتنفيذ قوي مُنقَّح عبر الضبط الدقيق الخاضع للإشراف، وذلك للتغلب على قيود التدريب النهائي المباشر مثل مسارات الاسترجاع الغامضة والمكافآت الشحيحة.

Kun Chen, Qingchao Kong, Zhao Feifei, Wenji Mao2026-03-17
💬 NLP

Large Language Models Reproduce Racial Stereotypes When Used for Text Annotation

تُثبت هذه الورقة أنه عبر 19 نموذجاً لغوياً كبيراً وأكثر من 4 ملايين حكم تقييمي، تؤدي إشارات الهوية الدقيقة مثل الأسماء واللهجات بشكل منهجي إلى تحفيز الصور النمطية العرقية، مما يتسبب في تقييم النصوص المرتبطة بمجموعات الأقليات على أنها أكثر عدوانية، وأقل احترافية، وأقل ثقة، مما يؤدي بالتالي إلى ترسيخ هذه الانحيازات في مجموعات البيانات المؤتمتة المستخدمة في الأبحاث واتخاذ القرار.

Petter Törnberg2026-03-17
💬 NLP

ToolFlood: Beyond Selection -- Hiding Valid Tools from LLM Agents via Semantic Covering

تقدم هذه الورقة البحثية ToolFlood، وهو هجوم مبتكر على طبقة الاسترجاع يستهدف استهداف وكلاء النماذج اللغوية الكبيرة (LLMs) المعززة بالأدوات عبر حقن مجموعة صغيرة من الأدوات المصممة خصيصاً بأسلوب عدائي لتغطي دلالياً استعلامات مستخدم متنوعة بهدف السيطرة على نتائج الاسترجاع لأعلى (top-k) وإزاحة جميع الأدوات السليمة، محققةً نسبة نجاح في الهجوم تصل إلى 95% مع أدنى معدلات الحقن.

Hussein Jawad, Nicolas J-B Brunel2026-03-17
🤖 AI

Supervised Fine-Tuning versus Reinforcement Learning: A Study of Post-Training Methods for Large Language Models

تقدم هذه الورقة إطاراً موحداً لمرحلة ما بعد التدريب للنماذج اللغوية الكبيرة من خلال التحليل الشامل للأدوار المتميزة والمترابطة لكل من الضبط الدقيق الخاضع للإشراف والتعلم التعزيزي، واستكشاف تكاملهما الهجين، وتحديد الاتجاهات الرئيسية وأفضل الممارسات للتطبيق الفعال بناءً على الأدلة التجريبية الحديثة.

Haitao Jiang, Wenbo Zhang, Jiarui Yao, Hengrui Cai, Sheng Wang, Rui Song2026-03-17
💬 NLP

Beyond Explicit Edges: Robust Reasoning over Noisy and Sparse Knowledge Graphs

تقدم الورقة البحثية إطار عمل INSES، وهو إطار هجين يجمع بين الملاحة الموجهة بنماذج اللغات الكبيرة (LLM)، والتوسع في التشابه القائم على التضمين، وموجه خفيف الوزن لتمكين الاستدلال متعدد الخطوات القوي عبر الرسوم البيانية للمعرفة الصاخبة والمتفرقة، متفوقاً بشكل كبير على نماذج GraphRAG وRAG الحالية.

Hang Gao, Dimitris N. Metaxas2026-03-17
💬 NLP

The Reasoning Bottleneck in Graph-RAG: Structured Prompting and Context Compression for Multi-Hop QA

تحدد هذه الورقة أن أنظمة (Graph-RAG) تفشل أساساً بسبب اختناقات الاستنتاج بدلاً من مشكلات الاسترجاع، وتقترح الجمع بين تحفيز "سلسلة الأفكار" لـ (SPARQL) وضغط سياق "المسار الرسومي" لتعزيز دقة الإجابة على الأسئلة متعددة القفزات بشكل كبير، مما يمكّن النماذج الأصغر والأقل تكلفة من التفوق على النماذج المرجعية الأكبر.

Yasaman Zarinkia, Venkatesh Srinivasan, Alex Thomo2026-03-17
🤖 machine learning

Understanding the Emergence of Seemingly Useless Features in Next-Token Predictors

تقترح هذه الورقة طريقة لتتبع ظهور الميزات المجردة التي تبدو زائدة عن الحاجة في نماذج المحولات (Transformer) وإرجاعها إلى مكونات محددة في تدرج التنبؤ بالرمز التالي، مما يكشف أن مثل هذه الميزات غالبًا ما تشكل ركيزة لقدرات معقدة مثل نمذجة العالم، والنحو، والاستدلال الصوري.

Mark Rofin, Jalal Naghiyev, Michael Hahn2026-03-17
💬 NLP

OasisSimp: An Open-source Asian-English Sentence Simplification Dataset

تقدم هذه الورقة OasisSimp، وهي مجموعة بيانات جديدة مفتوحة المصدر لتبسيط الجمل متعددة اللغات تغطي خمس لغات آسيوية (بما في ذلك ثلاث لغات لا توجد لها مجموعات بيانات سابقة)، والتي تعمل كمورد قيم ومعيار تحدٍ للكشف عن تفاوت الأداء والقيود التي تواجهها النماذج اللغوية الكبيرة الحالية في البيئات ذات الموارد المنخفضة.

Hannah Liu, Muxin Tian, Iqra Ali, Haonan Gao, Qiaoyiwen Wu, Blair Yang, Uthayasanker Thayasivam, En-Shiun Annie Lee, Pak (…)2026-03-17
💬 NLP

The GELATO Dataset for Legislative NER

تقدم هذه الورقة GELATO، وهي مجموعة بيانات جديدة لمشاريع القوانين التشريعية الأمريكية من الكونجرس الـ118 الموضحة بوجود أنطولوجيا ذات مستويين، وتثبت أن نماذج RoBERTa المضبوطة بدقة والمدمجة مع النماذج اللغوية الكبيرة تؤدي بفعالية مهمة التعرف على الكيانات المسماة التشريعية.

Matthew Flynn, Timothy Obiso, Sam Newman2026-03-17