🤖 AI

SCHEDBench: A Benchmark for Evaluating LLM Constraint Faithfulness in Natural-Language Combinatorial Scheduling

تقدم هذه الورقة SCHEDBench، وهو معيار مرجعي شامل يعتمد على اللغة الطبيعية يوضح أن النماذج اللغوية الكبيرة تفشل في الحفاظ على موثوقية الالتزام بالقيود والجدوى عبر التباينات المتنوعة في الصيغ السطحية المتكافئة دلالياً في مهام الجدولة التوافقية المختلفة.

Shrenil Shaun Sharma, Avi Sharma2026-08-04
💬 NLP

Entity-Faithful Repair of Synthetic Supervision for Zero-Shot Image Captioning

تقترح الورقة البحثية إطار عمل ReCap، وهو إطار عمل جاهز للتشغيل (plug-and-play) يعزز وصف الصور بنمط الصفر (zero-shot image captioning) من خلال إصلاح عدم الاتساق على مستوى الكيانات صراحةً في بيانات التدريب الاصطناعية عبر إعادة كتابة التسميات التوضيحية الموجهة والتعلم الديناميكي الموزون التكيفي، محققاً بذلك أداءً هو الأفضل حالياً (state-of-the-art) في كل من معايير الاختبار داخل النطاق وعبر النطاقات.

Zhiyue Liu, Wenkai Zhou, Jian Qin, Qipeng Jiang2026-08-04
💬 NLP

MedUPS: Towards Diagnostic Assistance in Uncommon Medical Cases with Large Language Models

تقدم الورقة البحثية MedUPS، وهو إطار عمل للمواءمة ومجموعة بيانات مقابلة (MedUPSQA) تعمل على تحسين المساعدة التشخيصية للحالات الطبية غير الشائعة من خلال تدريب النماذج اللغوية الكبيرة على التنبؤ بالقرارات السريرية الوسيطة باستخدام التعلم التعزيزي، مما يؤدي إلى تفوقها على كل من النماذج الأساسية والنماذج الرائدة الأكبر حجماً في دقة الخطوة التالية.

Ofir Ben Shoham, Oriel Perets, Nir Grinberg, Nadav Rappoport2026-08-04
💬 NLP

Can Humans Dream of Electric Sheep? Human-Written Samples for Fine-Grained Vision-and-Language Hallucination Benchmarking

تقدم هذه الورقة معياراً مرجعياً متعدد اللغات ودقيقاً للكشف عن الهلوسة في الرؤية واللغة، مبرهنةً على أن العينات المكتوبة بشرياً تُعد بديلاً قابلاً للتطبيق ومستقلاً عن النماذج للبيانات المولدة آلياً، وذلك من خلال توفير توافق أعلى في التوصيف وتحكم أفضل مع الحفاظ على تشابه التوزيع.

Timothee Mickus, Claudio Savelli, Eduardo Calò, Emilio Raimond, Stella Frank, Hengyu Luo, Flavio Giobergia, Vincent Sego (…)2026-08-04
💬 NLP

DeBERTa-Sentinel: Toward Transparent and Trustworthy Detection of AI-Generated Text

تقدم الورقة البحثية DeBERTa-Sentinel، وهو إطار عمل شفاف وقابل للتفسير للكشف عن النصوص المولدة بواسطة الذكاء الاصطناعي يستفيد من آلية الانتباه المنفصل لنموذج DeBERTa-v3 لتحقيق دقة رائدة مع توفير تفسيرات على مستوى الرمز (token-level) لتمكين التحقق من المحتوى القابل للتدقيق والموثوق لمختلف أصحاب المصلحة.

Muhammad Yousaf Rehman, Muhammad Islam2026-08-04
💬 NLP

UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering

يُعد UniHEAR إطار عمل موحداً وخفيف الوزن يتغلب على قيود الاسترجاع أحادي المصدر وإعادة التصنيف غير المعتمد على المصدر في مجال الإجابة على الأسئلة البصرية القائمة على المعرفة، وذلك من خلال توظيف واصف استرجاع خشن، وبوابة نمطية انتباهية موجهة بالاسترجاع، ودمج مصادر مرجح بالإنتروبيا لتحقيق أداء رائد في معايير E-VQA وInfoSeek.

Ganzhong Luo, Yang Ren, Hanyong Wang, Shuyu Zheng, Menglong Yang2026-08-04
💬 NLP

Morphology Aware Reversible Semantic Tokenization and Hierarchical Word Composition for Tamil Language Models

تقترح هذه الورقة نظاماً لترميز دلالي عكسي ومدرك للمورفولوجيا (الصرف) مع تركيب كلمات هرمي للغة التاميلية، يتفوق على النماذج المرجعية الحالية في جودة الترجمة مع تقليل طول التسلسل وتكاليف الاستدلال بشكل كبير في ظل ميزانية نموذج ثابتة.

Anand Murugan2026-08-04
💬 NLP

ACE-GraphRAG: Agentic Context Engineering for Hierarchical GraphRAG

تقترح الورقة البحثية إطار عمل ACE-GraphRAG، وهو إطار استدلال وكيلِيّ وقت الاستنتاج يجسّر الفجوة بين التمثيل والاستدلال في تقنية Hierarchical GraphRAG من خلال التكيف الديناميكي لبناء السياق عبر الاسترجاع التفاضلي المتوازي والسياسات المحددة للمهام، متفوقاً بذلك على النماذج المرجعية الثابتة في مهام الإجابة على الأسئلة متعددة القفزات ومهام التلخيص.

Yongfeng Huang, Yuren Lai, Ruiying Chen, Haoyu Huang, Mingming Zhao, James Cheng2026-08-04
💬 NLP

ArabicDialectSafety: A Dialect-Aware Benchmark for Arabic Content Safety Classification

تقدم الورقة البحثية ArabicDialectSafety، وهي مجموعة بيانات مرجعية منسقة بشرياً تضم أكثر من 25,000 مطالبة عبر ستة تنوعات لغوية عربية تم تصنيفها من حيث السلامة، والتي تكشف أن نموذج MARBERTv2 الذي تم ضبطه بدقة يتفوق على النماذج اللغوية الكبيرة الرائدة في الكشف عن الضرر المدرك للهجات، مع تسليط الضوء على التحديات المستمرة في اللهجات المغاربية ذات الموارد المنخفضة.

Wajdi Zaghouani, Md. Rafiul Biswas, Kholoud Khalil Aldous, Mabrouka Bessghaier2026-08-04
💬 NLP

RH-RAG: Trustworthy Long-Form Generation for Privacy-Constrained Settings

إن RH-RAG هو إطار عمل متعدد الوكلاء مصمم للبيئات ذات الخصوصية المقيدة، يتيح توليد نصوص طويلة موثوقة على الأجهزة المحلية من خلال تنسيق وكلاء التخطيط والكتابة والتحقق مع فهرس استرجاع ثنائي المستوى لضمان الدقة الواقعية والتماسك الدلالي دون الاعتماد على واجهات برمجة تطبيقات سحابية مملوكة.

Raj Shekhar Singh2026-08-04