💬 NLP

Creating a Hybrid Rule and Neural Network Based Semantic Tagger using Silver Standard Data: the PyMUSAS framework for Multilingual Semantic Annotation

تقدم هذه الورقة إطار عمل PyMUSAS، الذي يقدم أكبر تقييم لنظام الوسم الدلالي USAS عبر خمس لغات، ويوضح كيف يعزز النهج الهجين الذي يجمع بين الأساليب القائمة على القواعد والشبكات العصبية، والمدرب على مجموعة بيانات "فضية المعايير" تم إنشاؤها حديثاً، أداء التوسيم الدلالي متعدد اللغات بشكل كبير.

Andrew Moore, Paul Rayson, Dawn Archer, Tim Czerniak, Dawn Knight, Daisy Lal, Gearóid Ó Donnchadha, Mícheál Ó Meachair (…)2026-03-09
🤖 machine learning

Restoring Exploration after Post-Training: Latent Exploration Decoding for Large Reasoning Models

تقدم هذه الورقة استراتيجية فك ترميز تسمى "فك تشفير الاستكشاف الكامن" (Latere Exploration Decoding - LED)، وهي استراتيجية فك ترميز خالية من التدريب تستفيد من التوزيعات البعدية للطبقات المتوسطة ذات الاعتلاج العالي لمواجهة انهيار الاستكشاف في نماذج الاستدلال اللغوية التي خضعت للتدريب اللاحق، مما يؤدي إلى تحسين الدقة بشكل كبير عبر معايير قياس متعددة.

Wenhui Tan, Fiorenzo Parascandolo, Enver Sangineto, Jianzhong Ju, Zhenbo Luo, Qian Cao, Rita Cucchiara, Ruihua Song, Jia (…)2026-03-09
🤖 AI

Accelerating Scientific Research with Gemini: Case Studies and Common Techniques

تقدم هذه الورقة مجموعة من دراسات الحالة التي توضح كيف نجح الباحثون في التعاون مع نماذج Gemini من Google لحل مشكلات مفتوحة واستخراج براهين جديدة في علوم الحاسوب النظرية ومجالات أخرى، مع استخلاص تقنيات مشتركة للشراكة الفعالة بين الإنسان والذكاء الاصطناعي في الاكتشاف العلمي.

David P. Woodruff, Vincent Cohen-Addad, Lalit Jain, Jieming Mao, Song Zuo, MohammadHossein Bateni, Simina Branzei, Micha (…)2026-03-09
🤖 AI

The Consensus Trap: Dissecting Subjectivity and the "Ground Truth" Illusion in Data Annotation

تنتقد هذه المراجعة المنهجية للأدبيات نموذج "الحقيقة المطلقة" في تعلم الآلة باعتباره مغالطة وضعية تُسيء تفسير الخلاف البشري على أنه ضجيج، وتدفع بدلاً من ذلك نحو بنى تحتية للتوسيم تتسم بالتعددية، تعامل وجهات النظر الذاتية المتنوعة كإشارات عالية الدقة وضرورية لبناء نماذج ذات كفاءة ثقافية.

Sheza Munir, Benjamin Mah, Krisha Kalsi, Shivani Kapania, Julian Posada, Edith Law, Ding Wang, Syed Ishtiaque Ahmed2026-03-09
🤖 AI

IntelliAsk: Learning to Ask High-Quality Research Questions via RLVR

تقدم هذه الورقة البحثية IntelliAsk، وهو نموذج لتوليد الأسئلة تم تدريبه عبر التعلم المعزز من التغذية الراجعة من خلال التقييم (RLVR) باستخدام نموذج مكافأة مبتكر (IntelliReward) وتحسين DAPO لإنتاج أسئلة بحثية عالية الجودة وقائمة على الأدلة تتفوق على المراجعين البشريين والنماذج المرجعية القوية في تقييمات الخبراء، مع تعزيز قدرات الاستدلال والكتابة بشكل أوسع في الوقت ذاته.

Karun Sharma, Vidushee Vats, Shengzhi Li, Yuxiang Wang, Zhongtian Sun, Prayag Tiwari2026-03-09
💬 NLP

Diverse Word Choices, Same Reference: Annotating Lexically-Rich Cross-Document Coreference

تقترح هذه الورقة مخطط تعليق توضيحي منقحاً لحل مشكلة المرجع الجوهري عبر المستندات، يعامل سلاسل المراجع الجوهرية كعناصر خطاب لالتقاط التنوع اللفظي واختلافات التأطير في وسائل الإعلام الإخبارية بشكل أفضل، مبرهنةً من خلال إعادة التعليق التوضيحي لمجموعتي بيانات NewsWCL50 وECB+ أن هذا النهج يتيح تحليلاً أكثر توازناً وإدراكاً للسياق الخطابي.

Anastasia Zhukova, Felix Hamborg, Karsten Donnay, Norman Meuschke, Bela Gipp2026-03-09
💬 NLP

Both Ends Count! Just How Good are LLM Agents at "Text-to-Big SQL"?

تقدم هذه الورقة مقاييس تقييم مبتكرة لـ "النص إلى SQL الضخمة" (Text-to-Big SQL) لمعالجة أوجه القصور في المعايير المرجعية الحالية في تقييم وكلاء النماذج اللغوية الكبيرة (LLM) على مستوى الإنتاج، مما يثبت أن مقاييس "النص إلى SQL" التقليدية تفشل في استيعاب الآثار الحرجة المتعلقة بالتكلفة، وزمن الاستجابة، والكفاءة التي تنشأ عند التوسع إلى مجموعات بيانات ضخمة.

Germán T. Eizaguirre, Lars Tissen, Marc Sánchez-Artigas2026-03-09
🤖 machine learning

Attention Meets Reachability: Structural Equivalence and Efficiency in Grammar-Constrained LLM Decoding

تثبت هذه الورقة أنه في حين أن قواعد النحو الخالية من السياق المتكافئة لغوياً تنتج أقنعة رمزية متطابقة في فك التشفير المقيد بالقواعد، إلا أن اختلافات هيكلية تؤثر بشكل كبير على الكفاءة الحسابية من خلال إدخال تضخمات متغيرة في فضاء الحالة وتكاليف الغموض، مما يؤدي إلى حدود دنيا جوهرية لعملية فك التشفير ومقاييس تشويه جديدة لأخذ العينات المقنعة.

Faruk Alpay, Bilge Senturk2026-03-09
🤖 AI

CBR-to-SQL: Rethinking Retrieval-based Text-to-SQL using Case-based Reasoning in the Healthcare Domain

تقدم الورقة البحثية CBR-to-SQL، وهو إطار عمل للاستدلال القائم على الحالات (Case-Based Reasoning) يعمل على تحسين عملية توليد "النص إلى SQL" في مجال الرعاية الصحية من خلال استخدام قوالب حالات مجردة وعملية استرجاع ثنائية المراحل لتحقيق دقة وكفاءة عينات ومتانة أعلى مقارنة بطرق التوليد المعزز بالاسترجاع القياسية على مجموعة بيانات MIMICSQL.

Hung Nguyen, Hans Moen, Pekka Marttinen2026-03-09
💬 NLP

NOTAI.AI: Explainable Detection of Machine-Generated Text via Curvature and Feature Attribution

تقدم الورقة البحثية NOTAI.AI، وهو إطار عمل قابل للتفسير يجمع بين الإشارات القائمة على الانحناء، والميزات العصبية، والميزات الأسلوبية ضمن مصنف XGBoost للكشف عن النصوص المولدة آلياً، مع استخدام SHAP وطبقة نموذج لغوي كبير (LLM) لإنشاء مسوغات منظمة وبلغة طبيعية لقراراته.

Oleksandr Marchenko Breneur, Adelaide Danilov, Aria Nourbakhsh, Salima Lamsiyah2026-03-09