💬 NLP

Negative Advantage Is a Double-Edged Sword: Calibrating Advantage in GRPO for Deep Search

تقدم هذه الورقة CalibAdv، وهي طريقة مبتكرة لمعايرة الميزة تخفف من عدم الاستقرار وتدهور الأداء في تحسين السياسة النسبية للمجموعات (GRPO) في وكلاء البحث العميق، وذلك من خلال خفض دقيق للمزايا السلبية المفرطة بناءً على صحة الخطوات المتوسطة وإعادة توازن توزيع المزايا.

Jiayi Wu, Ruobing Xie, Zeqian Huang, Lei Jiang, Can Xu, Kangyang Luo, Ming Gao, Xiang Li2026-04-21
💬 NLP

Beyond Pattern Matching: Seven Cross-Domain Techniques for Prompt Injection Detection

تقترح هذه الورقة وتقيم سبع تقنيات للكشف عبر المجالات عن حقن الأوامر (prompt injection) — مستمدة من مجالات مثل المعلوماتية الحيوية، والاقتصاد، ونظرية المترجمات — للتغلب على قيود أساليب التعبيرات النمطية (regex) والمصنفات الضبطية (fine-tuned classifiers) الحالية، مع دمج ثلاث من هذه الطرق بنجاح في إصدار prompt-shield v0.4.1 وإظهار تحسينات كبيرة في مقياس F1 score.

Thamilvendhan Munirathinam2026-04-21
💬 NLP

Where Do Self-Supervised Speech Models Become Unfair?

تقدم هذه الورقة أول تحليل للعدالة على مستوى الطبقات لنماذج الكلام ذات التعلم الذاتي، كاشفةً أن تحيزات مجموعات المتحدثين تظهر من الطبقات الأولى وتُظهر علاقة عكسية بين تحديد هوية المتحدث والأداء في التعرف التلقائي على الكلام، مما يشير إلى أن هذه التحيزات تتشكل أثناء مرحلة ما قبل التدريب وتستمر حتى بعد الضبط الدقيق.

Felix Herron, Maja Hjuler, Solange Rossato, Alexandre Allauzen, François Portet2026-04-21
💬 NLP

DocQAC: Adaptive Trie-Guided Decoding for Effective In-Document Query Auto-Completion

تقدم الورقة البحثية DocQAC، وهو إطار عمل جديد لفك التشفير الموجه بالتري (trie) التكيفي يستفيد من السياق الخاص بالوثيقة وآلية عقوبة تكيفية للتفوق على النماذج الضخمة المضبوطة للتعليمات في الإكمال التلقائي للاستعلام داخل الوثيقة مع تقديم كفاءة وقابلية توسع أكبرين.

Rahul Mehta, Kavin R V, Indrajit Pal, Tushar Abhishek, Pawan Goyal, Manish Gupta2026-04-21
💬 NLP

Reasoning Models Know What's Important, and Encode It in Their Activations

تُثبت هذه الورقة أن النماذج اللغوية تُشفّر تمثيلاً داخلياً وقابلاً للتعميم لأهمية خطوات الاستدلال ضمن تنشيطاتها، مما يكشف أن تحليل المكونات الداخلية للنموذج يوفر رؤى أعمق في عمليات الاستدلال مقارنة بالتحليل السطحي للرموز (tokens).

Yaniv Nikankin, Martin Tutek, Tomer Ashuach, Jonathan Rosenfeld, Yonatan Belinkov2026-04-21
💬 NLP

On the Importance and Evaluation of Narrativity in Natural Language AI Explanations

تجادل هذه الورقة بأن تفسيرات الذكاء الاصطناعي للغة الطبيعية يجب أن تتبنى بنية سردية لدعم الفهم البشري بشكل أفضل، وتقترح سبعة مقاييس آلية جديدة لتقييم جودة السرد عبر أربعة أبعاد رئيسية، وتستعرض قواعد توليد لتحسين القدرة التفسيرية لمخرجات الذكاء الاصطناعي القابل للتفسير بما يتجاوز قوائم الميزات القياسية.

Mateusz Cedro, David Martens2026-04-21
💬 NLP

FregeLogic at SemEval 2026 Task 11: A Hybrid Neuro-Symbolic Architecture for Content-Robust Syllogistic Validity Prediction

تقدم الورقة البحثية FregeLogic، وهو نظام هجين عصبي-رمزي لمهمة SemEval-2026 Task 11 يجمع بين مجموعة من النماذج اللغوية الكبيرة ومحلل Z3 SMT لحل أخطاء التحيز المحتوي في التنبؤ بصحة القياس المنطقي، محققاً دقة بنسبة 94.3% ومقللاً بشكل كبير من مقياس تأثير المحتوى من خلال التحقق الرسمي المستهدف في الحالات المتنازع عليها.

Adewale Akinfaderin, Nafi Diallo2026-04-21
💬 NLP

HiGMem: A Hierarchical and LLM-Guided Memory System for Long-Term Conversational Agents

يُعد HiGMem نظام ذاكرة هرمي موجه بنماذج اللغات الكبيرة (LLM) يعمل على تحسين الوكلاء الحواريين طويلي الأمد عبر استخدام ملخصات الأحداث كمرتكزات دلالية لاسترجاع مجموعات أدلة موجزة وعالية الدقة، متفوقاً بشكل كبير على الأساليب الحالية في معيار LoCoMo10 مع استرجاع عدد أقل بكثير من جولات الحوار.

Shuqi Cao (East China Normal University, Shanghai, China), Jingyi He (Shanghai Jiao Tong University, Shanghai, China), F (…)2026-04-21
💬 NLP

StepPO: Step-Aligned Policy Optimization for Agentic Reinforcement Learning

تقدم هذه الورقة StepPO، وهو إطار عمل يعزز التعلم التعزيزي الوكيل عبر نقل نموذج التحسين من عمليات ماركوف لاتخاذ القرار على مستوى الرمز (token-level) إلى مستوى الخطوة (step-level)، مما يؤدي إلى مواءمة تحديثات السياسة وتخصيص الائتمان مع التدرج الطبيعي لقرارات الوكيل للتعامل بشكل أفضل مع التفاعلات متعددة الأدوار، والمكافآت الشحيحة، واستخدام الأدوات المعقدة.

Daoyu Wang, Qingchuan Li, Mingyue Cheng, Jie Ouyang, Shuo Yu, Qi Liu, Enhong Chen2026-04-21
📊 statistics

Knowing When to Quit: A Principled Framework for Dynamic Abstention in LLM Reasoning

تقترح هذه الورقة إطار عمل مبني على التعلم التعزيزي المنهجي للامتناع الديناميكي أثناء التوليد في النماذج اللغوية الكبيرة، مما يثبت أن إنهاء مسارات الاستدلال غير الواعدة عندما تنخفض قيمتها المقدرة عن عتبة المقايضة بين الحوسبة والمعلومات يحسن بشكل كبير من الدقة الانتقائية والكفاءة مقارنة بالطرق الحالية.

Hen Davidov, Nachshon Cohen, Oren Kalinsky, Yaron Fairstein, Guy Kushilevitz, Ram Yazdi, Patrick Rebeschini2026-04-21