🤖 machine learning

Key-Value Means

تقدم الورقة البحثية "أوساط المفتاح والقيمة" (Key-Value Means - KVM)، وهي آلية تكرار كتلية (block-recurrence) مبتكرة لآلية الانتباه توحد فوائد نماذج المحولات (Transformers) والشبكات العصبية المتكررة الخطية (linear RNNs) من خلال تمكين تدريب فعال قابل للتوازي عبر الكتل مع نمو مرن للحالة ووقت استباقي (prefill time) دون تربيعي، وكل ذلك باستخدام عمليات قياسية وبأقل قدر من المعلمات الإضافية.

Daniel Goldstein, Eugene Cheah2026-05-12✓ Author reviewed
🤖 AI

Pseudo-Deliberation in Language Models: When Reasoning Fails to Align Values and Actions

تقدم هذه الورقة مفهوم "التداول الزائف" لوصف عدم الاتساق المستمر بين القيم المعلنة للنماذج اللغوية الكبيرة وأفعالها الفعلية حتى في حالة وجود عملية استدلال، وتقترح إطار عمل VALDI ونظام التدخل VIVALDI لقياس ومعالجة فجوة القيمة والعمل هذه بشكل منهجي.

Sushrita Rakshit, Hanwen Zhang, Hua Shen2026-05-12
🤖 AI

The Gordian Knot for VLMs: Diagrammatic Knot Reasoning as a Hard Benchmark

يقدم KnotBench معياراً مرجعياً صارماً باستخدام ما يقرب من 860,000 مخطط للعقد لتوضيح أن النماذج اللغوية الرؤية الحالية، على الرغم من تحسن أدائها مع أوضاع "التفكير"، تعاني بشكل أساسي من صعوبة في ترجمة هياكل العقد البصرية إلى استدلال رمزي قابل للتنفيذ، وغالباً ما تفشل في التفوق على الخطوط المرجعية العشوائية في المهام التي تتطلب معالجة تخطيطية.

Hao Liu, Jicheng Liu2026-05-12
🤖 AI

Position: Academic Conferences are Potentially Facing Denominator Gaming Caused by Fully Automated Scientific Agents

تحذر هذه الورقة الموقفية من أن مؤتمرات الذكاء الاصطناي التنافسية الكبرى تواجه ثغرة نظامية تسمى "التلاعب بالمنظومة عبر الوكلاء" (Agentic Denominator Gaming)، حيث يستخدم الفاعلون الخبثاء وكلاءً آليين لإغراق مجمعات التقديم بأوراق بحثية منخفضة الجودة لرفع معدلات القبول للأعمال المشروعة المستهدفة بشكل مصطنع، مما يستلد إصلاحات هيكلية في السياسات بدلاً من مجرد الاكتفاء بالرصد التقني للتخفيف من حدة احتراق المراجعين وتدهور جودة المراجعة الناتج عن ذلك.

Rong Shan, Te Gao, Hang Zheng, Yunjia Xi, Jiachen Zhu, Zeyu Zheng, Yong Yu, Weinan Zhang, Jianghao Lin2026-05-12
🤖 AI

Team-Based Self-Play With Dual Adaptive Weighting for Fine-Tuning LLMs

تقدم هذه الورقة البحثية "اللعب الذاتي القائم على الفريق مع التوزين التكيفي المزدوج" (TPAW)، وهو خوارزمية تعلم ذاتي مبتكرة تعزز محاذاة النماذج اللغوية الكبيرة من خلال استخدام إطار عمل فريق تعاوني-تنافسي مع نقاط تفتيش تاريخية وآليات توزين تكيفي مزدوج للتغلب على عدم الاستقرار والقيود التحسينية لأساليب التدريب الذاتي الحالية.

Wu Li, Yigeng Zhou, Zesheng Shi, Yequan Wang, Min Zhang, Jing Li2026-05-12
🤖 AI

PruneTIR: Inference-Time Tool Call Pruning for Effective yet Efficient Tool-Integrated Reasoning

تُعد PruneTIR إطار عمل في مرحلة الاستدلال يعمل على تعزيز الاستدلال المتكامل مع الأدوات في النماذج اللغوية الكبيرة من خلال التقليم الديناميكي للمسارات الخاطئة، وإعادة أخذ عينات استدعاءات الأدوات، وتعليق محاولات إعادة التجربة لتحسين الدقة والكفاءة دون تدريب إضافي.

Luan Zhang, Dandan Song, Zhijing Wu, Zhengyu Chen, Chen Zhang, Yuhang Tian, Huipeng Ma, Chenhao Li, Changzhi Zhou, Xudon (…)2026-05-12
🤖 machine learning

G-Zero: Self-Play for Open-Ended Generation from Zero Data

إن G-Zero هو إطار عمل تطوري مشترك وخالٍ من المتحقق (verifier-free)، يتيح التحسين الذاتي مفتوح النهاية للنماذج اللغوية الكبيرة عبر استخدام مكافأة "تلميح-δ\delta" (Hint-δ\delta) جوهرية لتدريب نموذج "المقترح" (Proposer) على توليد استعلامات وتلميحات تحدّية، والتي يتعلم منها نموذج "المولد" (Generator) عبر خوارزمية التفضيل المباشر (DPO)، مما يتجاوز قيود الحكام الخارجيين.

Chengsong Huang, Haolin Liu, Tong Zheng, Runpeng Dai, Langlin Huang, Jinyuan Li, Zongxia Li, Zhepei Wei, Yu Meng, Jiaxin (…)2026-05-12
🤖 machine learning

The Truth Lies Somewhere in the Middle (of the Generated Tokens)

تُثبت هذه الورقة أن التجميع المتوسط عبر الرموز المولدة تلقائياً يؤدي إلى تمثيلات دلالية متفوقة مقارنة بحالات الرموز الفردية، مما يكشف أن المعلومات موزعة عبر عملية التوليد بدلاً من كونها ممركزة في موضع واحد.

Sophie L. Wang, Phillip Isola, Brian Cheung2026-05-12
🤖 AI

GLiNER2-PII: A Multilingual Model for Personally Identifiable Information Extraction

يقدم البحث نموذج GLiNER2-PII، وهو نموذج متعدد اللغات مدمج تم تدريبه على مجموعة نصوص اصطناعية للكشف بفعالية عن 42 نوعاً من معلومات الهوية الشخصية عبر لغات وتنسيقات متنوعة، محققاً أداءً هو الأفضل في فئته على مقياس SPY المرجعي.

Urchade Zaratiana, Ash Lewis, George Hurn-Maloney2026-05-12
🤖 AI

Personalizing LLMs with Binary Feedback: A Preference-Corrected Optimization Framework

تقدم هذه الورقة البحثية C-BPO، وهو إطار تحسين مُعاير بالتفضيلات يعزز تخصيص النماذج اللغوية الكبيرة من خلال الاستفيد من التغذية الراجعة الثنائية للتمييز بين تفضيلات المستخدم الفردية والمعرفة المشتركة، مما يساهم بفعالية في نمذجة الاختلافات بين المستخدمين مع الحفاظ على الفائدة العامة.

Xilai Ma, Liye Zhao, Weijun Yao, Haibing Di, Wenya Wang, Jing Li2026-05-12