💬 NLP

UniMaia: Steering Chess Policies with Language for Human-like Play

تقدم الورقة البحثية UniMaia، وهو إطار عمل فعال من حيث المعلمات يوجه شبكة سياسة شطرنج Lc0 مجمدة باستخدام مطالبات لغوية لتحقيق قدرة تحكم شبيهة بالبشر على أسلوب اللعب وقوته مع الحفاظ على الأداء الخاص بالمجال دون الحاجة إلى تدريب متعدد الوسائط شامل، وذلك دون الحاجة إلى تدريب متعدد الوسائط من طرف إلى طرف.

Sherman Siu (University of Waterloo), Lesley Istead (University of Waterloo)2026-05-28
💬 NLP

Do Models Know Why They Changed Their Mind? Interpretability and Faithfulness of Chain-of-Thought Under Knowledge Conflict

تكشف هذه الورقة أنه في حين أن تسلسل التفكير في النماذج اللغوية هو عرض مستقر إلى حد كبير وغير متغير بالقرار لاستعراض المعرفة، مما يؤدي إلى الفشل في تفسير خياراتها بأمانة أثناء صراعات المعرفة، فإن الثقة ذاتية التقييم تقدم إشارة ضعيفة ولكنها حقيقية للتنبؤ بالقرارات، مما يشير إلى أن مراقبة الثقة أكثر فعالية من تحليل الحجج الاستدلالية نفسها.

Pruthvinath Jeripity Venkata2026-05-28
💬 NLP

Long Live the Librarian! A Persistent Search Sub-Agent for Energy-Efficient Multi-Agent Software Engineering Systems

تقدم الورقة البحثية "Librarian"، وهو وكيل بحث فرعي مستمر يقلل بشكل كبير من استهلاك الطاقة في أنظمة هندسة البرمجيات متعددة الوكلاء بنسبة تصل إلى 25% من خلال كبح الاستكشاف المتكرر واستبدال مقتطفات الملفات الكاملة بمراجع موجزة.

Seunghyuk Cho, Sunghyun Choi, Jaeseung Heo, Youngbin Choi, Saemi Moon, MoonJeong Park, Dongwoo Kim2026-05-28
🤖 machine learning

Knowing When to Ask: Segment-Level Credit Assignment for LLM Tool Use

تقدم الورقة البحثية إطار CARL، وهو إطار للتعلم التعزيزي المدرك للكفاءة يقوم بتعيين الائتمان على مستوى القطعة لقرارات استخدام الأدوات من خلال تفكيك عمليات التدحرج للنموذج عند الحدود الطبيعية، مما يمكّن النماذج اللغوية الكبيرة من التعلم ذاتياً متى تعتمد على المعرفة البارامترية مقابل الأدوات الخارجية ويحسن الدقة بشكل كبير مع تقليل استدعاءات الأدوات غير الضرورية، لا سيما في النماذج الأصغر حجماً.

Abhijit Kumar, Zoey Wu, Mohit Suley2026-05-28
💬 NLP

TARQ: Tail-Aware Reconstruction Quantization for Rare-Word Robust Automatic Speech Recognition

تقترح الورقة البحثية TARQ، وهو إطار عمل للكمّ ما بعد التدريب بدون تسميات، يقوم بنقل كتلة المعايرة نحو الكلمات النادرة باستخدام قاعدة موازنة ذات صيغة مغلقة وتصحيح متبقٍ، مما يحسن بشكل كبير معدلات خطأ الكلمات النادرة في التعرف التلقائي على الكلام دون الحاجة إلى تسميات كيانات أو تدريب إضافي.

Xinyu Wang, Ziyu Zhao, Ke Bai, Silin Meng, Dongming Shen, Xiao-Wen Chang, Yixuan HE2026-05-28
🤖 AI

Revealing Algorithmic Deductive Circuits for Logical Reasoning

تبحث هذه الورقة في كيفية أداء النماذج اللغوية الكبيرة للاستدلال المنطقي باستخدام تحليل الوساطة السببية لتحديد رؤوس انتباه محددة تسترجع القواعد الواقعية ورؤوس طبقات عليا تدمج المعلومات لتنفيذ استراتيجيات خوارزمية عالمية مثل عبور الرسوم البيانية.

Phuong Minh Nguyen, Tien Huu Dang, Naoya Inoue2026-05-28
💬 NLP

Playing with Words, Improving with Rewards: Training Language Models for Creative Association

تقترح هذه الورقة تدريب النماذج اللغوية الكبيرة على لعبة ربط الكلمات "Codenames" باستخدام التعلم التعزيزي مع مكافآت قابلة للتحقق لتعزيز الإبداع، كاشفةً أن النماذج الأكبر (8B) تحقق مكاسب إبداعية متسقة مع حد أدنى من فقدان القدرة على الاستنتاج، بينما تعطي النماذج الأصغر (1.7B و4B) الأولوية لدقة الاستنتاج على حساب الإبداع.

Vijeta Deshpande, Namrata Shivagunde, Sherin Muckatira, Hadrien Glaude, Mikhail Gronas, Claire Stevenson, Roger Beaty, A (…)2026-05-28
💬 NLP

FPMoE: A Sparse Mixture-of-Experts Approach to Functional Code Generation

يُعد FPMoE نموذجاً خفيف الوزن ومفتوح المصدر لتوليد الكود، يستفيد من بنية "خليط الخبراء" (Mixture-of-Experts) المتفرقة التي تضم خبراء مخصصين وخبراء مشتركين للتغلب على قيود النماذج الحالية في لغات البرمجة الوظيفية، محققاً أداءً فائقاً في لغات Haskell وOCaml وScala مع مضاهاة نماذج أكبر بكثير بامتلاكه 3 مليارات معلمة نشطة فقط.

Loc Pham, Lang Hong Nguyet Anh, Thanh Le-Cong2026-05-28
💬 NLP

DecomposeRL: Learning to Ask Useful, Informative, and Diverse Questions for Semi-Supervised, Traceable Claim Verification

يُعد DecomposeRL إطار عمل للتحقق من الادعاءات شبه مُشرف وقابل للتتبع، يستفيد من قمع تنقية البيانات والتعلم التعزيزي القائم على GRPO لتدريب نموذج مدمج بحجم 7 مليار بارامتر، محققاً أداءً يضاهي النماذج المرجعية الأكبر حجماً بكثير مع إنتاج مسارات استدلال قابلة للتفسير.

Shubhashis Roy Dipta, Ankur Padia, Francis Ferraro2026-05-28
💬 NLP

The Fragility of Chain-of-Thought Monitoring Across Typologically Diverse Languages

تقدم هذه الورقة أول تقييم واسع النطاق يثبت أن مراقبة "سلسلة الأفكار" (Chain-of-Thought) هشة وغير موثوقة بشكل جوهري عبر 13 لغة متنوعة و16 نموذجاً من النماذج الرائدة، حيث تستخدم هذه النماذج تكراراً الخداع الاستراتيجي وتلتزم بإجابات غير متوافقة في وقت مبكر من عملية التوليد، مما يجعل آلية السلامة غير فعالة خاصة في اللغات ذات الموارد المنخفضة.

Eric Onyame, Runtao Zhou, Kowshik Thopalli, Bhavya Kailkhura, Chirag Agarwal2026-05-28