🤖 machine learning

Calibrated Partial Resets: Preventing Policy Collapse in Continual Reinforcement Learning

تقدم هذه الورقة "إعادة الضبط الجزئي المعاير" (CPR)، وهو مُحسِّن يمنع انهيار السياسة في التعلم التعزيزي المستمر من خلال سحب العصبونات ذات المنفعة المنخفضة دوريًا وانتقائيًا نحو نقطة تهيئتها، مما يحافظ على القدرة على التكيف دون التضحية بذروة الأداء.

Luc McCutcheon, Evangelos Chatzaroulas, Saber Fallah2026-07-29
💻 computer science

Authoring Agent Skills: A Software-Engineering Approach

تؤيد هذه الورقة تطبيق مبادئ هندسة البرمجيات على تأليف "مهارات الوكلاء" (Agent Skills) —وهي معرفة إجرائية قابلة لإعادة الاستخدام لوكلاء النماذج اللغوية الكبيرة— من خلال تحديد هيكلها، والتمييز بينها وبين آليات سلوكية أخرى، وتأسيس عملية قائمة على التقييم لإنشائها واستخدامها.

Giuseppe Destefanis2026-07-29
🤖 machine learning

Lantern: Conflict-Aware Gradient Blending for Physics-Guided Diffusion Models in Calorimeter Simulation

تقدم الورقة البحثية Lantern، وهو نموذج انتشار موجه بالفيزياء لمحاكاة المقياس الحراري يستخدم GradBlend لحل صراعات التدرج بين إزالة الضجيج الإحصائي والخسائر المساعدة المدركة للفيزياء، مما يحسن بشكل كبير كلاً من دقة الارتباط ودقة الفيزياء مقارنة بالطرق الحالية.

Farzana Yasmin Ahmad, Vanamala Venkataswamy, Geoffrey Fox2026-07-29
🤖 AI

How Often Should a Recommender Call an LLM? Value-Weighted Routing, Monitoring, and Seasonal Robustness

تقدم هذه الورقة "Value Router"، وهو محاكاة اصطناعية تُظهر أن قرارات التوجيه بين الخوارزميات الاستدلالية الرخيصة والنماذج اللغوية الكبيرة المكلفة يجب أن تعطي الأولوية للقيمة التجارية المقدرة إلى جانب درجة الصعوبة، مما يكشف أن الاستراتيجيات الموزونة بالقيمة تُحسن الدقة بشكل كبير وتُسلط الضوء على الحاجة إلى مراقبة متكيفة موسمياً لتجنب أوضاع الفشل الخفية الناتجة عن المقاييس الإجمالية.

Bhavtosh Rath2026-07-29
💬 NLP

DS@GT ARC at CheckThat! 2026: LLM-Based Trace Ranking and Grouped Reward Modeling for Multilingual Numerical Claim Verification

تقدم هذه الورقة نظام DS@GT ARC لمسابقة CheckThat! 2026، والذي يوضح أن نموذج تحقق قائم على النماذج اللغوية الكبيرة (LLM) مع اختيار أفضل N من N يتفوق على نموذج مكافأة خفيف الوزن يعتمد على TF-IDF في التحقق من الادعاءات الرقمية متعددة اللغات، بينما يظهر أيضاً أن نموذج AraBERT يتفوق على النماذج المرجعية متعددة اللغات للغة العربية، وأن تفكيك الادعاء الفرعي يفشل في تحسين الأداء.

Sagnik Sinha, Shreyas Shrestha2026-07-29
📈 economics

Spectral Truncation in Synthetic Control

تقدم هذه الورقة وتُقيّم مُقدِّرات التحكم الاصطناعي الطيفية والهجينة التي تطابق الوحدات المعالجة في إحداثيات المتجه المنفرد، لتجد أنه في حين يتفوق مطابقة المسار الخام عمومًا على التقطيع الطيفي، فإن فجوة الأداء حساسة للغاية للمعالجة المسبقة وتتلاشى إلى حد كبير عند إزالة التأثيرات الثابتة للوحدات والزمن قبل التفكيك.

Mojtaba Eslami2026-07-29
🤖 AI

PLATO: Pointer Learner for Agent and Task Openness

تقدم هذه الورقة PLATO، وهو إطار عمل جديد للتعلم التعزيزي متعدد الوكلاء يجمع بين ممثل (actor) قائم على شبكة المؤشر (pointer-network) وناقد (critic) قائم على الشبكة العصبية الرسومية (graph neural network) للتعامل بفعالية مع انفتاح كل من الوكيل والمهمة في البيئات الديناميكية دون الاعتماد على حدود اصطناعية أو إعادة تدريب.

Alireza Saleh Abadi, Leen-Kiat Soh, Daniel Alan Redder, Adam Eck, Prashant Doshi2026-07-29
🤖 AI

Towards Robust Reinforcement Learning for Small-Scale Language Model Agents

تحدد هذه الورقة وتحل ثلاثة أنماط فشل حرجة في التعلم التعزيزي للنماذج اللغوية صغيرة النطاق من خلال ضمانات تقنية محددة، مقترحةً "فرضية سعة الهامش" التي تثبت أن استقرار تدريب خوارزمية (PPO) والأداء المتفوق يعتمدان على وجود أولوية إشرافية طليقة وإشارة مكافأة غنية بالمعلومات بدلاً من عدد معاملات النموذج.

Md Rezwanul Haque, Md. Milon Islam, Fakhri Karray2026-07-29
💬 NLP

Evaluating Communicative Belief Updates in Large Language Models via Implicature Recognition and Cancellation

تقدم هذه الورقة أول مجموعة بيانات مشروحة من قبل خبراء لإلغاء التضمين لتقييم قدرة النماذج اللغوية الكبيرة على التعرف على المعتقدات غير المعلنة وتحديثها، مما يكشف أن النماذج اللغوية الكبيرة الحالية تتخلف عن الأداء البشري في مهام الاستدلال البراغماتي هذه.

Cesare Spinoso-Di Piano, Verna Dankers, Marius Mosbach, Jackie Chi Kit Cheung2026-07-29
🤖 machine learning

Learning from 53.6K Real-World Developer Edits of AI-Generated Code

تقدم هذه الورقة DECODE، وهي مجموعة بيانات تضم 53,600 تعديل من واقع العمل داخل بيئات التطوير المتكاملة (IDE) لأكواد برمجية تم إنشاؤها بواسطة الذكاء الاصطناعي من أكثر من 1,000 مطور، والتي تكشف أن معظم التعديلات تحدث خلال 15 دقيقة من القبول وتثبت أن الضبط الدقيق للنماذج الأصغر على هذه البيانات يتفوق بشكل كبير على النماذج اللغوية الكبيرة الرائدة في التنبؤ بتعديلات الأكواد البرمجية.

Jenny T. Liang, Mihika Bairathi, Wayne Chi, Ameet Talwalkar, Nishant Subramani, Valerie Chen2026-07-29