🤖 machine learning

Verifier-Induced Support Reshaping in On-Policy Optimization

تكشف هذه الورقة أن التعلم المعزز القائم على السياسة ذات المكافآت القابلة للتحقق (RLVR) يمكن أن يحسن أداء المهام الفورية، بينما يتسبب دون قصد في "إعادة تشكيل الدعم الناجم عن التحقق"، حيث تضيق السياسة توزيع مخرجاتها لجعل المسارات الناجحة للأهداف المستقبلية نادرة للغاية بحيث يصعب أخذ عينات منها، مما يؤدي إلى تقويض القدرة على التدريب طويل الأمد والقدرة المشتركة.

Shaohang Wei, Zikun Su, Feifan Song, Wen Luo, Wei Li, Guangyue Peng, Houfeng Wang2026-08-04
💬 NLP

Sixteen models, fewer than two voices: measuring ensemble dispersion where no answer is uniquely correct

تقدم هذه الورقة مقياساً لمساهمة الاختلاف لكل نموذج لتحليل كيفية توليد ستة عشر نموذجاً لغوياً لتفسيرات متنوعة لحالات العلاج النفسي، كاشفةً أنه في حين أن هوية النموذج تشكل هذا الاختلاف بشكل كبير، فإن التشتت الناتج مدفوع بالمحتوى السريري وتكوين المجموعة المحددة أكثر من كونه مدفوعاً بالفئات القياسية للنماذج أو بالانفتاح التفسيري المنشود للحالات.

Mario Vega-Barbas, Lidia Mora-Valenciano, Iván Pau, Fernando Seoane, Farhad Abtahi2026-08-04
🤖 AI

Bayesian and Motivated Reasoning in AI Agents

تُثبت هذه الورقة أن الوكلاء المعتمدين على الذكاء الاصطناعي يُظهرون استدلالاً بايزياً واستدلالاً مدفوعاً بالدوافع من خلال استخلاص استنتاجات مختلفة من بيانات متطابقة بناءً على صياغة السيناريو، حيث تؤثر معتقداتهم المسبقة بشكل كبير على عملياتهم التحليلية وقراراتهم النهائية في المجالات عالية المخاطر.

Eddie Yang2026-08-04
💬 NLP

CurveShift: Is Agent Progress Scalar? Separating Level from Shape

تجادل هذه الورقة بأنه في حين أن معظم التحولات الظاهرة في تقدم الذكاء الاصطناعي نحو المهام الأكثر صعوبة هي نتاج تأثيرات سقفية وارتفاع في القدرة العامة، إلا أن تحسناً حقيقياً ومتميزاً في حل أصعب مشكلات البرمجة التنافسية قد ظهر في النماذج الصادرة بعد سبتمبر 2024، وهو اكتشاف تم عزله من خلال ضبط المتغيرات المربكة المتعلقة بالهياكل المساعدة باستخدام معيار LiveCodeBench.

Hanwen Xing, Pengyun Wang, BingXu Meng, Kumail Alhamoud, Xiang Li, Jicheng Wang, Xin Yu, Xinyang Han, Xiaomin Li, Philip (…)2026-08-04
💻 computer science

The methodology of Constructing the Large-Scale Dataset for Detecting Presuicidal and Anti-Suicidal Signals in Social Media Texts in Russian

تقدم هذه الورقة منهجية شاملة لبناء مجموعة بيانات روسية واسعة النطاق لوسائل التواصل الاجتماعي تحتوي على أكثر من 50,000 نص مُصنف للكشف عن إشارات ما قبل الانتحار ومناهضة الانتحار، مع تفصيل العملية بأكملها بدءاً من إنشاء التعليمات وصولاً إلى التحقق، مع توفير مجموعة البيانات والبرمجيات ونتائج التصنيف الأولية للجمهور.

Igor Buyanov, Darya Yaskova, Danil Serenko, Danil Shkereda, Andrey Yaskov, Ilya Sochenkov2026-08-04
💻 computer science

The Learning Objective Governs Perceptual Narrowing: A Cross-Lingual, Layer-Wise, Ten-Seed Study of Self-Supervised Speech Encoders

تُظهر هذه الدراسة عابرة اللغات، ذات البذور العشر، أن هدف التعلم، وليس البنية أو نوع البيانات، هو المحدد الرئيسي لضيق الإدراك في مشفرات الكلام ذات التعلم الذاتي، حيث تؤدي مهام إعادة البناء إلى تدهور التمييز غير الأصلي بينما تعززه مهام التنبؤ.

Sejin Yoo2026-08-04
💻 computer science

Auditable Release Control for Pedagogical Leakage in LLM Tutors

تقدم هذه الورقة إطار عمل للتحكم في الإصدار، وهو قابل للتدقيق ومعتمد على التفويض، مخصص للمعلمين القائمين على النماذج اللغوية الكبيرة، حيث يقضي بفعالية على التسرب البيداغوجي (الكشف المبكر عن الإجابة) من خلال الوساطة الصارمة وعزو المكونات، رغم أن هذه السلامة المعززة تأتي على حساب تقليل الفائدة ولا تضمن السلامة الدلالية الشاملة.

Nizam Kadir2026-08-04
💬 NLP

S4^4R: Selective Sampling, Subspaces, and Sparse Reconstruction for Compressed Long-Context KV Caching

تقترح الورقة البحثية S4^4R، وهي طريقة جديدة لضغط ذاكرة التخزين المؤقت لـ KV تجمع بين أخذ العينات الانتقائي الواعي بالمطالبة لبناء فضاءات فرعية منخفضة الرتبة مع إعادة البناء المتناثر أثناء فك التشفير، محققةً ضغطاً يصل إلى 5 أضعاف مع دقة تقارب الدقة الكاملة، مع تجنب الاعتماد على بيانات المعايرة في الطرق غير المتصلة (offline) والتكلفة الحسابية العالية لإعادة بناء المطالبة الكاملة عبر الإنترنت (online).

Jialong Han, You Wu, Kewei Tu2026-08-04
💬 NLP

Native Multilingual Chain-of-Thought Reasoning in Low-Resource Southeast Asian Languages

تقدم هذه الورقة البحثية خوارزمية "Onramp-Sequence Cross-Distillation (OSCD)"، وهي خوارزمية ما بعد التدريب تجمع بين حلقة وكيل ترجمة متكاملة ومحاذاة دلالية للتمثيل المشترك للتغلب على الانهيار عبر اللغات والنسيان الكارثي، مما يعزز بشكل كبير قدرات الاستدلال الرياضي الأصلية في لغات جنوب شرق آسيا ذات الموارد المنخفضة.

Sean Gip Lim, William Chandra Tjhi, Hai Leong Chieu2026-08-04
💻 computer science

TrimMoE A communication aware and adaptive depth framework for distributed edge inference

إن TrimMoE هو إطار عمل مدرك للاتصالات ومتكيف العمق للاستنتاج الموزع عند الحافة، يعمل على تقليل زمن الاستجادة وحركة المرور عبر الخوادم من خلال الجمع ديناميكياً بين تخطي الطبقات، والخروج المبكر القائم على الثقة، والتنفيذ البديل، مع ضمان بقاء تدهور جودة المهام ضمن ميزانية محددة.

Ning Li, Shuting Bai, Xin Yuan, Wenchao Xu, Athanasios V. Vasilakos, Song Guo, Haijun Zhang2026-08-04