💻 computer science

ValueFlow: Measuring the Propagation of Value Perturbations in Multi-Agent LLM Systems

تقدم الورقة البحثية إطار عمل "ValueFlow"، الذي يحدد كمياً كيفية انتقال اضطرابات القيم عبر أنظمة النماذج اللغوية الكبيرة متعددة الوكلاء من خلال تفكيك انحراف القيم إلى قابلية التأثر على مستوى الوكيل والآثار الهيكلية على مستوى النظام، مما يثبت أن محاذاة القيم هي في الأساس خاصية على مستوى النظام تشكلها طوبولوجيا التفاعل.

Jinnuo Liu, Chuke Liu, Hua Shen2026-05-29
💬 NLP

Beyond Normalization: Rethinking the Partition Function as a Difficulty Scheduler for RLVR

تقدم هذه الورقة البحثية إطار عمل PACED-RL، وهو إطار عمل لما بعد التدريب يعيد تفسير دالة التجزئة في GFlowNet كإشارة دقة لكل مطالبة (per-prompt) لإعطاء الأولوية للمطالبات الغنية بالمعلومات وتحسين عملية إعادة التشغيل، مما يؤدي إلى تحسين كفاءة العينات وأداء الاستنتاج في النماذج اللغوية الكبيرة بشكل كبير دون تكبد أعباء حسابية إضافية.

Dohyung Kim, Minbeom Kim, Jeonghye Kim, Sangmook Lee, Sojeong Rhee, Kyomin Jung2026-05-29
💻 computer science

DLT-Corpus: A Large-Scale Text Collection for the Distributed Ledger Technology Domain

تقدم هذه الورقة DLT-Corpus، وهي مجموعة نصوص ضخمة ومتخصصة في مجال معين تضم 2.98 مليار توكن من الأدبيات العلمية وبراءات الاختراع ووسائل التواصل الاجتماعي، والتي تُستخدم لإثبات أن أبحاث تقنية السجلات الموزعة (DLT) تسبق النمو السوقي ولإصدار أدوات معالجة لغات طبيعية محسنة مثل LedgerBERT.

Walter Hernandez Cruz, Peter Devine, Nikhil Vadgama, Paolo Tasca, Jiahua Xu2026-05-29
🤖 AI

Thinking Fast, Thinking Wrong: Intuitiveness Modulates LLM Counterfactual Reasoning in Policy Evaluation

تُظهر هذه الورقة أنه بينما يعزز التلقين بسلسلة الأفكار أداء النماذج اللغوية الكبيرة في تقييمات السياسات الحدسية، إلا أن استدلالها التوقعي يظل معيبًا بشكل كبير في الحالات غير الحدسية بسبب عدم القدرة على تجاوز الأولويات الحدسية بالكامل، مما يكشف عن انفصال حرج بين استرجاع المعرفة والاستدلال المنطقي.

Yanjie He2026-05-29
💻 computer science

What are They Thinking? Delineation, Probing and Tracking of Concepts in LLMs

تحدد هذه الورقة إطار عمل لإنشاء مجسات خطية منخفضة التكلفة وقابلة للتوسع لتحديد ورصد وتتبع مفاهيم محددة ضمن تضمينات النماذج اللغوية الكبيرة عبر طبقات وسياقات مختلفة، مما يعزز قدرات التفسير والمراقبة.

Mohamed Abdelwahab, Michelle Yu Collins, Sihan Chen, Yi Cheng Zhao, Zafarullah Mahmood, Jiading Zhu, Soliman Ali, Jonath (…)2026-05-29
💻 computer science

RightNow-Arabic-0.5B-Turbo: An Open Sub-1B Arabic Language Model via Vocabulary Injection and Edge-First Deployment

تقدم هذه الورقة البحثية نموذج RightNow-Arabic-0.5B-Turbo، وهو نموذج لغوي مفتوح المصدر متخصص في اللغة العربية بـ 518 مليون معلمة، تم بناؤه على نموذج Qwen2.5-0.5B من خلال حقن المفردات والضبط الدقيق المكثف، والذي يحقق أداءً هو الأفضل في فئته بين النماذج التي يقل عدد معلماتها عن مليار معلمة، مع تمكين النشر الفعال على الأجهزة الطرفية عبر التكميم إلى أقل من 400 ميجابايت.

Jaber Jaber, Osama Jaber2026-05-29
💻 computer science

Aryabhata 2: Scaling Reinforcement Learning for Advanced STEM Reasoning

تقدم الورقة البحثية "Aryabhata 2"، وهو نموذج لغوي مدرب بالتعلم التعزيزي يعتمد على GPT-OSS-20B، والذي يحقق أداءً فائقاً وكفاءة أعلى في عدد الرموز (tokens) في الاختبارات التنافسية لمجالات العلوم والتكنولوجيا والهندسة والرياضيات (STEM) مثل JEE وNEET، وذلك من خلال الاستفادة من منهج تعليمي عالي الجودة واستكشاف التوسع التدريجي.

Ritvik Rastogi, Vishal Singh, Tejas Chaudhari, Sandeep Varma2026-05-29
💻 computer science

S3Mem: Structured Spatiotemporal Scene-Event Memory for Long-Horizon Interactive Question Answering

تقدم الورقة البحثية S3Mem، وهو إطار عمل للذاكرة العرضية للمشاهد والأحداث المهيكلة يتفوق على التوليد المعزز بالاسترجاع القياسي والنماذج المرجعية الأخرى في الإجابة التفاعلية على الأسئلة طويلة المدى من خلال تحويل مسارات الوكيل إلى وحدات أدلة مهيكلة وحساسة للمرتكزات تعمل على تحسين الدقة وكفاءة الرموز بشكل كبير.

Encheng Su, Jinouwen Zhang, Jianyu Wu, Qiucheng Yu, Chen Tang, Pengze Li, Lintao Wang, Yizhou Wang, Xinzhu Ma, Shixiang (…)2026-05-29
💻 computer science

GenesisFunc: Multi-Agent Data Generation for Accurate and Generalizable Function-Calling

تقدم الورقة البحثية GenesisFunc، وهو مسار عمل مؤتمت متعدد الوكلاء يولد بيانات استدعاء وظائف اصطناعية عالية الجودة ومتنوعة لتدريب نموذج لغوي كبير بحجم 8 مليار بارامتر، والذي يحقق أداءً فائقاً في النطاق المحدد وقدرة على التعميم خارج النطاق مقارنة بالنماذج مفتوحة المصدر ذات الحجم المماثل، بينما ينافس الأنظمة المتقدمة القائمة على واجهات برمجة التطبيقات (API).

Hao-Xiang Xu, Chong Deng, Jiaqing Liu, Wen Wang, Qian Chen, Lujia Bao, Xiangang Li, Zhen-Hua Ling2026-05-29