🤖 machine learning

Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning

تُعد Molt إطار عمل مفتوح المصدر، مدمج ومبني أصلياً على PyTorch، صُمم لتبسيط أبحاث التعلم التعزيزي الوكيل عبر تمكين التعديلات الخوارزمية من البداية إلى النهاية دون التضحية بالأداء، مع تقديم تكافؤ إحصائي مع حزم Megatron المتطورة مع ضمان اتساق الكود البرمجي ووضوح البنية.

Jian Hu, Huiying Li, Hao Zhang, Binfeng Xu, Yifan Zhang, Shaokun Zhang, Hemil Desai, Michael Demoret, Pavlo Molchanov, J (…)2026-07-27
🤖 machine learning

Learning What Matters: Supervising Sparse Attention Routing with Causal Evidence Sets

تُثبت هذه الورقة أن تدريب مُنتقيات الانتباه المتناثرة على مجموعات أدلة سببية مستمدة من تجارب الحجب أكثر فعالية بشكل ملحوظ من الاعتماد على أنماط الانتباه من النماذج الكثيفة المعلمة، حيث غالبًا ما يخطئ الانتباه في تحديد السياق الفعلي الذي يعتمد عليه النموذج في إجاباته.

Jim Allchin2026-07-27
💬 NLP

Humanly: A Configurable and Traceable Environment for Human-AI Collaborative Writing

تُعد Humanly منصة كتابة قابلة للضبط تُحوّل عملية الكتابة إلى دليل قابل للتحقق من خلال تسجيل النشاط التفصيلي والمساعدة بالذكاء الاصطناًعي لإنشاء شهادات مختومة، مما يتيح الكشف عن التعاون بين البشر والذكاء الاصطناعي والتمييز بين الكتابة اليدوية والأتمتة عبر السيناريوهات التعليمية والمهنية.

Shenzhe Zhu, Haoqian Zhang, Xu Yang, Jingyu Tang, Yi Nian, Xiaoxue Du, Shu Yang, Alex Pentland, Joachim Baumann, Jiaxin (…)2026-07-27
💬 NLP

Probing Latent Colombian Identity Inferences in Qwen2.5-7B with Natural Language Autoencoders

تستخدم هذه الدراسة الاستطلاعية المشفرات التلقائية اللغوية الطبيعية لتحليل تنشيطات النموذج الداخلي لـ Qwen2.5-7B-Instruct، مما يكشف أن النموذج يستنتج الهوية الكولومبية والأنماط النمطية المرتبطة بها من إشارات لغوية دقيقة في المطالبات باللغتين الإسبانية والإنجليزية قبل توليد المخرجات الصريحة.

Pablo Santiago Potes Velasco, María del Mar García Matabanchoy, Óscar Julián Pérez Ladino, Jhoan Stevan Mosquera Ortiz (…)2026-07-27
💬 NLP

Khondo: A Multimodal Benchmark for Document Packet Splitting of Bangla Forms

تقدم الورقة البحثية "خوندو" (Khondo)، وهو أول معيار مرئي ثنائي اللغة لتقسيم وإعادة ترتيب النماذج الحكومية البنغالية المتصلة، والذي كشف أنه في حين يمكن للنماذج اللغوية الكبيرة متعددة الوسائط تجميع الصفحات بفعالية حسب المستند، إلا أنها تعاني بشكل كبير في إعادة بناء الترتيب الأصلي للصفحات، لا سيما في اللغات ذات الموارد المحدودة.

Abu Tyeb Azad, Fahim Ahmed, Ishita Sur Apan, Ezharuddin Jubaer, Sumaiya Karim Katha, Armun Alam, Amin Ahsan Ali, Aman Ch (…)2026-07-27
💬 NLP

Agentic Evaluation of Copyright Law Compliance

تقدم هذه الورقة البحثية "Copyright-Bench"، وهو معيار مرجعي يوضح أن وكلاء النماذج اللغوية الكبيرة (LLM) المتطورين ينتهكون قانون حقوق الطبع والنشر بشكل متكرر عبر اختيار محتوى منتهك للحقوق بدلاً من البدائل المتاحة في الملك العام، مع ارتفاع معدلات الانتهاك في النماذج ذات الأوزان المفتوحة في ظل تفضيلات مستخدم محددة وضغط زمني.

Zheng Hui, Doni Bloomfield, Noam Kolt2026-07-27
💬 NLP

Adversarial Prompts for Acceptance Collapse in Speculative Decoding

تقدم هذه الورقة البحثية ADSD، وهو أول هجوم للاحقة المطالبة (prompt-suffix attack) يستغل ثغرة في فك التشفير التخميني (speculative decoding) باستخدام بديل الانهيار الناعم (Soft-Collapse surrogate) لتوليد لواحق عدائية تزيد من زمن استجابة الاستدلال بشكل كبير مع الحفاظ على جودة المهمة.

Run Wang, Chaoyi Zhou, Xi Liu, Yi Zhu, Amir Salarpour, Pedram MohajerAnsari, Zhi-Qi Cheng, Feng Luo, Siyu Huang, Mert D. (…)2026-07-27
💬 NLP

Data Quality over Capacity: Internalizing Documents into LoRA Adapters for Closed-Book QA

تُثبت هذه الورقة البحثية أنه بالنسبة للإجابة على الأسئلة بنظام الكتاب المفتوح، فإن استيعاب المستندات داخل محولات LoRA عبر تنسيق البيانات عالي الجودة (مثل توحيد الإجابات وإزالة المعلومات التافهة) هو أمر أكثر أهمية للأداء من السعة الهيكلية أو ضبط المعلمات الفائقة، مما يُمكّن في النهاية نموذج Gemma-4 بـ 4 بت من التفوق على الخطوط المرجعية التقليدية القائمة على الاسترجاع.

Joan Figuerola Hurtado2026-07-27
💬 NLP

Towards Reducing Foreign Language Anxiety Using Level-Appropriate Embodied Conversational Agents

تقترح هذه الورقة وتقيم بشكل أولي نظاماً محادثياً تجسيدياً متعدد الوكلاء، يولد حوارات ملائمة لمستوى الإطار الأوروبي المرجعي العام للغات (CEFR) لمتعلمي اللغة الإنجليزية بهدف تقليل القلق من اللغة الأجنبية، مما أظهر تحسناً في التوافق اللغوي مع كفاءة المستخدم رغم عدم حسم النتائج الإحصائية بشأن تقليل القلق بسبب صغر حجم العينة.

Krishan Rajaratnam, Wenbin Gan, Yuan Sun2026-07-27
💬 NLP

Leveraging External Knowledge for Historical Document Restoration via Retrieval-Augmented Large Language Models

تقدم هذه الورقة ARI، وهو إطار عمل للنماذج اللغوية الكبيرة المعززة بالاسترجاع، والذي يحسن بشكل كبير من استعادة الوثائق التاريخية، ولا سيما الكيانات المسماة، من خلال الجمع بين معرفة النماذج اللغوية الكبيرة سابقة التدريب والسياق الخارجي المسترجع صراحةً.

Gabeen Kim, Kyeongpil Kang2026-07-27