💬 NLP

RubricReviewer: From Direct Critique to Objective and Comprehensive Rubric-Driven Peer Review

تقدم هذه الورقة البحثية RubricReviewer، وهو إطار عمل مبتكر يعزز مراجعة النظراء القائمة على النماذج اللغوية الكبيرة من خلال التوليد الصريح لمعايير تقييم تكيفية ودمج وكيل لجمع الأدلة لا يتطلب تدريباً مع نموذج مدرب متوافق مع القيم البشرية لإنتاج مراجعات أكثر شمولاً وتمييزاً ومتانة.

Shuyu Guo, Wenxiang Hu, Yuyue Zhao, Yougang Lyu, Xiaohui Yan2026-08-04
💬 NLP

DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis

يقدم البحث إطار عمل DLLM-TTS، وهو نموذج بـ 0.6 مليار معلمة يصيغ عملية تحويل النص إلى كلام كعملية انتشار كتلي شرطي منفصل فوق رموز الترميز الصوتي العصبي، محققاً أداءً تنافسياً مع وضوح عالٍ وعامل زمن حقيقي قدره 0.15 من خلال التنبؤ المتوازي للرموز ضمن كتل متتالية.

Wasim Madha, Nityanand Mathur, Hamees Sayed, Apoorv Singh, Sameer Khurana, Akshat Mandloi, Sudarshan Kamath2026-08-04
💬 NLP

Obshazard-bench: Benchmarking Multimodal Foundation Models for Real-Time Disaster Intelligence from Raw Earth Observation Streams

تقدم هذه الورقة Obshazard-bench، وهو معيار مرجعي جديد في الوقت الفعلي يقيم النماذج اللغوية الكبيرة متعددة الوسائط على تدفقات مراقبة الأرض الخام وعالية التردد عبر 8 فئات من الكوارث باستخدام تصنيف عملياتي ثلاثي المراحل، مما يكشف عن قيود كبيرة في قدرة النماذج الحالية على دعم استخبارات الكوارث الحرجة زمنياً.

Fengxiang Wang, Qiuyang Yu, Yueying Li, Mingshuo Chen, Chengchi Fei, Kaiyi Xu, Lixin Gu, Wangxu Wei, Junchao Gong, Lipen (…)2026-08-04
💬 NLP

Exploring More to Solve More: Boosting Diversity in Text Diffusion Models via Entropy-Based Guidance

تقدم هذه الورقة البحثية "الإنتروبيا النواة الواعية دلالياً" (SAKE)، وهي طريقة توجيه مبتكرة خالية من التدريب تستفيد من إنتروبيا ريني من الرتبة الثانية عبر مصفوفة غرام النواة لموازنة الدقة والتنوع ديناميكياً في نماذج الانتشار النصي، متفوقةً بذلك على النماذج المرجعية الحالية في المهام كثيفة الاستدلال مثل توليد الأكواد والرياضيات.

Jingwei Zhang, Haoyu Lei, Zijin Feng, Jiacheng Sun, Farzan Farnia2026-08-04
💬 NLP

SLMs as Multi-Agent Routers: A Progressive SFT and Reinforcement Learning Approach

تقترح هذه الورقة نموذج لغة صغيراً تم تدريبه عبر الضبط الدقيق الخاضع للإشراف التدريجي والتعلم التعزيزي لتوجيه الاستعلامات ديناميكياً إلى وكلاء استرجاع متخصصين بناءً على أداء الاسترجاع بدلاً من مجرد القصد، مما يحقق صلة أعلى بكثير (NDCG@10 يبلغ 0.771) وزمن انتقال أقل (120.1 مللي ثانية) مقارنة بالنماذج اللغوية الكبيرة المرجعية.

Gayathri V Kondapalli, Alexander Ng, Hirsh Pithadia, Rahul Monish, Harvey Yorke, Amir Kayhani2026-08-04
💬 NLP

Trustworthiness Costs of Domain Adaptation in Small Language Models:A Cross-Architecture Empirical Study

تقدم هذه الورقة دراسة تجريبية منهجية عابرة للبنى الهيكلية تكشف أنه في حين أن تكييف النطاق للنماذج اللغوية الصغيرة باستخدام بيانات مضطربة تنافسياً يحسن الأداء دون الإضرار بالمعايرة الواقعية، فإن استراتيجيات الحفاظ على السلامة الشائعة مثل "Dark Experience Replay" و"Task Arithmetic LoRA" تفشل في الحفاظ على المتانة التنافسية ويمكن أن تزيد بشكل كبير من القابلية للمخرجات الضارة.

Ramesh B. Paramkusham2026-08-04
💬 NLP

Neural Circuit Function Inference with LLMs

تقدم الورقة البحثية LLantia، وهي طريقة مؤتمتة تستفيد من النماذج اللغوية الكبيرة لتقطير وظائف أنواع الخلايا المستمدة من الأدبيات العلمية ودمجها مع بيانات الموصلات العصبية (connectome) لاستنتاج وظائف الدوائر العصبية وأنواع خلاياها المكونة بشكل منهجي وهيكلي هرمي، كما تم إثباته والتحقق من صحته في دماغ ذبابة الفاكهة البالغة.

Yijie Yin (Department of Physiology, Development and Neuroscience, University of Cambridge, Cambridge, UK, MRC Laborator (…)2026-08-04
🤖 machine learning

Leak It: A Probabilistic Approach to Training-Data Extraction from Black-Box Language Models

تجادل هذه الورقة بأن مقاييس استدلال العضوية الإجمالية مثل (ROC-AUC) تحجب الخطر الشديد، المعتمد على السعة، المتمثل في استخراج بيانات التدريب حرفياً من النماذج اللغوية ذات الصندوق الأسود، حيث تُظهر أن وثائق محددة تحتوي على معرفات أو أكواد برمجية يتم تسريبها بشكل متكرر بغض النظر عن الخطوط المرجعية العمياء أو إزالة التكرار، وتقترح إطار عمل للتدقيق الاحتمالي لكل وثيقة عبر أداة "leakit" لقياس هذا الضرر المتعلق بالخصوصية بدقة.

Victor Maricato2026-08-04
💬 NLP

DiffusionGemma Technical Report

يُعد DiffusionGemma نموذجاً لغوياً مفتوح الأوزان يحقق سرعات استثنائية في توليد النصوص تصل إلى حوالي 1,500 رمز (token) في الثانية، وذلك من خلال ضبط بنية Gemma 4 بدقة باستخدام خط معالجة فعال حوسبياً يتكون من مرحلتين لتمكين الانتشار المنفصل المتوازي على مستوى الكتل، مما يؤدي إلى إرساء حدود جبهة باريتو جديدة للمفاضلة بين سرعة الاستدلال وقدرة النموذج.

DiffusionGemma Team, Adrien Ali Taïga, James Assiene, Daniele Calandriello, Rahma Chaabouni, João Gante, Tamara von Gleh (…)2026-08-04
💬 NLP

Bridging the English-Arabic Medical Knowledge Gap: Targeted Low-Rank Adaptation via Causal Layer Selection

تحدد هذه الورقة أن المعرفة الطبية باللغة العربية موجودة في النماذج اللغوية الكبيرة ولكنها مكبوتة في الطبقات المتوسطة، مما أدى إلى اقتراح عملية التكيف المستهدف منخفض الرتبة (TLoRA) التي تعمل على ضبط هذه الطبقات المحددة بدقة لتحسين الأداء بشكل كبير في المهام الطبية العربية مع تقديم معيار AraClinicDialog الجديد.

Chaimae Abouzahir, Musa Khan, Hala Ali-Hassan, Congbo Ma, Khaled Saleh, Yousra Sadqi, Jihad Mallat, Walid Al-Eisawi, Niz (…)2026-08-04