💬 NLP

DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis

يقدم البحث إطار عمل DLLM-TTS، وهو نموذج بـ 0.6 مليار معلمة يصيغ عملية تحويل النص إلى كلام كعملية انتشار كتلي شرطي منفصل فوق رموز الترميز الصوتي العصبي، محققاً أداءً تنافسياً مع وضوح عالٍ وعامل زمن حقيقي قدره 0.15 من خلال التنبؤ المتوازي للرموز ضمن كتل متتالية.

Wasim Madha, Nityanand Mathur, Hamees Sayed, Apoorv Singh, Sameer Khurana, Akshat Mandloi, Sudarshan Kamath2026-08-04
💬 NLP

Obshazard-bench: Benchmarking Multimodal Foundation Models for Real-Time Disaster Intelligence from Raw Earth Observation Streams

تقدم هذه الورقة Obshazard-bench، وهو معيار مرجعي جديد في الوقت الفعلي يقيم النماذج اللغوية الكبيرة متعددة الوسائط على تدفقات مراقبة الأرض الخام وعالية التردد عبر 8 فئات من الكوارث باستخدام تصنيف عملياتي ثلاثي المراحل، مما يكشف عن قيود كبيرة في قدرة النماذج الحالية على دعم استخبارات الكوارث الحرجة زمنياً.

Fengxiang Wang, Qiuyang Yu, Yueying Li, Mingshuo Chen, Chengchi Fei, Kaiyi Xu, Lixin Gu, Wangxu Wei, Junchao Gong, Lipen (…)2026-08-04
🤖 AI

Optimization and Constraint Modeling using LLMs with a Retrieval Augmented Generation Process

تُثبت هذه الورقة أن مسار التوليد المعزز بالاسترجاع (RAG) الذي يستفيد من مجموعة بيانات اصطناعية منسقة يحسن بشكل كبير من دقة واتساق البنية لنماذج الأمثلة والقيود المولدة بواسطة النماذج اللغوية الكبيرة، مما يقدم بديلاً فعالاً من حيث التكلفة لعملية الضبط الدقيق لتطبيقات دعم القرار في العالم الحقيقي.

Prateek Roy, Akash Singirikonda2026-08-04
💬 NLP

Exploring More to Solve More: Boosting Diversity in Text Diffusion Models via Entropy-Based Guidance

تقدم هذه الورقة البحثية "الإنتروبيا النواة الواعية دلالياً" (SAKE)، وهي طريقة توجيه مبتكرة خالية من التدريب تستفيد من إنتروبيا ريني من الرتبة الثانية عبر مصفوفة غرام النواة لموازنة الدقة والتنوع ديناميكياً في نماذج الانتشار النصي، متفوقةً بذلك على النماذج المرجعية الحالية في المهام كثيفة الاستدلال مثل توليد الأكواد والرياضيات.

Jingwei Zhang, Haoyu Lei, Zijin Feng, Jiacheng Sun, Farzan Farnia2026-08-04
🤖 AI

Motif-Mamba: network motif improved mamba for long-range sequence modeling

يُعد Motif-Mamba نموذج فضاء حالة مهيكل يعزز قدرات نمذجة التسلسل طويلة المدى لنموذج Mamba من خلال دمج مسار متكرر منخفض الرتبة مقيد بالنماذج (motif-constrained) لتسهيل التفاعلات الصريحة عبر الأبعاد مع الحفاظ على كفاءة الوقت الخطي.

Chonghe Hao, Yue Sun, Jian Zhang, Yansong Wang, Wangzi Yao, Yunjie Yao, Tielin Zhang2026-08-04
🤖 AI

Width, Memory, and Delay: A Resource Accounting for the Limits of Flat Multi-Agent Systems

تتحدى هذه الورقة البحثية المفهوم القائل بأن التنظيم الهرمي ضروري حتماً للأنظمة متعددة الوكلاء عالية الأداء، وذلك من خلال إثبات أن الأسراب المسطحة والمتجانسة يمكنها تحقيق قدرة مماثلة أو متفوقة على صد الاضطرابات عبر زيادة الذاكرة والنمذجة الداخلية لكل وكيل، شريطة محاسبة مواردها الجماعية (العرض، والذاكرة، والتعامل مع التأخير) كمياً مقابل الحدود البيئية الجوهرية.

Oleksandr Kuznetsov, Emanuele Frontoni2026-08-04
💬 NLP

SLMs as Multi-Agent Routers: A Progressive SFT and Reinforcement Learning Approach

تقترح هذه الورقة نموذج لغة صغيراً تم تدريبه عبر الضبط الدقيق الخاضع للإشراف التدريجي والتعلم التعزيزي لتوجيه الاستعلامات ديناميكياً إلى وكلاء استرجاع متخصصين بناءً على أداء الاسترجاع بدلاً من مجرد القصد، مما يحقق صلة أعلى بكثير (NDCG@10 يبلغ 0.771) وزمن انتقال أقل (120.1 مللي ثانية) مقارنة بالنماذج اللغوية الكبيرة المرجعية.

Gayathri V Kondapalli, Alexander Ng, Hirsh Pithadia, Rahul Monish, Harvey Yorke, Amir Kayhani2026-08-04
🤖 AI

SIRIN: A Unified Toolkit for Detecting Contextual Hallucinations in Retrieval-Augmented and Memory-Grounded LLM Systems

تُعد SIRIN مجموعة أدوات موحدة وواجهة ويب تفاعلية تدمج نماذج كشف متعددة لتحديد الهلوسة السياقية وتقييم قابلية الإجابة على الاستعلام في أنظمة النماذج اللغوية الكبيرة المعتمدة على الاسترجاع، والوكيلة، والمستندة إلى الذاكرة.

Julia Belikova, Rauf Parchiev, Mikhail Filimonov, Konstantin Polev, Andrey Savchenko, Maksim Makarenko2026-08-04
🤖 AI

Linguistic Context Recodes Visual Representations in Vision-Language Models

تُثبت هذه الورقة أن نماذج الرؤية واللغة تعيد ترميز التمثيلات البصرية ديناميكيًا من خلال آليات مستحثة لغويًا، وتحديدًا عبر توليد ناقلات مرجعية مجردة للأجسام ذات الصلة بالهدف وتضخيم السمات الخاصة بالمهمة، مما يتحدى الرؤية التي تعتبر الرموز البصرية مستودعات معلومات ثابتة.

Brian Song, Michael A. Lepori, Ellie Pavlick2026-08-04
💬 NLP

Trustworthiness Costs of Domain Adaptation in Small Language Models:A Cross-Architecture Empirical Study

تقدم هذه الورقة دراسة تجريبية منهجية عابرة للبنى الهيكلية تكشف أنه في حين أن تكييف النطاق للنماذج اللغوية الصغيرة باستخدام بيانات مضطربة تنافسياً يحسن الأداء دون الإضرار بالمعايرة الواقعية، فإن استراتيجيات الحفاظ على السلامة الشائعة مثل "Dark Experience Replay" و"Task Arithmetic LoRA" تفشل في الحفاظ على المتانة التنافسية ويمكن أن تزيد بشكل كبير من القابلية للمخرجات الضارة.

Ramesh B. Paramkusham2026-08-04