💻 computer science

Beyond the Hivemind: Escaping LLM Homogeneity via Meta-Persona Anchoring and Sequential Temperature Scaling

تقترح هذه الورقة إطار عمل مبتكرًا يجمع بين "تثبيت الشخصية الميتافيزيقية" (Meta-Persona Anchoring) و"تدرج الحرارة المفلتر" (Filtered Temperature Scaling) للتخفيف من تأثير "الخلية الاصطناعية الموحدة" (Artificial Hivemind) في النماذج اللغوية الكبيرة، مما نجح في تقليل التقارب الدلالي وزيادة تنوع الاستجابات عبر خفض متوسط تشابه جيب التمام الزاوي من حوالي 0.85 إلى 0.65.

Tairan Fu, Javier Conde, Carlos Arriaga, Gonzalo Martínez, Pedro Reviriego, Javier Coronado-Blázquez2026-08-05
💬 NLP

Knowing the Form, Not the Function: Automatically Auditing Answer--Authority Decoupling in Legal Benchmarks

تقترح هذه الورقة إطار تقييم مشترك للمعايير المرجعية القانونية يقيم في آن واحد صحة الإجابة والاستناد إلى السلطة التشريعية، مما يكشف أن النماذج تفصل بشكل متكرر بين هذين البعدين وأن الاعتماد فقط على دقة الإجابة يؤدي إلى مقاييس أداء مضللة.

Hsien-Jyh Liao2026-08-05
💬 NLP

Speculative Correction: Draft-then-Refine Decoding for Diffusion Language Models

تقدم هذه الورقة استراتيجية فك تشفير قائمة على مبدأ "المسودة ثم الصقل" لنماذج اللغات الانتشارية، والتي تستفيد من الصقل ثنائي الاتجاه لتحسين الدقة والسرعة بشكل كبير مقارنة بالتوليد التلقائي الكتلي القياسي، مما يثبت أن التصحيح الذاتي للنموذج نفسه والتصحيح التخميني عبر النماذج يوفران مسارات فعالة وخالية من التدريب للوصول إلى توليد نصوص عالية الجودة وسريع.

Brian K Chen, Chong Wu, Kenji Kawaguchi2026-08-05
💻 computer science

Rethinking Self-Evolving Agent Skills: Feedback Dynamics over Multiple Rounds

تتحدى هذه الورقة البحثية مفهوم التحسن المستمر في مهارات الوكلاء ذاتي التطور من خلال إثبات، عبر تجارب منضبطة، أن التطور المستمر للمهارات هو في الواقع عملية بحث متفرقة تخضع لفلترة التحقق وتعتمد بشكل كبير على ديناميكيات التغذية الراجعة والتفاعلات المحددة بين النموذج والمعيار، بدلاً من كونه مكسباً ثابتاً ناتجاً عن جولات إضافية من الصقل.

Yuxuan Liu, Zhaochen Su, Yuhao Zhang, Jiahe Guo, Zhongwei Xie, Huihao Jing, Lingyun Xie, Qing Zong, Yauwai Yim, Zhixiong (…)2026-08-05
💻 computer science

Studying, Identifying, and Fixing Hidden Technical Debt in AI-Intensive Cyber-Physical Systems

تهدف هذه الأطروحة إلى توصيف الدين التقني الفريد الموجود في الأنظمة السيبرانية الفيزيائية كثيفة الاعتماد على الذكاء الاصطناعي من خلال تحليل النظم البيئية ومقابلة المطورين، بهدف نهائي يتمثل في تحديد استراتيجيات التحديد وتطوير أداة مؤتمتة لمراقبة هذا الدين وتسديده.

Beena2026-08-05
💻 computer science

Instruction Stacking Collapse: A Benchmark and the Capability-Dependent Value of Prompt Compilation

تقدم هذه الورقة معياراً يوضح أن أداء اتباع التعليمات في النماذج اللغوية الكبيرة يتدهور بشكل غير خطي مع تراكم القيود بسبب التعارضات الثنائية، وتُظهر أن مُجمِّع أوامر (prompt compiler) خالٍ من التدريب يعمل بفعالية على التخفيف من هذه المشكلة بالنسبة للنماذج الأضعف بينما يترك النماذج الأقوى دون تأثير يُذكر.

Atul Anand, Sourav Chattaraj2026-08-05
💻 computer science

CUADebug: Diagnosing and Repairing Computer-Use Agent Failures

تقدم هذه الورقة CUADebug، وهو إطار عمل يتكون من تصنيف للأخطاء، ومعيار مرجعي مُصنف بشرياً، ومصحح أخطاء نشط ومعزز بالأدوات يعمل على تحسين تشخيص وإصلاح إخفاقات وكلاء استخدام الكمبيوتر بشكل كبير عبر تحديد الأسباب الجذرية في المسارات متعددة الوسائط لتمكين إعادة تنفيذ المهام بفعالية.

Weijia Zhang, Kunlun Zhu, Zeyi Liu, Yinting Chen, Tianyi Ma, Jiateng Liu, Jiaxun Zhang, Bingxuan Li, Xiangru Tang, Heng (…)2026-08-05
💻 computer science

Verified Tool Calls Improve LLM Agent Reliability Under Non-Atomic Failures

تقترح هذه الورقة غلاف أداة خفيف الوزن، واعٍ بالتحقق، يعمل على تخفيف مشكلات الموثوقية في وكلاء النماذج اللغوية الكبيرة الناتجة عن فشل الأدوات غير الذري — مثل المهلات الزمنية والتحديثات الجزئية — من خلال تقليل الإجراءات المكررة بشكل كبير مع الحفاظ على معدلات نجاح المهام دون تعديل النموذج اللغوي الأساسي.

Isham Kalappurackal Mansoor, Abhishek Phadke, Pratip Rana2026-08-05
💻 computer science

HyperAgent: Planning and Acting over Tool-Schema Hypergraphs for Tool-Use LLM Agents

تقدم الورقة البحثية HyperAgent، وهو إطار عمل مبتكر يستفيد من مخطط هيبيرغ (Hypergraph) موجه للأدوات والمخططات (Tool-Schema) لتوجيه التخطيط الديناميكي والتنفيذ الموجه نحو العجز، مما يؤدي إلى تحسين معدلات إكمال المهام والكفاءة لوكلاء النماذج اللغوية الكبيرة (LLM agents) في سيناريوهات استخدام الأدوات المعقدة مقارنة بالنماذج المرجعية الحالية.

Zian Zhai, Xingyu Tan, Gaowang Zou, Xiaoyang Wang, Wenjie Zhang2026-08-05
💻 computer science

Your Agentic LLMs Secretly Encode Latent Signals of Indirect Prompt-Injection Exposure

تُثبت هذه الورقة أن النماذج اللغوية الكبيرة الوكيلّة (agentic LLMs) تُشفّر بطبيعتها إشارات كامنة قابلة للكشف للتعرض لحقن الأوامر غير المباشر في حالاتها الخفية، والتي يمكن استغلالها لبناء دفاع قوي قائم على المسبار (AGRI) يعمل بفعالية على تحييد الهجمات مع الحفاظ على فائدة المهام.

Jianshuo Dong, Yiming Liu, Maosen Zhang, Nan Deng, Xu Peng, Xiaoping Zhang, Tianwei Zhang, Jie Zhang, Han Qiu2026-08-05