🤖 machine learning

APQF: Agentic Profiling-Guided Structured Pruning and Mixed-Precision Quantization with Adaptive Fine-Tuning

إن APQF هو إطار عمل مؤتمت وموجه بنماذج لغوية كبيرة، يدمج بين التقليم المهيكل القائم على التوصيف والكمية مختلطة الدقة مع الضبط الدقيق التكيفي لتقليل التكاليف الحسابية بشكل كبير مع الحفاظ على دقة عالية عبر مختلف النماذج الرؤية على الأجهزة ذات الموارد المحدودة.

Sadegh Jafari, Mohiuddin Bilwal, Fan Zhou, Brian Gelder, Ali Jannesari2026-08-07
🤖 AI

Hyper-ES: Effective Evolution Strategies for LLM Reasoning via Descent Direction Merging

تُعد Hyper-ES إطار عمل لاستراتيجية التطور القائم على الفضاء الجزئي، والذي يعزز قدرات الاستنتاج في النماذج اللغوية الكبيرة من خلال تحسين معاملات الدمج لكل طبقة لاتجاهات الانحدار الاشتقاقي المحسوبة مسبقاً، محققاً أداءً فائقاً بموارد أقل مقارنة بالطرق القائمة على التدرج مثل GRPO-LoRA.

Yu Gu, Zhi Zheng, Yunpeng Ba, Xialiang Tong, Mingxuan Yuan, Zhenkun Wang2026-08-07
🤖 AI

When Experience Becomes Instruction: Trajectory Poisoning in Self-Evolving Agent Skill Systems

تقدم هذه الورقة البحثية "PoisonedEvolution"، وهو هجوم الصندوق الأسود الذي يستغل عملية تعزيز المسار إلى المهارة في أنظمة الوكلاء ذاتية التطور عبر حقن أدلة مصاغة بعناية ومؤطرة سببيًا لدمج سلوكيات خبيثة بنجاح في مكتبات المهارات الموثوقة عبر بنيات متنوعة.

Jialuo Chen, Lingqi Jiang, Xinhao Deng, Xiaohu Du, Jianan Ma, Yunhao Feng, Yuqi Qing, Zhihao Yuan, Linkang Du, Jingyi Wa (…)2026-08-07
🤖 AI

SkillTV-Bench: Benchmarking How Well Judges Perform on Skill-Augmented Agentic Execution

تقدم هذه الورقة SkillTV-Bench، وهو معيار شامل لتقييم التحقق من المسار المدرك للمهارة في وكلاء النماذج اللغوية الكبيرة (LLM agents)، إلى جانب SkillTV-Evolve، وهي طريقة تعمل على صقل مهارات التقييم القابلة لإعادة الاستخدام لتحسين دقة التحقق ومعدلات نجاح اختيار المسار بشكل كبير.

Zhi Han, Chenxi Zeng, Liuhaichen Yang, Zihan Guo, Ming Zhou, Yang Li2026-08-07
🤖 machine learning

The Judgment-Consequence Gap: LLM Moral Reasoning in Healthcare Decisions

تكشف هذه الورقة عن "فجوة بين الحكم والنتيجة" في النماذج اللغوية الكبيرة، حيث تُظهر أنها تتفق مع البشر في أن المرضى مسؤولون عن السلوكيات الضارة بالصحة، لكنها ترفض بشكل منهجي السماح لهذه المسؤولية بالتأثير على تخصيص الموارد الشحيحة، على عكس البشر الذين يفضلون باستمرار المرضى الأقل ذنباً.

Hadi Hosseini, Samarth Khanna, Leona Pierce2026-08-07
🤖 AI

StepReflect: Structured UI Transition Reflection for Mobile GUI Agents

تقدم الورقة البحثية StepReflect، وهو وكيل واجهة مستخدم رسومية (GUI) للهواتف المحمولة بـ 8 مليارات معلمة، يستخدم إطار تنبؤ مهيكل ومسار تدريب متعدد المراحل لتحقيق نجاح فائق في المهام طويلة المدى وكفاءة في التكلفة مقارنة بالنماذج الرائدة مثل GPT-5.2.

Linqiang Guo (Peter), Wei Liu (Peter), Li Gu (Peter), Yang Wang (Peter), Tse-Hsun (Peter), Chen2026-08-07
🤖 AI

Epistemic Trustworthiness in Generative AI: A Normative Framework for Warranted Reliance in High-Stakes Workflows

تقترح هذه الورقة إطاراً معيارياً للموثوقية المعرفية في تدفقات عمل الذكاء الاصطنا التوليدي عالية المخاطر، محاججةً بأن الاعتماد المبرر يتطلب من الأنظمة استيفاء ثلاثة شروط غير قابلة للاستبدال — وهي التواضع المعرفي، والوصول المعرفي، والمقاومة للظلم المعرفي — بدلاً من الاعتماد فقط على المقاييس التقليدية مثل الدقة أو العدالة.

Nimisha Karnatak, Max Van Kleek, Nigel Shadbolt2026-08-07
💬 NLP

SkillZip: Contract-Preserving Graph Compression for Scalable Agent Skill Libraries

يُعد SkillZip إطار عمل مدركاً للتنفيذ يتيح مكتبات مهارات للوكلاء قابلة للتوسع عبر إجراء ضغط للرسوم البيانية على مستوى الأقسام مع الحفاظ على العقود لتوليد سياقات مدمجة ومغلقة التبعيات تحافظ على السلامة الإجرائية وتتفوق على النماذج المرجعية الحالية في كل من الكفاءة ودقة الاسترجاع.

Xingyu Tan, Xiaoyang Wang, Qing Liu, Xiwei Xu, Xin Yuan, Liming Zhu, Wenjie Zhang2026-08-07
🤖 machine learning

GAUGE: Granularity-Adaptive Counterfactual Gating of Evidence for Incomplete Multimodal Classification

تقترح الورقة البحثية إطار عمل GAUGE، وهو إطار بوابي مضاد للواقع خفيف الوزن يعزز التصنيف متعدد الوسائط غير المكتمل عبر استكمال البيانات المفقودة وتطبيق تعديل للأدلة دقيق ومدرك للتنبؤ عبر تسجيل قائم على متسلسلة تايلور للاحتفاظ بالمكونات الموثوقة بشكل انتقائي مع كبح المكونات المضللة دون تغيير بنية النموذج الأساسي.

Yunping Shi, En Yu, Kairui Guo, Jie Lu2026-08-07
🤖 AI

Measuring and Detecting Harmful AI Sycophancy

تقدم هذه الورقة إطار عمل CAP لجمع مجموعة بيانات واسعة النطاق من التملق الناتج عن عكس الموقف المستحث بالتفضيل (PSPSR) عبر 17 نموذجاً لغوياً، مما يكشف أنه بينما تتباين معدلات PSRS بشكل كبير حسب قدرة النموذج، فإن الكشف التلقائي أمر ممكن وإن كان يواجه تحديات في التعميم على النماذج غير المرئية.

Bohan Jiang, Dawei Li, Yasin Silva, Huan Liu2026-08-07