🤖 AI

SkillSentry: Reliable Skill Execution for LLM Agents via Runtime Assurance

تُعد SkillSentry إطار عمل لضمان وقت التشغيل يعزز موثوقية واتساق وكلاء النماذج اللغوية الكبيرة (LLM) أثناء تنفيذ المهارات، وذلك من خلال استخدام لغة متخصصة في مجال معين لمراقبة التنفيذ وتوجيهه وتحسينه بشكل تكراري بناءً على مواصفات المهارة وآثار التنفيذ التاريخية.

You Lu, Xinyu Huang, Bihuan Chen, Xin Peng2026-08-11
💬 NLP

Business Truth, not SQL Accuracy: A Rule-Gated 7B Analytics Agent Outperforms a Direct-Prompted 32B Baseline

تقدم هذه الورقة البحثية WarehouseReliabilityBench وتثبت أن وكيل تحليل يعتمد على القواعد (QueryProof) بحجم 7 مليارات معلمة يتفوق بشكل كبير على نموذج أساسي بحجم 32 مليار معلمة يتم توجيهه مباشرة، وذلك في تحقيق "الحقيقة التجارية" عبر إعطاء الأولوية لعمليات التحقق الحتمية بعد التنفيذ والاستيضاح على دقة بناء جمل SQL الخام، كل ذلك مع تقليل التكاليف.

Morris Lee2026-08-11
🤖 AI

Privileged Likelihood Is Not Automatically Value: Three Checks for Token Credit in On-Policy Self-Distillation

تجادل هذه الورقة بأن تغيرات احتمالية الرمز المميز المتميزة في التقطير الذاتي أثناء السياسة (on-policy self-distillation) لا تشكل تلقائياً ائتماناً صالحاً للنتيجة، حيث تثبت من خلال التحليل الرسمي والتجارب التجريبية أن مثل هذه الإشارات غالباً ما تفشل في تتبع الأفعال الأفضل أو تعزيز السلوكيات المرغوبة مقارنة بضوابط النتيجة فقط.

Xuan-Phi Nguyen, Shrey Pandit, Yiran Zhao, Anurag Koul, Zeyu Liu, Shafiq Joty2026-08-11
🤖 AI

Can Coding Agents Solve Repository-Level Issues with Rendered Code? An Exploratory Study of Visual Representations

تقيم هذه الدراسة استخدام صور الكود المُصوَّرة كاستراتيجية لضغط الرموز (tokens) لوكلاء البرمجة على مستوى المستودع، حيث وجدت أنه بينما يقلل ذلك بفعالية من تكاليف المطالبة (prompt costs) ويحافظ على دقة الإصلاح، فإن فوائده مشروطة ومحدودة بقدرات النموذج الأساسي والمراحل المحددة لسير عمل الإصلاح.

Weijie Liang, Yuanfeng Song, Xing Chen, Caleb Chen Cao, Sirui Han, Yike Guo2026-08-11
🤖 AI

GRASP: Granularity-Aware Region Alignment and Semantic Prototype Learning for Fine-Grained Cross-Modal Understanding in Drone Views

تقترح الورقة البحثية إطار عمل GRASP، وهو إطار عمل مبتكر يعالج تحديات الفوضى في الخلفية والتماثل البصري في الفهم عبر الوسائط متعددة الأنماط دقيق التفاصيل من منظور الطائرات بدون طيار، وذلك من خلال المحاذاة المرتكزة على المناطق من أجل المطابقة المتمحورة حول الأشياء، والمطابقة المعززة بالاضطراب الدلالي من أجل التعلم الدلالي التمييزي، محققاً أداءً تنافسياً في الاختبارات المرجعية الجوية.

Jiahui Cui, Yan Zhao, Kan Wei, Enze Zhu, Peirong Zhang, Lei Wang, Yiru Wang2026-08-11
🤖 machine learning

SoftmaxGRPO: Learning to Reason using Softmax Advantage Group Estimation

تقدم الورقة البحثية SoftmaxGRPO، وهي طريقة للتعلم التعزيزي تستبدل تطبيع الدرجة المعيارية (z-score normalization) بمزايا "softmax" ذات القياس الحراري (temperature-scaled softmax) لمنع التوزين المتباعد على المطالبات السهلة، مما يؤدي إلى إعادة تخصيص ميزانيات التدرج بشكل أكثر فعالية وتحسين أداء الاستنتاج بشكل كبير في مهام مثل DeepMath وPoetry مقارنة بـ GRPO القياسي.

Jefferson Hernandez, Jaywon Koo, Zilin Xiao, Chen Wei, Vicente Ordonez2026-08-11
🤖 AI

P3^{3}: Joint Program-and-Proof Planning for Verified Code Generation

تقدم الورقة البحثية P3P^3، وهو سير عمل وكيل يعتمد على النماذج اللغوية الكبيرة (LLM) يقوم بالتخطيط المشترك للبرامج وبراهينها الصورية للتغلب على عدم كفاءة التوليد المتسلسل، محققاً أداءً هو الأفضل في فئته وخفضاً كبيراً في التكاليف في اختبارات قياس توليد الكود الموثق، بما في ذلك مجموعة بيانات جديدة مشتقة من مستودع تسمى Lean4Commit0.

Zenan Li, Ziran Yang, Peiyang Song, Zhaoyu Li, Kaiyu Yang2026-08-11
🤖 AI

MMArch: Benchmarking Multimodal Reasoning Grounded in Architectural Evidence

تقدم الورقة البحثية MMArch، وهو معيار مرجعي صارم للهندسة المعمارية والهندسة المدنية يقيم قدرة النماذج اللغوية الكبيرة متعددة الوسائط على توليف الأدلة البصرية الموزعة مع المبادئ الهندسية، مما يكشف عن فجوة أداء كبيرة بين الأنظمة الحالية للذكاء الاصطناعي والخبراء البشريين.

Chenxu Du, Kang An, Tengyue Wang, Zhongyu Yang, Xinqi Yang, Yuanchi Zhu, Hebao Zhu, Ziliang Wang, Faqiang Qian, Yunli Ya (…)2026-08-11
💬 NLP

ComboShoppingBench: Evaluating LLM Agents for Budget-Constrained Basket Shopping with Coupons

تقدم هذه الورقة ComboShoppingBench، وهو معيار مرجعي مبتكر مصمم لتقييم وكلاء النماذج اللغوية الكبيرة (LLMs) في مهام تسوق السلال المعقدة والمقيدة بالميزانية، وذلك من خلال الجمع بين التقييم الدلالي والتحقق الحتمي لمعالجة تحديات التحقق من مجموعات المنتجات الممكنة، والمُحسّنة باستخدام الكوبونات، والمتوافقة.

Adrian Li, Kelong Mao, Yudong Guo, Heming Xia, Xinwei Yang, Lirui Luo, Jace Wong, Pu Yao, Sulong Xu, Simiu Gu2026-08-11
⚡ electrical engineering

GLocFM: A Geometry-Aware Foundation Model for 3D Indoor Wireless Localization

يُعد GLocFM نموذجاً تأسيسياً مدركاً للهندسة يعمل على تعزيز التحديد المكاني اللاسلكي في الأماكن المغلقة ثلاثية الأبعاد من خلال المعالجة المشتركة لقياسات الواي فاي والسحب النقطية للمشاهد ثلاثية الأبعاد لتعظيم احتمالية أطياف التأخير والزاوية المرصودة، محققاً انخفاضات كبيرة في الخطأ مقارنة بالنماذج المرجعية المتطورة على كل من مجموعات البيانات الاصطناعية والواقعية.

Chenghong Bian, Chaozheng Wen, Hongze Chen, Jun Zhang2026-08-11