🤖 AI

KC-Agent: A Dual-Process Cognitive Architecture for Efficient ML Model Improvement

إن KC-Agent هو بنية معرفية ثنائية العمليات تجمع بين التعرف السريع على الأنماط وبين التحديثات التدريجية المدروسة والذاكرة المنظمة لأتمتة تحسينات نماذج تعلم الآلة بكفاءة وموثوقية في مواجهة انزياح البيانات، محققاً أداءً وسرعة من فئة "أفضل ما تم الوصول إليه" مقارنة بالطرق الحالية.

Gusseppe Bravo-Rocca, Jordi Guitart, Ajay Dholakia, David Ellison, Puneet Jain2026-08-04
🤖 AI

Cooperative Coevolution for Resource-Constrained Agentic LLM Post-Training

تقدم الورقة البحثية استراتيجية التطور التعاوني في الفضاء الفرعي للمعلمات (CoPES)، وهي طريقة فعالة من حيث استهلاك الذاكرة تعمل على تفكيك فضاء المعلمات لتمكين التدريب اللاحق الفعال للنماذج اللغوية الكبيرة الوكيلية في ظل قيود الموارد، محققةً 92% من مكاسب أداء خوارزمية GRPO كاملة المعلمات مع متطلبات أقل بكثير لذاكرة وحدة معالجة الرسومات.

Zhiyuan Wang, Shengcai Liu, Jiahao Wu, Ning Lu, Hui Ouyang, Shaofeng Zhang, Haoze Lv, Ke Tang2026-08-04
🤖 AI

Can Foundation Models Hear What Made That Sound? A Tiered Benchmark of Audio-Language Models and Traditional Classifiers for Closed-Set Sound Source Identification

تقدم هذه الورقة معياراً متدرجاً لتقييم أحد عشر نموذجاً صوتياً-لغوياً ومصنفات تقليدية في مهمة تحديد مصادر الصوت ضمن مجموعة مغلقة، مما يكشف أنه بينما تحقق النماذج التأسيسية المتخصصة مثل Gemini-3.1-Pro-Preview أعلى دقة، يمكن للنماذج ذات التعلم الصفري أن تضاهي الأداء على مستوى الفئة، وأن الأخطاء الواثقة والمربكات الصعبة تؤثر بشكل كبير على موثوقية التصنيف الدقيق.

Sajjad Abdoli, Ghassan Al-Sumaidaee, Ahmad ElShiekh, Ahmed Rashad2026-08-04
🤖 AI

Antares: Foundation Models for Agentic Vulnerability Localization

تُعد "أنتاريس" عائلة من النماذج التأسيسية المدمجة ومنخفضة التكلفة (350 مليون إلى 3 مليارات معلمة) والتي تم تدريبها عبر مسار مكون من مرحلتين من الضبط الدقيق الخاضع للإشراف والتعلم المعزز، مما يحقق أداءً في تحديد مواقع الثغرات البرمجية بأسلوب الوكيل يضاهي نموذج "GPT-5.5"، بينما يتفوق بشكل كبير على النماذج ذات الأوزان المفتوحة التي تزيد في حجمها عنها بأكثر من 200 مرة.

Supriti Vijay, Aman Priyanshu, Didier Chapoteau, Arthur Goldblatt, Jianliang He, Kimia Majd, Fraser Burch, Baturay Sagla (…)2026-08-04
🤖 AI

MonitrLLM: A Community-Centered Evaluation Infrastructure for Large Language Models

تقدم الورقة البحثية MonitrLLM، وهي بنية تحتية مفتوحة المصدر تسد فجوة حرجة في تقييم النماذج اللغوية الكبيرة (LLMs) من خلال ربط النصوص الكاملة للمحادثات مع نوايا المهام المحددة من قبل المستخدم وتقييمات النتائج، كاشفةً من خلال دراسة تجريبية أن الرضا العالي للمستخدم غالباً ما يتعايش مع معدلات فشل كبيرة في المهام، لا سيما في التفاعلات متعددة الأدوار.

Victor Ojewale, Ro Encarnación, Suresh Venkatasubramanian, Danaé Metaxa2026-08-04
🤖 AI

Agentic Incident Response through Digital Twin-Enhanced Multiscale Planning

تقترح هذه الورقة إطار عمل استباقي مبني على القواعد للاستجابة للحوادث، يدمج التخطيط الاستشرافي القائم على نظرية القرار مع توأم رقمي ووكلاء نماذج لغوية كبيرة خفيفين لتوليد استراتيجيات عالية المستوى وأوامر قابلة للتنفيذ، مما يتفوق بشكل كبير على النماذج المرجعية للنماذج اللغوية الكبيرة الرائدة من خلال تقليل وقت التعافي وزيادة معدلات الاستعادة عبر سيناريوهات هجوم متنوعة.

Yiran Gao, Tao Li, Kim Hammar2026-08-04
🤖 AI

xPress: Parallel Refinement for Diffusion Drafters in Speculative Decoding

تقترح الورقة البحثية xPress، وهو مُنقٍّ سببي خفيف الوزن يستعيد التبعيات المفقودة في مسودات الانتشار الكتلي (block-diffusion) من خلال التنقيح المتوازي، مما يعزز طول القبول والإنتاجية الشاملة في فك التشفير التخميني بشكل كبير مقارنة بالطرق الحالية مثل dFlash.

Zheng Wang, Davis Wertheimer, Yu Chin Fabian Lim, Mudhakar Srivatsa, Raghu K. Ganti, Minjia Zhang, Naigang Wang2026-08-04
💬 NLP

Right Answer, Wrong Method: Shortcut Hacking Misleads the Evaluation of LLM Reasoning on Frontier Science Benchmarks

تكشف هذه الورقة أن معايير التقييم الخاصة بالاستدلال العلمي التي تعتمد فقط على دقة الإجابة النهائية تبالغ بشكل كبير في تقدير قدرات النماذج اللغوية الكبيرة الرائدة لأن جزءاً كبيراً من الإجابات الصحيحة يتم تحقيقه من خلال "اختراق الحلول" — أي عبر طرق مختصرة غير صالحة مثل التخمين أو الحصر — بدلاً من الاستدلال الصحيح، وتقترح استراتيجيات لمكافحة الاختراق تكشف هذا التباين.

Xuan Ren, Weiqi Zhai, Tianle Pu, Yihua Zhu, Yihua Zhu, Hu Wei, Bing Zhao2026-08-04
🤖 AI

Infinite Trace Objectives with Finite Trace Techniques: Translating LTL to LTLf+

تقدم هذه الورقة أول ترجمة من منطق الزمن الخطي (LTL) إلى (LTLf+)، مما يتيح تطبيق تقنيات الأوتوماتا ذات المسارات المحدودة الفعالة على مشكلات الذكاء الاصطناعي ذات المسارات غير المحدودة دون زيادة التعقيد التقاربي لمسار التحويل القياسي من LTL إلى الأوتوماتا.

Christoph Weinhuber, Maximilian Prokop, Giuseppe De Giacomo, Moshe Y. Vardi2026-08-04
🤖 AI

Real-Time Detection and Repair of LLM Agent Failures

تقدم هذه الورقة نظاماً ذا طبقتين ومنخفض التأخير للكشف عن إخفاقات وكلاء النماذج اللغوية الكبيرة (LLM agents) وإصلاحها باستخدام مراقبات تتبع عن بُعد بمقياس الميكروثانية وتحقق حتمي، مما يحسن معدلات نجاح المهام بشكل كبير وبجزء ضئيل من تكلفة التقييم التقليدي القائم على النماذج اللغوية الكبيرة.

Sunny Dubey2026-08-04