🤖 AI

OODBench: Out-of-Distribution Benchmark for Large Vision-Language Models

تقدم هذه الورقة البحثية OODBench، وهو معيار تقييم مؤتمت يتكون من 40 ألف زوج من الحالات خارج التوزيع (OOD) على مستوى المثيل ومقياس تقييم تدريجي لتقييم وكشف التدهور الكبير في أداء النماذج اللغوية الرؤيوية الكبيرة الحالية عند التعامل مع بيانات خارج التوزيع في سيناريوهات العالم الحقيقي بشكل شامل.

Ling Lin, Yang Bai, Heng Su, Congcong Zhu, Yaoxing Wang, Yang Zhou, Huazhu Fu, Jingrun Chen2026-08-18
🤖 AI

Automating the Detection of Requirement Dependencies Using Large Language Models

تقدم هذه الورقة البحثية LEREDD، وهو نهج جديد يعتمد على النماذج اللغوية الكبيرة (LLM) ويستفيد من التوليد المعزز بالاسترجاع والتعلم في السياق لأتمتة اكتشاف تبعيات المتطلبات، مُظهرًا دقة ودرجات F1 متفوقة مقارنة بالنماذج المرجعية الرائدة، مع إصدار مجموعة بيانات جديدة مشروحة لدعم الأبحاث المستقبلية.

Ikram Darif, Feifei Niu, Manel Abdellatif, Lionel C. Briand, Ramesh S., Arun Adiththan2026-08-18
🤖 machine learning

The Energy Blind Spot: NVIDIA's Flagship Edge AI Hardware Cannot Support Process-Level Energy Attribution

تكشف هذه الورقة أن أنظمة الذكاء الاصطناعي الطرفية الرائدة من NVIDIA القائمة على بنية GB10 تفتقر إلى واجهات الأجهزة الأساسية لتخصيص استهلاك الطاقة لكل عملية، مما يخلق فجوة مراقبة حرجة لأعباء عمل الذكاء الاصطناعي الوكيل ويستلزم معايير جديدة وحلولاً مؤقتة لتمكين المحاسبة الدقيقة للطاقة.

Deepak Panigrahy, Aakash Tyagi2026-08-18
📊 statistics

Compositional Boundaries for Density Fusion

تثبت هذه الورقة أن التجميع الخطي الموزون والمطبع (normalized weighted linear pooling) هو قاعدة الدمج الثنائي المستمرة الوحيدة التي تضمن التنفيذ الهرمي غير المرتبط بالترتيب لإدارة عدم اليقين الموزعة، بينما توضح أن النهج البديلة مثل موازنة تباعد ff بين الطرف والنقطة المرشحة أو الضغط التدريجي للمزيج الغاوسي تفشل في الحفاظ على هذه الخاصية التركيبية دون قيود هندسية أو تطابق محددة.

Ratan Bahadur Thapa, Ali Darijani, Jürgen Beyerer, Steffen Staab2026-08-18
🤖 AI

LatentSkill: From In-Context Textual Skills to In-Weight Latent Skills for LLM Agents

إن LatentSkill هو إطار عمل يقوم بتحويل المهارات النصية إلى محولات LoRA جاهزة للاستخدام عبر شبكة فائقة مدربة مسبقاً، مما يمكّن وكلاء النماذج اللغوية الكبيرة (LLM agents) من تخزين إجراءات المهام القابلة لإعادة الاستخدام في مساحة الأوزان بدلاً من مساحة السياق، وهو ما يقلل بشكل كبير من عبء الرموز (tokens) مع تحسين الأداء وتمكين تكوين المهارات بشكل معياري.

Aofan Yu, Chenyu Zhou, Tianyi Xu, Zihan Guo, Rong Shan, Zhihui Fu, Jun Wang, Weiwen Liu, Yong Yu, Weinan Zhang, Jianghao (…)2026-08-18
🤖 AI

Agentic AI: User Empowerment or Foreclosure?

من خلال تحليل السوابق التاريخية مثل أدوات حجب الإعلانات وفلاتر البريد العشوائي، تجادل الورقة بأن قدرة الذكاء الاصطناً الوكيل على تمكين المستخدمين تعتمد على منع "إلغاء الطابع السياسي" للحوكمة عبر المعايير التي تسيطر عليها الصناعة، حيث إن التركيز الحالي حول البروتوكولات المملوكة يهدد بتفكيك قدرة المنافسة الجماعية قبل أن تتمكن البدائل المتوافقة مع توجهات المستخدمين من التبلور.

David Gamba, Daniel M. Romero, Grant Schoenebeck2026-08-18
🤖 AI

FLOPs vs Real Work: The Importance of Replication in AI Efficiency Assessment

تُعيد هذه الورقة إنتاج دراسة حول كفاءة الذكاء الاصطناعي لتأكيد أن عمليات الفاصلة العائمة (FLOPs) الخام غير كافية للتنبؤ بوقت التنفيذ، مع الكشف عن أن صيغة تقدير α\alpha-FLOPs المقترحة تفشل في مراعاة عدم استقرار الأجهزة في الأنظمة الحديثة، وتسليط الضوء على الحاجة الماسة لحزم إعادة الإنتاج الشفافة في الأبحاث المعتمدة على الأجهزة.

Enrique Barba Roque, Luís Cruz2026-08-18
🤖 AI

Large Language Models Show Metacognitive Sensitivity in Medical Reasoning

تقدم هذه الدراسة معياراً مستوحىً من الفيزياء النفسية يوضح أن النماذج اللغوية الكبيرة الطبية تظهر حساسية ميتا-معرفية جزئية في التمييز بين الاضطراب المعرفي العصبي من نوع ألزهايمر والضعف المعرفي المرتبط بالاكتئاب، حيث تتبع مستويات الثقة عموماً جودة الأدلة والدقة، رغم استمرار إخفاقات محددة في المعايرة في حالات الأدلة المتضاربة.

Ahmad Nazzal2026-08-18
💻 computer science

Orbital AI Computing: Carbon Tradeoffs Across Satellite Scale

توسع هذه الورقة إطار عمل ESpaS عبر نمذجة واعية بالمسرعات لتوضيح أنه في حين تقلل أنظمة الأقمار الاصطناعية منخفضة الكتلة من انبعاثات الإطلاق المطلقة، فإن أجهزة الذكاء الاصطناعي عالية الأداء تعمل بشكل أكثر فعالية على استهلاك تكاليف الكربون الثابتة هذه، مما يكشف أن استدامة الحوسبة المدارية للذكاء الاصطناعي تعتمد بشكل حاسم على خيارات أجهزة محددة.

Nisha Sarwar, Lei Jiang, Fan Chen2026-08-18
🤖 AI

When to Communicate: Belief Distributions and KL Divergence for Principled Gating in Multi-Agent RL

تقترح هذه الورقة آلية مبدئية للتحكم في التواصل في التعلم التعزيزي متعدد الوكلاء، حيث يتبادل الوكلاء المعلومات فقط عندما يتجاوز تباعد كولباك - ليبلر بين توزيعات الاعتقاد الخاصة بهم عتبة معينة، مما يثبت أن هذا النهج يحسن معدلات النجاح ويقلل التباين في اختبارات "المفترس والطريدة" الصعبة، مع تعزيز التمثيلات الكامنة للتنسيق في الوقت ذاته حتى بدون التحكم النشط في البوابة.

Teoman Kaman2026-08-18