📊 statistics

Winning by Peeking: Unenforced Budgets and Test-Set Selection Inflate Short-Budget AutoML Comparisons

تُثبت هذه الورقة أن مقارنات التعلم الآلي المؤتمت (AutoML) ذات الميزانية الزمنية القصيرة غالباً ما تكون مضخمة بسبب عيوب في البروتوكول، مثل انحياز اختيار مجموعة الاختبار وعدم فرض حدود زمنية، حيث تُظهر كيف أدى تصحيح هذه المشكلات في دراسة حالة محددة إلى انهيار معدل فوز نظام كان مهيمناً سابقاً وإلغاء المزايا ذات الدلالة الإحصائية على المنافسين.

Guilin Zhang, Kai Zhao2026-08-10
💬 NLP

Natural Language Processing Psychometrics

تقدم هذه الورقة "القياس النفسي عبر معالجة اللغات الطبيعية" (NLP Psychometrics)، وهو إطار عمل يستفيد من الذكاء الاصطناعي القابل للتفسير والميزات القائمة على الشبكات المستمدة من الشخصيات الاصطناعية التي تولدها النماذج اللغوية الكبيرة للتنبؤ بنتائج الصحة النفسية بدقة عالية مع تحديد الدوافع اللغوية والنفسية المحددة وراء هذه التنبؤات بشكل صريح.

Edoardo Sebastiano De Duro, Emma Franchino, Massimo Stella2026-08-10
🤖 AI

H2AL: Hyperbolic Hierarchy-aware Aggregative Learning for Registration-based Few-shot Medical Image Segmentation

تقترح هذه الورقة البحثية إطار عمل H2AL، وهو إطار عمل جديد لتجزئة الصور الطبية بلقطات قليلة تعتمد على التسجيل، والذي يستفيد من الفضاء الزائدي لنمذجة التسلسلات الهرمية التشريحية ويستخدم تجميع التدرج للتحسين المشترك، مما يتغلب على قيود الطرق القائمة على الفضاء الإقليدي لتحسين كل من دقة التسجيل وأداء التجزئة بشكل كبير.

Jia Wang, Jiaming Cai, Zunying Hu, Zhanjie Wu, Jinyuan Liu, Hua Cheng, Yun Peng2026-08-10
⚡ electrical engineering

Assessing AI-generated music detection in real-world broadcast monitoring

تقدم هذه الورقة البحثية مجموعة بيانات BAMM، وهي عبارة عن 40 ساعة من تسجيلات التلفزيون من العالم الحقيقي، لتوضيح أن كواشف الموسيقى المولدة بواسطة الذكاء الاصطناعي القائمة على الشبكات العصبية الالتفافية (CNN) تعاني من تدهور حرج في الأداء وعدم كفاية في الموثوقية عند تطبيقها في ظروف مراقبة البث الفعلي مقارنة بالبيئات النظيفة أو الاصطناعية.

David López-Ayala, Fernando García de la Cruz, Pablo Zinemanas, Emilio Molina, Martín Rocamora2026-08-10
🤖 AI

People Are Not Just Their Countries. Disentangling Social Determinants of LLM Value Alignment Across Europe

تكشف هذه الدراسة، باستخدام بيانات من المسح الاجتماعي الأوروبي، أنه في حين تؤثر العوامل الديموغرافية والاجتماعية بشكل كبير على توافق قيم نماذج اللغات الكبيرة عبر أوروبا، فإن بلد إقامة المستجيب يظل مؤشراً متميزاً وقوياً بنفس القدر، حيث يقدم كلا البعدين رؤى متكاملة حول تفاوتات التوافق.

Maria-Louisa Wightman, Guillaume Bied, Tijl De Bie2026-08-10
💬 NLP

ResidencyRL: Reinforcement Learning in Simulated Clinical Environments

يقدم ResidencyRL إطار عمل للتعلم التعزيزي يدرب وكلاء الذكاء الاصطناٍ السريري من خلال مواجهات مرضية محاكية متعددة الأدوار مع نماذج لغوية كبيرة خصمية ومكافآت مهيكلة، مما يحسن بشكل كبير دقة التشخيص والسلامة ومهارات التواصل مع إظهار قدرة قوية على التعميم عبر مختلف المعايير السريرية.

Valentin Liévin, Samuel Schmidgall, Tim Strother, Alex Bijamov, Akshay Goel, Anil Palepu, Chunjong Park, Vahid Balazadeh (…)2026-08-10
🤖 AI

A Picture is Worth a Thousand Tokens: How Vision Language Models Cut AI Energy Costs While Improving Accuracy

تُثبت هذه الورقة أن تحويل البيانات الزمنية الرقمية إلى مخططات بصرية ثنائية الأبعاد لنماذج الرؤية واللغة يقلل بشكل كبير من تكاليف طاقة الاستدلال للذكاء الاصطناعي ومتطلبات نافذة السياق، مع تحقيق دقة فائقة في كشف الشذوذ في الوقت ذاته مقارنة بالنماذج اللغوية الكبيرة التقليدية القائمة على النصوص والأساليب الإحصائية المرجعية.

Bhavika Jalli, Nikhil Korati Prasanna, Jayanta Choudhury2026-08-10
🤖 machine learning

Diffusion LLMs as Targets and Adversaries: Mechanistic Safety Exploits

تكشف هذه الورقة أن النماذج اللغوية الكبيرة القائمة على الانتشار ترث ثغرات أمنية متفرقة وقابلة للانتقال من أسلافها ذات التوليد الذاتي، مما يتيح عمليات اختراق فعالة للغاية للنماذج في حالة الصندوق الأسود من خلال تقليم العصبات الميكانيكي وإطار عمل "الانتشار الموجه بـ SN" الجديد الذي يحقق معدلات نجاح هجوم تقترب من المثالية بتكاليف توليد ضئيلة.

Elena Dumitrescu, Gert Lek, Lydia Y. Chen, Jérémie Decouchant2026-08-10
🤖 machine learning

Post-Grokking Collapse at the Representation-Readout Interface in Muon-Trained Transformers

تُثبت هذه الورقة أن نماذج المحولات (transformers) المُدربة باستخدام Muon تُظهر "انهيار ما بعد التبصر" (post-grokking collapse) حيث يفشل التعميم بعد تعلم الحساب النمطي بسبب عدم الاستقرار عند واجهة التمثيل-القراءة (representation-readout interface)، وهي ظاهرة تتميز بديناميكيات مُحسِّن متباعدة وتأثيرات حجب يمكن حلها عن طريق تجميد مكونات محددة للنموذج أو إعادة قياس الدائرة المتوافقة مع المهمة.

Ali Janati, Kaoutar El Maghraoui, Andrei Kanavalau, Anass Belfatmi2026-08-10
🤖 AI

Fisher-R1: Training LLM Agents for Reliable Hypothesis Testing

تقدم هذه الورقة P-Bench، وهو معيار لتقييم الاستدلال الإحصائي في اختبار الفرضيات، وتقدم Fisher-R1، وهو وكيل لغوي كبير مدرب بالتعلم التعزيزي يتفوق بشكل كبير على النماذج الحالية من خلال معالجة الأخطاء الاستنتاجية الدقيقة التي تؤدي إلى استنتاجات علمية غير صحيحة.

Jiacheng Miao, Jin Mu, Guanhua Chen, James Zou2026-08-10