💬 NLP

Grounded Cache Routing for Retrieval-Augmented Generation: When Is It Safe to Reuse an Answer?

تقترح هذه الورقة GroundedCache، وهي آلية توجيه مثبتة بالأدلة تضمن إعادة الاستخدام الآمن للإجابات المخزنة مؤقتاً في التوليد المعزز بالاسترجاع من خلال فرض أربع بوابات سلامة متزامنة، مما يؤدي إلى القضاء على معدلات تقديم الإجابات غير الآمنة عبر أعباء عمل متنوعة مع الحفاظ على زمن انتقال قريب من الخط المرجعي.

Syed Huma Shah (Duke University)2026-05-28
🤖 machine learning

Representation-Conditioned Diffusion Models for Guided Training Data Generation

تُثبت هذه الورقة أن تدريب المصنفات على صور اصطناعية تم إنشاؤها بواسطة نماذج الانتشار الكامنة المشروطة بالتمثيل (باستخدام DINOv2 وDINOv3 وCLIP) يتفوق بشكل كبير على كل من التوليد المشروط بالفئة والنماذج المدربة على مجموعات البيانات الواقعية، مما يقدم حلاً واعداً لندرة البيانات في التعلم البصري واسع النطاق.

Nithesh Chandher Karthikeyan, Jonas Unger, Gabriel Eilertsen2026-05-28
🤖 machine learning

GenSBI: Generative Methods for Simulation-Based Inference in JAX

تعد GenSBI مكتبة جديدة مفتوحة المصدر بلغة JAX، تقوم بتنفيذ نماذج مطابقة التدفق، ومطابقة الدرجة، ونماذج الانتشار لإزالة الضجيج باستخدام بنيات قائمة على المحولات لتوفير إطار عمل أصيل للاستدلال القائم على المحاكاة للباحثين الذين يستخدمون JAX، مما يحقق دقة عالية وتوزيعات لاحقة جيدة المعايرة في المعايير القياسية.

Aurelio Amerio2026-05-28
📊 statistics

Semiparametrically Efficient Inference for Kernel Measures of Noise Heterogeneity

تقترح هذه الورقة مُقدِّراً كفؤاً شبه معلمي (semiparametrically efficient) من خطوة واحدة لمقاييس النواة الخاصة بتباين الضجيج، والذي يصحح انحياز الانحدار في المرحلة الأولى في نماذج الضجيج الجمعي، مما يتيح إجراء اختبارات معيرة بالبثق (bootstrap-calibrated tests) وفترات ثقة كفؤة تقاربياً لاستقلال البواقي والتباين التوزيعي.

Jakub Wornbard, Zikai Shen, Dimitri Meunier, Arthur Gretton2026-05-28
🤖 machine learning

SparseOpt: Addressing Normalization-induced Gradient Skew in Sparse Training

تحدد هذه الورقة البحثية "التطبيع الدفعي" (Batch Normalization) كسبب رئيسي لبطء التقارب في التدريب المتناثر الديناميكي (Dynamic Sparse Training) بسبب انحراف التدرج، وتقترح SparseOpt، وهو مُحسِّن مدرك للتناثر يحسن بشكل كبير سرعة التقارب والقدرة على التعميم في نماذج ResNet.

Mohammed Adnan, Rohan Jain, Tom Jacobs, Ekansh Sharma, Rahul G. Krishnan, Rebekka Burkholz, Yani Ioannou2026-05-28
🤖 machine learning

Detection Without Correction: A Two-Parameter Decomposition of Multi-Stage LLM Pipelines

تقترح هذه الورقة تحليلاً ثنائي المعالم لخطوات معالجة النماذج اللغوية الكبيرة متعددة المراحل إلى قرارات الكشف والتوليد الشرطي، وتحدد "الكشف دون تصحيح" باعتباره نمط الفشل الأساسي الذي يفسر حالات الثبات والانعكاسات المحيرة في الأداء عبر مختلف النماذج والمعايير والأساليب.

Prashanti Nilayam, Kiran Ramanna, Prashil Tumbade2026-05-28
🤖 machine learning

Gradient Transformer: Learning to Generate Updates for LLMs

تقدم هذه الورقة "Gradient Transformer"، وهو إطار عمل لتقطير المعرفة بدون بيانات يُمكّن المؤسسات ذات الموارد الحسابية المحدودة من توليد ناقلات تحديث فعالة لنماذج اللغات الكبيرة عبر تحويل ناقلات التحديث من نماذج لغوية صغيرة تم ضبطها بدقة على بيانات خاصة، مما يسهل التعاون الآمن بين المؤسسات المتعددة دون الكشف عن المعلومات الحساسة.

Binh-Nguyen Nguyen, Khang Tran, NhatHai Phan, Issa Khalil2026-05-28
🤖 machine learning

Evaluating Local Explainability Metrics for Machine Learning Models on Tabular Data

تقيم هذه الورقة موثوقية مقاييس التفسير المحلي (LIME وSHAP وFeature Ablation) عبر 32 مجموعة بيانات جدولية ونماذج متنوعة، كاشفةً أن جودة التفسير تعتمد على تعقيد مجموعة البيانات وتوزيعات الميزات أكثر من اعتمادها على الأداء التنبؤي للنموذج.

Tomás Pereira, João Vitorino, Eva Maia, Isabel Praça2026-05-28
🤖 machine learning

Supervised Distributional Reduction via Optimal Transport and Dependence Maximization

تقترح هذه الورقة البحثية خوارزمية "التقليص التوزيعي الخاضع للإشراف" (SDR)، وهي خوارزمية مبتكرة تدمج النقل الأمثل مع تعظيم الاعتماد الصريح لتعلم تمثيلات مدمجة وواعية بالهدف، تحافظ في الوقت ذاته على الهندسة الجوهرية للبيانات والإشارة التنبؤية، مع تمكين بناء نوى تكيفية غير مستقرة للمهام اللاحقة مثل نمذجة العمليات الغاوسية.

Sai-Aakash Ramesh, Archit Sood, Andrew Corbett, Tim Dodwell2026-05-28✓ Author reviewed
🤖 machine learning

Poison with Style: A Practical Poisoning Attack on Code Large Language Models

تقدم هذه الورقة البحثية "التسميم بالأسلوب" (PoS)، وهو هجوم تسميم نماذج عملي وخفي يستغل أساليب البرمجة الضمنية للمطورين كعناصر تحفيز خفية لحث نماذج لغات الكود الكبيرة (CLLMs) على توليد كود برمجى يحتوي على ثغرات بمعدلات نجاح عالية، مع الحفاظ في الوقت ذاته على أداء قوي في الاختبارات المعيارية.

Khang Tran, Yazan Boshmaf, Issa Khalil, NhatHai Phan, Ting Yu, Md Rizwan Parvez2026-05-28