🤖 machine learning

Insect-inspired modular architectures as inductive biases for reinforcement learning

تُثبت هذه الورقة أن بنية التعلم المعزز النمطية المستوحاة من الحشرات، والتي تُجزئ التحكم إلى دوائر متخصصة متفاعلة بدلاً من متحكم مركزي واحد، تتفوق على نماذج الـ MLP والـ GRU المتجانسة في مهام الملاحة المعقدة التي تنطوي على أهداف سلوكية متنافسة.

Anne E. Staples2026-04-27
🤖 machine learning

Removing Sandbagging in LLMs by Training with Weak Supervision

تُظهر الورقة البحثية أن الجمع بين الضبط الدقيق الخاضع للإشراف على نماذج توضيحية ضعيفة وبين التعلم المعزز يمكن أن يحد بفعالية من سلوك "التدني في الأداء" (sandbagging) في النماذج اللغوية الكبيرة، بشرط أن تكون عملية التدريب غير قابلة للتمييز عن مرحلة التشغيل الفعلي.

Emil Ryd, Henning Bartsch, Julian Stastny, Joe Benton, Vivek Hebbar2026-04-27
🤖 machine learning

Generating Synthetic Malware Samples Using Generative AI

تقترح هذه الورقة نظاماً يستخدم نماذج الذكاء الاصطناعي التوليدي — وتحديداً WGAN-GP ونموذج انتشار (Diffusion model) معدلاً — لإنشاء تسلسلات عمليات برمجية (opcode) خبيثة اصطناعية عالية الدقة، مما يحسن بشكل كبير أداء التصنيف لفئات البرمجيات الخبيثة الأقلية ومعدلات الكشف الإجمالية في مجموعات البيانات غير المتوازنة.

Tiffany Bao, Kylie Trousil, Quang Duy Tran, Fabio Di Troia, Younghee Park2026-04-27
🤖 machine learning

Assessing the impact of dimensionality reduction on clustering performance -- a systematic study

تُقيّم هذه الدراسة بشكل منهجي كيفية تأثير خمس تقنيات مختلفة لتقليل الأبعاد على أداء أربع خوارزميات تجميع رئيسية عبر مستويات تقليل متنوعة، وتخلص إلى أن الاختيار الأمثل يعتمد بشكل كبير على هندسة البيانات المحددة وطريقة التجميع المستخدمة.

Ousmane Assani Amate, Mohammadreza Bakhtyari, Émilie Roy, Vladimir Makarenkov2026-04-27
🤖 machine learning

Do Not Imitate, Reinforce: Iterative Classification via Belief Refinement

تقترح الورقة البحثية طريقة التصنيف التكراري المعزز (RIC)، وهي طريقة تستبدل المحاكاة الخاضعة للإشراف القياسية بنهج التعلم التعزيزي لتمكين وجود مصنف في أي وقت يخصص الحوسبة بشكل تكيفي ويحقق معايرة أفضل من خلال تحسين تنبؤاته بشكل تكراري.

Mahdi Kallel, Johannes Tölle, Ahmed Hendawy, Carlo D'Eramo2026-04-27
🤖 machine learning

PermaFrost-Attack: Stealth Pretraining Seeding(SPS) for planting Logic Landmines During LLM Training

تقدم الورقة البحثية "PermaFrost-Attack"، وهي طريقة مبتكرة لبذر التمهيد الخفي (SPS) تقوم بدمج "ألغام منطقية" كامنة في النماذج اللغوية الكبيرة عبر توزيع حمولات مسمومة صغيرة تبدو حميدة عبر الويب ليتم امتصاصها أثناء التدريب، وتقترح مجموعة من التشخيصات الهندسية للكشف عن هذه الثغرات الكامنة.

Harsh Kumar, Rahul Maity, Tanmay Joshi, Aman Chadha, Vinija Jain, Suranjana Trivedy, Amitava Das2026-04-27
🤖 machine learning

Sovereign Agentic Loops: Decoupling AI Reasoning from Execution in Real-World Systems

تقدم الورقة البحثية حلقات الوكلاء السياديين (SAL)، وهي بنية مستوية للتحكم تعزز سلامة الذكاء الاصطناعي من خلال فصل الاستنتاج عن التنفيذ عبر طبقة تحقق تتحقق من نوايا النموذج مقابل سياسات النظام والحالة قبل تنفيذها.

Jun He, Deying Yu2026-04-27
🤖 machine learning

Sum-of-Checks: Structured Reasoning for Surgical Safety with Large Vision-Language Models

تقدم الورقة البحثية إطار عمل "مجموع الفحوصات" (Sum-of-Checks)، الذي يعمل على تحسين دقة وشفافية نماذج الرؤية واللغة الكبيرة في تقييم "الرؤية الحرجة للسلامة" أثناء جراحة المناظير، وذلك من خلال تفكيك المعايير السريرية المعقدة إلى فحوصات استدلالية مهيكلة ومحددة من قبل الخبراء.

Weiqiu You, Cassandra Goldberg, Amin Madani, Daniel A. Hashimoto, Eric Wong2026-04-27
🤖 machine learning

Estimating Tail Risks in Language Model Output Distributions

تقترح الورقة البحثية طريقة فعالة لأخذ العينات بالوزن باستخدام نسخ "غير آمنة" من النماذج اللغوية لتقدير احتمالية المخرجات الضارة والنادرة بدقة، مما يوفر وسيلة أكثر فعالية لقياس مخاطر الذيل مقارنة بطرق أخذ العينات التقليدية القائمة على القوة الغاشمة.

Rico Angell, Raghav Singhal, Zachary Horvitz, Zhou Yu, Rajesh Ranganath, Kathleen McKeown, He He2026-04-27
🤖 machine learning

Optimal sequential decision-making for error propagation mitigation in digital twins

تُطوّر هذه الورقة إطار عمل لاتخاذ القرار المتسلسل، باستخدام كل من عمليات ماركوف لاتخاذ القرار (MDP) وعمليات ماركوف لاتخاذ القرار ذات الملاحظة الجزئية (POMDP)، لتحسين المقايضة بين دقة النظام وتكاليف الصيانة من أجل التخفيف من انتشار الخطأ في التوائم الرقمية النمطية.

Annice Najafi, Shokoufeh Mirzaei2026-04-27