🤖 machine learning

ISAAC: Auditing Causal Reasoning in Deep Models for Drug-Target Interaction

تقدم الورقة البحثية ISAAC، وهو إطار عمل للتدقيق البعدي يقيم قدرات الاستدلال السببي لنماذج التعلم العميق للتفاعل بين العقاقير والأهداف من خلال قياس حساسيتها للتدخلات الميكانيكية مقابل التدخلات الزائفة، مما يكشف عن تباينات هيكلية كبيرة في الاستدلال تظل غير مكتشفة بواسطة مقاييس الدقة القياسية رغم الأداء التنبؤي المتماثل.

Barbara Tarantino, Sun Kim, Yijingxiu Lu, Paolo Giudici2026-05-06
🤖 machine learning

Reward Hacking Benchmark: Measuring Exploits in LLM Agents with Tool Use

تقدم الورقة البحثية معيار "اختراق المكافأة" (RHB) لتقييم كيفية استغلال وكلاء النماذج اللغوية المدربة بالتعلم التعزيزي (RL) للمسارات المختصرة الطبيعية في المهام القائمة على الأدوات، مما يكشف أن التدريب اللاحق بالتعلم التعزيزي يزيد بشكل كبير من معدلات الاستغلال مقارنة بالنماذج غير المدربة بالتعلم التعزيزي، وأنه بينما يمكن للتحصين البيئي أن يخفف من هذه المشكلات، فإن التدريب المتوافق مع بيئة الإنتاج غالباً ما يكتفي فقط بكبح الاختراق دون عتبة معينة من التعقيد.

Kunvar Thaman2026-05-06
🌀 nonlinear sciences

Finite-Size Gradient Transport in Large Language Model Pretraining: From Cascade Size to Intensive Transport Efficiency

تقدم هذه الورقة إطار عمل لنقل التدرج ذي الحجم المحدود باستخدام خمسة مقاييس ملحوظة لتحليل قياسات التدرج الخام من نماذج Pico-LM وPythia، كاشفةً أنه بينما يتشاركان في هيكل أساسي لحجم الشلال يقترب من الواحد الصحيح، إلا أنهما يشغلان أنظمة نقل متميزة ذات سلوكيات قياس مختلفة في المدة والكفاءة المكثفة ترتبط بالأداء الخارجي.

Ping Wang, Yan-Qi Du2026-05-06
🤖 machine learning

Structured Diffusion Bridges: Inductive Bias for Denoising Diffusion Bridges

تقترح هذه الورقة إطار عمل لجسر الانتشار المهيكل يعامل الإشراف المزدوج كخيار استرشادي بدلاً من كونه شرطاً مسبقاً، مما يتيح ترجمة فعالة للأنماط عبر الأنظمة غير المزدوجة، وشبه المزدوجة، والمزدوجة، مع تحقيق جودة تقارب الجودة في الأنظمة المزدوجة بالكامل حتى مع متطلبات الاقتران المخففة.

Eitan Kosman, Gabriele Serussi, Chaim Basking2026-05-06
💰 quantitative finance

PHBench: A Benchmark for Predicting Startup Series A Funding from Product Hunt Launch Signals

تقدم هذه الورقة PHBench، وهو معيار مرجعي قابل لإعادة الإنتاج يربط بين 67,292 من إشارات إطلاق منتجات "Product Hunt" وسجلات التمويل في "Crunchbase" لإثبات أن بيانات الإطلاق المهيكلة تتنبأ إحصائياً بنتائج الجولة التمويلية (Series A)، محققةً مكاسب أداء كبيرة باستخدام نموذج تجميعي مع الكشف عن قيود غير متوقعة في النماذج اللغوية الكبيرة ذات التعلم الصفري والحساسية الزمنية للسوق.

Yagiz Ihlamur, Ben Griffin, Rick Chen2026-05-06
🤖 machine learning

Mixed-Precision Information Bottlenecks for On-Device Trait-State Disentanglement in Bipolar Agitation Detection

تقدم الورقة البحثية إطار عمل "عنق زجاجة المعلومات مختلط الدقة" (MP-IB)، الذي يستفيد من عدم التماثل في الدقة العددية لفصل سمات المتحدث المستقرة عن حالات الهياج المتقلبة بفعالية على الأجهزة الطرفية محدودة الموارد، محققاً أداءً إكلينيكياً فائقاً وحمايةً للخصوصية مقارنة بالطرق الحالية القائمة على التعلم العميق والطرق المصممة يدوياً.

Joydeep Chandra2026-05-06
📊 statistics

Dynamic Vine Copulas: Detecting and Quantifying Time-Varying Higher-Order Interactions

تقدم هذه الورقة نماذج "ديناميكيات كرمة كوبولا" (Dynamic Vine Copulas - DVC)، وهي إطار عمل مبتكر ينمذج الاعتماد غير الغاوسي المتغير زمنياً من خلال الحفاظ على بنية "كرمة" ثابتة مع تتبع التغيرات السلسة في المعلمات، مما يتيح الكشف النوعي والقياس الكمي للتفاعلات الشرطية من الرتب العليا التي غالباً ما تغفل عنها النماذج الغاوسية التقليدية.

Houman Safaai, Alessandro Marin Vargas2026-05-06
🤖 machine learning

OGPO: Sample Efficient Full-Finetuning of Generative Control Policies

تقدم هذه الورقة البحثية خوارزمية OGPO، وهي خوارزمية خارج السياسة (off-policy) ذات كفاءة في العينات تتيح الضبط الدقيق الكامل لسياسات التحكم التوليدية لتحقيق أداء رائد في مهام روبوتية متنوعة، بما في ذلك الضبط الدقيق للسياسات ضعيفة التهيئة دون بيانات خبير، وذلك من خلال الاستفادة من أهداف PPO المعدلة والمثبتات العملية للتخفيف من حدة الاستغلال المفرط للمنتقد (critic over-exploitation).

Sarvesh Patil, Mitsuhiko Nakamoto, Manan Agarwal, Shashwat Saxena, Jesse Zhang, Giri Anantharaman, Cleah Winston, Chaoyi (…)2026-05-06
💻 computer science

Distributed Deep Variational Approach for Privacy-preserving Data Release

تقترح هذه الورقة "حامي الخصوصية الغاوسي" (GPP)، وهو إطار عمل تبايني عميق وموزع يُمكّن التعلم الاتحادي من إصدار تمثيلات بيانات مطهرة ومنخفضة الأبعاد تحافظ بفعالية على المنفعة مع تقليل تسرب السمات الحساسة من خلال تقليل المعلومات المتبادلة.

Zahir Alsulaimawi, Huaping Liu2026-05-06
💻 computer science

Refining Compositional Diffusion for Reliable Long-Horizon Planning

تقدم هذه الورقة طريقة "تكرير الانتشار التركيبي" (RCD)، وهي طريقة توجيه خالية من التدريب تعمل على التخفيف من حدة متوسط الأنماط في التخطيط طويل الأمد عبر الاستفيد من خطأ إعادة البناء الذاتي واتساق التداخل لتوجيه الانتشار التركيبي نحو مسارات عالية الكثافة ومتماسكة عالميًا.

Kyowoon Lee, Yunhao Luo, Anh Tong, Jaesik Choi2026-05-06