🤖 machine learning

Hypergradient-based Bilevel Reinforcement Learning with Improved Sample Complexity

تقترح هذه الورقة خوارزمية تعلم تعزيزي ثنائي المستوى تعتمد على التدرج الفائق (hypergradient) وتخلو من مصفوفة هيسيان (Hessian-free)، تستفيد من مثالية سياسات بولتزمان لتحقيق تعقيد عينة يبلغ O~(ϵ2)\tilde{O}(\epsilon^{-2}) وتعقيد تكرار يبلغ O(ϵ1)O(\epsilon^{-1})، وهي مستويات رائدة في مجالها، دون اشتراط شرط بولياك-لوجاستفيتش (Polyak-Lojasiewicz) على دالة الهدف في المستوى الخارجي.

Naman Saxena, Mudit Gaur, Vaneet Aggarwal2026-08-03
🤖 AI

A Unified Benchmark of Deep Learning Models for Multi-task 3D Brain Tumor Segmentation from Magnetic Resonance Imaging

تقدم هذه الورقة معياراً موحداً يقيم بإنصاف خمس بنيات للتعلم العميق هي الأحدث حالياً (بما في ذلك الشبكات العصبية الالتفافية CNNs، والمحولات Transformers، ونماذج فضاء الحالة SSMs) لتقسيم أورام الدماغ ثلاثية الأبعاد متعددة المهام على مجموعات بيانات BraTS 2023 و2024 تحت ظروف تجريبية متطابقة لتحليل المقايضات بين دقة التقسيم والكفاءة الحسابية.

Diego J. Torrejón, Luna Y. Hernández, Javier Sánchez2026-08-03
💬 NLP

TextCloak: Thwarting Unauthorized LLM Exploitation via RL-Driven Unlearnable Text

يُعد TextCloak إطار عمل مدفوعاً بالتعلم المعزز (RL) يحمي البيانات النصية من الاستغلال غير المصرح به من قبل النماذج اللغوية الكبيرة (LLMs) عبر استخدام سياسة توليدية مُحسّنة بواسطة خوارزمية GRPO-UE لإنشاء أمثلة غير قابلة للتعلم تعمل على إضعاف أداء الضبط الدقيق للنماذج مع الحفاظ على الأمانة الدلالية والطبيعية اللغوية.

Chengshuai Zhao, Pingchuan Ma, Dawei Li, Bohan Jiang, Zhiyuan Yu, Zhen Tan, Huan Liu2026-08-03
🤖 AI

To Add Is Machine, To Delete Is Human: Measuring and Mitigating Deletion Avoidance in LLM Code Editing

تحدد هذه الورقة وتُكمّم انحياز "تجنب الحذف" المنهجي في النماذج اللغوية الكبيرة الرائدة، والذي يتسبب في احتفاظها بالتعليمات البرمجية بدلاً من إزالتها أثناء التعديل، مما يثبت أن هذا السلوك يقلل بشكل كبير من قابلية صيانة الكود ويمكن التخفيف من حدته من خلال التدريب اللاحق المستهدف.

Amir M. Ebrahimi, Mohammed Mehedi Hasan, Aaditya Bhatia, Gopi Krishnan Rajbahadur, Ahmed E. Hassan2026-08-03
🤖 AI

Identifying Informative Environments for Cognition Parameter Inference via Bayesian Experimental Design

تقترح هذه الورقة إطاراً للتصميم التجريبي البايزي يعامل البيئات التجريبية كمتغيرات تصميم لتحديد الإعدادات الأكثر إفادة لاستنتاج المعلمات المعرفية بكفاءة، مما يكشف أنه لا توجد بيئة واحدة مثالية عالمياً عبر مختلف أهداف الاستنتاج.

Manisha Dubey, Rimvydas Rubavicius, N. Siddharth, Subramanian Ramamoorthy2026-08-03
💬 NLP

TORUS: A Test of Rendering-Understanding Self-Coherence for Unified Audio Models

تقدم هذه الورقة البحثية TORUS، وهو أول معيار للاتساق الذاتي لنماذج الصوت الموحدة، والذي يكشف أن النماذج الحالية تعاني من صعوبة في مواءمة فهمها الصوتي مع توليداتها الخاصة، لا سيال مهمات التحرير، وتؤدي بشكل أسوأ بكثير من النماذج المتتالية المتخصصة.

Aryan Vijay Bhosale, Harshit Rajgarhia, Abhishek Mukherji, Dinesh Manocha2026-08-03
🤖 AI

Design Concept: Scaffolding Geopolitical Reflection Among Tech Workers

تقترح هذه الورقة نظاماً سردياً تفاعلياً مدعوماً بالذكاء الاصطناعي مصمماً لتعزيز الانعكاسية الجيوسياسية لدى العاملين في مجال التكنولوجيا من خلال إشراكهم في سيناريوهات استشرافية وتأملات مدعومة اجتماعياً، مما يساعدهم على فحص افتراضاتهم ومواقفهم ضمن الأنظمة الاجتماعية التقنية الأوسع بشكل نقدي دون الاعتماد على الوعظ الأخلاقي التوجيهي.

Sydney Reis2026-08-03
🤖 machine learning

Gated Q-learning: Add Off-Policy Bias to Taste

يعالج التعلم بـ Q المبوّب (Gated Q-learning) المقايضة طويلة الأمد بين انحياز السياسة الخارجية وطول تعيين الائتمان في التعلم التعزيزي من خلال تقديم آلية بوابية مبتكرة تدمج بسلاسة بين طرفي نقيض لـ Q(λ\lambda) عند واتكينز وبينج، مما يتيح تعلمًا أسرع بانحياز محكوم دون الاعتماد على أخذ العينات بالأهمية.

Brett Daley2026-08-03
💬 NLP

FairFund-Bench: Evaluating Distributive Bias in LLM Resource Allocation

تقدم هذه الورقة FairFund-Bench، وهو معيار شامل يوضح أنه في حين أن التحيزات الديموغرافية للنماذج اللغوية الكبيرة في تخصيص الموارد حساسة للغاية لتصميم التدقيق وغالباً ما تنعكس بين المهام الفردية والمقارنة، إلا أن تقييماتها مدفوعة بشكل أقوى وأكثر اتساقاً بالأطر السببية للاحتياج التي تتوافق مع نظريات الاستحقاق البشرية.

Martin Lukk (University of Toronto)2026-08-03
🤖 AI

DiffAttack: Evasion Attacks Against Face Recognition via Latent Diffusion Models

تقدم الورقة البحثية DiffAttack، وهو إطار عمل هجومي مبتكر يستفيد من نماذج الانتشار الكامنة لتوليد صور وجوه عالية الجودة وغير محسوسة تنجح في خداع أنظمة التعرف على الوجوه العميقة بمعدلات نجاح في الهجوم وقابلية للنقل أعلى بكثير مقارنة بالطرق الحالية.

Omid Ahmadieh, Nima Karimian2026-08-03