🤖 machine learning

Good SFT Optimizes for SFT, Better SFT Prepares for Reinforcement Learning

تقدم الورقة البحثية طريقة PEAR، وهي طريقة في مرحلة الضبط الدقيق الموجه (SFT) تستخدم أخذ العينات بالأهمية لإعادة وزن خسائر التدريب بناءً على عدم التطابق بين البيانات غير المتصلة (offline data) وسياسات التعلم المعزز المستقبلية، مما يحسن بشكل كبير أداء التعلم المعزز في المهام اللاحقة على مهام الاستدلال مقارنة بالضبط الدقيق الموجه القياسي.

Dylan Zhang, Yufeng Xu, Haojin Wang, Qingzhi Chen, Hao Peng2026-05-29
🔬 condensed matter

Rare Event Analysis of Large Language Models

تقدم هذه الورقة إطار عمل متكامل للتحليل المنهجي للأحداث النادرة ولكن الهامة في النماذج اللغوية الكبيرة، حيث توفر أدوات عملية لتوليدها، وتقدير احتمالية حدوثها، وتحليل أخطائها لمعالجة التحديات الناجمة عن الحجم الهائل والطبيعة الاحتمالية لهذه النماذج.

Jake McAllister Dorman, Edward Gillman, Dominic C. Rose, Jamie F. Mair, Juan P. Garrahan2026-05-29
🤖 machine learning

Gradient Preconditioning for Efficient and Reliable Reward-Guided Generation

تقترح الورقة طريقة لتهيئ التدرج (gradient preconditioning) تقوم بإسقاط تدرجات المكافأة على مجموعة مسموحة من الضوضاء الغاوسية البيضاء لتمكين التحسين الفعال والموثوق والخالي من الاختراق (hack-free) في وقت الاختبار للنماذج التوليدية ذات الخطوة الواحدة، محققةً أداءً هو الأفضل في فئته مع تقليل التكلفة الحسابية بشكل كبير.

Jisung Hwang, Minhyuk Sung2026-05-29
📊 statistics

Coarse-Grained Boltzmann Generators

تقدم هذه الورقة "مولدات بولتزمان خشنة الحبيبات" (CG-BGs)، وهي إطار عمل يجمع بين النماذج التوليدية القائمة على التدفق وجهود متوسط القوة المتعلمة لتمكين أخذ عينات التوازن بكفاءة وصحة تقاربية للأنظمة الجزيئية الكبيرة في فضاءات إحداثيات خشنة الحبيبات مختزلة.

Weilong Chen, Bojun Zhao, Jan Eckwert, Julija Zavadlav2026-05-29
📊 statistics

Aggregate Models, Not Explanations: Improving Feature Importance Estimation

يُثبت هذا البحث، من خلال التحليل النظري والتحقق التجريبي، أن تجميع تقديرات أهمية الميزات عبر النماذج الفردية داخل مجموعة (ensemble) يُسفر عن نتائج أكثر دقة من تفسير المجموعة ككل، لا سيما بالنسبة للنماذج التعبيرية حيث يكون تقليل المخاطر الزائدة أمراً بالغ الأهمية للاكتشاف العلمي الموثوق.

Joseph Paillard, Angel Reyero Lobo, Denis A. Engemann, Bertrand Thirion2026-05-29
🤖 machine learning

Securing SIM-Assisted Wireless Networks via Quantum Reinforcement Learning

تقترح هذه الورقة إطار عمل هجين لسياسة التحسين القريبة الكمومية (QPPO) يدمج الدوائر الكمومية ذات المعلمات في شبكة الفاعل لتحسين قدرة الإرسال وإزاحات طور تعديل السعة المتغير (SIM) بكفاءة، مما يعزز بشكل كبير معدلات السرية وسرعة التقارب في الشبكات اللاسلكية المدعومة بتقنية (SIM) مقارنة بطرق التعلم المعزز العميق التقليدية.

Le-Hung Hoang, Quang-Trung Luu, Dinh Thai Hoang, Diep N. Nguyen, Van-Dinh Nguyen2026-05-29
🤖 AI

Benchmarking at the Edge of Comprehension

تقدم هذه الورقة "التقييم المرجعي المقاوم للنقد"، وهو إطار عمل تنافسي يتيح تقييم النماذج اللغوية الكبيرة الرائدة بما يتجاوز الإدراك البشري من خلال تعريف الصحة عبر عدم قدرة الخصوم على دحض الإجابات، مع استخدام البشر كمدققين محدودين للادعاءات المحلية.

Samuele Marro, Jialin Yu, Emanuele La Malfa, Oishi Deb, Jiawei Li, Yibo Yang, Ebey Abraham, Sunando Sengupta, Eric Somme (…)2026-05-29
📊 statistics

GICDM: Mitigating Hubness for Reliable Distance-Based Generative Model Evaluation

تقدم هذه الورقة البحثية نموذج GICDM (النموذج التوليدي لـ ICDM)، وهو منهج متعدد المقاييس يعمل على التخفيف من ظاهرة "المركزية" (hubness) في فضاءات التضمين عالية الأبعاد لاستعادة موثوقية ومواءمة البشر لمقاييس تقييم النماذج التوليدية القائمة على المسافة.

Nicolas Salvy, Hugues Talbot, Bertrand Thirion2026-05-29
🤖 machine learning

Is Your Diffusion Sampler Actually Correct? A Sampler-Centric Evaluation of Discrete Diffusion Language Models

تقدم هذه الورقة إطار عمل "أوراكل" (oracle) متمحوراً حول العينات لإثبات أن نماذج اللغة ذات الانتشار المنفصل (discrete diffusion language models) ذات الخطوات القليلة تعاني من أخطاء عينة متأصلة وتفشل في تحقيق الصحة التوزيعية حتى مع وجود مزيلات ضجيج مثالية، مما يكشف أن المقاييس القياسية مثل NLL والارتباك (perplexity) لا تضمن دقة أخذ العينات.

Luhan Tang, Longxuan Yu, Shaorong Zhang, Greg Ver Steeg2026-05-29
🤖 machine learning

Towards Efficient and Expressive Offline RL via Flow-Anchored Noise-conditioned Q-Learning

تقدم الورقة البحثية خوارزمية التعلم المعزز غير المتصل بالإنترنت "التعلم بـ Q المشروط بالضجيج والمثبت بالتدفق" (FAN)، وهي خوارزمية فعالة للتعلم المعزز غير المتصل بالإنترنت تحقق أداءً رائدًا في المهام الروبوتية من خلال تحسين سياسات التدفق والنقاد التوزيعيين لتتطلب تكرارًا واحدًا وعينة ضجيج واحدة فقط، مما يقلل بشكل كبير من التكاليف الحسابية دون التضحية بالدقة.

Sungyoung Lee, Dohyeong Kim, Eshan Balachandar, Zelal Su Mustafaoglu, Keshav Pingali2026-05-29