🤖 machine learning

Learn from A Rationalist: Distilling Intermediate Interpretable Rationales

تقترح هذه الورقة إطار عمل REKD، وهو إطار لتقطير المعرفة يعزز الأداء التنبؤي وقابلية التفسير لنماذج استخراج المبررات من خلال تدريب شبكات طالب أصغر للتعلم من مبررات وتنبؤات نموذج معلم أكثر قدرة، مما يتغلب على التحديات الحسابية لتعلم مجموعات الميزات الفرعية تحت الإشراف عن بُعد.

Jiayi Dai, Randy Goebel2026-05-29
🤖 machine learning

Good SFT Optimizes for SFT, Better SFT Prepares for Reinforcement Learning

تقدم الورقة البحثية طريقة PEAR، وهي طريقة في مرحلة الضبط الدقيق الموجه (SFT) تستخدم أخذ العينات بالأهمية لإعادة وزن خسائر التدريب بناءً على عدم التطابق بين البيانات غير المتصلة (offline data) وسياسات التعلم المعزز المستقبلية، مما يحسن بشكل كبير أداء التعلم المعزز في المهام اللاحقة على مهام الاستدلال مقارنة بالضبط الدقيق الموجه القياسي.

Dylan Zhang, Yufeng Xu, Haojin Wang, Qingzhi Chen, Hao Peng2026-05-29
🤖 AI

AutoSizer: Automatic Sizing of Analog and Mixed-Signal Circuits via Large Language Model (LLM) Agents

تقدم هذه الورقة AutoSizer، وهو إطار عمل لوكيل نماذج لغوية كبيرة (LLM) تأملي يعمل على أتمتة تحديد أحجام دوائر التماثل والاشارة المختلطة (AMS) من خلال توحيد فهم الدائرة مع عملية تحسين ثنائية الحلقة لتكرار تحسين فضاءات البحث، مع توفير أيضاً معيار AMS-SizingBench لإثبات أدائه المتفوق على الطرق التقليدية والطرق الحالية القائمة على النماذج اللغوية الكبيرة.

Xi Yu, Dmitrii Torbunov, Soumyajit Mandal, Yihui Ren2026-05-29
💬 NLP

Beyond Normalization: Rethinking the Partition Function as a Difficulty Scheduler for RLVR

تقدم هذه الورقة البحثية إطار عمل PACED-RL، وهو إطار عمل لما بعد التدريب يعيد تفسير دالة التجزئة في GFlowNet كإشارة دقة لكل مطالبة (per-prompt) لإعطاء الأولوية للمطالبات الغنية بالمعلومات وتحسين عملية إعادة التشغيل، مما يؤدي إلى تحسين كفاءة العينات وأداء الاستنتاج في النماذج اللغوية الكبيرة بشكل كبير دون تكبد أعباء حسابية إضافية.

Dohyung Kim, Minbeom Kim, Jeonghye Kim, Sangmook Lee, Sojeong Rhee, Kyomin Jung2026-05-29
🤖 AI

Benchmarking at the Edge of Comprehension

تقدم هذه الورقة "التقييم المرجعي المقاوم للنقد"، وهو إطار عمل تنافسي يتيح تقييم النماذج اللغوية الكبيرة الرائدة بما يتجاوز الإدراك البشري من خلال تعريف الصحة عبر عدم قدرة الخصوم على دحض الإجابات، مع استخدام البشر كمدققين محدودين للادعاءات المحلية.

Samuele Marro, Jialin Yu, Emanuele La Malfa, Oishi Deb, Jiawei Li, Yibo Yang, Ebey Abraham, Sunando Sengupta, Eric Somme (…)2026-05-29
📊 statistics

GICDM: Mitigating Hubness for Reliable Distance-Based Generative Model Evaluation

تقدم هذه الورقة البحثية نموذج GICDM (النموذج التوليدي لـ ICDM)، وهو منهج متعدد المقاييس يعمل على التخفيف من ظاهرة "المركزية" (hubness) في فضاءات التضمين عالية الأبعاد لاستعادة موثوقية ومواءمة البشر لمقاييس تقييم النماذج التوليدية القائمة على المسافة.

Nicolas Salvy, Hugues Talbot, Bertrand Thirion2026-05-29
🤖 AI

JAEGER: Joint 3D Audio-Visual Grounding and Reasoning in Simulated Physical Environments

تقدم الورقة البحثية إطار عمل JAEGER، الذي يوسع نماذج اللغة الكبيرة الصوتية-البصرية إلى الفضاء ثلاثي الأبعاد من خلال دمج ملاحظات RGB-D مع تمثيل مبتكر لمتجه الكثافة العصبية (Neural Intensity Vector) ومعيار SpatialSceneQA، مما يتيح قدرة فائقة على التأسيس والاستدلال المكاني في البيئات الفيزيائية المعقدة مقارنة بالنهج التقليدية التي تركز على البعدين.

Zhan Liu, Changli Tang, Yuxin Wang, Zhiyuan Zhu, Youjun Chen, Yiwen Shao, Tianzi Wang, Lei Ke, Zengrui Jin, Chao Zhang2026-05-29
🤖 AI

Recurrent Structural Policy Gradient for Partially Observable Mean Field Games

تقدم هذه الورقة البحثية "تدرج السياسة الهيكلية المتكرر" (RSPG)، وهو أول أسلوب هيكلي هجين مدرك للتاريخ لألعاب المجال المتوسط ذات الإدراك الجزئي، والذي يحقق تقارباً أسرع بكثير من التعلم المعزز الخالي من النموذج، إلى جانب إطلاق MFAX، وهو إطار عمل جديد يعتمد على JAX لأبحاث ألعاب المجال المتوسط.

Clarisse Wibault, Johannes Forkel, Sebastian Towers, Tiphaine Wibault, Juan Duque, George Whittle, Andreas Schaab, Yuche (…)2026-05-29
🤖 AI

P2^2RAG: Efficient Privacy-Preserving RAG Service Supporting Arbitrary Top-kk Retrieval

تقترح الورقة البحثية P2^2RAG، وهي خدمة توليد معزز بالاسترجاع (RAG) فعالة تحافظ على الخصوصية وتستخدم طريقة التنصيف التفاعلية والمشاركة السرية لدعم استرجاع (top-$k) عشوائي دون الحاجة إلى فرز آمن، مما يحقق تسريعاً كبيراً مقارنة بالأنظمة الحالية مع حماية البيانات ومطالبات المستخدمين.

Yulong Ming, Mingyue Wang, Jijia Yang, Jie Xu, Zihan Wu, Cong Wang, Xiaohua Jia2026-05-29
🤖 AI

Thinking Fast, Thinking Wrong: Intuitiveness Modulates LLM Counterfactual Reasoning in Policy Evaluation

تُظهر هذه الورقة أنه بينما يعزز التلقين بسلسلة الأفكار أداء النماذج اللغوية الكبيرة في تقييمات السياسات الحدسية، إلا أن استدلالها التوقعي يظل معيبًا بشكل كبير في الحالات غير الحدسية بسبب عدم القدرة على تجاوز الأولويات الحدسية بالكامل، مما يكشف عن انفصال حرج بين استرجاع المعرفة والاستدلال المنطقي.

Yanjie He2026-05-29