💻 computer science

CHORUS: Complementary Experts for High-Coverage Testbench Stimulus Generation

إنَّ CHORUS هو إطار عمل لما بعد التدريب يستفيد من نقاط تفتيش متنوعة سلوكيًا والتعلم التعزيزي ذي المكافأة الكثيفة لإنشاء نماذج خبيرة متكاملة، والتي يتم دمجها بعد ذلك في نموذج واحد بحجم 4 مليارات معلمة يتفوق بشكل كبير على النماذج الأكبر والأحدث في توليد محفزات لوحة اختبار التحقق من العتاد ذات التغطية العالية.

Hejia Zhang, Sheng Lu, Zhongming Yu, Chia-Tung Ho, Brucek Khailany, Jishen Zhao2026-08-12
🤖 machine learning

ChronoSSM: Training for Temporally Aware Representations in Autoregressive State Space Models

تقدم الورقة البحثية ChronoSSM، وهو نموذج فضاء حالة ذاتي الانحدار (autoregressive State Space Model) يتدرب بشكل مشترك على توليد الأحداث والطوابع الزمنية لإنتاج تمثيلات أكثر إفادة من الناحية الزمنية دون المساس بجودة التنبؤ بالمحتوى، متفوقاً بذلك على النهج التقليدي المكون من مرحلتين والذي يعامل التوقيت كإشارة ثانوية.

Adrien Schoen, Nachiketa Ratnakar Patil, Arjun Bhagoji, Francesco Bronzino2026-08-12
🤖 machine learning

Procedural Fairness Failures in RLHF from Preference Averaging

تحدد هذه الورقة أن التعلم المعزز القياسي من التغذية الراجعة البشرية (RLHF) يفشل في تحقيق العدالة الإجرائية عبر متوسط التفضيلات غير المتجانسة، مما يتسبب في هيمنة مجموعات الأغلبية على تعلم المكافأة، وتقترح "التعلم المعزز من التفضيلات الواعية" (PA-RLHF) لفصل التحسين عبر أنماط التفضيل، مما يحسن دقة المحاذاة بشكل كبير ويقلل فجوات العدالة.

M P V S Gopinadh, Karthik Kamuju, Kummari Avinash, John Joshua, Srinivasa Raju Rudraraju2026-08-12
🤖 machine learning

The Evaluation Protocol Determines the Result: An Independent Reproduction of LeWorldModel on TwoRoom

يكشف هذا التكرار المستقل لنموذج LeWorldModel أن نجاحه المُبلغ عنه في بيئة TwoRoom يعتمد كليًا على اتفاقيات تقييم وخيارات تكوين غير موثقة بدلاً من القدرات الجوهرية للنموذج، حيث تفشل أوزان المؤلف نفسه في ظل الإعدادات المنشورة وتثبت دقة التنبؤ أنها غير مرتبطة بالنجاح في التخطيط طويل الأمد.

Joyjeet Singh2026-08-12
🤖 machine learning

Intrinsic Structure: Spectral Identifiability for Mechanistic Interpretability

تضع هذه الورقة البحثية أول نظرية للتعرف (identifiability theorem) في مجال التفسير الآلي من خلال إثبات أن طيف "كوبمان" (Koopman spectrum) الخاص بالنموذج هو بصمة جوهرية، مستقلة عن الإحداثيات، ويمكن استردادها من البيانات، مما يميز الخصائص الهيكلية عن النواتج المنهجية الاصطناعية، ويكشف في الوقت ذاته عن انفصال جوهري بين الميزات القابلة للتعرف إحصائياً والدوائر القابلة للقراءة بشرياً.

Ashim Dhor, Pin-Yu Chen2026-08-12
🤖 machine learning

From Prediction to Incrementality: Causal Optimization for Large-Scale Targeting and Recommendation

تقدم هذه الورقة إطار عمل متمحوراً حول القرار يستبدل الاستهداف التنبؤي التقليدي بالتحسين السببي لأنظمة التوصية واسعة النطاق، من خلال دمج الشبكات العصبية السببية، والاستكشاف البايزي، والتخصيص المقيد لتحقيق زيادة ذات دلالة إحصائية قدرها 7.20% في القيمة طويلة الأمد خلال اختبار A/B عبر الإنترنت على LinkedIn.

Changshuai Wei, John Bencina, Phuc Nguyen, Andre Assuncao Silva T Ribeiro, Benjamin Zelditch2026-08-12
💻 computer science

More Accurate, Less Human: Gestalt Grouping in Vision Models

تقدم هذه الورقة مجموعة اختبار سلوكية تقيم 45 نموذج رؤية مقابل بيانات إدراكية بشرية في أربع مهام تجميع "جشطالت"، مما يكشف أن التوافق مع التنظيم البصري البشري هو مقياس متميز وحاسم تفشل المعايير المرجعية التقليدية غالباً في رصده، لا سيما بالنسبة للنماذج التأسيسية المغلقة.

Sudhanva Manjunath Athreya, Sai Phani Kumar Malladi2026-08-12
🤖 machine learning

ELMER: Evolutionary Language Model that Explores and Refines

تقدم الورقة البحثية نموذج ELMER، وهو نموذج لغوي تطوري يستخدم نموذج Qwen3-8B الذي تم ضبطه بدقة باستخدام التحسين المباشر للتفضيلات (Direct Preference Optimization) لتوجيه طفرات السياسة باللغة الطبيعية حسب القوة، مما يثبت أن التمثيلات القائمة على اللغة توفر معايرة سلوكية وكفاءة بحث متفوقة مقارنة بمقاييس التحرير النحوية التقليدية في تطور البرامج.

Matthew Siper, Ahmed Khalifa, Julian Togelius2026-08-12
🤖 machine learning

Boundary-Seeking Policy Gradient for Safe Reinforcement Learning

تقدم هذه الورقة "تدرج السياسة الباحث عن الحدود" (BSPG)، وهو منهج من الدرجة الأولى للتعلم المعزز الآمن يعمل صراحةً على دفع السياسات نحو قيود السلامة النشطة من خلال الجمع بين صعود المكافأة المماسي ومكون طبيعي مُوقَّع، مما يحقق مكافآت أعلى والتزاماً أدق بالحدود مقارنة بالنماذج المرجعية الحالية مع استيفاء شروط كيه كيه تي (KKT).

Chenhua Fan, Jiahui Zhu, Yuhang Zhang, Honghao Wei2026-08-12
🤖 machine learning

The Kuramoto Neural Operator: Learning to Solve PDEs via Coupled Oscillator Dynamics

تقدم هذه الورقة البحثية "مؤثر كوراماتو العصبي" (KNO)، وهو بنية مبتكرة تنمذج حلول المعادلات التفاضلية الجزئية من خلال تطور متذبذبات كامنة متفاعلة، محققةً أداءً تنبؤياً فائقاً ومقدمةً رؤى جديدة حول ديناميكيات الخطأ من منظور التزامن.

Petr Badolia, Leonid Obukhov, Dmitry Bylinkin, Aleksandr Beznosikov2026-08-12