🤖 machine learning

When Can You Trust Offline Evaluation of Equal-Cost Top-k Allocation? A Controlled, Reproducible Benchmark and Practitioner's Guide

تقدم هذه الورقة معياراً مضبوطاً وقابلاً لإعادة الإنتاج يثبت أن التقييم غير المتصل لتخصيص أعلى k من التكاليات المتساوية يتأثر أساساً بالخلاف على مستوى الإجراء في التسجيل، وأخطاء تقدير الميل، وتحيز إعادة استخدام السياسة، بدلاً من مقاييس التداخل البسيطة، مما يقدم للممارسين دليلاً لتجاوز هذه العثرات المحددة من خلال التقسيم الصادق على مستوى السياسة واختيار المقدر القوي.

Binshuang Li2026-08-14
🤖 machine learning

Scaling Automatic Research Agents via World Models

تقدم هذه الورقة البحثية نموذج تعلم تعزيزي قائم على النموذج العالمي (WMRL)، وهو إطار عمل يستبدل تنفيذ البيئة المكلف بنموذج عالمي متعلم، ويستخدم تقنيات إزالة الانحياز عبر الإنترنت وإزالة الضجيج بتباين عكسي للتغلب على اختناقات التوسع، مما يؤدي إلى تسريع التدريب وتمكين الوكلاء الأصغر حجماً من التفوق بشكل كبير على النماذج المرجعية الأكبر بكثير في مهام البحث الآلي والمهام المتجسدة.

Xiyuan Yang, Sheikh Sarwar, Jingru Cheng, Zhan Shi, Duanshun Li, Huiyuan Chen, Haiyang Zhang, Chenlei Guo, Jingrui He, Z (…)2026-08-14
🤖 machine learning

Prof-K: Probabilistic One-Pass Filtering for Efficient Top-k Selection

تقدم الورقة البحثية Prof-K، وهو خوارزمية تمريرة واحدة سريعة وقابلة للتوسع ومستقلة عن التوزيع لاختيار أفضل k، تستخدم أخذ العينات الاحتمالية لضمان الصحة باحتمالية عالية مع تحقيق تسريع كبير مقارنة بالطرق الحالية، لا سيما في السيناريوهات واسعة النطاق.

Tadeusz Dziarmaga, Witold Sikora, Łukasz Struski, Jacek Tabor, Marcin Mazur2026-08-14
💰 quantitative finance

DYSANOS Generative Dynamic Smooth Arbitrage-free Non-parametric Option Surfaces

تقدم هذه الورقة نموذج DYSANOS، وهو نموذج سوق توليدي ينتج أسطح خيارات سلسة وخالية من التحكيم الساكن لجميع أسعار التنفيذ وتواريخ الاستحقاق، مع توليد مسارات لعدة سنوات من أسعار السهم والخيارات اليومية، مما يثبت فعاليته على بيانات مؤشر S&P مقارنة بنهج يعتمد على تحليل المكونات الرئيسية (PCA).

Hans Buehler, Blanka Horvath, Anastasis Kratsios2026-08-14
🤖 machine learning

Represent, Then Generate: Multimodal-Conditioned Time-Series Generation under Irregular Missingness

تقدم الورقة البحثية ReCoGen، وهو إطار عمل متعدد الوسائط يتكون من مرحلتين يعمل على فصل تمثيل الشرط عن التوليد لتخليق الإشارات الفسيولوجية المفقودة من بيانات سريرية غير متجانسة ومفقودة بشكل غير منتظم، محققاً فائدة فائقة في المهام اللاحقة عبر معايير متعددة.

Haochen Zhang, Jiaheng Guo, Yu-Chao Huang, Nicholas Knoz, Tianlong Chen2026-08-14
🤖 machine learning

From Visual Widgets to UI Code: Efficient Tool-Grounded Generation

يقدم البحث WidgetGen، وهو إطار عمل خفيف الوزن يعتمد على الأدوات (tool-grounded) يعمل على تحسين المقايضة بين الدقة والكفاءة في عملية توليد الكود من لقطات الشاشة عبر الربط الانتقائي لأدلة النصوص والألوان المرئية لإنتاج JSX مباشرة، متفوقاً بذلك على كل من التلقين المباشر ومسارات العمل المهيكلة، مع تمكين أيضاً من الضبط الدقيق الفعال للنماذج ذات الأوزان المفتوحة.

Houston H. Zhang, Tao Zhang, Li Gu, Linfeng Ye, Yuanhao Yu, Xinxin Zuo, Yang Wang, Zhixiang Chi2026-08-14
🤖 machine learning

Interpretable Causal Discovery via Causal-Effect Constraints

تقترح هذه الورقة طريقة بايزية للاكتشاف السببي تطوع تقنيات تقدير الأحداث النادرة لاستنتاج الرسوم البيانية السببية والمعلمات بكفاءة بشرط قيود محددة، مما يتيح تفسيرات قابلة للتفسير لظواهر مثل الآثار السببية الكبيرة حتى عندما تكون احتمالية حدوث هذه الأحداث في التوزيع البعدي منخفضة.

Cixuan Zhang, Guy Van den Broeck, Benjie Wang2026-08-14
🤖 machine learning

Excess Separability: Nuisance-Controlled Residual-Stream Probing for Benchmark Contamination Detection

تقدم هذه الورقة بروتوكولاً قوياً للكشف عن تلوث المعايير المرجعية في نماذج المحولات (transformers) عبر قياس "الانفصال الزائد" في مجسات التدفق المتبقي، والذي يعمل على تصحيح ملفات العمق غير المسطحة ويستخدم خط أساس وهمي متساوي المستوى لتجنب معدلات الإيجاب الكاذب العالية وفقدان القدرة المتأصل في طرق الاستقصاء البسيطة الموجودة حالياً.

Florian Braun2026-08-14
🤖 machine learning

SteerBench-Work: A Benchmark for Agent Steering at Action Boundaries

تقدم هذه الورقة SteerBench-Work، وهو معيار لتقييم قدرة وكلاء النماذج اللغوية الكبيرة (LLMs) على اتخاذ القرار الصحيح بشأن المضي قدمًا في إجراءات مكان العمل عالية المخاطر أو التوقف عنها، مما يكشف أن النماذج الحالية تبالغ بشكل كبير في رفض المهام المصرح بها بينما تعاني في التمييز بين الحوادث الحقيقية وبين المرايا المعكوسة للأدلة رغم قدراتها العامة.

Oguz Serdar, Cuneyt Mertayak2026-08-14
🤖 machine learning

Training Under Challenge: Executable Certificates and Challenge-Closed Optimality for Neural Networks

تقدم هذه الورقة "التدريب تحت التحدي" (Training Under Challenge)، وهو إطار عمل للشهادات القابلة للتنفيذ يقوم ببناء مرشحين بديلين للشبكات العصبية لتوليد شهود قابلين لإعادة التشغيل لتقدير الحد الأدنى لفجوات الأمثلية العالمية التجريبية، مما يميز بين المصائد المحلية، وحدود التمثيل، وعدم التوافق مع المدرب، مع توفير حدود قابلة للقياس الكمي لفجوات الأمثلية في الممارسة العملية.

Farhang Yeganegi, Arian Eamaz, Mojtaba Soltanalian2026-08-14