🤖 AI

SIGMA: SHAP-Guided Implicit-Trajectory Generation for Metadata-Free LLM-Based AutoFE

إنَّ SIGMA هو إطار عمل هندسة ميزات تلقائية (AutoFE) قابل للتوسع وخالٍ من البيانات الوصفية، يستفيد من قيم SHAP ومنهج "المسار الضمني للميزات المكشوفة" (EXIT) لتوجيه توليد الميزات باستخدام نافذة سياق ثابتة، مما يقلل بفعالية من تكرار الميزات ويحسن الكفاءة مع مطابقة أداء أحدث التقنيات المتاحة.

Xuan Zheng, Kento Uchida, Shinichi Shirakawa2026-08-19
⚡ electrical engineering

An Omitted Mode Is a Rare Rule: The Sampling-Verification Danger Law in Continuous Code World Models

تُثبت هذه الورقة أنه في نماذج عالم الكود المستمرة، يُعد قبول مخطط مُصاغ بواسطة نموذج لغوي كبير بناءً على التحقق من أخذ العينات فقط أمراً غير كافٍ بشكل خطير، لأنه غالباً ما يغفل الأنماط المنفصلة الحرجة، مما يؤدي إلى إخفاقات تخطيط كارثية لا يمكن تحديدها بشكل موثوق إلا من خلال تدخلات مستهدفة بدلاً من أخذ العينات العشوائية.

Javier Aguilar Martín2026-08-19
🤖 machine learning

Understanding the Surprising Generalization Properties of Tabular Foundation Models

تكشف هذه الورقة أن النماذج التأسيسية للبيانات الجدولية يمكنها تحقيق تعميم قوي من خلال التدريب المسبق ذاتي الإشراف على جدول حقيقي واحد، مما يثبت أن أداءها يعتمد على عدد وجودة المهام والميزات أكثر من اعتماده على مجموعات البيانات الضخمة، ويشير إلى أن آلية التعلم داخل السياق لديها هي آلية قائمة على الاسترجاع بشكل أساسي.

Nour Shaheen, Junwei Ma, Alex Labach, Frank Hutter, Valentin Thomas, Anthony L. Caterini2026-08-19
🤖 AI

Towards Zero-Shot Task Transfer with Neurosymbolic World Models

تقدم هذه الورقة نموذج عالم عصبي-رمزي يفصل بين إعادة بناء الملاحظة والتنبؤ بالمكافأة باستخدام مكونات رمزية مهيكلة، مما يتيح التكيف الصفري (zero-shot) مع دوال مكافأة جديدة دون تفاعلات إضافية مع البيئة، ويُظهر قدرة فائقة على التعميم مقارنة بالطرق العصبية البحتة.

Isidoro Tamassia, Lennert De Smet, Giuseppe Marra2026-08-19
🤖 machine learning

Evaluating and improving crop-yield forecasting methods during extreme drought

تقيم هذه الدراسة وتعمل على تحسين نماذج التنبؤ بإنتاجية المحاصيل لجفاف عام 2012 الشديد في الولايات المتحدة من خلال مقارنة نهجي تعلم الآلة والتعلم العميق في ظل ظروف عدم تشابه توزيع الميزات وندرة البيانات، لتجد أنه بينما يعزز وزن العينات واختيار الميزات النماذج غير القائمة على التعلم العمبال، فإن نموذج التعلم العميق VITA يتفوق عليها بغض النظر عن هذه التعديلات.

Shrey Gupta, Yi Ming, George Mohler2026-08-19
🤖 machine learning

Revisiting WEASEL 2.0: Reproduction, Sensitivity, and an Adaptive Ensemble-Size Rule

تعيد هذه الورقة إنتاج مصنف السلاسل الزمنية WEASEL 2.0 للتحقق من أدائه، وتحدد أن قاعدة حجم المجموعة الثابتة الخاصة به غير فعالة لمجموعات البيانات ذات السلاسل الطويلة، مما أدى إلى اقتراح قاعدة تكيفية تقلل بشكل كبير من استهلاك الذاكرة ووقت التدريب مع تأثير ضئيل على الدقة.

Cian Higgins, Gerard Carrigan, Pinar Sungu Isiacik, Georgiana Ifrim2026-08-19
📊 statistics

Where A Small Language Model Helps in Invoice Categorisation, Understood Through Embedding Geometry

تُثبت هذه الورقة أن الضبط الدقيق لنموذج لغوي صغير (SBERT) على وحدة معالجة رسومية واحدة يحقق دقة عالية في تصنيف الفواتير من خلال الاستفادة من عناقيد التضمين المتماثلة محلياً والمرتبطة بهوية المورد، مما يثبت أن النماذج اللغوية الصغيرة الداخلية توفر بديلاً فعالاً من حيث التكلفة وآمناً وقابلاً للتعميم للنماذج اللغوية الكبيرة، بينما تكشف أيضاً أن المدخلات المهيكلة المفيدة للبشر قد لا تحسن أداء النموذج.

Emma Ceccherini, Daniel Lawson, Anjulika Salhan2026-08-19
🤖 machine learning

Optimize Your Sampling: Tuned Diffusion Sampling with Bayesian Optimization

تقدم هذه الورقة البحثية طريقة "تحسين أخذ العينات الخاص بك" (OYS)، وهي طريقة لا تتطلب تدريباً تستخدم التحسين البايزي لضبط الخطوات الزمنية لأخذ عينات نماذج الانتشار بشكل مباشر، مما يقلل تكاليف الاستدلال بشكل كبير مع الحفاظ على جودة توليد عالية عبر مختلف المهام وأدوات أخذ العينات.

Travis Zhang, Christian Belardi, Justin Lovelace, Jin Peng Zhou, Saebyeol Shin, Carla P. Gomes, Kilian Q. Weinberger2026-08-19
🤖 AI

On the Fragility of Self-Improving Agents: Variance, Task Order, and Underspecification

تكشف هذه الورقة عن هشاشة الوكلاء ذاتيي التحسين القائمين على الذاكرة من خلال إثبات أن أداءهم حساس للغاية لتباين التقييم وترتيب المهام بسبب عدم التحديد، مما يدعو إلى بروتوكولات تقييم أكثر صرامة وتعزيز الإشراف البشري.

Qinyuan Ye, Yu Li, Yada Pruksachatkun, Jiaxin Zhang, Chien-Sheng Wu2026-08-19
🤖 machine learning

Confidence intervals for the random forest generalization error

تُثبت هذه الورقة أن فترات الثقة لخطأ التعميم في الغابات العشوائية يمكن حسابها بكفاءة مباشرة من نواتج التدريب القياسية، مما يوفر بديلاً منخفض التكلفة لتقسيم البيانات وإعادة التدريب يحقق تغطية إحصائية ومعدلات تقارب جيدة.

Paulo C. Marques F2026-08-18