💬 NLP

Measuring Evaluation-Context Divergence in Open-Weight LLMs: A Paired-Prompt Protocol with Pilot Evidence of Alignment-Pipeline-Specific Heterogeneity

تقدم هذه الورقة بروتوكول التلقين المزدوج لقياس تباين سياق التقييم في النماذج اللغوية الكبيرة ذات الأوزان المفتوحة، كاشفةً أن مسارات المحاذاة تُحدث تحولات سلوكية متباينة حيث تصبح بعض النماذج أكثر حذراً تحت إطار التقييم بينما تصبح نماذج أخرى أقل حذراً، وهو نمط يختلف بشكل كبير اعتماداً على عائلة النموذج المحددة ومصنف السلامة المستخدم للحكم.

Florian A. D. Burnat, Brittany I. Davidson2026-05-08
💬 NLP

MANTRA: Synthesizing SMT-Validated Compliance Benchmarks for Tool-Using LLM Agents

تقدم الورقة البحثية إطار عمل MANTRA، الذي يقوم تلقائياً بتوليف والتحقق رسمياً من معايير قياس الامتثال القابلة للتوسع والقابلة للفحص آلياً لوكلاء النماذج اللغوية الكبيرة (LLMs) المستخدمة للأدوات، وذلك عبر توليد نماذج عالم رمزية وفحوصات على مستوى التتبع مدعومة ببرمجيات التحقق من النماذج (SMT) من أدلة إجرائية مكتوبة بلغة طبيعية.

Ashwani Anand, Ivi Chatzi, Ritam Raha, Anne-Kathrin Schmuck2026-05-08
🤖 machine learning

Eliciting associations between clinical variables from LLMs via comparison questions across populations

تقترح هذه الورقة طريقة تستخدم أسئلة ثلاثية لمقارنة المرضى مهيكلة ونمذجة إحصائية لاستخلاص ارتباطات مستقرة وقابلة للتفسير سريرياً من النماذج اللغوية الكبيرة، مما يتيح التنبؤ السببي الثابت لتحديد الروابط السببية المرشحة المحافظة عبر مختلف المجموعات الفرعية للمرضى دون الوصول إلى المكونات الداخلية للنموذج.

Fabian Kabus, Kian Kordtomeikel, Thomas Brox, Heinz Wiendl, Daiana Stolz, Harald Binder2026-05-08
🤖 machine learning

A Benchmark for Strategic Auditee Gaming Under Continuous Compliance Monitoring

تقدم هذه الورقة معياراً وإطاراً رسمياً لتحليل التلاعب الاستراتيجي من جانب الجهات الخاضعة للتدقيق في ظل المراقبة المستمرة للامتثال، مما يكشف عن القيود المتأصلة في تصميمات التدقيق الثابتة ويوضح كيف يمكن للاستراتيجيات التكيفية استغلال الفجوات الزمنية في التغطية ودقة التفاصيل.

Florian A. D. Burnat, Brittany I. Davidson2026-05-08
💬 NLP

Is Escalation Worth It? A Decision-Theoretic Characterization of LLM Cascades

تقدم هذه المساهمة إطاراً قائماً على نظرية القرار لتوصيف منحنيات حد التكلفة والجودة لمتواليات النماذج اللغوية الكبيرة (LLM cascades)، وتوضح أن التكاليف الهيكلية المرتبطة بالدفع مقابل توليدات النماذج الأولية غير المكلفة، بدلاً من نقص المراحل المتوسطة، تحد بشكل جوهري من مكاسب الأداء لمتواليات متعددة المراحل مقارنة باستراتيجيات التوجيه الأكثر بساطة.

Dylan Bouchard2026-05-08
📊 statistics

Order-Agnostic Autoregressive Modelling with Missing Data

تقدم هذه الورقة نماذج الترتيب غير المعتمد على الترتيب والمدركة لفقدان البيانات (MO-ARM)، وهو إطار عمل يعيد تفسير النماذج التوليدية ذات الترتيب غير المعتمد على الترتيب من خلال منظور البيانات المفقودة لتمكين الاستكمال القوي في ظل آليات فقدان عامة وتسهيل اكتساب المعلومات النشط، متفوقةً باستمرار على النماذج المرجعية الحالية في الاختبارات القياسية الواقعية.

Ignacio Peis, Pablo M. Olmos, Jes Frellsen2026-05-08
🤖 machine learning

Flow Matching with Arbitrary Auxiliary Paths

تقدم هذه الورقة البحثية AuxPath-FM، وهو إطار عمل لمطابقة التدفق (flow matching) معمم يدمج متغيراً مساعداً من توزيع عشوائي في المسار الاحتمالي، مما يتيح خصائص هندسية متنوعة ومهام متخصصة مثل التوليد الموجه بالتسميات مع الحفاظ على الاتساق النظري.

Xin Peng, Ang Gao2026-05-08
🤖 machine learning

Layer Collapse in Diffusion Language Models

تكشف هذه الورقة أن نماذج اللغات الانتشارية تظهر ظاهرة "انهيار الطبقات" الفريدة الناتجة عن الإفراط في التدريب، حيث تطور الطبقات المبكرة قيمًا شاذة فائقة وحالات تمثيل زائدة، مما يتيح ضغطًا أفضل بشكل ملحوظ واستراتيجيات تخصيص تخلخل متميزة مقارنة بالنماذج ذات التوليد الذاتي الانحداري.

Alexander Conzelmann, Albert Catalan-Tatjer, Shiwei Liu2026-05-08
📊 statistics

The Interplay of Data Structure and Imbalance in the Learning Dynamics of Diffusion Models

تُطوّر هذه الورقة إطاراً تحليلياً عالي الأبعاد للكشف عن كيفية تحكم تباين الفئات وعدم توازن العينات هرمياً في ديناميكيات التعلم لنماذج الانتشار، مما يتسبب غالباً في جعل النموذج يحفظ الفئات ذات التباين العالي أو الفئات الأكثرية بينما يؤخر أو يفشل في تعلم الفئات الأقلية وذات التباين المنخفض.

Flavio Nicoletti, Chenxiao Ma, Enrico Ventura, Luca Saglietti, Stefano Sarao Mannelli2026-05-08
🤖 machine learning

eXplaining to Learn (eX2L): Regularization Using Contrastive Visual Explanation Pairs for Distribution Shifts

تقترح الورقة البحثية eX2L، وهو إطار عمل قابل للتفسير يخفف من حدة انزياحات التوزيع عن طريق معاقبة التشابه بين خرائط Grad-CAM لمصنف التسمية ومصنف المربك لفك الارتباط بين الميزات المربكة، مما يحقق أداءً هو الأفضل في فئته على معيار تحدي Spurious Many-to-Many Hard.

Paulo Mario P. Medina, Jose Marie Antonio Miñoza, Sebastian C. Ibañez2026-05-08