📊 statistics

Reasoning Is Not Free: Robust Adaptive Cost-Efficient Routing for LLM-as-a-Judge

تقدم هذه الورقة البحثية RACER، وهو إطار عمل توجيهي تكيفي قوي يختار ديناميكيًا بين أحكام النماذج اللغوية الكبيرة (LLMs) القائمة على الاستنتاج وغير القائمة عليه تحت ميزانية ثابتة من خلال حل مسألة تحسين متينة توزيعيًا، مما يحقق مقايضات فائقة بين الدقة والتكلفة مع مراعاة التحولات في التوزيع.

Wenbo Zhang, Lijinghua Zhang, Liner Xiang, Hengrui Cai2026-05-12
🤖 AI

PhyGround: Benchmarking Physical Reasoning in Generative World Models

تقدم الورقة البحثية PhyGround، وهو معيار مرجعي شامل يتميز بـ 250 مطالبة منسقة، وتصنيف مكون من 13 قانوناً، وحكم متخصص في النماذج اللغوية البصرية (PhyJudge-9B) لتقييم وتشخيص قدرات الاستدلال الفيزيائي لنماذج الفيديو التوليدية بصرامة من خلال تعليق بشري واسع النطاق ومحكم الجودة.

Juyi Lin, Arash Akbari, Yumei He, Lin Zhao, Haichao Zhang, Arman Akbari, Xingchen Xu, Zoe Y. Lu, Enfu Nan, Hokin Deng, E (…)2026-05-12
🤖 AI

Threat Modelling using Domain-Adapted Language Models: Empirical Evaluation and Insights

تقدم هذه الورقة تقييماً تجريبياً شاملاً للنماذج اللغوية الكبيرة والصغيرة المتكيفة مع المجال لنمذجة تهديدات STRIDE في شبكات الجيل الخامس (5G)، كاشفةً أن التكيف مع المجال أو توسيع نطاق النماذج لا يضمن باستمرار أداءً موثوقاً، مما يسلط الض الضوء على القيود الجوهرية للنماذج اللغوية الكبيرة الحالية في المهام الأمنية المهيكلة والحاجة إلى تعزيز القدرة على الاستنتاج والترسيخ.

Saba Pourhanifeh, AbdulAziz AbdulGhaffar, Ashraf Matrawy2026-05-12
🤖 machine learning

Policy Gradient Methods for Non-Markovian Reinforcement Learning

تقدم هذه الورقة إطار عمل يرتكز على المكافأة للتعلم المعزز غير الماركوفي يعمل على تحسين ديناميكيات حالة الوكيل وسياسات التحكم بشكل مشترك، مما يؤسس لنظرية تدرج سياسة جديدة وخوارزمية ASMPG مع ضمانات تقارب نظرية وأداء تجريبي متفوق على النماذج التنبؤية المرجعية.

Avik Kar, Siddharth Chandak, Rahul Singh, Soumitra Sinhahajari, Eric Moulines, Shalabh Bhatnagar, Nicholas Bambos2026-05-12
🤖 AI

MaD Physics: Evaluating information seeking under constraints in physical environments

تقدم الورقة البحثية MaD Physics، وهو معيار مرجعي مبتكر صُمم لتقييم قدرة الوكلاء الاصطناعيين على استنتاج القوانين الفيزيائية والتخطيط للقياسات في ظل قيود الموارد من خلال اختبارهم في بيئات ذات قوانين فيزيائية معدلة، مما يكشف عن حدود قدرات الاستدلال العلمي والاستكشاف المنظم في نماذج Gemini الحالية.

Moksh Jain, Mehdi Bennani, Johannes Bausch, Yuri Chervonyi, Bogdan Georgiev, Simon Osindero, Nenad Tomašev2026-05-12
🤖 AI

The First Drop of Ink: Nonlinear Impact of Misleading Information in Long-Context Reasoning

تحدد هذه الورقة تأثير "قطرة الحبر الأولى" في الاستدلال طويل السياق، حيث تُظهر أن الأداء يتدهور بشكل حاد مع وجود حتى نسبة ضئيلة من المشتتات الصعبة بسبب استحواذها غير المتناسب على الانتباه، مما يعني أن الاسترداد الجوهري يتطلب نسباً من المشتتات تقترب من الصفر بدلاً من مجرد تقليل طول السياق.

Muhan Gao, Zih-Ching Chen, Kuan-Hao Huang2026-05-12
🤖 machine learning

SLIM: Sparse Latent Steering for Interpretable and Property-Directed LLM-Based Molecular Editing

تقدم الورقة البحثية إطار عمل SLIM، وهو إطار عمل جاهز للتشغيل (plug-and-play) يعزز تحرير الجزيئات الموجه بالخصائص في النماذج اللغوية الكبيرة عبر تفكيك الحالات الخفية إلى سمات متفرقة وقابلة للتفسير بواسطة مُشفّر تلقائي متفرع (Sparse Autoencoder)، مما يتيح توجيهاً دقيقاً يحسن معدلات نجاح التحرير بشكل كبير دون تعديل معاملات النموذج.

Mingxu Zhang, Yuhan Li, Lujundong Li, Dazhong Shen, Hui Xiong, Ying Sun2026-05-12
🤖 AI

MMVIAD: Multi-view Multi-task Video Understanding for Industrial Anomaly Detection

تقدم هذه الورقة البحثية MMVIAD، وهي أول مجموعة بيانات ومعيار مرجعي للفيديو المستمر متعدد المشاهد لكشف الشذوذ الصناعي، وتقترح VISTA، وهو نموذج تم تدريبه عبر مسار تدريب لاحق مبتكر من مرحلتين يتفوق بشكل كبير على النماذج اللغوية الكبيرة متعددة الوسائط للفيديو الحالية والأسس المرجعية بمستوى البشر عبر أربع مهام تفتيش صناعية رئيسية.

Xiran Zhao, Jing Jin, Yan Bai, Zhongan Wang, Yifeng Sun, Yihang Lou, Xuanyu Zhu, Tao Feng, Yingna Wu2026-05-12
🧬 biology

Clin-JEPA: A Multi-Phase Co-Training Framework for Joint-Embedding Predictive Pretraining on EHR Patient Trajectories

يقدم Clin-JEPA إطار عمل تدريب مشترك مستقر مكون من خمس مراحل ينجح في تطويع بنية التنبؤ بالتمثيل المشترك (JEPA) لتتناسب مع بيانات السجلات الصحية الإلكترونية، وذلك عبر التدريب المشترك لمُشفّر ومتنبئ، مما يمكّن نموذجاً أساسياً واحداً من تحقيق تنبؤ فائق لمسارات الفضاء الكامن وتنبؤ متعدد المهام بالمخاطر دون الحاجة إلى ضبط دقيق لكل مهمة على حدة.

Yixuan Yang, Mehak Arora, Ryan Zhang, Baraa Abed, Junseob Kim, Tilendra Choudhary, Md Hassanuzzaman, Kevin Zhu, Ayman Al (…)2026-05-12
🤖 AI

Training-Free Cultural Alignment of Large Language Models via Persona Disagreement

تقدم الورقة البحثية DISCA، وهي طريقة تعتمد على الاستدلال في وقت التشغيل، وهي طريقة "الصندوق الأسود" التي لا تتطلب تدريباً، وتعمل على مواءمة النماذج اللغوية الكبيرة مع التفضيلات الثقافية المتنوعة من خلال الاستفادة من الخلافات في الشخصيات القائمة على مسح القيم العالمي لتصحيح مخرجات النموذج دون الحاجة إلى ضبط دقيق.

Huynh Trung Kiet, Dao Sy Duy Minh, Tuan Nguyen, Chi-Nguyen Tran, Phu-Hoa Pham, Nguyen Lam Phu Quy, The Anh Han, Long Tra (…)2026-05-12