🤖 machine learning

LLM Benchmark Datasets Should Be Contamination-Resistant

تجادل هذه الورقة بأن مجموعات بيانات اختبار النماذج اللغوية الكبيرة يجب إعادة تصميمها لتكون مقاومة للتلوث —بما يجعلها غير قابلة للتعلم أثناء التدريب مع بقائها قابلة للحل أثناء الاستنتاج— وذلك عبر الاستفادة من التباينات الهيكلية والتقدم الرياضي لضمان تقييم موثوق وقابل للتكرار للنماذج.

Ali Al-Lawati, Jason Lucas, Dongwon Lee, Suhang Wang2026-05-20
🤖 machine learning

Training Neural Networks with Optimal Double-Bayesian Learning

تقدم هذه الورقة إطاراً احتمالياً جديداً يعتمد على "بايزي المزدوج" (double-Bayesian) يشتق نظرياً معدل تعلم أمثلي لعملية الانحدار الاشتقاقي العشوائي، مبرهنةً من خلال تجارب مكثفة أن هذا النهج يعزز بفعالية تدريب الشبكات العصبية عبر مهام متنوعة.

Vy Bui, Hang Yu, Karthik Kantipudi, Ziv Yaniv, Stefan Jaeger2026-05-20
🤖 AI

When Skills Don't Help: A Negative Result on Procedural Knowledge for Tool-Grounded Agents in Offensive Cybersecurity

تتحدى هذه الورقة الافتراض القائل بأن "المهارات" الإجرائية تعزز أداء وكلاء النماذج اللغوية الكبيرة (LLMs) بشكل عالمي، وذلك من خلال إثبات أن إضافة مثل هذه المهارات في بيئات الأمن السيبراني الهجومية ذات التغذية الراجعة للأدوات عالية النطاق الترددي والمحققة وفق مخطط هيكلي (schema-validated)، توفر فائدة ضئيلة أو حتى تؤدي إلى تدهور الأداء لأن البيئة نفسها توفر إشارات التصحيح اللازمة.

Samuel Jacob Chacko, James Hugglestone, Chashi Mahiul Islam, Xiuwen Liu2026-05-20
💬 NLP

PromptRad: Knowledge-Enhanced Multi-Label Prompt-Tuning for Low-Resource Radiology Report Labeling

يُعد PromptRad إطار عمل لضبط المطالبات معززاً بالمعرفة، حيث يعيد صياغة وسم تقارير الأشعة كنمذجة لغة مقنعة باستخدام مرادفات UMLS، مما يتيح تصنيفاً عالي الأداء متعدد الملصقات بأقل قدر من البيانات الموسومة عبر التفوق على طرق الضبط الدقيق التقليدية والطرق القائمة على القواميس.

Ying-Jia Lin, Tzu-Chin Lo, Ping-Chien Li, Chi-Tung Cheng, Chien-Hung Liao, Hung-Yu Kao2026-05-20
🤖 AI

Towards LLM-Assisted Architecture Recovery for Real-World ROS~2 Systems: An Agent-Based Multi-Level Approach to Hierarchical Structural Architecture Reconstruction

تقدم هذه الورقة نهجاً معززاً قائماً على الوكلاء ومتعدد المستويات لاستعادة البنى البرمجية الهرمية في أنظمة ROS 2 المعقدة والواقعية، وذلك عبر استخدام صياغة مطورة للمطالبات لنماذج اللغات الكبيرة (LLM) واستراتيجية استعادة مرحلية للتغلب على قيود الطرق الحالية القائمة على مستوى العقدة.

Dominique Briechle, Raj Chanchad, Tobias Geger, Ruidi He, Dhruv Jajadiya, Dhruv Kapadiya, Andreas Rausch, Meng Zhang2026-05-20
🤖 AI

Probing Embodied LLMs: When Higher Observation Fidelity Hurts Problem Solving

تكشف هذه الورقة أن وكلاء النماذج اللغوية الكبيرة المتجسدة التي تحل الألغاز الميكانيكية يمكنهم، على نحو مفارق، تحقيق معدلات نجاح أعلى باستخدام مدخلات حسية ذات دقة أقل أو ضجيج إدراكي متوسط، حيث تساعد هذه العيوب في كسر حلقات الحركة المتكررة وحجب إخفاقات الاستدلال، مما يتحدى الافتراض بأن الملاحظة المثالية تؤدي دائمًا إلى الأداء الأمثل.

Oussama Zenkri, Oliver Brock2026-05-20
💬 NLP

CopT: Contrastive On-Policy Thinking with Continuous Spaces for General and Agentic Reasoning

يُعد CopT إطار عمل استدلالي لا يتطلب تدريباً، حيث يعكس نموذج "سلسلة الأفكو" التقليدي عبر توليد إجابة مسودة أولاً، ثم توظيف أدوات تحقق تباينية في الفضاء المستمر لتفعيل التأمل الذاتي المعتمد على السياسة (on-policy reflection) ديناميكياً عند الضرورة فقط، مما يؤدي إلى تحسين الدقة بشكل كبير وتقليل تكاليف الرموز (tokens) عبر مهام استدلالية متنوعة.

Dachuan Shi, Hanlin Zhu, Xiangchi Yuan, Wanjia Zhao, Kejing Xia, Wen Xiao, Wenke Lee2026-05-20
🤖 AI

What Do Evolutionary Coding Agents Evolve?

تقدم هذه الورقة EvoTrace، وهي مجموعة بيانات لآثار الترميز التطوري، وEvoReplay، وهي منهجية قائمة على إعادة التشغيل، لتكشف أن مكاسب الأداء في وكلاء الترميز التطوري غالبًا ما تنبع من آليات متنوعة مثل إعادة الضبط أو إعادة استخدام المعرفة الموجودة بدلاً من الابتكار الخوارزمي الحقيقي، وهو ما يستدل عليه من خلال التكرار الحتمي المتكرر لأسطر الكود.

Nico Pelleriti, Sree Harsha Nelaturu, Zhanke Zhou, Zongze Li, Max Zimmer, Bo Han, Sebastian Pokutta2026-05-20
💬 NLP

ThoughtTrace: Understanding User Thoughts in Real-World LLM Interactions

تقدم هذه الورقة البحثية ThoughtTrace، وهي أول مجموعة بيانات واسعة النطاق تجمع بين المحادثات الواقعية بين البشر والذكاء الاصطناعي وبين أفكار المستخدمين المبلغ عنها ذاتياً، لتكشف أن هذه الحالات المعرفية الكامنة تختلف عن الرسائل المنطوقة، ويصعب على النماذج استنتاجها، وتعد ذات قيمة عالية لتحسين التنبؤ بسلوك المستخدم وتدريب مساعدين مخصصين ومتوافقين مع الأهداف.

Chuanyang Jin, Binze Li, Haopeng Xie, Cathy Mengying Fang, Tianjian Li, Shayne Longpre, Hongxiang Gu, Maximillian Chen (…)2026-05-20
🤖 AI

Neurosymbolic Learning for Inference-Time Argumentation

تقدم هذه الورقة "الاستدلال الحجاجي أثناء الاستنتاج" (Inference-Time Argumentation - ITA)، وهو إطار عمل عصبي رمزي يدمج دلالات الحجاج الصورية لتدريب النماذج اللغوية الكبيرة على توليد وتقييم الحجج، مما يتيح تحققاً ثلاثياً من الادعاءات يتسم باليقين والأمانة ويتفوق على النماذج المرجعية الحالية مع توفير استدلال شفاف وقابل للفحص.

Gabriel Freedman, Adam Dejl, Adam Gould, Mansi, Lihu Chen, Jianqi Jiang, Francesca Toni2026-05-20