🤖 AI

When Self-Consistency Backfires: Majority Vote Hurts the Majority of Hard Science Problems for Small LLMs

تُظهر هذه الورقة أنه بالنسبة للنماذج اللغوية الكبيرة الصغيرة المضبوطة بالتعليمات في المسائل العلمية الصعبة، فإن الاتساق الذاتي عبر التصويت بالأغلبية غالباً ما يقلل من الدقة مقارنة بالاستدلال أحادي العينة لأن الاتفاق العالي بين الإجابات المولدة لا يرتبط بشكل موثوق بالصحة.

Utkarsh Bahuguna2026-08-13
🤖 AI

Social Chain of Thought: A Multi-Agent Architecture Grounded in Medical Differential Diagnosis Methodology

تقدم هذه الورقة البحثية "سلسلة التفكير الاجتماعي" (SCoT)، وهي بنية متعددة الوكلاء قائمة على منهجية التشخيص التفريقي الطبي، والتي تتفوق على نماذج الاستدلال أحادية الهيكل ونماذج التوسع المرجعية من خلال استخدام محادثات تداولية متعددة الجولات بين المتخصصين لتحسين استدعاء التشخيص بشكل كبير، لا سيما في الحالات المعقدة.

Del Coburn, Scott Sanner, Dan Silver2026-08-13
⚡ electrical engineering

Herding End-to-End Autonomous Driving via Neuro-Symbolic Safety Guards

تقدم هذه الورقة حارس سلامة عصبي-رمزي خفيف الوزن وغير قابل للتدريب، يتم إلحاقه بوكلاء القيادة الذاتية من طرف إلى طرف لفرض قواعد المرور الصريحة عبر استبدال الأوامر غير الآمنة ببدائل آمنة، مما يقلل الاصطدامات بشكل كبير ويحسن معدلات النجاح في اختبارات الحالات النادرة دون المساس بأداء القيادة العام.

Simón Patiño Idarraga, Erick Silva, Rehana Yasmin, Ali Shoker2026-08-13
🤖 AI

The Next Challenge for Agentic Cybersecurity: A Realistic, Contamination-Free Reverse Engineering Benchmark

تقدم هذه الورقة البحثية SRE-Bench، وهو أول معيار مرجعي واقعي وخالٍ من التلوث لتقييم قدرات الهندسة العكسية الوكيلية على الكود الثنائي، والذي يكشف أن حتى أقوى النماذج اللغوية الكبيرة الرائدة تعاني لمواكبة الأداء البشري بسبب التحديات الفريدة المتمثلة في تحليل الثنائيات غير المرئية والمحمية.

Jeremy Spence, Nicholas Assaderaghi, Jinhao Zhu, Nikil Ravi, Raluca Ada Popa, Guannan Wei, Yangruibo Ding, Zhuo Zhang2026-08-13
🧬 biology

A Modular Agentic Framework for Synthetically Constrained Multi-Objective Hit-to-Lead Optimization

تقدم هذه الورقة SABLE، وهو إطار عمل وكيل (agentic) مفتوح المصدر ومعياري يستخدم التنسيق باللغة الطبيعية والتحسين البايزي للتنقل بكفاءة عبر مساحات التصميم المقيدة اصطناعياً ومتعددة الأهداف في مرحلة تطوير المركبات الواعدة (hit-to-lead) لاكتشاف الأدوية.

Kelvin P. Idanwekhai, Enes Kelestemur, Benjamin Strickland, Matthew Hart, Steini Davidsson, Angelos Angelopoulos, Ron Al (…)2026-08-13
🤖 machine learning

Hierarchical Federated Transfer Learning in Digital Twin-Based Vehicular Networks

تقترح هذه الورقة إطار عمل للتعلم الانتقالي الاتحادي الهرمي (HFTL) لشبكات المركبات القائمة على التوأم الرقمي، والذي يعالج عدم تجانس البيانات وندرتها من خلال تجميع المركبات والتعلم الانتقالي، مع دمج آلية لجودة البيانات لضمان دقة النموذج العالمي ضد المركبات الضارة.

Qasim Zia, Saide Zhu, Haoxin Wang, Zafar Iqbal, Yingshu Li2026-08-13
⚡ electrical engineering

Generative Semantic Segmentation via an Observable Semantic-Image Interface and Hierarchical Generator Evidence Alignment

يقدم البحث "Semantic Prism"، وهو إطار عمل حتمي لتوليد التقسيم الدلالي يستخدم مولداً ذا خطوة واحدة مستخلصاً من الانتشار ومحاذاة أدلة المولد الهرمية لتقديم صور دلالية بواجهة لونية ثابتة، محققاً دقة هي الأفضل في فئتها، وممكناً مقياساً جديداً لترتيب الأخطاء دون الحاجة إلى عناصر مساعدة (C-IHD) يتفوق بشكل كبير على مقايضات الثقة التقليدية عبر مجموعات بيانات متعددة.

Weize Cai, Yongqi Dong, Zhida Shao, Zixin Fu2026-08-13
💬 NLP

Reinforcing Step-level Reasoning for Effective Self-Correction in LLMs

تقترح هذه الورقة إطار عمل "التحسين التفضيلي للخطوات ذات التصحيح الذاتي" (Self-Fix Step-DPO)، وهو إطار تعزيز تعلم ثنائي المراحل يعزز قدرات التصحيح الذاتي للنماذج اللغوية الكبيرة من خلال تقوية الاستدلال على مستوى الخطوة أولاً عبر التحسين التفضيلي، ثم التدريب صراحةً على التحقق من الأخطاء وتصحيحها، محققاً أداءً فائقاً على النماذج المرجعية الحالية.

Vu Duc Anh, Nhat M. Hoang, Do Xuan Long, Cong-Duy Nguyen, Ponhvoan Srey, Luu Anh Tuan2026-08-13
🤖 AI

Localizing Safety Alignment: MLP Layers and Mid-Network Blocks Encode Refusal Behavior in Large Language Models

تُثبت هذه الورقة أن سلوك الرفض المتوافق مع معايير السلامة في النماذج اللغوية الكبيرة يتركز أساساً ضمن طبقات الـ MLP في منتصف الشبكة بدلاً من كونه خاصية موزعة، مما يكشف أن نقل مجموعات فرعية محددة من هذه الأوزان يمكنه نقل قدرات الرفض بفعالية، مع تسليط الضوء على الطبيعة غير التراكمية والمعتمدة على المعايير المرجعية لعملية محاذاة السلامة.

Mingyu Zong, Sampad Mohanty, Bhaskar Krishnamachari2026-08-13
🤖 AI

EnterpriseRAG: Benchmarking LLM Instruction Adherence and Robustness under Non-Ideal Enterprise Retrieval

تقدم الورقة البحثية EnterpriseRAG، وهو معيار شامل يتكون من 983 عينة تم التحقق منها من قبل خبراء عبر ستة مجالات، والذي يكشف عن "فجوة تنسيق" حرجة في أنظمة التوليد المعزز بالاسترجاع (RAG) في المؤسسات، مظهرًا أنه بينما غالبًا ما تستوفي النماذج اللغوية الكبيرة القيود الفردية، فإن التزامها بالتعليمات الشاملة ينهار بشكل كبير في ظل ظروف الإنتاج الواقعية التي تنطوي على استرجاع مشوش، وفجوات معرفية، وتضاربات واقعية.

Huiqi Miao, Xinbao Sun, Bo Wang, Fanyu Meng, Lijun Mei, Na Wu, Di Jin, Chao Deng, Junlan Feng2026-08-13