💬 NLP

Right Answer, Wrong Method: Shortcut Hacking Misleads the Evaluation of LLM Reasoning on Frontier Science Benchmarks

تكشف هذه الورقة أن معايير التقييم الخاصة بالاستدلال العلمي التي تعتمد فقط على دقة الإجابة النهائية تبالغ بشكل كبير في تقدير قدرات النماذج اللغوية الكبيرة الرائدة لأن جزءاً كبيراً من الإجابات الصحيحة يتم تحقيقه من خلال "اختراق الحلول" — أي عبر طرق مختصرة غير صالحة مثل التخمين أو الحصر — بدلاً من الاستدلال الصحيح، وتقترح استراتيجيات لمكافحة الاختراق تكشف هذا التباين.

Xuan Ren, Weiqi Zhai, Tianle Pu, Yihua Zhu, Yihua Zhu, Hu Wei, Bing Zhao2026-08-04
🤖 AI

Infinite Trace Objectives with Finite Trace Techniques: Translating LTL to LTLf+

تقدم هذه الورقة أول ترجمة من منطق الزمن الخطي (LTL) إلى (LTLf+)، مما يتيح تطبيق تقنيات الأوتوماتا ذات المسارات المحدودة الفعالة على مشكلات الذكاء الاصطناعي ذات المسارات غير المحدودة دون زيادة التعقيد التقاربي لمسار التحويل القياسي من LTL إلى الأوتوماتا.

Christoph Weinhuber, Maximilian Prokop, Giuseppe De Giacomo, Moshe Y. Vardi2026-08-04
🤖 AI

Real-Time Detection and Repair of LLM Agent Failures

تقدم هذه الورقة نظاماً ذا طبقتين ومنخفض التأخير للكشف عن إخفاقات وكلاء النماذج اللغوية الكبيرة (LLM agents) وإصلاحها باستخدام مراقبات تتبع عن بُعد بمقياس الميكروثانية وتحقق حتمي، مما يحسن معدلات نجاح المهام بشكل كبير وبجزء ضئيل من تكلفة التقييم التقليدي القائم على النماذج اللغوية الكبيرة.

Sunny Dubey2026-08-04
🤖 AI

Grounding Agentic VLMs with Dedicated Segmentation for Fine-Grained Vehicle Damage Assessment

تقدم هذه الورقة TinyDamage، وهو إطار عمل وكيل هجين يدمج نموذج تقسيم مخصص متعدد المهام مع نموذج رؤية ولغة للتغلب على حالات فشل التمركز المكاني في تقييم أضرار المركبات دقيق التفاصيل، مما يقلل بشكل كبير من معدلات الهلوسة عبر الاستفيد من التعلم التبايني الخاضع للإشراف ومسار عمل LangGraph.

Vishwajeet Shivaji Hogale, Anjali Pai, Nitya Ravi2026-08-04
🤖 AI

Action-grounded tissue affordance enables anticipatory auto-framing that lowers surgeon cognitive workload during laparoscopic surgery

تقدم الورقة البحثية DiffeoAfford، وهو إطار عمل قائم على الأفعال يقوم تلقائياً بتوليد تسميات الانتباه البصري من الإجراءات الجراحية لتشغيل AffordView، وهو نظام تأطيم تلقائي يتوافق مع نظرات الخبراء ويقلل بشكل كبير من العبء المعرفي للجراح أثناء جراحة المناظير.

Jiayu Gu, Yiwei Wang, Jie Zhang, Guojun Cao, Keshen Lyu, Song Zhou, Yimeng Chen, Haorui Wang, Qingmin Feng, Shenchao Shi (…)2026-08-04
🤖 AI

Abduction Without a Body? Representational Grounding and the Abduction Loop for Scientific Hypothesis Generation

تجادل هذه الورقة بأن الاستدلال العلمي لا يتطلب تجسيداً حسياً حركياً مستمراً، مقترحةً بدلاً من ذلك إمكانية حدوث "استدلال الهوية" من خلال التجذير التمثيلي ضمن "فضاء اصطلاحي" عبر بنية "حلقة الاستدلال" الجديدة، والتي يتم توضيحها من خلال اكتشاف نموذج متعدد الوسائط لتكافؤ رياضي بين الذاكرة الجاذبية وعلم كونيات العدسة الضعيفة وتقييمها بواسطة معيار DAB-30.

Michael Farmer2026-08-04
🤖 AI

Magnet: Detecting Cross-Session AI Misuse Through Capability Accumulation

تقدم هذه الورقة Magnet، وهو إطار كشف يعالج الفجوة الحرجة في تحديد سوء استخدام الذكاء الاصطناعي عبر الجلسات من خلال تجميع الآثار التي تبدو غير ضارة من تفاعلات متعددة ومنعزلة للوكلاء لإعادة بناء الأهداف الضارة التي تتهرب من المراقبة التقليدية أحادية الجلسة.

Natalie Isak, Matthew Dressman2026-08-04
🤖 machine learning

Analytic Planning under Uncertainty with Moment Closure

تقترح هذه الورقة إطارًا مبدئيًا للتعلم المعزز التحليلي القائم على النماذج، والذي يستخدم مبدأ التوافق بين نماذج الانتقال الغاوسية ودوال القيمة ذات القواعد الشعاعية لاستخلاص عمليات تحديث "بيلمان" (Bellman backups) ذات صيغ مغلقة، مما يتيح تخطيطًا فعالًا في ظل عدم اليقين دون الاعتماد على هياكل سياسات تقييدية أو أخذ عينات عشوائية.

Shishir Sharma, Doina Precup2026-08-04
💬 NLP

Who Should Be Generated? Justifying Demographic Targets in Open-Ended Generation

تقترح هذه الورقة إطاراً رسمياً لتبرير الأهداف الديموغرافية في تقييم عدالة التوليد مفتوح النهايات، محاجةً بأن بناء الأهداف هو جزء لا يتجزأ من تقييم العدالة وليس مجرد خطوة تمهيدية، وتثبت من خلال التحليل التجريبي أن التبريرات المختلفة للأهداف (مثل الأولويات الجغرافية مقابل المهنية) تؤدي إلى قياسات عدالة متباينة بشكل كبير.

Zeshen Zheng, Yujia He, Qianmian Lin, Xiangyue Huang, Wenqing Chen2026-08-04
🤖 machine learning

Structured Memory for Edge Language Models: Persistent Context and Corpus Retrieval via O(1) SSM State Injection

تقدم هذه الورقة PRECOG وSMC، وهو نظام توليد معزز بالاسترجاع لنماذج فضاء الحالة (State-Space Models) يقوم بترميز مجموعات الوثائق مسبقاً إلى حالات خفية ثابتة الحجم لتحقيق حقن سياقي بسرعة O(1)O(1)، مما يتيح نماذج لغوية حافة تفاعلية مع تسريع هائل مقارنة بنماذج Transformer التقليدية المستخدمة في الـ RAG.

Anusha Madan Gopal, Aras Pirbadian, Kristofor D. Carlson, M Anthony Lewis, Jonathan Tapson2026-08-04