🤖 AI

Does the Competitive Component of Adversarial Self-Play Improve Legal Reasoning? A Controlled Negative Result

تفيد هذه الورقة بتقرير نتيجة سلبية منضبطة تُظهر أن إضافة مكون اللعب الذاتي التنافسي العدائي إلى تدريب الاستدلال القانوني لا يحقق أي تحسن في الأداء مقارنة بالنماذج المرجعية غير التنافسية، مما يشير إلى أن قيمة نهج تعدد المعلمين هذا تنبع من بناء بيئات قابلة للتحقق بدلاً من الديناميكية التنافسية نفسها.

Miseog Shawn Kim2026-08-04
🤖 AI

Enhancing Visual Perception in Foggy Conditions via Multiclass Fog Density Modeling

تقترح هذه الورقة نهجاً لنمذجة كثافة الضباب متعدد الفئات يقوم بتدريب نماذج إدراك منفصلة لخمس مستويات متميزة من الضباب باستخدام بيانات "Waymo" المولدة اصطناعياً، مما يثبت أن هذه الاستراتيجية المتخصصة تحسن بشكل كبير من معدل الاستدعاء في ظروف الضباب الكثيف جداً مقارنة بنموذج موحد واحد.

Mohamad Mofeed Chaar, Galia Weidl2026-08-04
🤖 machine learning

Measuring in-context algorithmic reasoning in language models against an exact Bayes-optimal standard

تقدم هذه الورقة البحثية F-ICL، وهو معيار مرجعي يستخدم معيارًا مثاليًا بايزيًّا دقيقًا مستمدًا من آلة كاملة تورينج، ليكشف أنه على الرغم من الدقة العالية، تفشل النماذج اللغوية الكبيرة في أداء الاستدلال الخوارزمي الحقيقي، وتعتمد بدلاً من ذلك على الإحصاءات منخفضة الرتبة وتُظهر سلوكيات تحديث غير رتيبة تبتعد بشكل كبير عن الحد الأمثل النظري.

Hector Zenil, Luan Ozelim2026-08-04
🤖 machine learning

HindSearch: Trajectory-Level Hindsight Critique for Search-Augmented Reinforcement Learning

تقدم HindSearch إجراءً للتقطير الذاتي القائم على التبصر في التفكير (hindsight self-distillation) لتعلم التعزيز المعزز بالبحث، والذي يستفيد من انتقادات حَكَمٍ مُجمّد للمسارات الفاشلة لتوفير إشارات مساعدة داخل السياسة (on-policy signals)، مما يحسن الأداء بشكل كبير مقارنة بالنماذج المرجعية السابقة عبر استخدام الإجابة النموذجية لتشخيص إخفاقات البحث.

Haowei Liu, Jiamian Wang, Hsin-Tai Wu, Zhiqiang Tao, Yi Fang2026-08-04
💬 NLP

PICTURE: Enhancing Theory-of-Mind in Large Language Models by Revealing, Not Hiding, Characters' Lack of Knowledge

تقدم الورقة البحثية طريقة PICTURE، وهي طريقة تحفيز تعزز قدرات "نظرية العقل" لدى النماذج اللغوية الكبيرة من خلال الكشف الصريح عن نقص معرفة الشخصيات أثناء الاستدلال الحر، مما يتغلب على قيود الأداء لأساليب إخفاء الأحداث التقليدية ويحقق تحسناً بنسبة 7.3% في مهام الاعتقاد الخاطئ.

Eojin Jeon, SangKeun Lee2026-08-04
🤖 AI

Post-Training on Office Work Improves Software Engineering: A Behavioral Account of Cross-Domain Transfer

تُثبت هذه الورقة أن التدريب اللاحق لنموذج لغوي كبير على سير عمل مكتبي طويل الأمد يحسن بشكل كبير من أدائه في هندسة البرمجيات من خلال تعزيز أربعة سلوكيات جوهرية موجهة نحو الهدف — وهي اختيار الهدف، وبناء الحالة، والحفاظ على الدقة، والتحقق — والتي تنتقل بفعالية عبر المجالات المختلفة.

Logan Ritchie, Sushant Mehta, Liudas Panavas, Edwin Chen2026-08-04
🤖 machine learning

QWRF-Net: A Quantum-Wavelet Framework with Rectified Flow for Short-Term Precipitation Nowcasting

تُعد شبكة QWRF-Net إطار عمل كمي-مويجيّ مبتكر يدمج بين التفكيك متعدد المقاييس القائم على المويجات، والتعديل المستوحى من الحوسبة الكمية المتمايز، وتوليد التدفق المصحح، لتحسين دقة وحفظ البنية في التنبؤ قصير المدى لهطول الأمطار بشكل كبير، لا سيما في حالات هطول الأمطار الحملية الكثيفة.

Zhuo Wang, Chaorong Li, Wenjie Luo, Chuanhu Deng2026-08-04
🤖 AI

AI-assisted Script Management for Requirements Elicitation Interviews

تقدم هذه الورقة وتقيم سير عمل لإدارة النصوص مدعومًا بالذكاء الاصطناعي لمقابلات استنباط المتطلبات، مبرهنةً من خلال دراسة شبه تجريبية أنه يتفوق على النهج القائم على التدريب فقط عبر توليد نصوص ذات جودة أعلى، وتمكين طرح أسئلة متابعة أكثر عمقًا، وإنتاج نماذج أهداف أكثر دقة رغم تغطيته لمواضيع أقل.

Anmol Singhal, Paulo Carvalho, Travis Breaux2026-08-04
🤖 AI

StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring

يُعد StreamTalk إطار عمل في الوقت الفعلي وذو حلقة مغلقة لتوليد إيماءات مصاحبة للكلام، حيث يعمل على الحد من الانحراف طويل المدى عبر توظيف دورة (توليد-استرجاع-تحسين) مرتكزة على وضعيات مفتاحية معقولة وبنية محول انتشار (DiT) مدركة للأجزاء.

Xiangyue Zhang, Jianfang Li, Jiaxu Zhang, Kaixing Yang, Steven Hoi2026-08-04
🤖 AI

GISAgentBench: A Practitioner-Sourced Benchmark for Evaluating LLM Agents on GIS Tasks

تقدم هذه الورقة GISAgentBench، وهو معيار مرجعي مستمد من ممارسين يضم 349 مهمة متعددة الخطوات في نظم المعلومات الجغرافية (GIS) مع مسارات مرجعية قابلة للتنفيذ ومخرجات حقيقية دقيقة لتقييم وكلاء النماذج اللغوية الكبيرة (LLMs) بصرامة، مما يكشف أن النماذج الحالية تواجه صعوبة في أتمتة سير العمل الجغرافي المكاني الواقعي بشكل كامل رغم إنتاجها لنتائج صحيحة تقريباً.

Abhinav Pothuri, Zhe Jiang, Zelin Xu, Di Yang2026-08-04