🤖 AI

Probing Embodied LLMs: When Higher Observation Fidelity Hurts Problem Solving

تكشف هذه الورقة أن وكلاء النماذج اللغوية الكبيرة المتجسدة التي تحل الألغاز الميكانيكية يمكنهم، على نحو مفارق، تحقيق معدلات نجاح أعلى باستخدام مدخلات حسية ذات دقة أقل أو ضجيج إدراكي متوسط، حيث تساعد هذه العيوب في كسر حلقات الحركة المتكررة وحجب إخفاقات الاستدلال، مما يتحدى الافتراض بأن الملاحظة المثالية تؤدي دائمًا إلى الأداء الأمثل.

Oussama Zenkri, Oliver Brock2026-05-20
💬 NLP

CopT: Contrastive On-Policy Thinking with Continuous Spaces for General and Agentic Reasoning

يُعد CopT إطار عمل استدلالي لا يتطلب تدريباً، حيث يعكس نموذج "سلسلة الأفكو" التقليدي عبر توليد إجابة مسودة أولاً، ثم توظيف أدوات تحقق تباينية في الفضاء المستمر لتفعيل التأمل الذاتي المعتمد على السياسة (on-policy reflection) ديناميكياً عند الضرورة فقط، مما يؤدي إلى تحسين الدقة بشكل كبير وتقليل تكاليف الرموز (tokens) عبر مهام استدلالية متنوعة.

Dachuan Shi, Hanlin Zhu, Xiangchi Yuan, Wanjia Zhao, Kejing Xia, Wen Xiao, Wenke Lee2026-05-20
🤖 AI

What Do Evolutionary Coding Agents Evolve?

تقدم هذه الورقة EvoTrace، وهي مجموعة بيانات لآثار الترميز التطوري، وEvoReplay، وهي منهجية قائمة على إعادة التشغيل، لتكشف أن مكاسب الأداء في وكلاء الترميز التطوري غالبًا ما تنبع من آليات متنوعة مثل إعادة الضبط أو إعادة استخدام المعرفة الموجودة بدلاً من الابتكار الخوارزمي الحقيقي، وهو ما يستدل عليه من خلال التكرار الحتمي المتكرر لأسطر الكود.

Nico Pelleriti, Sree Harsha Nelaturu, Zhanke Zhou, Zongze Li, Max Zimmer, Bo Han, Sebastian Pokutta2026-05-20
💬 NLP

ThoughtTrace: Understanding User Thoughts in Real-World LLM Interactions

تقدم هذه الورقة البحثية ThoughtTrace، وهي أول مجموعة بيانات واسعة النطاق تجمع بين المحادثات الواقعية بين البشر والذكاء الاصطناعي وبين أفكار المستخدمين المبلغ عنها ذاتياً، لتكشف أن هذه الحالات المعرفية الكامنة تختلف عن الرسائل المنطوقة، ويصعب على النماذج استنتاجها، وتعد ذات قيمة عالية لتحسين التنبؤ بسلوك المستخدم وتدريب مساعدين مخصصين ومتوافقين مع الأهداف.

Chuanyang Jin, Binze Li, Haopeng Xie, Cathy Mengying Fang, Tianjian Li, Shayne Longpre, Hongxiang Gu, Maximillian Chen (…)2026-05-20
🤖 AI

Neurosymbolic Learning for Inference-Time Argumentation

تقدم هذه الورقة "الاستدلال الحجاجي أثناء الاستنتاج" (Inference-Time Argumentation - ITA)، وهو إطار عمل عصبي رمزي يدمج دلالات الحجاج الصورية لتدريب النماذج اللغوية الكبيرة على توليد وتقييم الحجج، مما يتيح تحققاً ثلاثياً من الادعاءات يتسم باليقين والأمانة ويتفوق على النماذج المرجعية الحالية مع توفير استدلال شفاف وقابل للفحص.

Gabriel Freedman, Adam Dejl, Adam Gould, Mansi, Lihu Chen, Jianqi Jiang, Francesca Toni2026-05-20
🤖 AI

Using Aristotle API for AI-Assisted Theorem Proving in Lean 4: A Formalisation Case Study of the Grasshopper Problem

تقدم هذه الورقة دراسة حالة لصياغة مسألة "الجراد" (Grasshopper) من أولمبياد الرياضيات الدولي لعام 2009 باستخدام لغة Lean 4 عبر واجهة برمجة تطبيقات Aristotle، مما يوضح أنه بينما يمكن للذكاء الاصطناعي التحقق بنجاح من المكونات المحلية لاستراتيجية الإثبات، فإنه يواجه صعوبة حالياً في حل المسائل المتعلقة بالتدقيق الحسابي التوافقي الشامل المطلوب لإتمام المبرهنة الرئيسية.

Gabriel Rongyang Lau2026-05-20
🧬 biology

Beyond Prediction Accuracy: Target-Space Recovery Profiles for Evaluating Model-Brain Alignment

تقدم هذه الورقة إطاراً موحداً يقيم المحاذاة بين النموذج والدماغ من خلال قياس الأبعاد المحددة والقابلة للتكرار في فضاء الاستجابة الدماغية التي يتم استردادها، مما يكشف أن دقة التنبؤ وحدها يمكن أن تحجب تباينات جوهرية بين نماذج الرؤية الاصطناعية والقشرة البصرية البشرية.

Ken Nakamura, Tomoya Nakai, Ryuto Yashiro, Ayumu Yamashita, Kaoru Amano2026-05-20
💬 NLP

Less Back-and-Forth: A Comparative Study of Structured Prompting

تُثبت هذه الورقة أن استخدام المطالبات المحسنة بقوائم التحقق يعزز بشكل كبير جودة استجابات النماذج اللغوية الكبيرة عبر مهام متنوعة، مع تقليل جهد المستخدم واستهلاك الرموز مقارنة بالمطالبات الخام أو المطالبات التي تستخدم الأسئلة التوضيحية.

Saurav Ghosh, Gabriella Polach, Abdou Sow2026-05-20
💬 NLP

Rethinking Visual Attribution for Chest X-ray Reasoning in Large Vision Language Models

تقدم هذه الورقة MedFocus، وهو أسلوب عزو قائم على المفاهيم يستفيد من التقييم السببي والنقل الأمثل غير المتوازن لتحديد المناطق ذات المعنى السريري في صور الأشعة السينية للصدر بدقة، مما يعالج فشل الأساليب الحالية في تفسير استدلال نماذج الرؤية واللغة الكبيرة بصدق في التطبيقات الطبية.

Guangzhi Xiong, Qiao Jin, Sanchit Sinha, Zhiyong Lu, Aidong Zhang2026-05-20
🤖 AI

Long-term Power Grid Planning via Answer Set Programming

تقترح هذه الورقة أول نهج مؤتمت باستخدام برمجة مجموعة الإجابات (ASP) لتحسين التخطيط طويل الأمد لشبكة الطاقة، مما يثبت فعاليتها في التعامل مع القيود الطوبولوجية والتركيبية المعقدة من خلال تجارب على كل من البيانات الاصطناعية والواقعية.

Antonio Ielo, Francesco Doria, Sandra Castellanos-Paez, Marco Maratea, Francesco Percassi, Mauro Vallati2026-05-20