💬 NLP

DSAgentBench: Can Agents Automate End-to-End Data-Science Workflows in Real Computer Environments?

تقدم هذه الورقة DSAgentBench، وهو أول معيار مصمم لتقييم قدرة وكلاء الذكاء الاصطناعي على أتمتة سير عمل علم البيانات من البداية إلى النهاية ضمن بيئات حاسوبية حقيقية، مما يكشف عن فجوة أداء كبيرة حيث تواجه حتى أقوى النماذح صعوبة في تنسيق الأدوات والاستنتاج متعدد الخطوات.

Mizanur Rahman, Mohammed Saidul Islam, Ridwan Mahbub, Md Tahmid Rahman Laskar, Shafiq Joty, Enamul Hoque Prince2026-08-12
💻 computer science

Persona Conditioning as an Assessor-Sensitivity Probe for LLM-Based IR Evaluation

تتقصى هذه الورقة كيف يؤثر تكييف الشخصية (persona conditioning) على تقييم استرجاع المعلومات القائم على النماذج اللغوية الكبيرة، كاشفةً أنه في حين تؤثر أدوار المقيم المحددة وسعة النموذج بشكل كبير على صرامة الحكم واستقرار الترتيب المحلي، فإن النماذج ذات السعة العالية تحافظ عمومًا على ترتيبات الأنظمة الإجمالية، مما يجعل من التقييم المشروط بالشخصية أداة تشخيصية محكومة لاختبار إجهاد مسارات تقييم استرجاع المعلومات.

Samaneh Mohtadi, Pietro Bernardelle, Joel Mackenzie, Gianluca Demartini2026-08-12
🤖 machine learning

Recovering Wasted Compute in Autoresearch Agents

تحدد هذه الورقة أوضاع الفشل الشائعة في وكلاء البحث الذاتي المطبقين على مجموعات البيانات الجدولية، مثل التصحيح البرمجي الزائد وضعف الاستكشاف، وتثبت أن تدخلات التصميم الوكيل المستهدفة يمكن أن تستعيد بشكل كبير الحوسبة المهدرة وتعزز الأداء دون تغيير النموذج اللغوي الأساسي.

Au Kwok Chun, Abhigyan Acherjee, Amrutha Rao, Zaiqian Chen, Kazem Meidani, C. Bayan Bruss, Micah Goldblum2026-08-12
🔬 optics

Causality Sum Rules in Conventional Scattering Matrices

تؤسس هذه الورقة سير عمل هجينًا يجمع بين الذكاء الاصطناٍعي والبشري لاستنباط قواعد مجموع السببية مباشرة من مصفوفات التشتت التقليدية عبر تعريف مصفوفة متأخرة النطاق، مما يتيح حدودًا جديدة على الكميات القابلة للقياس مثل فقد الإدراج ويمدد نظرية السببية الأساسية لتشمل البيانات التجريبية دون تحويلات مساعدة.

Ning Han, Rui Zhao, Shuxing Yang, Mingzhu Li, Hongsheng Chen, Yihao Yang2026-08-12
💻 computer science

What We Know about Responsible AI Practices in Industry: A Half Decade of Empirical Research

تجمع هذه الورقة البحثية نتائج 161 دراسة تجريبية على مدار ست سنوات لتقديم نظرة شاملة حول التقدم، والاحترافية، والتحديات المستمرة في ممارسات الذكاء الاصطناعي المسؤول داخل قطاع التكنولوجيا.

Wesley Hanwen Deng, Agathe Balayn, Andrew Selbst, Jason I. Hong, Motahhare Eslami, Kenneth Holstein, Hanna Wallach, Jenn (…)2026-08-12
💻 computer science

Continuous Interaction Diffusion: A Diffusion-Native Runtime for Asynchronous Tool-Augmented Reasoning

تقدم هذه الورقة البحثية "الانتشار التفاعلي المستمر" (CID)، وهو بنية مبتكرة تدمج تفاعلات الأدوات غير المتزامنة مباشرة في عملية إزالة الضجيج التكرارية لنماذج لغة الانتشار، وذلك لتمكين التعرض المبكر للأدلة، وتداخل زمن انتقال الأدوات مع الحوسبة، وتقليل العمل الخارجي الزائد، رغم تركيزها حالياً على الصياغة النظرية دون ادعاءات حول الأداء التجريبي.

Yuhang Cao2026-08-12
💻 computer science

Towards Efficient Reasoning in LLM-Based Recommender Systems via Model Merging

تقترح هذه الورقة إطار عمل REAM، وهو إطار عمل جديد لدمج النماذج لا يتطلب تدريباً، يقوم بدمج دقيق على مستوى رؤوس الانتباه لنماذج اللغات الكبيرة ذات التفكير البطيء والتفكير السريع لتقليل الإسهاب في الاستنتاج بشكل كبير في أنظمة التوصية مع الحفاظ على دقة التوصية.

Linh Dieu Le, Tong Chen, Shazia Sadiq, Hongzhi Yin, Ming Jin, Junliang Yu2026-08-12
💬 NLP

MD-ProTector: Positioning Multiple Data-Driven Prototypes for LLM-Generated Text Detection

يعزز MD-ProTector الكشف عن النصوص المولدة بواسطة النماذج اللغوية الكبيرة (LLMs) من خلال توظيف نماذج أولية متعددة قابلة للتدريب لكل فئة ضمن فضاء تضمين المشفر، مسترشداً بخسارة تموضع النماذج الأولية المبتكرة لنمذجة تنوعات الكتابة المتنوعة بفعالية وتحقيق أداء فائق عبر مختلف المجالات واللغات ونماذج التوليد.

Jinmo Han, Jimin Hong, Chanyeong Moon, Ju Yeon Kang, Seonuk Kim, Nam Soo Kim2026-08-12
💬 NLP

Lost in Reconstruction: Aligning Action Representations with Language in Vision-Language-Action Models

تقدم الورقة البحثية SALT، وهو أداة ترميز أفعال متوافقة دلالياً تعزز أهداف إعادة البناء القياسية بمهمة استرداد لغوية مساعدة للحفاظ على معلومات ربط الأفعال في التمثيلات الكامنة للأفعال، مما يحسن بشكل كبير من أداء التحكم في الروبوتات المشروط باللغة مقارنة بالنماذج المرجعية التي تقتصر على إعادة البناء فقط.

Li Wenjie, Yash Jangir, Ignacy Stepka, Yash Agarwal, Marion Kipsang, Yonatan Bisk2026-08-12
💻 computer science

INSIDE the Student's Mind: Jointly Modeling Latent Reasoning and Action in LLM Student Simulators

تقدم الورقة البحثية إطار INSIDE، وهو إطار لنمذجة الطلاب يعمل على ضبط النماذج اللغوية الكبيرة لتوليد كل من أفعال الطلاب وتفكيرهم الداخلي الكامن المستند إلى تصنيف بلوم، مما يحسن بشكل كبير من دقة المحاكاة ومواءمة الاستدلال مقارنة بطرق التلقين الحالية.

Rose Niousha, Minwoo Kang, Narges Norouzi2026-08-12