💻 computer science

Autonomous Research Agents: A Survey of AI Scientists and the Verification Gap

يكشف هذا المسح لـ 35 نظاماً من أنظمة الوكلاء البحثيين المستقلين أنه بينما يعد إصدار الكود أمراً شائعاً، لا تزال هناك فجوة تحقق حرجة بسبب ندرة المصوغات القابلة لإعادة الإنتاج والادعاءات الموثقة خارجياً، مما يشير إلى أن العائق الأساسي في هذا المجال قد تحول من إنجاز المهام إلى التحقق من الادعاءات.

Tianyu Ding, Aditya Nannapaneni, Bingfan Liu, Ling Zhang2026-08-07
💬 NLP

Position: It's Time to Optimize LLMs for Self-Consistency

تجادل هذه الورقة الموقعة بأن العديد من الإخفاقات المستمرة في النماذج اللغوية الكبيرة تنبع من تقييم المخرجات بمعزل عن غيرها، وتقترح "الاتساق الذاتي" كإطار عمل موحد لتحسين النماذج من خلال التفكير في العلاقات بين استجاباتها عبر مدخلات مختلفة.

Itamar Pres, Belinda Z. Li, Laura Ruis, Zifan Carl Guo, Keya Hu, Mehul Damani, Isha Puri, Ekdeep Singh Lubana, Jacob And (…)2026-08-07
💻 computer science

ASTELD: A Six-Axis Classification Framework for Autonomous AI Agents - Design, Evaluation, and an OpenClaw Case Study

تقدم هذه الورقة ASTELD، وهو إطار تصنيف سداسي المحاور للوكلاء المستقلين القائمين على الذكاء الاصطناعي يتيح إجراء مقارنة منهجية وتحليل للمخاطر لتصاميم المنصات، كما هو موضح من خلال تقييم ثمانية أطر عمل ودراسة حالة مفصلة لـ OpenClaw، مما يكشف في النهاية عن فجوات حرجة مثل الافتقار إلى الأنظمة التي تجمع بين النشر القائم على الأولوية المحلية والأمن المخصص للمؤسسات.

Siyuan Li, Peng Shu, Churan Yu, Peilong Wang, Ruidong Zhang, Bowen Guo, Xinliang Li, Ruiyu Yan, Arif Hassan Zidan, Yi Pa (…)2026-08-07
🤖 AI

SkillTrace: Multi-Trace Provenance Auditing for LLM-Agent Skill Reuse

تقدم هذه الورقة SkillTrace، وهو إطار عمل لتدقيق المنشأ متعدد المسارات يكتشف إعادة استخدام المهارات في الوكلاء القائمين على النماذج اللغوية الكبيرة عبر استخراج ومقارنة مسارات التعبير والتنفيذ والتشغيل (الممثلة كرسوم بيانية تشغيلية للمهارات)، محققاً دقة عالية في الاختبارات المعيارية وممكناً للمراجعة القابلة للتنفيذ في عمليات التدقيق الواسعة النطاق.

Jialuo Chen, Minghe Wang, Lingqi Jiang, Jianan Ma, Xinhao Deng, Xiaohu Du, Ruixiao Lin, Yunhao Feng, Linkang Du, Jingyi (…)2026-08-07
🤖 AI

Abstract Event Causal Rules: Induction and Application

تقدم هذه الورقة "قواعد الأحداث السببية المجردة" (AECRs)، وهي نموذج جديد يستخلص المنطق السببي المعمم من البيانات المشوشة باستخدام نظام استقراء متعدد الوكلاء، ويستفيد من هذه القواعد لتعزيز أداء التعميم والتنبؤ للأنظمة المتمحورة حول الأحداث بشكل كبير، لا سيما بالنسبة لمجموعات الأحداث النادرة وغير المرئية.

Ziwei Zheng, Peiqiong Chen, Bang Wang2026-08-07
💻 computer science

Innocent Panels, Hateful Stories: Evaluating and Detecting Hateful Intent in Multi-Turn Visual Story Generation

تتناول هذه الورقة التهديد الناشئ المتمثل في السرديات البصرية الكريهة القابلة للتوسع والتي يتم إنشاؤها بواسطة أنظمة تحويل النص إلى صورة متعددة الأدوار، وذلك من خلال تقديم مجموعة بيانات مرجعية جديدة، وإثبات فشل عمليات الإشراف الحالية على مستوى الصورة في اكتشاف الكراهية على مستوى المجموعات، واقتراح دفاعات استباقية ودفاعات ما بعد الإنشاء فعالة تقوم بتحليل حالات التفاعل والعلاقات بين الصور.

Ye Leng, Junjie Chu, Yiting Qu, Mingjie Li, Yun Shen, Yang Zhang2026-08-07
🤖 AI

Small Foundation Models of Human Cognition and Behaviour

تُظهر هذه الورقة أنه بينما يمكن للنماذج التأسيسية الصغيرة التي تم ضبطها بدقة على البيانات السلوكية البشرية أن تضاهي بفعالية النماذج المرجعية واسعة النطاق في المهام النفسية ضمن نطاق التوزيع، فإن النماذج الأكبر فقط هي التي تُحسّن بشكل ملحوظ من القدرة على التعميم تجاه هياكل المهام الجديدة، مع اعتماد الأداء بشكل كبير على معالجة محتوى محفزات وتغذية راجعة محددة بدلاً من مجرد تاريخ الاختيارات.

Nick Oh, Fernand Gobet2026-08-07
💻 computer science

In-Context Forcing: Uncovering Context Effects in Autoregressive Video Diffusion

تقدم هذه الورقة البحثية "الإرغام داخل السياق" (In-Context Forcing)، وهو نموذج تلقائي الترتيب تدريجي لانتشار الفيديو يستخدم سياقات بمستويات ضجيج متناقصة لتحقيق التوازن بين الاتساق الزمني والديناميكيات بين الإطارات، مع تمكين إزالة الضجيج المتوازي عبر الإطارات لتسريع الاستدلال بشكل كبير.

Lingxiao Yang, Liu Liu, Moran Li, Han Feng, Wenjian Cao, Jiangning Zhang, Ye Shi2026-08-07
🤖 machine learning

Marginal Matching Does Not License Factorized Sampling: Auditing Conditional Style Leakage in Factorized Generative Models

تُثبت هذه الورقة أن مطابقة التوزيع الهامشي لمتغير أسلوب كامن مع توزيع غاوسي مسبق غير كافٍ لضمان الاستقلال عن تسميات الفئات، حيث يمكن للنماذج التوليدية المفككة أن تظهر استمرار تسرب الأسلوب الشرطي بشكل كبير مما يسمح بالتنبؤ بالفئة رغم ظهورها كنموذج غاوسي في المجمل.

Duong Bach, Hai Nguyen Hong, Cuong Do2026-08-07
🤖 machine learning

PRISM: Priority-aware Rubric Internalization via Structured Multimodal Data Synthesis

تقدم الورقة البحثية PRISM، وهو إطار عمل لتوليد البيانات مكون من أربع مراحل يُمكّن النماذج متعددة الوسائط من العمل كمنفذين لمعايير مدركين للأولويات بدلاً من مجرد مولدات بسيطة، مما يُظهر تحسينات كبيرة في اتباع التعليمات متعددة القواعد عبر بنيات مختلفة باستخدام 10 آلاف عينة مُولدة فقط ومقياس تقييم حتمي.

Xiaomin He, Dongling Xiao, Jiahao Xie, Ruiqi Lu, Qianle Wang, Zhongbin Guo, Wanxuan Sun2026-08-07