🤖 AI

IACDM: Interactive Adversarial Convergence Development Methodology -- A Structured Framework for AI-Assisted Software Development

تقدم هذه الورقة إطار عمل IACDM، وهو إطار مكون من 8 مراحل لتطوير البرمجيات بمساعدة الذكاء الاصطناعي يعالج "فجوة التحقق" من خلال فرض نقد عدائي خارجي محكوم بآلة حالة، مع تقديم أدلة أولية على قدراته الفريدة في اكتشاف العيوب إلى جانب إقرار صريح بموّقفه الحالي فيما يتعلق بالتحقق من الفعالية المستقلة.

Jasmine Moreira2026-08-14
🤖 AI

Alipay-PIBench: A Realistic Payment Integration Benchmark for Coding Agents

تقدم هذه الورقة Alipay-PIBench، وهو معيار مرجعي واقعي يتكون من 18 نموذجاً للمهام عبر تسعة مشاريع من Alipay لتقييم قدرات وكلاء البرمجة في دمج عمليات الدفع، مما يثبت أن توفير مهارات مجال محدد يحسن الأداء بشكل كبير ويوفر بيئة محكومة لتشخيص نقاط قوة النماذج في مهام البرمجيات المعقدة والمدركة للمخاطر.

Shiyu Ying, Xuejie Cao, Yingfan Ma, Yuanhao Dong, Wenyu Chen, Bowen Song, Lin Zhu2026-08-14
🤖 AI

SetGo: Metadata Readiness for Scientific AI Datasets

تُعد SetGo مجموعة أدوات مفتوحة المصدر بلغة بايثون تعمل على تقييم وإصلاح البيانات الوصفية للمجموعات البيانية العلمية عبر ستة أبعاد حاسمة — وهي الامتثال لمعايير FAIR، والترخيص، والمنشأ، والحوكمة، وقابلية التكرار، وجاهزية الفهرسة — وذلك قبل النشر، مما يتيح الإثراء الموجه والنشر الآلي مع التكامل مع وكلاء البرمجة المدعومين بالنماذج اللغوية الكبيرة لتنفيذ سير العمل عبر اللغة الطبيعية.

Sean R. Wilkinson, Polina Shpilker, Wesley Brewer2026-08-14
💬 NLP

Similarity All The Way Up: Multilingual Generalization in LLMs Relies on Language-Level Similarity Structures

تُثبت هذه الورقة أن النماذج اللغوية الكبيرة تعمم بشكل أفضل عبر اللغات عندما تلتقط تمثيلاتها الكامنة بدقة هياكل التشابه الهرمية للعائلات اللغوية، مثل شجرة اللغات الهندوأوروبية، حيث يرتبط هذا التوافق الهيكلي ارتباطاً مباشراً بتحسن الأداء في الاختبارات المرجعية متعددة اللغات مثل XNLI.

Supantho Rakshit, Adele Goldberg, Henry Conklin2026-08-14
🤖 AI

Do LLMs Know Their Vulnerable Scenarios?

تقدم هذه الورقة البحثية \textsc{Concept2Scenario}، وهو إطار عمل للتفسير الآلي (mechanistic interpretability) يحدد اتجاهات السيناريوهات الداخلية التي تقمع الرفض، ويترجمها إلى سيناريوهات لغوية طبيعية قابلة للتفسير، ويثبت أن هذه السيناريوهات المكتشفة ترفع معدلات نجاح عمليات الاختراق (jailbreak) بشكل كبير عبر نماذج متعددة مفتوحة المصدر ومتطورة.

Ziheng Peng, Huiqi Deng, Haoran Jing, Xuankun Rong, Jiahui Han, Xiting Wang, Na Zou, Xia Hu2026-08-14
💻 computer science

LLMs Know the Constraint But Do Not Use It: Activation Bottlenecks in Pragmatic Constraint Reasoning

تجادل هذه الورقة بأن فشل النماذج اللغوية الكبيرة في الالتزام بقيود الجدوى الضمنية لا ينبع من نقص في المعرفة، بل من عنق زجاجة في التوجيه حيث لا يتم تفعيل القيد المشفر باستمرار أثناء عملية اتخاذ القرار، وهو قصور لا يمكن للتدخلات القائمة على التلقين التغلب عليه، ولكن يمكن لترقيع التنشيط المستهدف إصلاحه جزئياً.

Yubo Li, Ramayya Krishnan, Rema Padman2026-08-14
💻 computer science

What Drives LLM Self-Reflection? A Controlled Ablation of Uncertainty Routing in Armed Conflict Forecasting

تُثبت هذه الورقة، من خلال دراسات الاستئصال المنضبطة، أن توجيه الإجراءات المصنف هو الآلية الأساسية التي تقود مكاسب الأداء في قدرة النماذج اللغوية الكبيرة على التأمل الذاتي للتنبؤ بالنزاعات المسلحة، وليس السقالات التشخيصية أو مفردات التصنيف.

Poli Nemkova, Haeshitha Indukuri2026-08-14
💻 computer science

When AI Is Your Pastor: A Benchmark for Theological Triage and Pastoral Guidance in Large Language Models

تقدم هذه الورقة FMG-Bench، وهو معيار مرجعي يتكون من 120 سيناريو مصمم لتقييم وتحسين أداء النماذج اللغوية الكبيرة في الفرز اللاهوتي المسيحي والإرشاد الرعوي، مما يثبت أن التعليمات المهيكلة تعزز بشكل كبير السلوكيات الحرجة المتعلقة بالسلامة مثل التعرف على الحالات التي يكون فيها الإحالة البشرية ضرورية.

Alex Chao2026-08-14
💻 computer science

AnchorSIPS: A Synthetic Dataset and Evaluation Resource for Evidence-Supported Psychosis-Risk Symptom Measurement

تقدم هذه الورقة AnchorSIPS، وهي مجموعة بيانات اصطناعية مكونة من 10,000 مقابلة مهيكلة لمخاطر الذهان مع أهداف قياس مستندة إلى النصوص، صُممت للتغلب على عقبات الوصول إلى البيانات وتقييم قدرة نماذج الذكاء الاصطناعي على إجراء تقييم وتشخيص للأعراض مدعوم بالأدلة.

Guilherme C. Oliveira, Stephanie Fong, Zimu Wang, Clarice Lee, Xiangyu Zhao, Duy Khoa Pham, Duong Nhu, Yiwen Jiang, Jiah (…)2026-08-14
💻 computer science

Thought-Aware KV Cache Compaction for Reasoning via Adaptive Attention Matching

تقترح الورقة البحثية "مطابقة الانتباه الواعية بالتفكير" (TAM)، وهي طريقة مبتكرة لضغط ذاكرة التخزين المؤقت لـ KV، تستفيد من الهيكل الهرمي لسلسلة التفكير من خلال تخصيص الميزانية التكيفي وحماية الرموز المحورية لتقليل استخدام الذاكرة بشكل كبير مع الحفاظ على الدقة أو تحسينها مقارمًا بالضغط الموحد.

Yang Liu, Bin Chong, Chongyang Zhang, Hao Zheng, Jiayu Liang, Xu Kefu2026-08-14