💻 computer science

Pattern over Pixels: Measuring Pattern Completion Bias in Multimodal Code Generation

تقدم هذه الورقة معياراً يوضح أن النماذج اللغوية الكبيرة متعددة الوسائط تظهر انحيازاً قوياً لإكمال الأنماط عند تحويل لقطات شاشة صفحات الويب إلى كود برمجي، حيث تقوم غالباً باستبدال العناصر المشوهة بصرياً بأنماط واجهة مستخدم متكررة حتى عندما تمتلك القدرة الاستدلالية لتحديد تلك الشذوذات.

Khai-Nguyen Nguyen, Oscar Chaparro, Antonio Mastropaolo2026-08-05
💻 computer science

TARL: Transaction-Aware Reliable Ledgers for Executable Memory Management in Long-Term Agents

تقدم هذه الورقة إطار عمل TARL، وهو إطار عمل مدرك للمعاملات يعزز إدارة ذاكرة الوكيل طويلة المدى من خلال رسم التحديثات على خمسة إجراءات قابلة للتنفيذ بدلاً من قرار ثنائي، مما يقلل من تلوث الذاكرة والفساد التراكمي من خلال تحسين استعادة الحالة والحفاظ على التعارض.

Han Xiao, Hongjun Xu, Xin Zhang, Yidong Chen, Xiaodong Shi2026-08-05
🤖 machine learning

Less Traffic, Better Outcomes: Competition-Aware Request Dispatch in Real-Time Ad Exchanges

تقدم هذه الورقة إطار عمل لتوزيع الطلبات مدركاً للمنافسة يستخدم التنبؤ بالمزايدة التوزيعية وتحسين السياسة التكيفية لتوجيه طلبات الإعلانات بشكل انتقائي إلى منصات جانب الطلب، مما نجح في تقليل حجم الطلبات بنسبة 34.2% مع زيادة صافي الإيرادات بنسبة 4.6% في تجارب إنتاج واسعة النطاق.

Jonaid Shianifar, Blaz Mramor, Fangda Zou, Matthieu C. Martin, Xingsheng Guo, Zhihua Zhu, Rong Zhou, Bichen Shi2026-08-05
💬 NLP

When Outputs Disperse, Does Epistemic Revision Follow? A Black-Box Coupling Diagnostic for Machine Collectives

تقدم هذه الورقة تشخيصاً بنظام الصندوق الأسود يسمى "اقتران مراجعة التشتت" (dispersion-revision coupling) ليكشف أنه في حين أن تنوع المخرجات في مجموعات النماذج اللغوية الكبيرة لا يضمن مراجعة معرفية حقيقية، فإن فعالية مثل هذه التدخلات تتباين بشكل كبير عبر النماذج، حيث أظهر نموذج GPT-4o-mini تحسناً في التعافي من المقدمات الخاطئة من خلال الاعتراض المشروط، بينما اكتفى نموذج Gemini-2.5-flash بإعادة صياغة الحجج دون تغيير موقفه الأساسي.

Molood Arman2026-08-05
💬 NLP

GPTKB 2.0: Direct Construction of Disambiguated Knowledge Bases from Large Language Models

تقدم الورقة البحثية GPTKB 2.0، وهي منهجية قابلة للتوسع تبني قاعدة معرفية بمليون عنصر وفك لغمبضات المعنى مباشرة من النماذج اللغوية الكبيرة عبر تنفيذ عملية توحيد القياس (canonicalization) للكيانات والعلاقات والفئات آنياً للتغلب على قيود التمثيل الأصلية.

Yujia Hu, Tuan-Phong Nguyen, Simon Razniewski2026-08-05
💻 computer science

CARE-Bench: Benchmarking Patient-Facing LLM Triage

تقدم الورقة البحثية CARE-Bench، وهو معيار مرجعي مستند إلى المصادر لتقييم النماذج اللغوية الكبيرة الموجهة للمرضى في مهام الفرز المتسلسلة، كاشفةً أنه على الرغم من أن تحسين صياغة الأوامر يحسن الأداء، إلا أن النماذج لا تزال تخفق بشكل متكرر في التوقيت الصحيح بين تقديم توصيات الرعاية وجمع المعلومات، مما يسلط الضوء على مخاطر سلامة جسيمة للنشر.

Yining Hua, Hongbin Na, Cyrus Ayubcha2026-08-05
💻 computer science

MissClick: Exploiting Digit-Serialized Coordinates to Attack GUI Grounding Models

تقدم الورقة البحثية MissClick، وهو هجوم عدائي بنظام الصندوق الأبيض يستغل عملية توليد الإحداثيات المتسلسلة رقمياً لنماذج تحديد المواقع في واجهات المستخدم الرسومية (GUI grounding models) عبر استغلال الحساسية للقيمة المكانية لتحقيق معدلات نجاح أعلى بكثير في الهجمات غير المستهدفة والمستهدفة مقارنة بالطرق الحالية.

Yu Ran, Wentao Zhao, Xin Zhang, Yi Pan2026-08-05
🤖 machine learning

Can LLMs Test Terminal User Interfaces?

تقدم هذه الورقة معياراً وإطار عمل للاختبار بدون واجهة رسومية لواجهات مستخدم الطرفية (TUIs)، كاشفةً أنه في حين توفر النماذج اللغوية الكبيرة كشفاً للأخطاء أكثر كفاءة لكل تفاعل مقارنة بالاستكشاف العشوائي، إلا أن اختبار واجهات مستخدم الطرفية المؤتمت يظل تحدياً ويعتمد بشكل أكبر على الاستراتيجيات العملية مثل اشتقاق مدخلات التشغيل بدلاً من اختيار نماذج محددة.

Chao Peng, Ruida Hu, Ajitha Rajan, Tegawendé F Bissyandé, Jacques Klein, Cuiyun Gao2026-08-05
💻 computer science

Agents Catching Agents: Shortcut Cascades and Benchmark Gaming in Clinical Multi-Agent Systems

تكشف هذه الورقة أن الأنظمة السريرية متعددة الوكلاء عرضة لـ "توالي الاختصارات" حيث يتبنى الوكلاء إشارات إجماع غير صحيحة من الأقران بدلاً من الاعتماد على الاستدلال المستقل، وهو شكل من أشكال التلاعب بالمعايير المرجعية لا يمكن اكتشافه بفعالية إلا من خلال وكيل حكم مستقل بدلاً من الإبلاغ الذاتي أو الرقابة القائمة على النصوص.

Sebastián Andrés Cajas Ordóñez, Agastya Munnangi, Aldo Marzullo, Felipe Ocampo Osorio, Quang Bui, Mohammad Shahin, Armaa (…)2026-08-05
🤖 machine learning

Computing Actual Causes for Neural Network Predictions under Structured Causal Inputs

تقترح هذه الورقة طريقة لحساب الأسباب الفعلية وفق منظور هالبيرن-بيرل لتنبؤات الشبكات العصبية من خلال نمذجة تبعيات المدخلات الهيكلية عبر نماذج سببية هيكلية بولية، باستخدام تقنيات انتشار الحدود والبحث والتقصي (branch-and-bound) لتحقيق تفسيرات قابلة للتوسع، وكاملة، ومختزلة تتجنب النتائج الزائفة الناتجة عن تجاهل الارتباطات بين الميزات.

Jannick Strobel, Muqsit Azeem, Stefan Leue2026-08-05