💻 computer science

VISTA: An End-to-End Benchmark for Visual Spec-to-Web-App Coding Agents

تقدم الورقة البحثية VISTA، وهو معيار شامل مصمم لتقييم الوكلاء القائمين على النماذج اللغوية الكبيرة في توليد تطبيقات الويب من المواصفات المرئية من خلال تحديد ظروف مطالبة متنوعة واستخدام إطار تقييم متعدد الأوجه يجمع بين مطابقة نموذج كائن مستند إلى المستند (DOM)، والاختبار السلوكي، والتشابه البصري للتغلب على قيود الأدوات التقليدية القائمة على البرامج النصية.

JunJia Guo (Joe), Yuhang Yao (Joe), Jiawei (Joe), Zhou, Jingdi Chen2026-05-27
💻 computer science

Augment Engineering: A Methodology for Multi-Tool AI Orchestration Across Professional Domains

تقدم هذه الورقة "هندسة التعزيز" (Augment Engineering) كمنهجية لتنسيق أدوات ذكاء اصطناعي متعددة ومصممة لأغراض محددة عبر مجالات مهنية متنوعة، وذلك من خلال الاستفرد بالمهارات الميتا-وظيفية القابلة للنقل لهندسة الأوامر والسياق، مدعومة بإطار عمل مكون من ست مراحل وأدلة تجريبية أولية من دراسة حالة لممارس واحد تُظهر زيادة في الكفاءة والجودة.

Elias Calboreanu2026-05-27
🤖 machine learning

TSFMAudit: Data Contamination Auditing in Forecasting Time Series Foundation Models

تقدم هذه الورقة البحثية TSFMAudit، وهي الطريقة الأولى المصممة للكشف عن تلوث بيانات ما قبل التدريب في نماذج التأسيس للسلاسل الزمنية من خلال الاستفادة من الحدس القائل بأن مجموعات البيانات الملوثة تُظهر ديناميكيات تكيف فعالة بشكل غير عادي أثناء الضبط الدقيق.

Hongkai Li, Shifeng Xie, Lefei Shen, Zhuo Li, Mouxiang Chen, Xiaobin Zhang, Han Fu, Jianling Sun, Xiaoxue Ren, Chenghao (…)2026-05-27
🤖 machine learning

On the Push-Based Asynchronous Federated Learning: A Bias-Correction Aggregation Approach

تقترح الورقة البحثية إطار عمل PushCen-ADFL، وهو إطار تعلم اتحادي غير متزامن وفعال في الاتصالات يستخدم تبادل الرسائل القائم على المركز، وخوارق الجمع والدفع (push-sum mixing) لتصحيح الانحياز، وتنظيم المركز للتخفيف من حدة انحراف النموذج وتحسين الدقة بشكل كبير مع تقليل تكاليف الاتصال في الأنظمة اللامركزية غير المتجانسة.

Jiahui Bai, Hai Dong, A. K. Qin2026-05-27
💻 computer science

Tool-Schema Compression Enables Agentic RAG Under Constrained Context Budgets

تُثبت هذه الورقة أن ضغط مخططات الأدوات (tool-schema compression) يمثل بنية تحتية حاسمة لأنظمة البحث والاسترجاع المعززة بالوكلاء (Agentic RAG)، مما يتيح الأداء الوظيفي في ظل ميزانيات السياق المحدودة من خلال منع تجاوز تعريفات الأدوات لنافذة السياق، وتحسين درجات المطابقة التامة بشكل كبير مقارنة بالمخططات غير المضغوطة.

Furkan Sakizli2026-05-27
💻 computer science

A Universal Cliff and a Design Fingerprint: Cross-Section Defect Detection Under LLM Orchestration

تكشف هذه الورقة أن تنسيق النماذج اللغوية عبر وكلاء متعددين يخلق "منحدر كشف" عالمياً حيث تنهار القدرة على تحديد عيوب المستندات المتقاطعة بأكثر من الثلثين بغض النظر عن حجم النموذج أو محاذاته، كما تكشف أيضاً عن تحول محدد يعتمد على المطور في معايير الإبلاط وعدم موثوقية الحكام الآليين في اكتشاف هذه الإخفاقات الهيكلية.

Hiroki Fukui2026-05-27
🤖 machine learning

InfoQuant: Shaping Activation Distributions for Low-Bit LLM Quantization

تُعد InfoQuant طريقةً للكمّ ما بعد التدريب لا تتطلب تدريباً، حيث توظف تحويل ذروة الكبت المتعامد (PSOT) واختيار الرموز الشاذة التكيفي لإعادة تشكيل توزيعات التنشيط إلى شكل مدمج ومشتت جيداً، مما يقلل بشكل كبير من خطأ الكمّ ويتفوق على النماذج المرجعية الحالية لنشر النماذج اللغوية الكبيرة منخفضة البت.

Ke Li, Dong An, Xiaoling Zang, Can Ye, Liang Xie, Qibo Qiu, Chen Shen, Xiaofei He, Wenxiao Wang2026-05-27
💻 computer science

PitchBench: Measuring Pitch Hearing in Audio-Language Models

تقدم هذه الورقة PitchBench، وهي مجموعة تقييم شاملة تضم 28 تجربة تكشف أن نماذج الصوت واللغة الحالية تفتقر إلى إدراك موثوق ومستقر لطبقة الصوت عبر مختلف الظروف الصوتية، والآلات الموسيقية، وتنسيقات الاستجابة.

Milan Liessens Dujardin, Song-Ze Yu, Craver Corbyn Thomas-Smith, David M. Chan, Karina Nguyen2026-05-27
🔬 materials science

AutoDFT: A Closed-Loop Multi-Agent Framework for Autonomous DFT Calculations

تُعد AutoDFT إطار عمل متعدد الوكلاء ذو حلقة مغلقة يدمج استدلال النماذج اللغوية الكبيرة (LLM) طوال دورة حياة نظرية الكثافة الوظيفية (DFT) بأكملها لأتمتة التخطيط، وتوليد المعلمات، واستعادة الأخطاء، محققاً معدلات نجاح عالية في اختبارات قياسية متنوعة، مما يمكّن غير المتخصصين من الحصول على تنبؤات موثوقة للمواد القائمة على المبادئ الأولية.

Penghui Yang, Zhonghan Zhang, Yue Li, Xinrun Wag, Yanchen Deng, Yuhao Lu, Bijun Tang, Zheng Liu, Bo An2026-05-27
🤖 machine learning

GAC: Noise-Aware Adaptive Mixing for Hybrid SFT-RL Post-Training

تقترح الورقة البحثية GAC، وهو متحكم خلط تكيفي مدرك للضوضاء يقوم بضبط التوازن ديناميكيًا بين الضبط الدقيق الخاضع للإشراف والتعلم التعزيزي بناءً على تقديرات آنية لتباين التدرج وعدم الاتفاق في الإشارة، مما يحسن أداء ما بعد التدريب الهجين عبر مجالات متنوعة بأقل قدر من العبء الإضافي.

Yuelin Hu, Zhenbo Yu, Zhengxue Cheng, Wei Liu, Li Song2026-05-27