🤖 AI

EvoMD-LLM: Learning the Language of Species Evolution in Reactive Molecular Dynamics

يقدم EvoMD-LLM إطار عمل يعيد صياغة الديناميكا الجزيئية التفاعلية كمسألة نمذجة لغوية زمنية رمزية من خلال تحويل المسارات إلى رموز (tokens) تمثل الأحداث والمدد الزمنية، مما يمكّن النماذج اللغوية الكبيرة من التنبؤ بدقة بتطور الأنواع وتوليد تفسيرات كيميائية دون إشراف صريح.

Zhichen Tang, Zhengzheng Dang, Yulin Chen, Jixin Wu, Haiwen Li, Yanming Wang2026-05-29
🤖 AI

Aligned but Fragile: Enhancing LLM Safety Robustness via Zeroth-Order Optimization

تقترح هذه الورقة إطار عمل هجين يعزز متانة النماذج اللغوية الكبيرة المتوافقة مع معايير السلامة ضد الاضطرابات، وذلك عبر تطبيق خطوات تحسين من الدرجة الصفرية بعد عملية المحاذاة القياسية من الدرجة الأولى، مع تحقيق تحسن في الكفاءة من خلال تركيز التحديثات على الطبقات التي تم تحديدها كأكثر الطبقات حساسية تجاه المتانة.

Zhihao Liu, Yifan Wu, Jian Lou, Di Wang, Yuxi Zhou, Yuke Hu2026-05-29
🤖 machine learning

GDSD: Reinforcement Learning as Guided Denoiser Self-Distillation for Diffusion Language Models

تقدم هذه الورقة البحثية إطار عمل "التقطير الذاتي للمزيل الموجه" (GDSD)، وهو إطار لتعلم التعزيز لنماذج اللغات الانتشارية يتجاوز تحيزات بدائل الاحتمالية القائمة على "حد الاحتمال الأدنى المتوقع" (ELBO) من خلال تقطير معلم موجه بالميزة مباشرة في المزيل، مما يحقق تدريباً أكثر استقراراً ومكاسب أداء كبيرة في معايير اختبار الاستدلال.

Xiaohang Tang, Keyue Jiang, Che Liu, Qifang Zhao, Xiaoxiao Xu, Sangwoong Yoon, Ilija Bogunovic2026-05-29
🤖 AI

Architecture-Sensitive Supervised Fine-Tuning for Screen-Conditioned Action Prediction: A PiSAR Benchmark

تقدم هذه الورقة معيار PiSAR لتوضيح أنه في حين أن الضبط الدقيق الخاضع للإشراف على مجموعة بيانات إجراءات مشروطة بالشاشة مكونة من 12,929-توبل يعزز الأداء بشكل كبير للنماذج الأصغر مثل Qwen3-VL-8B، فإن وصفة التدريب نفسها تفشل في تحسين النماذج الأكبر الموجهة للاستنتاج مثل Gemma-4-26B، مما يكشف عن عدم تطابق حرج حساس للبنية بين استراتيجيات الضبط الدقيق وقدرات النموذج.

Rahul Bissa, Abhishek Vyas, Yash Jain2026-05-29
🤖 AI

Towards Human-Like Interactive Speech Recognition With Agentic Correction and Semantic Evaluation

تقترح هذه الورقة البحثية "Agentic ASR"، وهو إطار عمل ذو حلقة مغلقة يحول التعرف على الكلام إلى مهمة تحسين تفاعلية متعددة الأدوار لتتوافق بشكل أفضل مع التواصل البشري، مقدمةً مقياس تقييم دلالي جديد (S2ERS^2ER) ومثبتةً تحسينات كبيرة في تصحيح الأخطاء الحرجة للمعنى مقارنة بالنهج التقليدي القائم على مستوى الرموز (token-level).

Zixuan Jiang, Yanqiao Zhu, Peng Wang, Qinyuan Chen, Xinjian Zhao, Xipeng Qiu, Wupeng Wang, Zhifu Gao, Xiangang Li, Kai Y (…)2026-05-29
🤖 AI

AliMark: Enhancing Robustness of Sentence-Level Watermarking Against Text Paraphrasing

يُعد ™AliMark إطار عمل قوي للعلامات المائية على مستوى الجملة، حيث يعيد صياغة عملية الكشف كمسألة محاذاة لتسلسل البتات، ويستخدم استراتيجية مرحلية من مرحلتين مع متغيرات نصية مُعاد هيكلتها بشكل تكيفي لمقاومة الاضطرابات الهيكلية مثل تقسيم الجمل ودمجها بفعالية.

Yuexin Li, Wenjie Qu, Linyu Wu, Yulin Chen, Yufei He, Tri Cao, Bryan Hooi, Jiaheng Zhang2026-05-29
🤖 AI

How Coding Agents Fail Their Users: A Large-Scale Analysis of Developer-Agent Misalignment in 20,574 Real-World Sessions

تقدم هذه الورقة دراسة رصدية واسعة النطاق لأكثر من 20,000 جلسة برمجية واقعية لتحديد سبعة أشكال متكررة من عدم التوافق بين المطور والوكيل، كاشفةً أنه في حين أن معظم الإخفاقات تسبب تكاليف في الثقة والجهد بدلاً من أضرار لا يمكن إصلاحها، إلا أنها تتطلب بشكل ساحق تصحيحاً صريحاً من المستخدم وتُظهر أنماطاً متميزة عبر مختلف سير العمل والوقت.

Ningzhi Tang, Chaoran Chen, Gelei Xu, Yiyu Shi, Yu Huang, Collin McMillan, Tao Dong, Toby Jia-Jun Li2026-05-29
🤖 AI

CrystalXRD-Bench: Benchmarking Vision-Language Models for XRD Peak Indexing Across Diverse Crystalline Materials

تقدم هذه الورقة CrystalXRD-Bench، وهو معيار مرجعي جديد مصمم لتقييم نماذج الرؤية واللغة في المهمة المعقدة المتمثلة في فهرسة قمم حيود الأشعة السينية (XRD)، مما يكشف عن معاناة النماذج الحالية في الاستنتاج البلوري متعدد الخطوات والاستخراج البصري رغم إمكانية الوصول إلى بيانات كيميائية تكميلية.

Chengliang Xu, Xiaogang Li, Peiyao Xiao, Beng Wang, Hu Wei, Bing Zhao2026-05-29
🤖 AI

Adaptive Interviewing for Persona Simulation in LLMs: Evidence-Grounded Reasoning Improves Decision Alignment

تقترح هذه الورقة إطار عمل للمقابلة التكيفية يحسن قدرة النماذج اللغوية الكبيرة على محاكاة اتخاذ القرار الفردي في المعضلات الأخلاقية من خلال الجمع الديناميكي للأدلة الخاصة بالمستخدم، مما يثبت أن مكاسب الدقة تعتمد على قدرة النموذج على ترسيخ استدلاله في هذه الأدلة بدلاً من مجرد امتلاك سياق غني للشخصية.

Ruoxi Su, Yuhan Liu, Jingyu Hu2026-05-29