cs.AI
23941 ورقة بحثية
EvoMD-LLM: Learning the Language of Species Evolution in Reactive Molecular Dynamics
يقدم EvoMD-LLM إطار عمل يعيد صياغة الديناميكا الجزيئية التفاعلية كمسألة نمذجة لغوية زمنية رمزية من خلال تحويل المسارات إلى رموز (tokens) تمثل الأحداث والمدد الزمنية، مما يمكّن النماذج اللغوية الكبيرة من التنبؤ بدقة بتطور الأنواع وتوليد تفسيرات كيميائية دون إشراف صريح.
Aligned but Fragile: Enhancing LLM Safety Robustness via Zeroth-Order Optimization
تقترح هذه الورقة إطار عمل هجين يعزز متانة النماذج اللغوية الكبيرة المتوافقة مع معايير السلامة ضد الاضطرابات، وذلك عبر تطبيق خطوات تحسين من الدرجة الصفرية بعد عملية المحاذاة القياسية من الدرجة الأولى، مع تحقيق تحسن في الكفاءة من خلال تركيز التحديثات على الطبقات التي تم تحديدها كأكثر الطبقات حساسية تجاه المتانة.
GDSD: Reinforcement Learning as Guided Denoiser Self-Distillation for Diffusion Language Models
تقدم هذه الورقة البحثية إطار عمل "التقطير الذاتي للمزيل الموجه" (GDSD)، وهو إطار لتعلم التعزيز لنماذج اللغات الانتشارية يتجاوز تحيزات بدائل الاحتمالية القائمة على "حد الاحتمال الأدنى المتوقع" (ELBO) من خلال تقطير معلم موجه بالميزة مباشرة في المزيل، مما يحقق تدريباً أكثر استقراراً ومكاسب أداء كبيرة في معايير اختبار الاستدلال.
Architecture-Sensitive Supervised Fine-Tuning for Screen-Conditioned Action Prediction: A PiSAR Benchmark
تقدم هذه الورقة معيار PiSAR لتوضيح أنه في حين أن الضبط الدقيق الخاضع للإشراف على مجموعة بيانات إجراءات مشروطة بالشاشة مكونة من 12,929-توبل يعزز الأداء بشكل كبير للنماذج الأصغر مثل Qwen3-VL-8B، فإن وصفة التدريب نفسها تفشل في تحسين النماذج الأكبر الموجهة للاستنتاج مثل Gemma-4-26B، مما يكشف عن عدم تطابق حرج حساس للبنية بين استراتيجيات الضبط الدقيق وقدرات النموذج.
Towards Human-Like Interactive Speech Recognition With Agentic Correction and Semantic Evaluation
تقترح هذه الورقة البحثية "Agentic ASR"، وهو إطار عمل ذو حلقة مغلقة يحول التعرف على الكلام إلى مهمة تحسين تفاعلية متعددة الأدوار لتتوافق بشكل أفضل مع التواصل البشري، مقدمةً مقياس تقييم دلالي جديد () ومثبتةً تحسينات كبيرة في تصحيح الأخطاء الحرجة للمعنى مقارنة بالنهج التقليدي القائم على مستوى الرموز (token-level).
AliMark: Enhancing Robustness of Sentence-Level Watermarking Against Text Paraphrasing
يُعد ™AliMark إطار عمل قوي للعلامات المائية على مستوى الجملة، حيث يعيد صياغة عملية الكشف كمسألة محاذاة لتسلسل البتات، ويستخدم استراتيجية مرحلية من مرحلتين مع متغيرات نصية مُعاد هيكلتها بشكل تكيفي لمقاومة الاضطرابات الهيكلية مثل تقسيم الجمل ودمجها بفعالية.
How Coding Agents Fail Their Users: A Large-Scale Analysis of Developer-Agent Misalignment in 20,574 Real-World Sessions
تقدم هذه الورقة دراسة رصدية واسعة النطاق لأكثر من 20,000 جلسة برمجية واقعية لتحديد سبعة أشكال متكررة من عدم التوافق بين المطور والوكيل، كاشفةً أنه في حين أن معظم الإخفاقات تسبب تكاليف في الثقة والجهد بدلاً من أضرار لا يمكن إصلاحها، إلا أنها تتطلب بشكل ساحق تصحيحاً صريحاً من المستخدم وتُظهر أنماطاً متميزة عبر مختلف سير العمل والوقت.
CrystalXRD-Bench: Benchmarking Vision-Language Models for XRD Peak Indexing Across Diverse Crystalline Materials
تقدم هذه الورقة CrystalXRD-Bench، وهو معيار مرجعي جديد مصمم لتقييم نماذج الرؤية واللغة في المهمة المعقدة المتمثلة في فهرسة قمم حيود الأشعة السينية (XRD)، مما يكشف عن معاناة النماذج الحالية في الاستنتاج البلوري متعدد الخطوات والاستخراج البصري رغم إمكانية الوصول إلى بيانات كيميائية تكميلية.
Adaptive Interviewing for Persona Simulation in LLMs: Evidence-Grounded Reasoning Improves Decision Alignment
تقترح هذه الورقة إطار عمل للمقابلة التكيفية يحسن قدرة النماذج اللغوية الكبيرة على محاكاة اتخاذ القرار الفردي في المعضلات الأخلاقية من خلال الجمع الديناميكي للأدلة الخاصة بالمستخدم، مما يثبت أن مكاسب الدقة تعتمد على قدرة النموذج على ترسيخ استدلاله في هذه الأدلة بدلاً من مجرد امتلاك سياق غني للشخصية.