💬 NLP

When Do LLM Agents Treat Surface Noise Differently from Semantic Noise? A 68-Cell Measurement Study with a Held-Out Trace-Level Validation

تُظهر هذه الدراسة التجريبية لـ 68 خلية تجريبية عبر عشرة نماذج لغوية كبيرة أن الاضطرابات الحاملة للمعنى تعطل استدلال الوكيل وإجاباته النهائية بشكل أكبر بكثير من الضجيج القائم على العرض ذي الشدة المماثلة، وهو اكتشاف تم التحقق من صحته في نموذج محجوز ومُعزى إلى آلية "التباعد الخفي" حيث يؤدي الضجيج الدلالي إلى إحداث تباعد في خطوات الاستدلال الوسيطة بدلاً من الإجراءات الأولية.

Liyun Zhang, Jiayi Guo2026-05-26
💬 NLP

What Makes a Medical Checker Trainable? Diagnosing Signal Collapse and Reward Hacking in Checker-Guided RAG for Biomedical QA

تُثبت هذه الورقة أنه في أنظمة التوليد المعزز بالاسترجاع (RAG) الموجهة بالتحقق الطبي، تعتمد قابلية تدريب النظام على توزيع مخرجات المُحقِّق بدلاً من دقته، مما يكشف أن أدوات التحقق القائمة على الاستدلال اللغوي الطبيعي (NLI) والمستندة إلى احتمالية السجل (log-prob) تسبب انهيار الإشارة، بينما تؤدي أدوات التحقق القوية للغاية إلى حدوث "اختراق للمكافأة" (reward hacking)، وهو ما يُظهر في النهاية أن المصنفات المحلية ذات الإشارة المتوسطة تحقق جودة إجابة متفوقة دون تبعيات خارجية.

Yuelyu Ji, Min Gu Kwak, Hang Zhang, Xizhi Wu, Chenyu Li, Yanshan Wan2026-05-26
💬 NLP

Forgotten Words: Benchmarking NeoBERT for Dementia Detection in Low-Resource Conversational Filipino and English Speech

تقدم هذه الورقة أول تقييم منهجي للكشف عن الخرف القائم على نماذج المحولات (transformer) في الكلام الممزوج بين الفلبينية والإنجليزية، مما يثبت أنه بينما تفشل النماذج أحادية اللغة في التعميم عبر اللغات، فإن الضبط الدقيق ثنائي اللغة يقضي بفعالية على تدهور الأداء عبر اللغات ويحقق دقة عالية بغض النظر عن بنية النموذج.

Rez Samantha Z. Floresca, Edric Castel C. Hao, Hannah Grachiella Buñales, Chelsea Dominique E. Temprosa, Georgianna Z. R (…)2026-05-26✓ Author reviewed
💬 NLP

STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models

إن STORMS هو إطار عمل ثنائي المراحل يعزز قدرات الاستدلال المكاني-الزماني لنماذج اللغة والفيديو من خلال تدريبها على استيعاب الأدلة البصرية الديناميكية ضمن مسارات كامنة مستمرة ومحدودة، مما يحقق دقة أعلى مع زمن انتقال استدلال أقل بكثير مقارنة بالطرق التي تعتمد على أدوات خارجية أو تسلسل أفكوم نصي صريح.

Yiming Liang, Yixiao Chen, Yiyang Zhou, Yixuan Wang, Shoubin Yu, Andong Deng, Fuxiao Liu, Qin Zhang, Chen Chen, Mohit Ba (…)2026-05-26
🤖 AI

CausaLab: A Scalable Environment for Interactive Causal Discovery Toward AI Scientists

تقدم CausaLab بيئة تفاعلية قابلة للتوسع لتقييم قدرات الاكتشاف السببي لوكلاء النماذج اللغوية الكبيرة (LLMs) من خلال مطالبتهم باستعادة النماذج السببية الهيكلية الكامنة في بيئة مختبرية اصطناعية، مما يكشف عن فجوة كبيرة بين الدقة التنبؤية والفهم السببي الحقيقي، مع تسليط الضوء على نقاط الضعف في تصميم التدخلات والتوقف المبكر.

Junlin Yang, Dylan Zhang, Xiangchen Song, Qirun Dai, Xiao Liu, Yuen Chen, Aniket Vashishtha, Jing Shi, Chenhao Tan, Hao (…)2026-05-26
💬 NLP

Peak-Then-Collapse and the Four Interface Channels of Knowledge-Graph Tool Use

تكشف هذه الورقة أن التعلم المعزز القياسي مع المكافآت القابلة للتحقق (RLVR) يتسبب في فشل من نوع "الذروة ثم الانهيار" في استخدام أدوات الرسوم البيانية للمعرفة بسبب غياب إشارات الخطأ باللغة الطبيعية في الواجهة، وهي مشكلة تستمر عبر إعادة تصميم المكافآت وتوسيع النماذج ولكن يمكن التخفيف منها بفعالية من خلال التقطير الذاتي.

Tianda Sun, Dimitar Kazakov2026-05-26
💬 NLP

Confidence and Calibration of Activation Oracles for Reliable Interpretation of Language Model Internals

تتقصى هذه الورقة البحثية تقدير عدم اليقين لنماذج التنشيط (activation oracles) من خلال تقييم ست طرق لتقدير الثقة، حيث وجدت أن تردد النمط القائم على "بوتستراب" (bootstrap mode frequency) يقدم أفضل معايرة، بينما يعمل الاحتمال اللوغاريتمي (log-probability) كإشارة فرز فعالة من حيث التكلفة.

Federico Torrielli, Peter Schneider-Kamp, Lukas Galke Poech2026-05-26
💬 NLP

When Gradients Collide: Failure Modes of Multi-Objective Prompt Optimization for LLM Judges

تحدد هذه الورقة نمطي فشل أساسيين — تخفيف التدرج أثناء وقت التحسين وتداخل التعليمات أثناء وقت الاستدلال — يعيقان تحسين المطالبات متعددة الأهداف لنماذج الحكم اللغوية الكبيرة، مما يثبت أن طرق التدرج النصي الحالية غالبًا ما تفشل في التحسن عن المطالبات الأولية عند التعامل مع معايير متعددة في آن واحد.

Parth Darshan, Abhishek Divekar2026-05-26
💬 NLP

Automated Benchmark Auditing for AI Agents and Large Language Models

تقدم هذه الورقة البحثية إطار عمل "Auto Benchmark Audit" (ABA)، وهو إطار عمل وكيل (agentic framework) يحدد بشكل منهجي العيوب الحرجة في أكثر من 25% من معايير القياس الخاصة بالذكاء الاصطناعي، مما يثبت أن إزالة هذه المهام الإشكالية يغير ترتيب النماذج بشكل كبير ويحسن مقاييس الأداء.

Junlin Wang, Federico Bianchi, Shang Zhu, Fan Nie, Yongchan Kwon, Bhuwan Dhingra, James Zou2026-05-26
💬 NLP

Language Models Need Sleep

تقترح هذه الورقة آلية دمج شبيهة بالنوم للنماذج اللغوية الكبيرة تقوم دورياً بتحويل السياق الأخير إلى أوزان سريعة مستمرة خلال تمريرات تكرارية غير متصلة، مما يتغلب على قيود توسع الانتباه ويحسن الأداء بشكل كبير في المهام طويلة المدى والتعليل العميق مع الحفاظ على زمن انتقال الاستدلال.

Sangyun Lee, Sean McLeish, Tom Goldstein, Giulia Fanti2026-05-26