🤖 AI

Hidden Error Awareness in Chain-of-Thought Reasoning: The Signal Is Diagnostic, Not Causal

تُثبت هذه الورقة أنه بينما تمتلك النماذج اللغوية الكبيرة "وعياً داخلياً بالخطأ" قوياً يمكن اكتشافه في حالاتها الخفية، فإن هذه الإشارة التشخيصية غير سببية جوهرياً ولا يمكن استغلالها لتصحيح أخطاء الاستدلال من خلال تقنيات تدخل متنوعة.

Aojie Yuan, Zhiyuan Julian Su, Haiyue Zhang, Yi Nian, Yue Zhao2026-05-12
🤖 machine learning

Scratchpad Patching: Decoupling Compute from Patch Size in Byte-Level Language Models

تقدم هذه الورقة تقنية "رقعة دفتر الملاحظات" (Scratchpad Patching - SP)، وهي تقنية تفصل بين الحوسبة وحجم الرقعة في النماذج اللغوية ذات المستوى البايتي عبر إدراج دفاتر ملاحظات عابرة ديناميكيًا للتخفيف من تأخر الرقعة، مما يتيح رقعًا أكبر لتقليل تكاليف ذاكرة التخزين المؤقت لـ (KV-cache) والحوسبة دون التضحية بجودة النمذجة.

Lin Zheng, Vasilisa Bashlovkina, Timothy Dozat, Dan Garrette, Laura Rimell, Joshua Maynez2026-05-12
🤖 AI

MedMeta: A Benchmark for LLMs in Synthesizing Meta-Analysis Conclusion from Medical Studies

تقدم الورقة البحثية MedMeta، وهو معيار جديد لتقييم قدرة النماذج اللغوية الكبيرة على توليف استنتاجات التحليل التلوي الطبي من ملخصات الدراسات، كاشفةً أن التوليد المعزز بالاسترجاع يتفوق بشكل كبير على النهج المعتمد على المعلمات فقط، بينما يكشف في الوقت ذاته عن ثغرات حرجة في التعامل مع الأدلة المنفية والقيمة المحدودة للضبط الدقيق المتخصص في المجال لهذه المهمة.

Huy Hoang Ha, Benoit Favre, Francois Portet2026-05-12
📊 statistics

Calibrate, Don't Curate: Label-Efficient Estimation from Noisy LLM Judges

تُثبت هذه الورقة أنه في عملية تقييم النماذج اللغوية الكبيرة متعددة الحكام باستخدام بيانات معايرة مصنفة، فإن الاحتفاظ بجميع الحكام ومعايرة مخرجاتهم يؤدي إلى معدلات خطأ أقل بكثير من اختيار مجموعة فرعية بناءً على الدقة وحدها، لأن حتى الحكام الضعفاء أو المنحازين يقدمون إشارات غير متكررة تعمل على تحسين المعايرة الاحتمالية.

Yanran Li2026-05-12
🤖 AI

The Silent Vote: Improving Zero-Shot LLM Reliability by Aggregating Semantic Neighborhoods

تقدم هذه الورقة البحثية "Semantic Softmax"، وهي طريقة تُستخدم أثناء مرحلة الاستدلال لدمج الدرجات من الجوارات الدلالية للتخفيف من حدة "انحياز إعادة المعايرة" (Renormalization Bias) وما ينتج عنه من "التصويت الصامت" (Silent Vote) في تصنيف النماذج اللغوية الكبيرة (LLMs) في وضع صفر المعرفة (zero-shot)، مما يؤدي إلى تحسين معايرة النموذج والأداء التمييزي بشكل كبير عبر اختبارات قياسية متعددة.

Sanket Badhe, Priyanka Tiwari, Deep Shah2026-05-12
🤖 AI

Exploitation Without Deception: Dark Triad Feature Steering Reveals Separable Antisocial Circuits in Language Models

تُظهر هذه الدراسة أن استخدام توجيه ميزات المشفر التلقائي المتناثر لتضخيم سمات "الثالوث المظلم" في نموذج Llama-3.3-70B-Instruct يزيد بشكل انتقائي من السلوكيات الاستغلالية والقاسية مع ترك الخداع الاستراتيجي والتعاطف المعرفي دون تغيير، مما يكشف أن النزعات المعادية للمجتمع في النماذج اللغوية الكبيرة تتكون من مسارات حوسبية منفصلة بدلاً من كونها بنية موحدة.

Cameron Berg, Roshni Lulla2026-05-12
🤖 AI

EvoPref: Multi-Objective Evolutionary Optimization Discovers Diverse LLM Alignments Beyond Gradient Descent

يقدم EvoPref خوارزمية تطورية متعددة الأهداف باستخدام NSGA-II ومهايئات LoRA للتغلب على انهيار التفضيل في الطرق القائمة على التدرج، محققاً تنوعاً أكبر بكثير في محاذاة النماذج اللغوية الكبيرة مع الحفاظ على جودة تنافسية في المعايك القياسية.

Dongxin Guo, Jikun Wu, Siu Ming Yiu2026-05-12
🤖 AI

Parameter-Efficient Neuroevolution for Diverse LLM Generation: Quality-Diversity Optimization via Prompt Embedding Evolution

تقدم الورقة البحثية QD-LLM، وهو إطار عمل للتطور العصبي فعال في المعلمات يقوم بتطوير تضمينات مطالبات مدمجة ضمن مخطط تحسين التنوع والجودة لتوجيه النماذج اللغوية الكبيرة المجمدة نحو مخرجات متنوعة وعالية الجودة، متفوقاً بشكل كبير على الأساليب الحالية في التغطية والمنفعة في المهام اللاحقة دون الحاجة إلى ضبط دقيق للنموذج.

Dongxin Guo, Jikun Wu, Siu Ming Yiu2026-05-12
🤖 AI

The Metacognitive Probe: Five Behavioural Calibration Diagnostics for LLMs

تقدم الورقة البحثية "المسبار الميتا-معرفي" (Metacognitive Probe)، وهو أداة تشخيصية مكونة من خمس مهام تقيم سلوكيات الثقة لدى النماذج اللغوية الكبيرة عبر خمسة أبعاد متميزة للكشف عن جيوب خفية من الثقة المفرطة التي تغفل عنها الاختبارات القياسية التجميعية، مما يظهر تباينًا كبيرًا قدره 47 نقطة بين معايرة النموذج الخاصة بمهمة معينة وقدراته على التنبؤ بصعوبة المهام عبر مختلف المهام.

Rafael C. T. Oliveira2026-05-12
🤖 AI

EgoMemReason: A Memory-Driven Reasoning Benchmark for Long-Horizon Egocentric Video Understanding

تقدم هذه الورقة EgoMemReason، وهو معيار شامل مصمم لتقييم فهم الفيديو من منظور الشخص الأول (egocentric) طويل المدى عبر اختبار الاستدلال القائم على الذاكرة عبر أنواع الكيانات والأحداث والسلوكيات، مما يكشف أن النماذج متعددة الوسائط الحالية تعاني بشكل كبير في دمج الأدلة المتفرقة عبر فترات زمنية تمتد لعدة أيام.

Ziyang Wang, Yue Zhang, Shoubin Yu, Ce Zhang, Zengqi Zhao, Jaehong Yoon, Hyunji Lee, Gedas Bertasius, Mohit Bansal2026-05-12