💬 NLP

Can AI Guess What You Know? Performance Comparison of Large Language Models for Human Domain Knowledge Estimation From Communication Logs

تقيم هذه الدراسة قدرة سبعة نماذج لغوية كبيرة على استنتاج المعرفة بالمجال الفردي من سجلات اتصالات "سلاك" عبر مقارنة تقديراتها في وضع الصفر (zero-shot) بالمهارات المبلغ عنها ذاتياً، لتجد أنه بينما حقق نموذج "Gemini 2.5 Flash" أعلى دقة، فإن أداء الاستنتاج يعتمد بشكل ضعيف فقط على حجم الرسائل، مما يسلط الضوء على الحاجة إلى نهج يحافظ على الخصوصية ويهتم بالهيكلية.

Ko Watanabe, Shoya Ishimaru2026-05-25
💬 NLP

A Reproducible Universal Dependencies-Style Pipeline for Katharevousa Greek Parliamentary Text

تقدم هذه الورقة مساراً مفتوح الوصول وقابلاً لإعادة الإنتاج لإنشاء مورد تحليل نحوي بأسلوب "التبعيات العالمية" (Universal Dependencies) للنصوص البرلمانية المكتوبة باللغة اليونانية الكافاريوفوسا من فترة ما بعد الحقبة العسكرية المبكرة، مما يثبت أن نموذج XLM-R مخصص يتفوق بشكل كبير على أدوات التحليل الجاهزة في التحليل النحوي مع توفير منهجية قابلة للتدقيق لمعالجة بيانات التعرف الضوئي على الحروف (OCR) التاريخية.

George Mikros, Fotios Fitsilis2026-05-25
💬 NLP

Memorization Dynamics of Fill-in-the-Middle Pretraining

تتقصى هذه الورقة ديناميكيات الحفظ لتدريب "الملء في المنتصف" (FIM) المسبق مقارنة بأهداف التدريب القياسية من اليسار إلى اليمين، كاشفةً أنه بينما يتفوق "الملء في المنتصف" في استعادة الفراغات القصيرة أو الجزئية، فإنه يظل معتمداً بشكل كبير على سياق البادئة للاستدعاء الحرفي، ويظهر نمواً خطياً في الحفظ مع تكرار البيانات.

Tobias von Arx, Tanguy Dieudonné2026-05-25
🤖 machine learning

RADAR: Relative Angular Divergence Across Representations

تقدم الورقة البحثية RADAR، وهو مقياس قائم على الأسس الهندسية يقدر قابلية النقل عبر المجالات في النماذج التأسيسية من خلال تحليل التباعد الزاوي وتغيرات المسافة النسبية في مسارات تمثيل الطبقات، مما يظهر أداءً تنبؤياً تنافسياً عبر معايير النصوص والصور.

Xavier Cadet, Mateusz Nowak, Peter Chin2026-05-25
💬 NLP

Brain-LLM Alignment Tracks Training Data, Not Typology

تُظهر هذه الدراسة أن التوافق بين الدماغ والنماذج اللغوية الكبيرة عبر اللغات مدفوع أساساً بهيمنة لغة التدريب للنموذج وليس بميزة متأصلة للغة الإنجليزية، مع وجود تباينات متبقية تعكس مسافات تصنيفية حقيقية تؤثر بشكل غير متناسب على المناطق الدماغية النحوية.

Dongxin Guo, Jikun Wu, Siu Ming Yiu2026-05-25
💬 NLP

Sparse Autoencoders Map Brain-LLM Alignment onto Cortical Semantic Topography

تُظهر هذه الدراسة أن المشفّرات التلقائية المتناثرة (sparse autoencoders) المطبقة على النماذج اللغوية الكبيرة تكشف عن سمات دلالية قابلة للتفسير لا تفسر فقط سبب قدرة الطبقات المتوسطة على التنبؤ باستجابات الدماغ البشري بشكل أفضل، بل تعيد أيضاً محاكاة التضاريس الدلالية القشرية المعروفة للدماغ وتتنبأ بأوقات القراءة عبر لغات متعددة.

Dongxin Guo, Jikun Wu, Siu Ming Yiu2026-05-25
💬 NLP

Do Language Models Know What Not to Say? Causal Evidence for Statistical Preemption in LLMs

تقدم هذه الورقة أول دليل سببي على أن النماذج اللغوية الكبيرة تكتسب معرفة بعدم القبول اللغوي من خلال الاستباق الإحصائي، مما يثبت أن التعرض للأشكال التقليدية يثبط البدائل الممكنة بنيوياً ولكن غير المسجلة عبر التنافس التوزيعي بدلاً من مجرد التجذر الفعلي.

Dongxin Guo, Jikun Wu, Siu Ming Yiu2026-05-25
💬 NLP

Model Collapse as Cultural Evolution

تعيد هذه الورقة صياغة انهيار النموذج بوصفه ظاهرة انتقال ثقافي عبر تطبيق نظرية التعلم المتكرر لإثبات أن التدريب الذاتي غير المفلتر يسبب تدهوراً غير رتيب في التركيب اللغوي، وهو اكتشاف تم التحقق من صحته عبر نماذج ولغات متعددة ويقدم مبادئ ملموسة لتصميم مسارات تدريب ذاتي قوية.

Dongxin Guo, Jikun Wu, Siu Ming Yiu2026-05-25
💬 NLP

What Training Data Teaches RL Memory Agents: An Empirical Study of Curriculum Effects in Memory-Augmented QA

تُظهر هذه الدراسة التجريبية أن تكوين المناهج التدريبية يعمل كرافعة دقيقة لتخصيص وكلاء التعلم المعزز المدعومين بالذاكرة بدلاً من كونه مقياساً موحداً للأداء، مما يكشف أن التدريب على معايير مختلطة يحقق أفضل النتائج الإجمالية بينما يعزز التدريب ضيق النطاق خارج المجال الاستدلال الزمني بشكل فريد، وتسلط الضوء على رؤى عملية بالغة الأهمية لتكييف خوارزمية (GRPO) مع أنظمة المعالج الرسومي الواحد.

Xinjie He, Zhiyuan Lin, Su Liu, Jialun Wu, Qiyang Xie, Weikai Zhou, Shuai Xiao2026-05-25
💬 NLP

A Comparative Evaluation of Structural Topic Models and BERTopic for Short, Open-Ended Survey Responses

تقارن هذه الورقة بين نماذج المواضيع الهيكلية (STM) وBERTopic لتحليل استجابات المسوحات القصيرة والمفتوحة، لتجد أنه في حين ينتج نموذج BERTopic مع التعزيز السياقي مواضيع أكثر تماسكاً وقابلية للتفسير، يظل نموذج STM متفوقاً في تحليل المتغيرات المصاحبة الاستدلالي، مما يشير إلى أن الطريقتين تقدمان نقاط قوة متكاملة للبحوث الاجتماعية التطبيقية.

Yan Jiang, Sihong Liu, Philip A. Fisher2026-05-25