💻 computer science

Towards Distillation-Resistant Large Language Models: An Information-Theoretic Perspective

تقترح هذه الورقة دفاعاً قائماً على نظرية المعلومات ضد تقطير النماذج القائم على اللوجيت (logit-based model distillation) من خلال تقليل المعلومات المتبادلة الشرطية بين لوجيتات المعلم واستعلامات المدخلات، مما يحمي نماذج اللغات الكبيرة المملوكة بفعالية من استخراج المعرفة مع الحفاظ على فائدتها في المهام.

Hao Fang, Tianyi Zhang, Tianqu Zhuang, Jiawei Kong, Kuofeng Gao, Bin Chen, Leqi Liang, Shu-Tao Xia, Ke Xu2026-04-03
💬 NLP

Semantic Shifts of Psychological Concepts in Scientific and Popular Media Discourse: A Distributional Semantics Analysis of Russian-Language Corpora

تستخدم هذه الدراسة الدلالات التوزيعية لتحليل المتون اللغوية للغة الروسية، كاشفةً عن أن المفاهيم النفسية مثل الاحتراق النفسي والاكتئاب تشهد تحولات دلالية كبيرة في وسائل الإعلام الشعبية، حيث يتم تأطيرها من خلال السرديات الشخصية والتجارب اليومية بدلاً من المصطلحات المنهجية والسريرية الدقيقة الموجودة في الخطاب العلمي.

Orlova Anastasia2026-04-03
💬 NLP

Phonological Fossils: Machine Learning Detection of Non-Mainstream Vocabulary in Sulawesi Basic Lexicon

تستخدم هذه الدراسة التعلم الآلي لتحديد المفردات غير السائدة في لغات سولاويسي باعتبارها ركائز محتملة لما قبل الأسترونيزية، مما يكشف عن أنماط صوتية متميزة ولكنه لا يجد دليلًا على وجود لغة ركيزة واحدة مشتركة بسبب الافتقار إلى عائلات لغوية متماسكة.

Mukhlis Amien, Go Frendi Gunawan2026-04-03
💬 NLP

Hierarchical Chain-of-Thought Prompting: Enhancing LLM Reasoning Performance and Efficiency

تقدم هذه الورقة البحثية "سلسلة الأفكار الهرمية" (Hi-CoT)، وهي نموذج توجيه مهيكل يعمل على تفكيك الاستدلال إلى خطوات فرعية متبادلة من التخطيط والتنفيذ، مما يحقق تحسينات كبيرة في كل من الدقة والكفاءة مقارنة بطرق "سلسلة الأفكار" التقليدية عبر مختلف النماذج اللغوية الكبيرة والمعايير الرياضية.

Xingshuai Huang, Derek Li, Bahareh Nikpour, Parsa Omidi2026-04-03
💬 NLP

Polish phonology and morphology through the lens of distributional semantics

تُظهر هذه الدراسة أن المتجهات الدلالية التوزيعية للكلمات البولندية تشفر بطبيعتها معلومات صوتية وصرفية دون لغوية، مما يتيح تنبؤات دقيقة بالسمات اللغوية القائمة على الشكل، ويدعم الرؤية القائلة بأن الفضاء الدلالي متماثل بنيوياً مع فضاء الشكل الهيكلي.

Paula Orzechowska, R. Harald Baayen2026-04-03
💬 NLP

Do LLMs Know What Is Private Internally? Probing and Steering Contextual Privacy Norms in Large Language Model Representations

تُثبت هذه الورقة أن النماذج اللغوية الكبيرة تُشفّر داخلياً معايير الخصوصية السياقية كتمثيلات متميزة وقابلة للفصل خطياً، ومع ذلك تفشل في التصرف بناءً عليها بسبب عدم توافق بين هذه المفاهيم الكامنة والسلوك، وهي فجوة يمكن جسرها بفعالية من خلال التوجيه الهيكلي للمعلمات المعتمد على التدخل السياقي (CI-parametric steering).

Haoran Wang, Li Xiong, Kai Shu2026-04-03
💬 NLP

Do Language Models Know When They'll Refuse? Probing Introspective Awareness of Safety Boundaries

تقيم هذه الدراسة الوعي الاستبطاني لأربعة نماذج لغوية رائدة فيما يتعلق بحدود رفض السلامة لديها، وتجد أنه بينما تمتلك هذه النماذج عمومًا حساسية عالية للتنبؤ بالرفض، فإن الأداء يتباين باختلاف النموذج والموضوع، مع تقديم درجات الثقة آلية عملية لتوجيه الاستعلامات الحرجة المتعلقة بالسلامة.

Tanay Gondil2026-04-03
💬 NLP

FGR-ColBERT: Identifying Fine-Grained Relevance Tokens During Retrieval

يُعد FGR-ColBERT نموذج استرجاع فعال يدمج إشارات الصلة دقيقة التفاصيل المستخلصة من نموذج لغوي كبير مباشرة في وظيفة الاسترجاع، محققاً أداءً فائقاً على مستوى الرموز مقارنة بنماذج لغوية كبيرة أكبر بكثير مع الحفاظ على فعالية استرجاع عالية وضئيل جداً في زمن التأخير.

Antonín Jarolím, Martin Fajčík2026-04-03
💬 NLP

Large Language Models in the Abuse Detection Pipeline

تحلل هذه الورقة البحثية دمج النماذج اللغوية الكبيرة في المراحل الأربع لدورة حياة كشف الإساءة —توليد الملصقات والميزات، والكشف، والمراجعة والاستئناف، والتدقيق والحوكمة— مع تلخيص الممارسات الحالية، والاعتبارات الهيكلية، والتحديات الرئيسية مثل زمن الاستجابة والعدالة لتوجيه نشر أنظمة سلامة موثوقة واسعة النط scale.

Suraj Kath, Sanket Badhe, Preet Shah, Ashwin Sampathkumar, Shivani Gupta2026-04-03
💬 NLP

Locally Confident, Globally Stuck: The Quality-Exploration Dilemma in Diffusion Language Models

تتناول هذه الورقة معضلة الجودة والاستكشاف في نماذج اللغة الانتشارية من خلال إثبات أن إعادة القناع ذات الثقة المنخفضة تقيد الاستكشاف الضروري، وتقترح عينة "متروبوليس-هاستينغز المستقل" التي توازن بفعالية بين جودة التوليد وتنوع مسارات الاستدلال عبر مختلف اختبارات الاستدداء.

Liancheng Fang, Aiwei Liu, Henry Peng Zou, Yankai Chen, Enze Ma, Leyi Pan, Chunyu Miao, Wei-Chieh Huang, Xue Liu, Philip (…)2026-04-03