💬 NLP

SemiAdapt-Instruct: Extensible Instruction Tuning via Latent Domain-Specialised Adapters

يُعد SemiAdapt-Instruct إطار عمل نمطيًا يتيح ضبط التعليمات القابل للتوسع عبر اكتشاف المجالات الكامنة، وتدريب محولات LoRA متوازية لكل مجال، واستخدام التوجيه الخالي من المعلمات لدمج قدرات جديدة عبر تحديثات المحول المنفرد دون الحاجة إلى إعادة تدريب النموذج بالكامل.

Josh McGiff, Salma Mekaoui, Robert Shanahan, Nikola S. Nikolov2026-08-07
💬 NLP

Where Privacy Risk Lives in English-Source Multilingual RAG: A Stage-Decomposed Audit Across Five Query Languages

تتحدى هذه الورقة الافتراض القائل بأن الاستعلامات غير الإنجليزية تزيد بطبيعتها من مخاطر الخصوصية في أنظمة استرجاع المعلومات المعززة بالتوليد (RAG) متعددة اللغات ذات المصادر الإنجليزية، وذلك من خلال إثبات أن اللغة الإنجليزية تُظهر في الواقع أعلى معدلات تسريب معلومات الهوية الشخصية (PII) غير المهيكلة تحت نظام تصفية المخرجات فقط، عبر تدقيق مسار عمل نموذج Qwen2.5-7B، بينما تستمر المخاطر المتبقية في اللغتين العربية والسواحيلية حتى مع وجود قضاة للمدخلات والترجمة العكسية، رغم أنه يمكن التخفيف من حدتها إلى حد كبير من خلال تزويد قاضي المدخلات بسياق المستند.

Yanhang Li, Zhichao Fan, Zexin Zhuang2026-08-07
💬 NLP

Conditional Cognitive Biases in LLMs: How Biased User Turns Modulate In-Context Reasoning

تقيم هذه الورقة كيف تعمل مدخلات المستخدم المنحازة في المحادثات متعددة الأدوار على تعديل التعبير عن التحيز المعرفي في النماذج اللغوية الكبيرة المتطورة، كاشفةً أنه في حين أن التعرض الحواري يعزز التحيز بشكل عام، فإن إشارات التحيز الصريحة يمكن أن تفعّل آليات المواءمة التي تقمع التحيز العلني، وذلك بناءً على اختبار معياري شامل يضم أكثر من 24,000 مطالبة تم التحقق من صحتها عبر ثمانية نماذج.

Sachini Weerasekara, Sagar Kamarthi, Jacqueline Isaacs2026-08-07
💬 NLP

CNM-BERT: A Drop-In Structural Embedding for Chinese Characters via Ideographic Description Sequences

تقدم الورقة البحثية نموذج CNM-BERT، وهو تعزيز خفيف الوزن يقوم بحقن بنية تركيبية صريحة من تسلسلات الوصف التصويري (Ideographic Description Sequences) في نموذج BERT عبر شبكة Tree-MLP تكرارية، مما يحسن الأداء بشكل كبير في الرموز الصينية النادرة وخارج المفردات، مع تقديم مكاسب ثابتة عبر مختلف المهام اللاحقة.

Thomas Sing-wing Wu, Liqian Yan2026-08-07
💬 NLP

Position: It's Time to Optimize LLMs for Self-Consistency

تجادل هذه الورقة الموقعة بأن العديد من الإخفاقات المستمرة في النماذج اللغوية الكبيرة تنبع من تقييم المخرجات بمعزل عن غيرها، وتقترح "الاتساق الذاتي" كإطار عمل موحد لتحسين النماذج من خلال التفكير في العلاقات بين استجاباتها عبر مدخلات مختلفة.

Itamar Pres, Belinda Z. Li, Laura Ruis, Zifan Carl Guo, Keya Hu, Mehul Damani, Isha Puri, Ekdeep Singh Lubana, Jacob And (…)2026-08-07
💬 NLP

Analysis of Numerical Localisation in LLM Translations

توسع هذه الورقة البحثية الأبحاث السابقة حول الترجمة العددية من خلال تقييم خمسة نماذج لغوية كبيرة متوافقة مع السلع، حيث وجدت أن دمج مبادئ التوطين في سياق المطالبة (prompt) مباشرةً يحقق تحسينات ذات دلالة إحصائية في دقة ترجمة الأوقات والأرقام والتواريخ مقارنة بالترجمة المباشرة أو الاستراتيجيات الأخرى.

Patrizia Kaye2026-08-07
💬 NLP

Constraint-First Reasoning: A Training-Free Protocol for Exploiting Answer-Space Constraints in Mathematical Problem Solving

تقدم الورقة البحثية "الاستنتاج القائم على القيود" (CFR)، وهو بروتوكول توجيه ثنائي المراحل لا يتطلب تدريبًا، يقوم بتنشيط استخراج القيود والتحقق منها ديناميكيًا لتحسين دقة حل المسائل الرياضية في الاختبارات المعيارية التنافسية دون الحاجة إلى إعادة تدريب النموذج.

Hongbo Ma, Bangji Yang, Yunqian Selina Cheng, Jiajun Fan, Hanwen Zhang, Ge Liu2026-08-07
🤖 machine learning

QEvict: Recoverable Quantized KV Eviction for Attention-Drift-Robust Long-Context Decoding

يُعد QEvict نظاماً مبتكراً لإدارة ذاكرة التخزين المؤقت للمفاتيح والقيم (KV-cache) يستبدل عملية طرد الرموز غير القابلة للاسترداد بنهج ثلاثي المستويات قابل للاسترداد باستخدام التكميم لاستعادة الرموز التي تم التخلص منها سابقاً ديناميكياً عندما تزداد أهميتها، مما يعزز المتانة ضد انحراف الانتباه والأداء في فك تشفير النماذج اللغوية الكبيرة ذات السياق الطويل.

Ayushman Garg, Akshita Gupta, Shaswata Bhattacharya, Abhishek Gupta, Sandeep Kumar, Manoj Kumar2026-08-07
💬 NLP

Evidence Lock Before Commitment: A Frozen Interface Degrades LLM-as-Judge Evaluation

تُثبت هذه الورقة أن "قفل الأدلة" (evidence locking) —وهو سير عمل يقوم فيه حكام النماذج اللغوية الكبيرة باستخراج الأدلة وحفظها في استدعاء منفصل قبل إصدار حكم نهائي— يؤدي إلى تدهور أداء التقييم بشكل كبير من خلال تقليل التوافق مع التفضيلات البشرية وزيادة عدم الاتساق مع ترتيب الإجابات مقارنة بالتحكيم المهيكل ذي الاستدعاء الواحد.

Divyansh Singh2026-08-07
💬 NLP

Example-Guided Prompting for Document-Level Text Simplification

تُثبت هذه الورقة أن تعزيز المطالبات بأمثلة مسترجعة لتبسيط المستندات يحسن بشكل كبير جودة تبسيط النصوص على مستوى المستند في النماذج اللغوية الكبيرة، محققاً أداءً منافساً أو متفوقاً على الأنظمة المتخصصة الخاضعة للإشراف دون الحاجة إلى ضبط دقيق خاص بالمهمة.

Marina Litvak, Ariel Perstin, Ilan Shtilman, Michael Färber2026-08-07