💬 NLP

Beyond Two Bytes per Letter: Tokenization Overhead in Cyrillic AI Systems

تُحدد هذه الورقة البحثية كمياً العبء الإضافي الكبير في عملية التجزئة (tokenization) الذي تواجهه اللغة الأوكرانية وغيرها من اللغات السيريلية في أنظمة الذكاء الاصطناعي الحديثة مقارنة باللغة الإنجليزية، موضحةً أن هذا التفاوت ينبع من تخصيص بيانات التدريب، ولكن يمكن التخفيف من حدته بفعالية من خلال تقنيات الضغط أثناء الاستنتاج أو عبر تدريب أجهزة تجزئة "BPE" متوازنة على مستوى البايت.

Ivan Dobrovolskyi2026-08-25
💻 computer science

Generative Gap Filling

تتحدى هذه الورقة الافتراض القانوني القائل بأن العقود تحتوي على معلومات قليلة للغاية لحل النزاعات، وذلك من خلال إثبات قدرة النماذج اللغوية الكبيرة على إعادة بناء الشروط المحجوبة وغير المكتوبة بدقة من النص المتبقي، مما يشير إلى وجوب معاملة المحاكم لتنبؤات هذه النماذج كأدلة قابلة للطعن لسد الفجوات التعاقدية.

Yonathan A. Arbel, David A. Hoffman2026-08-25
💬 NLP

Mitigating Bias in Large Vision-Language Models via Counterfactual Ensemble Decoding

تقترح هذه الورقة "فك التشفير بالتعليق التوضيحي للمجموعات المتعددة عبر التناقض الشرطي" (CED)، وهو إطار عمل مبتكر يعمل على تخفيف التحيزات الاجتماعية في النماذج اللغوية البصرية الكبيرة من خلال بناء وتجميع منظورات تناقض شرطي متعددة المجموعات داخل فضاء التمثيل البصري لتعزيز التوليد العادل مع الحفاظ على القدرات الجوهرية للنموذج.

Yisong Xiao, Aishan Liu, Yongxin Huang, Zonghao Ying, Shiji Zhao, Tianlin Li, Yong Han, Jian Yang, Xianglong Liu2026-08-25
💬 NLP

Agentic Security: A Systematization of Tools, Failure Modes, and Design Laws for LLM-Driven Penetration Testing

تعمل هذه الورقة على تنظيم الإخفاقات التشغيلية لأدوات اختبار الاختراق المدفوعة بالنماذج اللغوية الكبيرة من خلال تقييم عملي، مستخلصةً قوانين تصميم كمية ومؤشر احتكاك رباعي الأبعاد لتوجيه بناء أنظمة أمنية وكيلية قوية، متمثلة في منصة Inspectra.

Israt Moyeen Noumi, Tarannum Ahmed Nowshin, Md. Mehedi Hasan Nipu, Mohammad Sakib Mahmood, Md. Jakir Hossain, M. F. Mrid (…)2026-08-25
💬 NLP

Forgotten in Weights, Recovered by Tools: Agentic Tool Unlearning for LLM Agents

تقدم هذه الورقة البحثية "إلغاء تعلم الأدوات الوكيل" (Agentic Tool Unlearning - ATU)، وهو إطار عمل ثنائي المراحل يجمع بين كبت المعرفة البارامترية والتعلم التعزيزي على مستوى المسار لمنع وكلاء النماذج اللغوية الكبيرة من استعادة المعلومات المنسية عبر الأدوات الخارجية مع الحفاظ على فائدتهم فيما يتعلق بالمعرفة المستبقاة.

Baicheng Chen, Zheyuan Liu, Jingyu Zhang, Kaize Ding, Ningshan Ma, Yue Huang, Meng Jiang2026-08-25
💬 NLP

Automating Multi-Hop RAG Evaluation via TRIAD: From Context Extraction to Validated Dataset Generation

تقدم هذه الورقة البحثية TRIAD، وهو إطار عمل مؤتمت ثلاثي المراحل يقوم بتوليد والتحقق من صحة مجموعات بيانات الأسئلة والأجوبة متعددة القفزات ذات النطاق المحدد مع سياقات مصنفة حسب الصلة لتقييم أنظمة التوليد المعزز بالاسترجاع (RAG) بفعالية على البيانات المملوكة.

Lorenz Brehme, Adam Jatowt2026-08-25
💬 NLP

Evidence-State Reliability Under Controlled Degradation: Parser-Validity Divergence in a Multi-Stage LLM Pipeline

تقدم هذه الورقة "موثوقية حالة الدليل" (ESR) كمعيار تقييم متميز عن صلاحية المحلل، وتوضح من خلال تجربة مسار عمل متعدد المراحل لنماذج اللغات الكبيرة (LLM) ومنضبطة، أنه في حين قد يظل التوافق الهيكلي مستقراً أو متحسناً في ظل تدهور الأدلة، فإن الموثوقية الفعلية والنجاح الوظيفي للمراحل اللاحقة يتدهوران بشكل كبير.

Naimur Rahman2026-08-25
🤖 AI

K-Bench: measuring model performance on real scientific agent requests

يقدم K-Bench إطار تقييم مبتكر لوكلاء الذكاء الاصطناعي العلميين باستخدام طلبات مستخدمين حقيقية وغير محددة بدقة وتقييم أعمى من عدة حكام، مما يكشف أن النماذج الرائدة الحالية لا تزال تعاني في تلبية عتبة العمل المقبول لدى العلماء المتخصصين باستمرار، مع تحديد الدقة العلمية والمبالغة في الادعاء كأشكال رئيسية للفشل.

Aubrey Brueckner, Darshil Patel, Yuhuan He, Timothy Kassis2026-08-25
💬 NLP

Can LLMs Truly Forget? Revealing Unlearning Gaps Through Adversarial Evaluation

تكشف هذه الورقة عن فجوة كبيرة بين مقاييس الاستعلام النظيف القياسية والمتانة الخصامية في عملية "إلغاء التعلم" (machine unlearning)، حيث تُظهر أنه بينما تبدو أساليب الضبط الدقيق ناجحة في نسيان البيانات بموجب التقييم التقليدي، إلا أن المعلومات المستهدفة تظل قابلة للاسترداد بدرجة عالية من خلال التلقين الاستراتيجي، مما يسلط الضوء على الحاجة الماسة لاختبار الإجهاد الخصامي لضمان إلغاء تعلم حقيقي.

Ayush Gupta, Hima Varshini Surisetty, Sreevidya Bollineni, Varad Ingale, Tuhina Tripathi, Abhishek Lalwani, Somya Chatte (…)2026-08-25
🤖 AI

Measuring Activation Control in Large Language Models

تقدم هذه الورقة "معيار قابلية التحكم في التنشيط" (Activation Controllability Benchmark) لتوضيح أن النماذج اللغوية الكبيرة يمكنها تعديل تنشيطات تدفق المتبقي الداخلي (residual stream activations) بشكل متعمد عبر تعليمات باللغة الطبيعية، وهي قدرة يمكنها التهرب جزئياً من طرق مراقبة الفضاء الكامن الحالية وتفرض تحدياً كبيراً لنشر النماذج بشكل آمن.

Marek Mateusz Kowalski, Joshua Fonseca Rivera, Uzay Macar, David Demitri Africa2026-08-25