🤖 machine learning

FreeKV: Boosting KV Cache Retrieval for Efficient LLM Inference

يُعد FreeKV إطار عمل خالٍ من التدريب يجمع بين الاسترجاع التخميني، والتصحيح دقيق التفاصيل، وإدارة الذاكرة الهجينة بين المعالج المركزي ومعالج الرسوميات لتسريع استرجاع ذاكرة التخزين المؤقت (KV cache) للنماذج اللغوية الكبيرة بشكل كبير، محققاً تسريعاً يصل إلى 13 ضعفاً مقارنة بأحدث الطرق الحالية مع الحفاظ على دقة تقارب الدقة الأصلية.

Guangda Liu, Chengwei Li, Zhenyu Ning, Jing Lin, Yiwu Yao, Danning Ke, Minyi Guo, Jieru Zhao2026-03-10
💬 NLP

SwingArena: Competitive Programming Arena for Long-context GitHub Issue Solving

تُعد SwingArena إطار تقييم تنافسي يحاكي سير عمل تطوير البرمجيات في العالم الحقيقي عبر إقران النماذج اللغوية الكبيرة (LLMs) كجهات مقدمة للرقع البرمجية ومراجعين لها ضمن مسار عمل مدفوع بالتكامل المستمر (CI)، وذلك باستخدام وحدة توليد أكواد تعتمد على الاسترجاع المعزز لحل مشكلات GitHub ذات السياق الطويل بفعالية عبر لغات برمجة متعددة.

Wendong Xu, Jing Xiong, Chenyang Zhao, Qiujiang Chen, Haoran Wang, Hui Shen, Zhongwei Wan, Jianbo Dai, Taiqiang Wu, He X (…)2026-03-10
🤖 machine learning

MMTU: A Massive Multi-Task Table Understanding and Reasoning Benchmark

تقدم هذه الورقة البحثية MMTU، وهو معيار مرجعي واسع النطاق يضم أكثر من 28,000 سؤال عبر 25 مهمة جدولية واقعية على مستوى الخبراء، صُمم لتقييم وكشف القيود الكبيرة للنماذج الرائدة الحالية في فهم واستنتاج ومعالجة البيانات الجدولية المهيكلة بشكل شامل.

Junjie Xing, Yeye He, Mengyu Zhou, Haoyu Dong, Shi Han, Lingjiao Chen, Dongmei Zhang, Surajit Chaudhuri, H. V. Jagadish2026-03-10
💬 NLP

CyclicReflex: Improving Reasoning Models via Cyclical Reflection Token Scheduling

تُعد CyclicReflex استراتيجية فك تشفير خالية من التدريب تعمل على تحسين أداء النماذج الاستدلالية الكبيرة أثناء الاختبار عبر جدولة توكنات التأمل بشكل تكيفي باستخدام موجة مثلثية ثنائية الاتجاه، مما يوازن بفعالية بين الإفراط في التأمل والتقليل منه لتحقيق مكاسب ثابتة عبر مختلف المعايوهات وأحجام النماذج.

Chongyu Fan, Yihua Zhang, Jinghan Jia, Alfred Hero, Sijia Liu2026-03-10
💬 NLP

Goal Alignment in LLM-Based User Simulators for Conversational AI

تقدم هذه الورقة تتبع حالة هدف المستخدم (UGST)، وهو إطار عمل ومنهجية ثلاثية المراحل تمكن محاكيات المستخدم القائمة على النماذج اللغوية الكبيرة من تتبع تقدم الأهداف ذاتياً وتوليد استجابات متوافقة مع الأهداف، مما يحسن الأداء بشكل كبير في معايير MultiWOZ 2.4 وτ\tau-Bench.

Shuhaib Mehri, Xiaocheng Yang, Takyoung Kim, Gokhan Tur, Shikib Mehri, Dilek Hakkani-Tür2026-03-10
🤖 machine learning

Linear probes rely on textual evidence: Results from leakage mitigation studies in language models

تُظهر هذه الورقة أن المجسات الخطية المستخدمة للكشف عن السلوكيات الضارة في النماذج اللغوية تعتمد بشكل كبير على الأدلة النصية الصريحة، حيث يتدهور أداؤها بشكل ملحوظ عند تصفية مثل هذه الإشارات السطحية أو عندما يتم تدريب النماذج على إظهار السلوكيات دون التعبير عنها لفظياً.

Gerard Boxo, Aman Neelappa, Shivam Raval2026-03-10
💬 NLP

Mapping Overlaps in Benchmarks through Perplexity in the Wild

تقدم هذه الورقة "التوقيعات المرجعية" — وهي مجموعات من الرموز البارزة من مجموعات النصوص الطبيعية التي يتنبأ مستوى حيرة (perplexity) النماذج تجاهها بالأداء — للكشف عن التداخلات الدقيقة والقدرات المتمايزة عبر 89 معياراً لتقييم النماذج اللغوية الكبيرة، مما يقدم بديلاً قوياً لارتباطات الأداء الخام لفهم مشهد قدرات النماذج اللغوية الكبيرة والتباعد بين التنظيم الدلالي للآلة والبشر.

Siyang Wu, Honglin Bao, Sida Li, Ari Holtzman, James A. Evans2026-03-10
🤖 machine learning

Your Agent May Misevolve: Emergent Risks in Self-evolving LLM Agents

تقدم هذه الورقة مفهوم "التطور السيئ" (misevolution) وتتحقق منه تجريبيًا، مبرهنةً على أن وكلاء النماذج اللغوية الكبيرة ذاتية التطور يواجهون مخاطر ناشئة واسعة النطاق عبر مسارات النموذج والذاكرة والأدوات وسير العمل، مما قد يؤدي إلى تدهور السلامة وثغرات غير مقصودة، وهو ما يسلط الض الضوء على الحاجة الملحة لنماذج سلامة جديدة.

Shuai Shao, Qihan Ren, Chen Qian, Boyi Wei, Dadi Guo, Jingyi Yang, Xinhao Song, Linfeng Zhang, Weinan Zhang, Dongrui Liu (…)2026-03-10
💬 NLP

TokMem: One-Token Procedural Memory for Large Language Models

يقدم TokMem إطار عمل للذاكرة الإجرائية يقوم بتجميع إجراءات المهام القابلة لإعادة الاستخدام في رموز (tokens) قابلة للتدريب واحدة لتوجيه توليد النماذج اللغوية الكبيرة بتكلفة إضافية ثابتة، مما يتيح الإضافة المستمرة لسلوكيات جديدة مع التفوق على التلقين المعزز بالاسترجاع ومضاهاة الضبط الدقيق كفء المعلمات بعدد أقل من المعلمات.

Zijun Wu, Yongchang Hao, Lili Mou2026-03-10
🔬 materials science

Automated Extraction of Material Properties using LLM-based AI Agents

تقدم هذه الدراسة سير عمل وكيلًا (agentic workflow) يعتمد على النماذج اللغوية الكبيرة (LLM)، وهو مؤتمت ومنخفض التكلفة، نجح في استخراج أكثر من 27,000 سجل للخصائص الكهروحرارية والإنشائية من حوالي 10,000 مقال علمي، مما أدى إلى إنشاء أكبر مجموعة بيانات منسقة بواسطة النماذج اللغوية الكبيرة حتى الآن، وتأسيس ركيزة قابلة للتوسع للاكتشاف القائم على البيانات للمواد.

Subham Ghosh, Abhishek Tewari2026-03-10