💬 NLP

CLBench-V: Evaluating Multimodal Context Learning from Grounding to Knowledge Acquisition

تقدم هذه الورقة CLBench-V، وهو معيار شامل مصمم لتقييم تعلم السياق متعدد الوسائط عبر ثلاثة أبعاد رئيسية —التجذر، وتطبيق المعلومات الجديدة، واكتساب المعرفة— كاشفةً أن النماذج الحالية الرائدة لا تزال تعاني بشكل كبير في هذه المهام رغم التقدم في القدرات متعددة الوسائط.

Lai Wei, Chengqi Li, Jiapeng Li, Ruina Hu, Yue Wang, Weiran Huang2026-07-29
💬 NLP

Toward a systematic method for identifying language areas

تقترح هذه الورقة طريقة تجميع جغرافي منهجي لتحديد المناطق اللغوية ذات الأحجام التعسفية، مما يعالج الفجوة في تعريفات المناطق الكبرى الحالية المعتمدة على الخبراء، ويسمح بفصل أفضل للخصائص اللغوية العالمية عن آثار الاتصال المحلي أو الوراثة.

Hiram Ring2026-07-29
💬 NLP

CAST: Game Solvers as Turn-Level Teachers for LLM Agents

تقترح الورقة البحثية CAST، وهي طريقة تستفيد من تغيرات قيمة الحالة من أدوات حل الألعاب لتوليد إشارات ائتمان كثيفة على مستوى الدور لتدريب وكلاء النماذج اللغوية الكبيرة عبر التعلم التعزيزي باستخدام مكافآت قابلة للتحقق، متفوقة بشكل كبير على الخطوط المرجعية الحالية عبر بيئات ألعاب متنوعة.

Yu Wang, Yi-Kai Zhang, Wentao Shi, Ziang Ye, Yuchun Miao, Yueqing Sun, Qi Gu, Xunliang Cai, Lan-Zhe Guo, Han-Jia Ye, Ful (…)2026-07-29
💬 NLP

Every Time I Hire a Linguist, Inference Costs Go Down: On Linguistic Rules as Effective Prompt Compressors

تثبت هذه الورقة أن القواعد اللغوية الحتمية، التي تم اكتشافها من خلال البحث التطوري، يمكن أن تعمل كأدوات فعالة ومنخفضة التكلفة لضغط المطالبات (prompts) مما يقلل من نفقات استدلال النماذج اللغوية الكبيرة دون الحاجة إلى عمليات تمرير أمامي للنموذج أثناء عملية الضغط، محققةً أداءً يضاهي الطرق المتقدمة القائمة على النماذج اللغوية.

Jianfei Ma, Zhaoxin Feng, Emmanuele Chersoni, Si Chen2026-07-29
💬 NLP

Temporal-Distance JEPA: Plan-Aware Representation Learning for Latent World Model Predictive Control

تقترح هذه الورقة نموذج "التمثيل التنبؤي الزمني-المسافي" (TD-JEPA)، وهو نهج لنموذج عالم يستخرج تكاليف زمنية موجهة من مسارات غير مرتبطة بمكافآت ومأخوذة من بيانات سابقة لسد الفجوة بين تعلم التمثيل والتخطيط، مما يجعله يتفوق على المخططات القائمة على نماذج JEPA الحالية عبر بيئات متعددة من خلال تمكين ترتيب أكثر فعالية لتقدم الأهداف دون الاعتماد على إعادة بناء البكسلات أو مكافآت صريحة.

Jiaxin Bai, Jiaxuan Xiong2026-07-29
💬 NLP

Inspect India Evals: An Open Benchmarking Framework for Evaluating Large Language Models in the Indian Linguistic and Cultural Context

تقدم الورقة البحثية "Inspect India Evals"، وهو إطار عمل مفتوح المصدر للتقييم مبني على منصة Inspect AI التابعة للمعهد البريطاني لسلامة الذكاء الاصطناعي (UK AISI) لمعالجة نقص التقييمات ذات الصلة ثقافياً ولغوياً للنماذج اللغوية الكبيرة في الهند، وذلك عبر اختبار ستة معايير محددة عبر ست عشرة لغة، مما يكشف أن نماذج مثل Sarvam-M وGemma 2 تتفوق على نظيراتها الأكبر حجماً في المعرفة الثقافية الهندية والامتثال لمعايير السلامة.

Abhishek Kumar Singh, Shrey Nag, Sachita, Lipi Goel, Rajeshwar Singh Janwar2026-07-29
💬 NLP

Memory for Large Language Models

تقدم هذه الدراسة المسحية تصنيفاً منهجياً متمحوراً حول البنية الهيكلية للذاكرة في النماذج اللغوية الكبيرة، موحدةً بذلك الأبحاث المجزأة من خلال إطار عمل ثلاثي المحاور يشمل التمثيل، وديناميكيات التحديث، والاستمرارية، لتوجيه التصميمات المستقبلية القابلة للتوسع والتكيف.

Sining Zhoubian, Dan Zhang, Evgeny Kharlamov, Jie Tang2026-07-29
🤖 AI

HANDBOOK.md: A Benchmark for Long-Context Agentic Instruction Following

تقدم هذه الورقة HANDBOOK.md، وهو معيار مرجعي يتكون من 65 مهمة وكيلية حتمية عبر خمسة مجالات لتقييم ما إذا كان بإمكان وكلاء النماذج اللغوية الالتزام الصارم بوثائق سياسة طويلة وملزمة عبر آفاق ممتدة من استخدام الأدوات، مما يكشف أن حتى النماذج الرائدة تعاني من أجل منع تجاوز السياسات والحفاظ على الامتثال للقواعد، حيث حقق أفضل تكوين نسبة نجاح بلغت 36.2% فقط.

Liudas Panavas, Sebastian Minus, Bradley Monton, Derek Ray, Suhaas Garre, Sushant Mehta, Edwin Chen2026-07-29
💬 NLP

Forensic Reproducibility Audit of a Radiology Vision-Language Model Benchmark: From Intended Protocol to Released Artifact

تقدم هذه الورقة تدقيقاً جنائياً لإعادة إنتاج معيار نموذج لغوي بصري لصور الأشعة السينية للصدر، والذي كشف عن تباينات حرجة في عرض البيانات، وتتبع مسارات الاستيراد والاستدعاء المحفوظة لدعم استنتاج بشأن ربط المطالبات، وتحليلاً إحصائياً — بما في ذلك التوضيح بأنه بينما أنتج تحليل المجموعة الثابتة ٢٧/٤٥ مقارنة غير معدلة و٢٠/٤٥ مقارنة معدلة بطريقة هولم، فقد تم إعادة إنتاج نتيجة ٢٨/٤٥ في تحليل منفصل للمقارنات المتاحة زوجياً حيث استخدمت كل مقارنة مقامها الخاص — مما أدى إلى سحب الادعاءات الأصلية المتعلقة بالأداء وعدم توافق تقارير الملصقات الآلية واقتراح ضوابط قابلة للتحقق آلياً لضمان سلامة النواتج المستقبلية.

Mateusz Kozłowski2026-07-29✓ Author reviewed
💬 NLP

PILA: Plug-and-Play Insertion for LLM-native Advertising

تقدم الورقة البحثية PILA، وهو نموذج جانبي (sidecar) مستقل عن النموذج ومستقل عن نوع النموذج (model-agnostic) وقابل للتوصيل والتشغيل الفوري، يعمل على فصل عملية إدراج الإعلانات عن توليد المحتوى لتمكين إعلانات عالية الجودة وقابلة للتحكم ومتوافقة مع النماذج اللغوية الكبيرة (LLM-native) دون تعديل النموذج الأساسي أو المساس بجودة الاستجابة.

Zhaowei Zhang, Yuhan Fu, Yihang Zhang, Xiaohan Liu, Ceyao Zhang, Xiaoyuan Zhang, Yipeng Kang, Tonghan Wang, Yaodong Yang2026-07-29