💬 NLP

Prompt Stability Scoring for Text Annotation with Large Language Models

تتناول هذه الورقة البحثية ضعف تعليق النصوص بواسطة النماذج اللغوية الكبيرة تجاه تغيرات الأوامر (prompts) عبر اقتراح إطار عمل عام يسمى "درجة استقرار الأوامر" (PSS)، والذي يُطوع مقاييس الموثوقية التقليدية لتشخيص مشكلات الاستقرار، ويتضمن حزمة بلغة بايثون للتنفيذ العملي.

Christopher Barrie, Elli Palaiologou, Petter Törnberg2026-05-18
💬 NLP

TokenButler: Token Importance is Predictable

يُعد TokenButler متنبئاً خفيف الوزن وواعياً بالاستعلام، يقوم بتحديد الرموز (tokens) الحرجة ديناميكياً لإدارة ذاكرة التخزين المؤقت لـ KV بكفاءة عبر تقطير توزيعات الانتباه السببي المقنع، محققاً دقة استرجاع تقارب الدقة المثالية (near-oracle) وخفضاً كبيراً في زمن الاستجابة دون طرد الرموز بشكل دائم.

Yash Akhauri, Ahmed F AbouElhamayed, Yifei Gao, Chi-Chih Chang, Sameh Gobriel, Nilesh Jain, Mohamed S. Abdelfattah2026-05-18
💬 NLP

Do Chinese models speak Chinese languages?

تكشف هذه الدراسة أنه على الرغم من المشهد اللغوي المتنوع في الصين، فإن نماذجها اللغوية الكبيرة ذات الأوزان المفتوحة تظهر ملفات أداء متعددة اللغات مشابهة بشكل صارخ للنماذج الغربية — حيث تتفوق في اللغات العالمية الرئيسية مثل الماندرين والفرنسية والألمانية بينما تخفق غالباً في دعم لغات الأقليات مثل الكازاخية والأويغورية — مما يشير إلى أن ممارسات القياس العالمي وموارد التدريب المشتركة تدفع نحو تجانس قدرات اللغة على حساب الأولويات المحلية.

Andrea W Wen-Yi, Unso Eun Seo Jo, David Mimno2026-05-18
💬 NLP

KG-HTC: Integrating Knowledge Graphs into LLMs for Effective Zero-shot Hierarchical Text Classification

تقترح الورقة البحثية KG-HTC، وهي طريقة تصنيف نصوص هرمي بنمط التعلم الصفري، تدمج الرسوم البيانية للمعرفة مع النماذج اللغوية الكبيرة عبر التوليد المعزز بالاسترجاع لمعالجة تحديات مثل فضاءات التصنيف الضخمة وتوزيعات الذيل الطويل بفعالية، مما يظهر تحسينات ملحوظة في الأداء مقارنة بالنماذج المرجعية على مجموعات بيانات متعددة.

Qianbo Zang, Christophe Zgrzendek, Igor Tchappi, Afshin Khadangi, Johannes Sedlmeir2026-05-18
💬 NLP

VideoGameBench: Can Vision-Language Models complete popular video games?

تقدم الورقة البحثية VideoGameBench، وهو معيار قياسي حيث يتعين على نماذج الرؤية واللغة لعب ألعاب فيديو من حقبة التسعينيات باستخدام المدخلات البصرية الخام والتعليمات عالية المستوى فقط، مما يكشف أن حتى النماذج المتطورة تعاني بشكل كبير في اللعب في الوقت الفعلي بسبب القيود في الإدراك، والملاحة المكانية، وزمن انتقال الاستدلال.

Alex L. Zhang, Thomas L. Griffiths, Karthik R. Narasimhan, Ofir Press2026-05-18
💬 NLP

Smoothie: Smoothing Diffusion on Token Embeddings for Text Generation

تقدم الورقة البحثية "Smoothie"، وهي طريقة انتشار (diffusion) مبتكرة لتوليد النصوص تعمل على تنعيم تضمينات الرموز (token embeddings) تدريجياً بناءً على التشابه الدلالي لسد الفجوة بفعالية بين الفضاءات الكامنة المستمرة وفك تشفير الرموز المنفصلة، محققةً جودة توليد متفوقة مقارنة بنماذج الانتشار الحالية.

Alexander Shabalin, Viacheslav Meshchaninov, Dmitry Vetrov2026-05-18
💬 NLP

Blending Supervised and Reinforcement Fine-Tuning with Prefix Sampling

تقدم هذه الورقة Prefix-RFT، وهي طريقة ضبط دقيق هجينة تدمج بين الضبط الدقيق الخاضع للإشراف والضبط الدقيق بالتعزيز من خلال أخذ عينات البادئة للتغلب على قيود كل نهج على حدة، مما يظهر أداءً فائقًا ومتانة في مهام الاستدلال الرياضي.

Zeyu Huang, Tianhao Cheng, Zihan Qiu, Zili Wang, Yinghui Xu, Edoardo M. Ponti, Ivan Titov2026-05-18
💬 NLP

Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty

تقدم هذه الورقة البحثية RLCR (التعلم التعزيزي مع مكافآت المعايرة)، وهو نهج تدريب مبتكر يعزز مكافآت الصحة الثنائية بنتيجة "براير" (Brier score) لتحسين الدقة والثقة المعايرة للنماذج اللغوية في آن واحد، مما يقلل من الهلوسة وتدهور المعايرة الذي غالباً ما يسببه التعلم التعزيزي القياسي.

Mehul Damani, Isha Puri, Stewart Slocum, Idan Shenfeld, Leshem Choshen, Yoon Kim, Jacob Andreas2026-05-18
📊 statistics

Painless Activation Steering: An Automated, Lightweight Approach for Post-Training Large Language Models

تقدم هذه الورقة البحثية "توجيه التنشيط غير المؤلم" (Painless Activation Steering - PAS)، وهو أسلوب مؤتمت بالكامل وخفيف الوزن يقوم ببناء ناقلات التنشيط من مجموعات البيانات المصنفة دون تدخل بشري لتوجيه النماذج اللغوية الكبيرة بفعالية نحو السلوكيات المرغوبة، متفوقاً على التقنيات الحالية في القدرة على التحكم والكفاءة مع إظهار فعالية محددة للمهام الموجهة نحو السلوك.

Sasha Cui, Zhongren Chen2026-05-18✓ Author reviewed
💬 NLP

How to Train Your Advisor: Steering Black-Box LLMs with Advisor Models

تقدم هذه الورقة "نماذج المستشار" (Advisor Models)، وهي طريقة لتدريب نماذج صغيرة مفتوحة الأوزان لتوليد نصائح لغوية طبيعية ديناميكية لكل حالة على حدة، مما يعمل بفعالية على توجيه وتعزيز أداء النماذج اللغوية الكبيرة الأمامية غير القابلة للوصول (black-box) من خلال التحسين البارامتري دون تعديل أوزانها.

Parth Asawa, Alan Zhu, Abigail O'Neill, Matei Zaharia, Alexandros G. Dimakis, Joseph E. Gonzalez2026-05-18