💬 NLP

Measuring the Cross-Lingual Comprehension Gap: How the language of the evidence shapes what language models understand

تقدم هذه الدراسة مفهوم "فجوة الاستيعاب عبر اللغات" (CLCG) لتوضيح أن النماذج اللغوية تظهر قدرات استيعابية منخفضة بشكل كبير في اللغات غير الإنجليزية مقارنة باللغة الإنجليزية، مما يكشف أن التقييمات المتمحورة حول اللغة الإنجليزية تبالغ في تقدير الأداء لمستخدمي اللغات ذات الموارد المنخفضة.

Rafael da Silva, Jeff Eicher2026-08-10
💬 NLP

GRASP: Reinforcing Language Model Anonymizers with Group Relative Policy Optimization

تقدم الورقة البحثية إطار عمل GRASP، وهو إطار عمل لإخفاء الهوية على الأجهزة يستفيد من تحسين السياسة النسبي للمجموعات (GRPO) لتدريب نموذج صغير واحد ليعمل في آن واحد كمجهل للهوية، ومهاجم، وحكم على المنفعة، مما يحقق مقايضات متفوقة بين الخصوصية والمنفعة مقارنة بالطرق الحالية القائمة على التقطير، مع القضاء على الحاجة إلى إرسال البيانات الخاصة إلى خوادم طرف ثالث.

Sajjad Ghiasvand, Nader Sehatbakhsh2026-08-10
💬 NLP

Lost in Interpolation: Why Predictive Feedback Fails in Diffusion Language Models

تحدد هذه الورقة أن الاستيفاء الخطي الإقليدي المستخدم في نماذج لغة الانتشار المقنعة الحالية غير متوافق هندسيًا مع فضاء التضمين الكروي الخاص بها، وتقترح "التقنيع الناعم الكروي" (S-SM)، وهي طريقة تستخدم الاستيفاء الخطي الكروي مما يحسن بشكل كبير جودة التوليد والارتباك دون التأثير سلبًا على التقارب.

Lavanya Nigam, Ishaan Bansal, Aryan Sood, Vidit Aggarwal, Gaurav Kumar Nayak2026-08-10
💬 NLP

Confidence Estimation for Financial Vision-Language Models in Chart and Document Understanding

تقيم هذه الورقة طرق تقدير الثقة لنماذج الرؤية واللغة المالية، حيث تجد أنه بينما تفتقر النماذج المرجعية القائمة على الاستدلال فقط إلى المعايرة اللازمة للأتمتة الآمنة، فإن مسابير محددة مدربة يمكنها تمييز الإجابات الموثوقة عن الهلوسة بفعالية، رغم أن الحجم الإجمالي للمهام القابلة للأتمتة بأمان يظل مقيداً بالكفاءة الجوهرية للنموذج بدلاً من مجرد درجات الثقة الخاصة به.

Reza Khanmohammadi, Simerjot Kaur, Charese H. Smiley, Ivan Brugere, Mohammad M. Ghassemi2026-08-10
💬 NLP

Model Confidence Under Answer-Preserving Attacks: An Informativeness-Manipulability Frontier

تُثبت هذه الورقة أن قراءات الثقة في أنظمة الرؤية واللغة المنشورة معرضة بشدة لهجمات الحفاظ على الإجابة، مما يثبت أنها تعمل كإشارات مراقبة حساسة للنزاهة بدلاً من كونها إشارات مراقبة قوية قادرة على التلاعب لقبول إجابات غير صحيحة أو خفض الدقة الإجمالية إلى ما دون المستويات المرجعية.

Reza Khanmohammadi, Ivan Brugere, Simerjot Kaur, Charese H. Smiley, Kundan Thind, Mohammad M. Ghassemi2026-08-10
💬 NLP

Pre-Inference Routing for Cost-Efficient Document Field Extraction

تقترح هذه الورقة إطار عمل للتوجيه قبل الاستنتاج يتنبأ بصعوبة المستند باستخدام ميزات غير مكلفة للاختيار الديناميكي بين نماذج استخراج رخيصة وأخرى قوية، محققاً تخفيضات كبيرة في التكلفة (تصل إلى 77%) دون التضحية بالدقة، ولكن فقط لأنواع معينة من النصوص حيث تفشل النماذج الأرخص بشكل متكرر وتكون حالات الفشل تلك قابلة للتنبؤ.

Sreerekha Rajendran2026-08-10
💬 NLP

The Horizon Gap: Planning, Memory, Execution, Training, and Evaluation for Long-Horizon LLM Agents

تُعرّف هذه الورقة "فجوة الأفق" بأنها إخفاق النماذج اللغوية الرائدة في المهام متعددة الخطوات، وتستعرض 1,547 دراسة حديثة للتمييز بين خصائص المهمة والنموذج والنظام، وتجادل بأن تحول المجال نحو إشارات أكثر كثافة على مستوى الخطوة هو استجابة ضرورية لتضاؤل المعلوماتية الناتجة عن التغذية الراجعة القائمة على النتيجة فقط مع طول آفاق المهمة.

Mingguang Chen, Licheng Wang, Bo Qu2026-08-10
💬 NLP

TA-RAG: Tone Awareness as a Design Imperative for Retrieval-Augmented Generation

تقدم هذه الورقة البحثية نظام "الاسترجاع المعزز بالتوليد المدرك للنبرة" (TA-RAG)، وهو إطار مفاهيمي يعالج القصور الهيكلي في أنظمة "الاسترجاع المعزز بالتوليد" القياسية التي تتجاهل تفضيلات نبرة المستخدم بسبب أساليب الوثائق المسترجعة، وذلك عبر اقتراح بنية جديدة تدمج قيود المحاذاة التواصلية إلى جانب الدقة الواقعية لمنع عدم المحاذاة في السياقات الحساسة اجتماعياً.

Yong-Bin Kang, Anthony McCosker2026-08-10
💬 NLP

Online Monitoring and Corrective Steering of Programming Agents

تقدم هذه الورقة LivePlan، وهو إطار عمل فعال من حيث التكلفة يعزز أداء الوكلاء البرمجيين في معالجة مشكلات GitHub المعقدة عبر توظيف مراقب حتمي للكشف عن الانحرافات السلوكية في الوقت الفعلي واستشارة مستشار يعتمد على النماذج اللغوية الكبيرة بشكل انتقائي لإجراء تصحيحات مستهدفة، محققاً بذلك تحسينات كبيرة في معدل الحل مع حد أدنى من الأعباء الإضافية.

Shuyang Liu, Saman Dehghan, Ji Young Kim, Jatin Ganhotra, Martin Hirzel, Reyhaneh Jabbarvand2026-08-10
💬 NLP

IB-RL: Isolated Bilateral Reinforcement Learning for Strategic Dialogue Agents

تقدم هذه الورقة البحثية التعلم التعزيزي الثنائي المعزول (IB-RL)، وهو نموذج تدريب مبتكر يطور وكلاء الحوار بشكل مشترك مع عزل صارم لكل وكيل للتغلب على عدم التوافق مع النظير الثابت وتحقيق تعميم فائق ضد الخصوم الاستراتيجيين غير المرئيين مقارنة بنهج التعلم التعزيزي أحادي الجانب التقليدي.

Senhao Wang, Chenghao Cai, Haitao Hu, Mingxing Huang, Xingguang Wang, Wenhao Li, Zecheng Lin2026-08-10