💬 NLP

The Best Programming Language for Tokenmaxxing: An Investigation of Coding Agent Behavior Across Programming Languages

تبحث هذه الورقة في كيفية إظهار وكلاء البرمجة تباينات كبيرة ومتسقة في استهلاك الرموز (tokens) عبر لغات البرمجة المختلفة، كاشفةً أن عدم الكفاءة ينبع من سلوكيات مثل توليد كود غير قابل للتجميع في اللغات غير المألوفة، وعدم الثقة في الاختبارات المقدمة، والقيام بالنمذجة الأولية بلغة بايثون، مما يرسخ كفاءة استهلاك الرموز حسب اللغة كمعيار حاسم للتقييم وتحسين التكلفة.

Zixuan Wu, Carolyn Jane Anderson, Arjun Guha2026-07-28
🤖 machine learning

Frustratingly Simple Black-Box Adaptation of Language Models via Logit Bias

تقدم هذه الورقة طريقة تكييف خفيفة الوزن وصندوقية سوداء تتعلم متجه انحياز لوجيت (logit-bias) واحد غير معتمد على السياق عبر هدف تعلم تعزيزي منظم بتباعد كولباك - ليبلر (KL-regularized) لتحسين أداء النماذج اللغوية في مهام الاستنتاج دون تعديل أوزان النموذج أو الحاجة إلى الوصول إلى التدرجات.

Ofek I. Cohen, Lior Shani, Aviv Rosenberg, Ankur Samanta, Tal Wagner, Yonathan Efroni2026-07-28
💬 NLP

Language-Routed RAG and Direct Option Scoring for Multilingual Financial QA: DS@GT at FinMMEval

يقترح فريق DS@GT مساراً موجهاً باللغة ومعززاً بالاسترجاع للأسئلة والأجوبة المالية متعددة اللغات يجمع بين تضمينات BGE-M3 ودمج الرتب العكسي الموزون وتسجيل الخيارات المباشر عبر احتمالات اللوغاريتم للرمز التالي، مما يثبت أن الأداء الأمثل يتطلب اختيار نماذج خاصة بكل لغة وتجنباً دقيقاً لتلقين سلسلة الأفك "chain-of-thought" لبعض اللغات.

Justice Ayela, Kabir Sahni2026-07-28✓ Author reviewed
💬 NLP

PatiGonit22K: A Comprehensive Dataset for Solving Complex Bengali MWPs

تقدم هذه الورقة PatiGonit22K، وهي مجموعة بيانات شاملة ومكيفة ثقافياً تضم 22,441 مسألة لفظية رياضية باللغة البنغالية مشروحة، صُممت لتعزيز الأبحاث في الاستدلال الرياضي ومعالجة اللغات الطبيعية التعليمية للغات ذات الموارد المنخفضة.

Swastika Kundu, Azizul Hakim Fayaz, Tashreef Muhammad2026-07-28
💬 NLP

CHiPS: Character Histograms and Positional Signals for Lightweight Authorship Attribution in Romanian Texts

تقدم هذه الورقة البحثية CHiPS، وهي طريقة خفيفة الوزن وشفافة لنسب التأليف على مستوى الحروف للنصوص الرومانية، تستخدم المخططات التكرارية للحروف وإشارات الطيف الموضعية لتحقيق دقة عالية دون الاعتماد على التجزئة، أو التحليل النحوي، أو النماذج اللغوية الكبيرة، مع إثبات فعالية مجموعات الميزات المقيدة تحت رقابة صارمة على تسرب البيانات.

Sanda-Maria Avram, George C. Ţurcaş2026-07-28
💬 NLP

Simple Language Normalization Wins: Cross-Lingual Speaker Verification for the TidyVoice 2026 Challenge

تُظهر هذه الورقة أن تطبيق إسقاط سمة الإزعاج (NAP) البسيط لتطبيع اللغة في فضاء التضمين، مقترناً بتطبيع الدرجة المتماثل التكيفي، يحسن بشكل كبير أداء التحقق من هوية المتحدث عبر اللغات في تحدي TidyVoice 2026، مما يضاهي الأنظمة الأكثر تعقيداً.

Nina Hosseini-Kivanani2026-07-28
💬 NLP

Beyond Direct Answering: Aligning Educational LLMs as Socratic Guides via Heuristic Reinforcement Learning

تقدم هذه الورقة HeuristicEdu، وهو إطار عمل للتعلم التعزيزي ثنائي المراحل يعمل على مواءمة نموذج Qwen2.5-7B ليعمل كمرشد سقراطي بدلاً من مجرد مجيب مباشر، محققاً تحسينات كبيرة في فعالية الدعم التعليمي وتقليل تسرب المفاهيم من خلال المكافآت الاستدلالية وتحسين السياسة النسبي للمجموعات.

Xiaokun Wang, Siyu Song, Wentao Liu, Xiaodong Zou2026-07-28✓ Author reviewed
💬 NLP

Similarity Is Not Logic: Factored Inference for Dual-Encoder Vision-Language Models

تحدد هذه الورقة أن نماذج الرؤية واللغة ذات المشفر المزدوج تفشل في الاستدلال التركيبي بسبب واجهة تشابه "حقيبة المفاهيم"، وتقترح طريقة لا تتطلب تدريباً تسمى LCSE (تحرير الدرجة المقيد بالمنطق) التي تفصل استخراج الأدلة عن تنفيذ القيود لتحسين الدقة المنطقية بشكل كبير مع الحفاظ على أداء الاسترجاع.

Sultan Alshehri, Zhantao Yang, Han Zhang, Marios Savvides2026-07-28
🤖 machine learning

Through the Bottleneck: How Multi-head Latent Attention Separates Content from Position in Language Models

تقدم هذه الورقة أول دراسة في التفسير الآلي لآلية الانتباه الكامن متعدد الرؤوس (MLA)، كاشفةً أن عنق الزجاجة منخفض الرتبة الخاص بها يفصل بفعالية بين المحتوى والموقع عبر الحفاظ على هوية الكيان مع التخلص من المعلومات الموضعية، مما يعيد تشكيل تنظيم دوائر المحولات إلى طبقات استحثاث وطبقات مركز دلالي متميزة.

Dhruvil S, Fenil Sojitra, Ravirajsinh Chauhan2026-07-28
💬 NLP

ADAGE: A Language-Agnostic Pipeline for Analogical Reasoning Evaluation

تقدم الورقة البحثية ADAGE، وهو مسار عمل غير مرتبط بلغة معينة ينشئ معايير قياس للاستدلال التناظري الخالي من الترجمة في اللغات العربية والأمهرية واليابانية، مما يكشف عن فجوة أداء كبيرة حيث تعاني النماذج الماهرة في اللغة الإنجليزية من صعوبة في الاستدلال القائم على الثقافة في هذه اللغات الأصلية.

Ahmed Haj Ahmed, Alvin Grissom II2026-07-28