💬 NLP

Rethinking Dense Sequential Chains: Reasoning Language Models Can Extract Answers from Sparse, Order-Shuffling Chain-of-Thoughts

تتحدى هذه الورقة الرؤية التقليدية التي تقضي بوجوب كون سلاسل الاستدلال كثيفة ومتسلسلة، وذلك من خلال إثبات قدرة النماذج اللغوية على استخراج الإجابات الصحيحة من آثار الاستدلال التي تعرضت لخلط شديد، وتجريد من اللغة الطبيعية، وحتى تلوث بإجابات خاطئة، مما يكشف عن ركيزة معلوماتية كامنة تتسم بالندرة وعدم الحساسية للترتيب.

Yi-Chang Chen, Feng-Ting Liao, Da-shan Shiu, Hung-yi Lee2026-05-11
💬 NLP

Gradient-Based LoRA Rank Allocation Under GRPO: An Empirical Study

تكشف هذه الدراسة التجريبية أن تخصيص الرتب التكيفي القائم على التدرج لتقنية LoRA، رغم فعاليته في الضبط الدقيق الخاضع للإشراف، يؤدي إلى تدهور الأداء بشكل كبير في ظل عملية تحسين السياسة النسبية الجماعية (GRPO) بسبب مشهد تدرج أكثر تسطحاً وتأثير تضخيم التدرج الضار، مما يشير إلى أن تخصيص الرتب الموحد يعد متفوقاً لمهام محاذاة التعلم المعزز.

Yash Ganpat Sawant2026-05-11
💬 NLP

Unsolvability Ceiling in Multi-LLM Routing: An Empirical Study of Evaluation Artifacts

تكشف هذه الدراسة التجريبية أن "سقوف عدم القدرة على الحل" المُبلغ عنها في توجيه النماذج اللغوية الكبيرة المتعددة (multi-LLM routing) مبالغ فيها إلى حد كبير بسبب عيوب تقييمية مثل انحياز الحكم والقص، مما يشوه إشارات تدريب الموجه ويؤدي إلى تكاليف فرصة بديلة كبيرة، مما يستلزم بروتوكولات تقييم أكثر موثوقية لتقدير المقايضات بين التكلفة والجودة بدقة.

Saloni Garg, Amit Sagtani2026-05-11
💬 NLP

The Proxy Presumption: From Semantic Embeddings to Valid Social Measures

تتناول هذه الورقة "افتراض الوكيل" في العلوم الاجتماعية الحوسبية من خلال تقديم "بروتوكول صلاحية البناء" (CVP) و"التحييد المقابل للواقع" للتحقق بدقة من صحة التضمينات الدلالية، بما يضمن قياسها للمفاهيم الاجتماعية بدلاً من السمات المربكة مثل الموضوع أو الأسلوب.

Baishi Li, Ta Yu, Kelvin J. L. Koa, Ke-Wei Huang2026-05-11
💬 NLP

SSP-based construction of evaluation-annotated data for fine-grained aspect-based sentiment analysis

تقدم هذه الورقة بناء مجموعة بيانات التقييم الكورية (EVAD) باستخدام الانتشار الرمزي شبه الآلي (SSP) والمحوّلات ذات الحالة النهائية لتوسيع تحليل المشاعر القائم على الجوانب لمراجعات التجارة الإلكترونية من خلال دمج قيم الجوانب، محققةً درجات F1 عالية بلغت 0.88 و0.90 باستخدام نموذجي KoBERT وKcBERT.

Suwon Choi, Shinwoo Kim, Changhoe Hwang, Gwanghoon Yoo, Eric Laporte, Jeesun Nam2026-05-11
💬 NLP

Data Contamination in Neural Hieroglyphic Translation: A Reproducibility Study

تكشف هذه الدراسة أن درجة "بلي" (BLEU) البالغة 61.5 التي تم الإبلاغ عنها سابقاً لترجمة الهيروغليفية إلى الألمانية قد تضخمت اصطناعياً بسبب تلوث بيانات الاختبار بنسبة 2%، ومن خلال إزالة التلوث الصارمة، تُحدد الدراسة نطاق أداء أساسي واقعي يتراوح بين 30.9 و39.2 درجة "بلي" لهذا النظام الكتابي المهدد بالانقراض.

Ammar Toutou, Abdelrahman Harb, Christine Basta2026-05-11
💬 NLP

Think-with-Rubrics: From External Evaluator to Internal Reasoning Guidance

تقدم هذه الورقة البحثية "التفكير مع المعايير" (Think-with-Rubrics)، وهو نموذج جديد يحول المعايير من مقيمات خارجية إلى توجيه استدلالي داخلي عبر جعل النماذج اللغوية الكبيرة تولد المعايير جنباً إلى جنب مع الاستجابات أثناء التدريب، مما يؤدي إلى تحسينات مستمرة في الأداء مقارنة بالنماذج المرجعية القائمة على المكافأة.

Jiachen Yu, Zhihao Xu, Junjie Wang, Yujiu Yang2026-05-11
💬 NLP

The Moltbook Files: A Harmless Slopocalypse or Humanity's Last Experiment

تقدم هذه الورقة "ملفات مولتبوك" (Moltbook Files)، وهي مجموعة بيانات تضم 232 ألف منشور و2.2 مليون تعليق من منصة شبيهة بـ "ريديت" (Reddit) مأهولة بوكلاء ذكاء اصطناعي، مما يكشف عن مخاطر خصوصية جسيمة مثل كشف مفاتيح واجهة برمجة التطبيقات (API keys) وانخفاض في صدقية النماذج عند الضبط الدقيق، ومع ذلك تصنف الحدث في النهاية على أنه "كارثة هراء غير ضارة" (harmless slopocalypse) مع التحذير من مخاطر ذيل مستمرة مثل تلوث البيانات وعدم الاتساق الناشئ.

William Brach, Federico Torrielli, Stine Lyngsø Beltoft, Annemette Brok Pirchert, Peter Schneider-Kamp, Lukas Galke Poec (…)2026-05-11
💬 NLP

InterLV-Search: Benchmarking Interleaved Multimodal Agentic Search

تقدم هذه الورقة البحثية InterLV-Search، وهو معيار شامل وإطار تقييم للبحث الوكيل متعدد الوسائط المتداخل الذي يسلط الضوء على أوجه القصور الحالية الكبيرة في قدرة الأنظمة على دمج الأدلة النصية والبصرية ديناميكيًا عبر سيناريوهات البحث النشط، والبحث الموجه غير المتصل بالإنترنت، والبحث في الويب المفتوح.

Bohan Hou, Jiuning Gu, Jiayan Guo, Ronghao Dang, Sicong Leng, Xin Li, Xuemeng Song, Jianfei Yang2026-05-11
💬 NLP

Why do Large Language Models Fail in Low-resource Translation? Unraveling the Token Dynamics of Large Language Models for Machine Translation

تتقصى هذه الورقة البحثية سبب معاناة النماذج اللغوية الكبيرة في الترجمة منخفضة الموارد عبر تحليل أنماط الفشل عبر 22 زوجاً لغوياً وتقديم مقياس معدل تنشيط الرموز (TAR)، والذي يكشف أن انخفاض استغلال الرموز الخاصة باللغة يرتبط ارتباطاً وثيقاً بجودة الترجمة الضعيفة، لا سيما في الأزواج غير المتمحورة حول اللغة الإنجليزية.

Shenbin Qian, Yves Scherrer2026-05-11