💬 NLP

Community size rather than grammatical complexity better predicts Large Language Model accuracy in a novel Wug Test

تُظهر هذه الدراسة أن قدرة النماذج اللغوية الكبيرة على تعميم القواعد الصرفية في اختبار "ووج" (Wug Test) متعدد اللغات مدفوعة أساساً بحجم مجتمع المتحدثين باللغة ومدى توفر بياناتها الرقمية بدلاً من التعقيد النحوي للغة، مما يشير إلى أن أداءها يعكس غنى الموارد أكثر من كونه كفاءة لغوية حقيقية.

Nikoleta Pantelidou, Evelina Leivada, Raquel Montero, Paolo Morosi2026-04-03
💻 computer science

Support-Contra Asymmetry in LLM Explanations

تُثبت هذه الورقة تجريبياً وجود "عدم تماثل بين الدعم والمعارضة" في تفسيرات النماذج اللغوية الكبيرة، كاشفةً أن التفسيرات للتنبؤات الصحيحة تستند في الغالب إلى الإشارات اللفظية الداعمة، في حين تميل التفسيرات للتنبؤات الخاطئة إلى الاستشهاد بالأدلة المتعارضة.

Avinash Patil2026-04-03
💻 computer science

Penalizing Length: Uncovering Systematic Bias in Quality Estimation Metrics

تكشف هذه الورقة أن مقاييس تقدير الجودة الحالية تعاقب الترجمات الطويلة بشكل منهجي بسبب توزيعات بيانات التدريب المنحرفة، وتوضح أن تطبيع الطول أثناء التدريب يخفف بفعالية من هذا الانحياز لإنتاج إشارات تقييم أكثر موثوقية.

Yilin Zhang, Wenda Xu, Zhongtao Liu, Tetsuji Nakagawa, Markus Freitag2026-04-03
💬 NLP

WAON: Large-Scale Japanese Image-Text Pair Dataset for Improving Model Performance on Japanese Cultural Tasks

تقدم هذه الورقة البحثية WAON، وهو مجموعة بيانات يابانية ضخمة للصور والنصوص تحتوي على ما يقرب من 155 مليون مثال، إلى جانب معيار تقييم منسق (WAON-Bench)، لمعالجة ندرة البيانات الثقافية اليابانية عالية الجودة ولإثبات أن الضبط الدقيق على مجموعة البيانات هذه يحسن بشكل كبير أداء نماذج الرؤية واللغة في المهام الثقافية اليابانية.

Issa Sugiura, Shuhei Kurita, Yusuke Oda, Daisuke Kawahara, Yasuo Okabe, Naoaki Okazaki2026-04-03
💻 computer science

Glia: A Human-Inspired AI for Automated Systems Design and Optimization

تقدم الورقة البحثية "Glia"، وهي بنية ذكاء اصطناعي متعددة الوكلاء مستوحاة من البشر، تستفيد من النماذج اللغوية الكبيرة والتغذية الراجعة التجريبية لتصميم آليات قابلة للتفسير وعالية الأداء للأنظمة الموزعة بشكل مستقل، محققةً مستويات من الإبداع والكفاءة تضاهي الخبراء البشريين في وقت أقل بكثير.

Pouya Hamadanian, Pantea Karimi, Arash Nasr-Esfahany, Kimia Noorbakhsh, Joseph Chandler, Ali ParandehGheibi, Mohammad Al (…)2026-04-03
💬 NLP

PETra: A Multilingual Corpus of Pragmatic Explicitation in Translation

تقدم هذه الورقة PragExTra، وهي أول متن لغوي وإطار كشف متعدد اللغات للتصريح التداولي في الترجمة، والذي يستفيد من التعلم النشط لتحديد وقياس كيفية إثراء المترجمين للنصوص بتفاصيل الخلفية الثقافية، مما يعزز تطوير الترجمة الآلية الواعية ثقافياً.

Doreen Osmelak, Koel Dutta Chowdhury, Uliana Sentsova, Cristina España-Bonet, Josef van Genabith2026-04-03
💬 NLP

Let the Model Distribute Its Doubt: Confidence Estimation through Verbalized Probability Distribution

تقترح هذه الورقة طريقة لتحسين تقدير ثقة النماذج اللغوية الكبيرة من خلال حث النموذج على التعبير لفظياً عن توزيع احتمالي كامل بدلاً من تخمين واحد، مما يثبت أن هذا النهج يعزز كفاءة الاستدلال، ويحقق أداءً فائقاً عبر المهام، ويقلل بشكل كبير من التكاليف الحسابية أثناء التوسع في وقت الاستدلال مقارنة بالنماذج المرجعية الحالية.

Ante Wang, Weizhi Ma, Yang Liu2026-04-03
🤖 machine learning

Bias Is a Subspace, Not a Coordinate: A Geometric Rethinking of Post-hoc Debiasing in Vision-Language Models

تقدم هذه الورقة البحثية "إزالة الانحياز عبر إسقاط الفضاء الجزئي" (Subfield Projection Debiasing - SPD)، وهو إطار هندسي يحسن الأساليب اللاحقة القائمة على الإحداثيات من خلال تحديد وإزالة الانحياز باعتباره فضاءً خطياً موزعاً بدلاً من كونه إحداثيات معزولة، مما يحقق عدالة أقوى بكثير مع حد أدنى من الخسارة في الأداء في نماذج الرؤية واللغة.

Dachuan Zhao, Weiyue Li, Zhenda Shen, Yushu Qiu, Bowen Xu, Haoyu Chen, Yongchao Chen2026-04-03
🤖 machine learning

Semantic Refinement with LLMs for Graph Representations

تقترح هذه الورقة إطار عمل "التحسين الدلالي الموجه بنماذج الرسوم البيانية المثاليه" (GES)، وهو نهج متمحور حول البيانات يستفيد من العقد داخل الرسم البياني المتشابهة بنيوياً ودلالياً لتوجيه النماذج اللغوية الكبيرة في تحسين أوصاف العقد بشكل تكيفي، مما يعالج تحدي عدم التجانس بين البنية والدلالة عبر مجالات الرسوم البيانية المتنوعة.

Safal Thapaliya, Zehong Wang, Jiazheng Li, Ziming Li, Yanfang Ye, Chuxu Zhang2026-04-03
💬 NLP

Language Steering for Multilingual In-Context Learning

تُثبت هذه الورقة أن إضافة "متجهات لغوية" محسوبة كإزاحات تنشيط لنماذج اللغات الكبيرة توجه تمثيلاتها الداخلية بفعالية نحو اللغات المستهدفة للتعلم السياقي متعدد اللغات، محققةً تحسينات مستمرة في الأداء عبر المهام واللغات، مع الكشف عن أن الهوية اللغوية تشغل اتجاهات منفصلة ومنظمة في فضاء تنشيط النموذج.

Neeraja Kirtane, Kuan-Hao Huang2026-04-03