💬 NLP

PSK at SemEval-2026 Task 9: Multilingual Polarization Detection Using Ensemble Gemma Models with Synthetic Data Augmentation

حقق فريق PSK المركز الثاني إجمالاً في المهمة التاسعة من مسابقة SemEval-2026 بمتوسط F1 كلي (mean macro-F1) بلغ 0.811، وذلك عبر توظيف نموذج تجميعي من نماذج Gemma 3 التي تم ضبطها باستخدام تقنية LoRA، مع تعزيزها ببيانات اصطناعية مُولدة بواسطة GPT-4o-mini وضبط العتبات لكل لغة، بينما أظهر الفريق الأهمية البالغة للتعميم على حساب البنيات التي حققت أداءً جيداً في مجموعات التطوير لكنها أخفقت في مجموعة الاختبار.

Srikar Kashyap Pulipaka2026-05-07
⚡ electrical engineering

MRI-Eval: A Tiered Benchmark for Evaluating LLM Performance on MRI Physics and GE Scanner Operations Knowledge

تقدم الورقة البحثية MRI-Eval، وهو معيار تقييم متعدد المستويات يكشف أنه بينما تحقق النماذج اللغوية الكبيرة المتطورة دقة عالية في الأسئلة متعددة الخيارات المتعلقة بفيزياء الرنين المغناطيسي وعمليات ماسحات GE، فإن أداءها ينخفض بشكل كبير في استرجاع النصوص الحرة والتعامل مع ادعاءات المستخدم غير الصحيحة، لا سيما فيما يتعلق بالمعرفة التشغيلية الخاصة بالشركة المصنعة.

Perry E. Radau2026-05-07
💬 NLP

Implicit Representations of Grammaticality in Language Models

تُثبت هذه الورقة أن النماذج اللغوية المدربة مسبقاً تكتسب ضمنياً تمثيلاً متميزاً للقواعد النحوية داخل طبقاتها الخفية، وهو ما يمكن استخراجه عبر المسابير الخطية ليتفوق على الأحكام القائمة على احتمالية السلسلة النصية في التمييز بين الجمل النحوية وغير النحوية عبر لغات متعددة.

Yingshan Susan Wang, Linlu Qiu, Zhaofeng Wu, Roger P. Levy, Yoon Kim2026-05-07
💬 NLP

Code-switching in text and speech challenges information-theoretic speaker design

تتحدى هذه الورقة النظرية التي تعزو التبديل اللغوي الإدراجي إلى المتحدث وحده، وذلك من خلال إثبات أنه في كل من النصوص والخطابات الصينية-الإنجليزية، تحدث التحولات إلى اللغة الإنجليزية عند نقاط انخفاض القدرة على التنبؤ ليس لأن الإنجليزية أسهل في الإنتاج، بل لأن قابليتها للتنبؤ هي في الواقع أقل حتى من البدائل الصينية المكافئة لها، مما يشير إلى أن المتحدثين يستخدمون التبديل اللغوي لأغراض تتجاوز سهولة الإنتاج، مثل الإشارة إلى الحاجة إلى جذب انتباه أكبر من المستمع.

Debasmita Bhattacharya, Marten van Schijndel2026-05-06
💬 NLP

How Good is Your Wikipedia? Auditing Data Quality for Low-resource and Multilingual NLP

تدقق هذه الورقة جودة نسخ ويكيبيديا غير الإنجليزية من خلال تطبيق تصفية صارمة للبيانات لتحديد المشكلات المنهجية مثل المحتوى الذي تولده الروبوتات والتلوث اللغوي، مما يثبت في النهاية أن النماذج المدربة على البيانات المفلترة عالية الجودة الناتجة تضاهي أو تتفوق على تلك المدربة على البيانات الخام، لا سيما بالنسبة لنسخ اللغات ذات الجودة المنخفضة.

Kushal Tatariya, Artur Kulmizev, Wessel Poelman, Esther Ploeger, Marcel Bollmann, Johannes Bjerva, Jiaming Luo, Heather (…)2026-05-06
💻 computer science

On Verbalized Confidence Scores for LLMs

تتقصى هذه الورقة مدى موثوقية النماذج اللغوية الكبيرة في التعبير عن عدم يقينها من خلال درجات الثقة، حيث تُظهر أنه بينما يتباين التأثير باختلاف استراتيجية التلقين، يمكن لأساليب محددة أن تحقق تقديراً لمعايير عدم اليقين يكون معايرًا جيدًا ومستقلاً عن النموذج مع تكلفة إضافية منخفضة.

Daniel Yang, Yao-Hung Hubert Tsai, Makoto Yamada2026-05-06
💬 NLP

Multiple Choice Questions: Reasoning Makes Large Language Models (LLMs) More Self-Confident, Especially When They are Wrong

تُثبت هذه الورقة أن تقنية "سلسلة الأفكار" (Chain-of-Thought) ترفع بشكل منهجي من مستوى ثقة النماذج اللغوية الكبيرة، لا سيما عندما تكون خاطئة، مما يؤدي إلى تدهور المعايرة ويجعل التقييمات القائمة على الاحتمالات غير موثوقة.

Tairan Fu, Javier Conde, Gonzalo Martínez, María Grandury, Pedro Reviriego2026-05-06
🤖 machine learning

Understanding and Mitigating Bias Inheritance in LLM-based Data Augmentation on Downstream Tasks

تقدم هذه الورقة أول استقصاء منهجي لـ "توريث التحيز"، حيث توضح كيف يمكن للنماذج اللغوية الكبيرة المستخدمة في تعزيز البيانات أن تنقل وتضخم تحيزات التدريب إلى المهام اللاحقة، مع تحديد عوامل عدم الاتساق الرئيسية واقتراح ثلاث استراتيجيات تخفيف متميزة لمعالجة هذا التحدي.

Miaomiao Li, Hao Chen, Yang Wang, Tingyuan Zhu, Weijia Zhang, Kaijie Zhu, Kam-Fai Wong, Jindong Wang2026-05-06
💬 NLP

Hallucination Detection in LLMs with Topological Divergence on Attention Graphs

تقدم الورقة البحثية TOHA، وهو كاشف للهلوسة قائم على الطوبولوجيا لأنظمة التوليد المعزز بالاسترجاع (RAG)، والذي يحدد المخرجات غير الصحيحة واقعياً من خلال قياس التباعد الطوبولوجي بين رسوم الانتباه البيانية للمطالبة والاستجابة، محققاً أداءً هو الأفضل في فئته بأقل قدر من البيانات والموارد الحسابية.

Alexandra Bazarova, Aleksandr Yugay, Andrey Shulga, Alina Ermilova, Andrei Volodichev, Konstantin Polev, Julia Belikova (…)2026-05-06
💬 NLP

TF1-EN-3M: Three Million Synthetic Moral Fables for Training Small, Open Language Models

تقدم الورقة البحثية TF1-EN-3M، وهي مجموعة بيانات مفتوحة ومبتكرة تضم ثلاثة ملايين حكاية أخلاقية إنجليزية اصطناعية تم إنشاؤها بواسطة نماذج لغوية صغيرة ذات أوزان مفتوحة باستخدام هيكل مكون من ست خانات منظم ومسار تقييم قابل لإعادة الإنتاج، مما يثبت إمكانية تحقيق سرد قصص أخلاقية عالي الجودة وضخم النطاق دون الاعتماد على النماذج العملاقة المملوكة لجهات خاصة.

Mihai Nadas, Laura Diosan, Andrei Piscoran, Andreea Tomescu2026-05-06