🤖 AI

When Weak LLMs Speak with Confidence, Preference Alignment Gets Stronger

تقدم هذه الورقة إطار عمل "تحسين التفضيل الموزون بالثقة" (CW-PO)، وهو إطار يوضح أن الاستفادة من تنبؤات نموذج لغوي كبير ضعيف ذات الثقة العالية لإعادة وزن بيانات التدريب يمكن أن يقلل بشكل كبير من الاعتماد على التعليقات البشرية المكلفة مع التفوق على طرق المحاذاة القياسية المدربة على بيانات موسومة بشرياً بالكامل.

Amirabbas Afzali, Myeongho Jeon, Maria Brbic2026-03-06
🤖 AI

MPCEval: A Benchmark for Multi-Party Conversation Generation

تقدم هذه الورقة MPCEval، وهي مجموعة معايير مرجعية مبتكرة وواعية بالمهام تعالج عقبة التقييم في توليد المحادثات متعددة الأطراف من خلال تفكيك الجودة إلى مقاييس نمذجة المتحدث، والمحتوى، والاتساق، مما يكشف أن التقييمات ذات الدرجة الواحدة تحجب الاختلافات السلوكية الحرجة في النماذج التوليدية الحديثة.

Minxing Zhang, Yi Yang, Zhuofan Jia, Xuan Yang, Jian Pei, Yuchen Zang, Xingwang Deng, Xianglong Chen2026-03-06
💬 NLP

VRM: Teaching Reward Models to Understand Authentic Human Preferences

تقترح الورقة البحثية نموذج المكافأة التبايني (VRM)، وهو إطار عمل مبتكر يحسن نماذج المكافأة التقليدية باستخدام الاستدلال التبايني لنمذجة أحكام التفضيل البشري صراحةً من خلال أوزان أهداف عالية الأبعاد وميزات دلالية منخفضة الأبعاد، مما يقلل من حدة استغلال المكافأة ويحقق محاذاة فائقة مع التفضيلات البشرية الأصيلة.

Biao Liu, Ning Xu, Junming Yang, Hao Xu, Xin Geng2026-03-06
💬 NLP

ThaiSafetyBench: Assessing Language Model Safety in Thai Cultural Contexts

تقدم هذه الورقة البحثية ThaiSafetyBench، وهو معيار مفتوح المصدر يتكون من 1,954 مطالبة باللغة التايلاندية ذات دلالات ثقافية دقيقة تكشف عن فجوات أمان كبيرة في النماذج اللغوية الكبيرة الحالية — لا سيما النماذج مفتوحة المصدر وتلك التي تواجه هجمات ذات خصوصية ثقافية — مع توفير مصنف عالي الأداء ولوحة صدارة لتعزيز تقييم الأمان في السياق التايلاندي.

Trapoom Ukarapol, Nut Chukamphaeng, Kunat Pipatanakul, Pakhapoom Sarapat2026-03-06
🤖 AI

MUTEX: Leveraging Multilingual Transformers and Conditional Random Fields for Enhanced Urdu Toxic Span Detection

تقدم هذه الورقة البحثية MUTEX، وهو إطار عمل مبتكر يجمع بين XLM-RoBERTa وحقول العشوائية المشروطة (Conditional Random Fields) مع مجموعة بيانات موسومة يدويًا على مستوى الرمز (token-level)، لتحقيق أول خط أساس خاضع للإشراف للكشف عن نطاق السمية الدقيق في اللغة الأردية، مما يعالج بفعالية تحديات مثل التبديل اللغوي (code-switching) والتباين الصرفي للوصول إلى درجة 60% في مقياس F1 على مستوى الرمز.

Inayat Arshad, Fajar Saleem, Ijaz Hussain2026-03-06
🤖 AI

Aura: Universal Multi-dimensional Exogenous Integration for Aviation Time Series

تقدم هذه الورقة "أورا" (Aura)، وهو إطار عمل عالمي يعزز التنبؤ بالسلاسل الزمنية في مجال الطيران من خلال الترميز والدمج الصريح لثلاثة أنواع متميزة من العوامل الخارجية متعددة الأبعاد عبر آلية ثلاثية مصممة خصيصاً، محققاً أداءً هو الأفضل في فئته على مجموعات بيانات صناعية واسعة النطاق.

Jiafeng Lin, Mengren Zheng, Simeng Ye, Yuxuan Wang, Huan Zhang, Yuhui Liu, Zhongyi Pei, Jianmin Wang2026-03-06
🤖 AI

Measuring the Redundancy of Decoder Layers in SpeechLLMs

تكشف هذه الدراسة أن نماذج اللغات الكبيرة للخطاب (SpeechLLMs) ترث فائضاً كبيراً من التكرار من أجهزة فك التشفير الخاصة بنماذج اللغات الكبيرة (LLM decoders) سابقة التدريب، مما يثبت أن تقليم ما يصل إلى 40% من طبقات فك التشفير يحافظ على أداء قوي عبر مهام التعرف التلقائي على الكلام (ASR) والترجمة، مع تمكين استخدام هيكل أساسي واحد وفعال للنشر متعدد المهام.

Adel Moumen, Guangzhi Sun, Philip C Woodland2026-03-06
🤖 AI

LBM: Hierarchical Large Auto-Bidding Model via Reasoning and Acting

تقترح هذه الورقة نموذج LBM، وهو نموذج مزاد تلقائي كبير هرمي يدمج وحدة LLM-Think القائمة على الاستنتاج مع وحدة LBM-Act لتوليد الإجراءات، مستفيداً من آلية تضمين مزدوجة والضبط الدقيق للتعلم التعزيزي غير المتصل بالإنترنت (GQPO) للتغلب على الهلوسة وتحسين أداء المزايدة في مزادات الإعلانات الديناميكية.

Yewen Li, Zhiyi Lyu, Peng Jiang, Qingpeng Cai, Fei Pan, Bo An, Peng Jiang2026-03-06
💬 NLP

Representation Fidelity:Auditing Algorithmic Decisions About Humans Using Self-Descriptions

تقترح هذه الورقة إطار عمل جديداً لتدقيق القرارات الخوارزمية من خلال قياس "دقة التمثيل" — وهو مدى التوافق بين بيانات المدخلات المفروضة خارجياً والأوصاف الذاتية البشرية — وتقدم مجموعة بيانات مرجعية مكونة من 30,000 سرد اصطناعي لطلبات القروض لتكميم وتصنيف هذه التباينات.

Theresa Elstner, Martin Potthast2026-03-06
🤖 AI

C2-Faith: Benchmarking LLM Judges for Causal and Coverage Faithfulness in Chain-of-Thought Reasoning

تقدم هذه الورقة البحثية C2-Faith، وهو معيار مستمد من PR800K يقيم قدرة القضاة من النماذج اللغوية الكبيرة على تقييم الأمانة السببية والشمولية في تسلسل التفكير، مما يكشف عن تباين أدائهم بشكل كبير حسب المهمة، وعن معاناتهم في تحديد مواقع الأخطاء أو تسجيل درجات دقيقة للتفكير غير المكتمل.

Avni Mittal, Rauno Arike2026-03-06