🤖 machine learning

Skip-Connected Policy Optimization for Implicit Advantage

تقدم هذه الورقة البحثية "تحسين السياسة ذو الاتصال القفزي" (SKPO)، وهو إطار عمل جديد للتعلم التعزيزي يفكك عملية الاستدلال إلى مرحلتين: مرحلة صاعدة ومرحلة هابطة مع وجود اتصال قفزي لحل مشكلات تقدير الميزة عالية التباين في بيئات المكافآت الكثيفة، مما يحقق مكاسب أداء كبيرة مقارنة بـ "تحسين السياسة النسبي للمجموعات" (GRPO) في اختبارات الاستدلال الرياضي والعام.

Fengwei Teng, Jinyi Bai, Xinhao Yao, Demi Ruohan Wang, Jiahao Zhao, Zhijiang Guo2026-04-13
🤖 machine learning

Every Response Counts: Quantifying Uncertainty of LLM-based Multi-Agent Systems through Tensor Decomposition

تقدم هذه الورقة MATU، وهو إطار عمل مبتكر يسخر تفكيك الموتر لتقدير عدم اليقين في الأنظمة متعددة الوكلاء القائمة على النماذج اللغوية الكبيرة من خلال تحليل مسارات الاستدلال الكاملة وفك الارتباط بين المصادر المتميزة لعدم اليقين الناشئة عن ديناميكيات التواصل المعقدة والطبولوجيا.

Tiejin Chen, Huaiyuan Yao, Jia Chen, Evangelos E. Papalexakis, Hua Wei2026-04-13
💬 NLP

Decomposing the Delta: What Do Models Actually Learn from Preference Pairs?

تستقصي هذه الورقة البحثية كيف تدفع بيانات التفضيل مكاسب الاستدلال في النماذج اللغوية من خلال التمييز بين فروق الجودة على مستوى المولد وعلى مستوى العينة، حيث وجدت أن تعظيم فجوة القدرة بين المسارات المختارة والمرفوضة يحسن الأداء خارج النطاق، بينما يعزز التصفية حسب جودة مستوى العينة كفاءة التدريب.

Chia-Hsuan Lee, Mingyang Zhou, Renkun Ni, Zelei Cheng, Sihui Dai, Supriyo Chakraborty, Shixiong Zhang, Sambit Sahu, Will (…)2026-04-13
💬 NLP

LLMs Underperform Graph-Based Parsers on Supervised Relation Extraction for Complex Graphs

تُظهر هذه الورقة أنه بينما تعد النماذج اللغوية الكبيرة واعدة في استخراج العلاقات، فإن أدوات التحليل القائمة على الرسوم البيانية الأصغر حجماً تتفوق عليها بشكل كبير في الرسوم البيانية اللغوية المعقدة ذات الأعداد الكبيرة من العلاقات، مما يجعل أدوات التحليل الأخف وزناً خياراً متفوقاً لمثل هذه المهام.

Paolo Gajo, Domenic Rosati, Hassan Sajjad, Alberto Barrón-Cedeño2026-04-13
💬 NLP

Cards Against LLMs: Benchmarking Humor Alignment in Large Language Models

تضع هذه الدراسة معياراً لمحاذاة الفكاهة في خمسة من النماذج اللغوية الكبيرة الرائدة من خلال جعلها تلعب لعبة "Cards Against Humanity"، مما يكشف أنه بينما تتفوق هذه النماذج على الاحتمالية العشوائية، فإن توافقها المتواضع مع التفضيلات البشرية وإجماعها المرتفع فيما بينها يشيران إلى أن أحكامها الفكاهية تتأثر بشكل كبير بالسمات الهيكلية بدلاً من الفهم الحقيقي الشبيه بالبشر.

Yousra Fettach, Guillaume Bied, Hannu Toivonen, Tijl De Bie2026-04-13
🔢 mathematics

Optimal Multi-bit Generative Watermarking Schemes Under Worst-Case False-Alarm Constraints

تُثبت هذه الورقة أن مخطط العلامات المائية التوليدية متعدد البتات المقترح سابقاً للنماذج اللغوية الكبيرة هو دون المستوى الأمثل في ظل قيود الإنذار الكاذب في الحالة الأسوأ، وتُقدم بنيتين جديدتين للترميز وفك الترميز تحققان الحد الأدنى النظري لاحتمالية الخطأ في الكشف، مما يؤدي إلى توصيف كامل لأداء العلامات المائية الأمثل.

Yu-Shin Huang, Chao Tian, Krishna Narayanan2026-04-13
💬 NLP

Revisiting Anisotropy in Language Transformers: The Geometry of Learning Dynamics

تتقصى هذه الورقة الأصول الهندسية لتباين الخواص في نماذج المحولات (Transformer) من خلال البرهنة نظرياً على كيفية تشكيل أخذ العينات المنحاز للتردد وديناميكيات التدريب لكل من الانحناء واتجاهات المماس، والتحقق تجريبياً عبر التفسير الآلي من أن بدائل المماس المستمدة من التنشيط تلتقط طاقة تدرج وتباين خواص أكبر بكثير من الضوابط القياسية عبر بنيات مختلفة.

Raphael Bernas, Fanny Jourdan, Antonin Poché, Céline Hudelot2026-04-13
💬 NLP

Lessons Without Borders? Evaluating Cultural Alignment of LLMs Using Multilingual Story Moral Generation

تقدم هذه الورقة البحثية توليد الأخلاق القصصية متعدد اللغات كمهمة تقييم مبتكرة لقياس التوافق الثقافي في النماذج اللغوية الكبيرة، كاشفةً أنه بينما تتوافق النماذج الرائدة مثل GPT-4o وGemini بشكل جيد مع التفسيرات الأخلاقية البشرية في المتوسط، إلا أنها تفشل في استيعاب التنوع اللغوي الغني المتأصل في الفهم السردي البشري.

Sophie Wu, Andrew Piper2026-04-13
🤖 machine learning

p1p1: Better Prompt Optimization with Fewer Prompts

تقدم الورقة البحثية p1p1، وهي طريقة تعمل على تحسين تحسين الأوامر (prompt optimization) من خلال تصفية أوامر المستخدم لاختيار مجموعة فرعية صغيرة ذات تباين عالٍ في أداء الأوامر النظامية (system prompts)، مما يتيح تحديداً أكثر فعالية للأوامر النظامية المتفوقة والتفوق على النماذج المرجعية الحالية في اختبارات معايير الاستدلال.

Zhaolin Gao (Sid), Yu (Sid), Wang, Bo Liu, Thorsten Joachims, Kianté Brantley, Wen Sun2026-04-13
🤖 machine learning

Dictionary-Aligned Concept Control for Safeguarding Multimodal LLMs

تقدم هذه الورقة البحثية "التحكم في المفاهيم المحاذي للقواميس" (DACO)، وهو إطار عمل يستفيد من مجموعة بيانات منسقة تضم 15,000 مفهوم متعدد الوسائط ومشفّر تلقائي متناثر (Sparse Autoencoder) لتوفير توجيه دقيق عند الاستنتاج للنماذج اللغوية الكبيرة متعددة الوسائط المجمدة، مما يعزز بشكل كبير سلامتها ضد الاستعلامات الخبيثة مع الحفاظ على قدراتها العامة.

Jinqi Luo, Jinyu Yang, Tal Neiman, Lei Fan, Bing Yin, Son Tran, Mubarak Shah, René Vidal2026-04-13