💬 NLP

DARE: Diffusion Large Language Models Alignment and Reinforcement Executor

تُعد DARE إطار عمل مفتوح المصدر يوحد مسارات ما بعد التدريب والتقييم لنماذج اللغات الكبيرة الانتشارية (dLLMs) من خلال دمج الضبط الدقيق الخاضع للإشراف، وتحسين التفضيلات، والتعلم التعزيزي لمعالجة تشتت المنظومة وتمكين مقارنات عادلة وقابلة للتكرار عبر عائلات النماذج المتنوعة.

Jingyi Yang, Yuxian Jiang, Xuhao Hu, Shuang Cheng, Biqing Qi, Jing Shao2026-04-07
🤖 AI

Combee: Scaling Prompt Learning for Self-Improving Language Model Agents

تقترح الورقة البحثية Combee، وهو إطار عمل مبتكر يعمل على توسيع نطاق تعلم المطالبات المتوازي لوكلاء النماذج اللغوية ذاتية التحسين باستخدام عمليات المسح المتوازي، وآلية خلط معززة، ووحدة تحكم ديناميكية في حجم الدفعة لتحقيق تسريع يصل إلى 17 ضعفاً مع الحفاظ على الدقة أو تحسينها عبر اختبارات معيارية متعددة.

Hanchen Li, Runyuan He, Qizheng Zhang, Changxiu Ji, Qiuyang Mang, Xiaokun Chen, Lakshya A Agrawal, Wei-Liang Liao, Eric (…)2026-04-07
🧬 biology

Entropy, Disagreement, and the Limits of Foundation Models in Genomics

تجادل هذه الورقة بأن الإنتروبيا العالية للتسلسلات الجينومية تحد بشكل أساسي من قدرة النماذج التأسيسية على تعلم تمثيلات ذات معنى، مما يؤدي إلى تنبؤات غير مستقرة وفشل في التقاط العلاقات بين الرموز (inter-token)، وهو ما يشير إلى أن منهجيات التدريب الحالية ذاتية الإشراف قد لا تكون مناسبة للبيانات الجينومية.

Maxime Rochkoulets, Lovro Vrček, Mile Šikić2026-04-07
💬 NLP

Adaptive Cost-Efficient Evaluation for Reliable Patent Claim Validation

تقدم هذه الورقة ACE، وهو إطار عمل هجين يجمع بين التوجيه القائم على الإنتروبيا التنبؤية وبروتوكول "سلسلة الفكر براءة الاختراع" لتحقيق دقة رائدة في التحقق من صحة مطالبات براءات الاختراع (94.95% F1) مع تقليل التكاليف التشغيلية بنسبة 78% مقارنة بالنماذج اللغوية الكبيرة المستقلة، مدعوماً بمعيار ACE-40k الجديد.

Yongmin Yoo, Qiongkai Xu, Longbing Cao2026-04-07
💬 NLP

High-Stakes Personalization: Rethinking LLM Customization for Individual Investor Decision-Making

تجادل هذه الورقة بأن اتخاذ القرار لدى المستثمر الفردي يكشف عن قيود حرجة في نماذج التخصيص الحالية للنماذج اللغوية الكبيرة بسبب التعقيد السلوكي، وانحراف الأطروحة، والتوتر بين الأسلوب والإشارة، والافتقار إلى الحقيقة المطلقة، مما يدفع المؤلفين إلى اقتراح استجابات معمارية واتجاهات بحثية جديدة لمجالات اتخاذ القرار عالية المخاطر والممتدة زمنياً بناءً على نظام إدارة المحافظ المعزز بالذكاء الاصطناعي الذي قاموا بنشره.

Yash Ganpat Sawant2026-04-07
💬 NLP

How Well Do Agentic Skills Work in the Wild: Benchmarking LLM Skill Usage in Realistic Settings

تقدم هذه الورقة أول تقييم شامل لمهارات وكلاء النماذج اللغوية الكبيرة في بيئات واقعية، كاشفةً أن مكاسب الأداء الناتجة عن المهارات هشة وتتدهور بشكل كبير عندما يتعين على الوكلاء الاسترجاع ذاتياً من مجموعات ضخمة، رغم أن استراتيجيات التحسين الخاصة بالاستعلام يمكن أن تستعيد هذا الأداء المفقود بشكل كبير.

Yujian Liu, Jiabao Ji, Li An, Tommi Jaakkola, Yang Zhang, Shiyu Chang2026-04-07
💬 NLP

Benchmarking Multi-turn Medical Diagnosis: Hold, Lure, and Self-Correction

تقدم هذه الورقة MINT، وهو معيار تشخيص طبي متعدد الأدوار يكشف كيف تهرع النماذج اللغوية الكبيرة غالبًا إلى استنتاجات سابقة لأوانها رغم قدراتها الكامنة على التصحيح الذاتي، وتثبت أن تأخير الأسئلة التشخيصية وعرض الأدلة بشكل استراتيجي يمكن أن يحسن دقة التشخيص بشكل كبير.

Jinrui Fang, Runhan Chen, Xu Yang, Jian Yu, Jiawei Xu, Ashwin Vinod, Wenqi Shi, Tianlong Chen, Heng Ji, ChengXiang Zhai (…)2026-04-07
💬 NLP

Talk2AI: A Longitudinal Dataset of Human--AI Persuasive Conversations

تعد Talk2AI مجموعة بيانات طولية واسعة النطاق تضم 3,080 محادثة بين 770 بالغاً إيطالياً ونماذج لغوية كبيرة متنوعة عبر أربعة جلسات أسبوعية، صُممت لتسهيل البحث حول كيفية تأثير الحوار بوساطة الذكاء الاصطناعي على تغيير الآراء، واستقرار القناعات، والتفاعل بين الإنسان والذكاء الاصطناعي في مواضيع مثل تغير المناخ، والقلق من الرياضيات، والمعلومات المضللة حول الصحة.

Alexis Carrillo, Enrique Taietta, Ali Aghazadeh Ardebili, Giuseppe Alessandro Veltri, Massimo Stella2026-04-07
📊 statistics

Relative Density Ratio Optimization for Stable and Statistically Consistent Model Alignment

تقترح هذه الورقة طريقة جديدة ومستقرة ومتسقة إحصائياً لمحاذاة النماذج اللغوية تعتمد على تحسين نسبة الكثافة النسبية بين البيانات المفضلة ومزيج من البيانات المفضلة وغير المفضلة، مما يتغلب بفعالية على مشكلات عدم الاستقرار في التدريب والتباعد الموجودة في مناهج تحسين نسبة الكثافة المباشرة الحالية.

Hiroshi Takahashi, Tomoharu Iwata, Atsutoshi Kumagai, Sekitoshi Kanai, Masanori Yamada, Kosuke Nishida, Kazutoshi Shinod (…)2026-04-07
💬 NLP

Responses Fall Short of Understanding: Revealing the Gap between Internal Representations and Responses in Visual Document Understanding

تكشف هذه الورقة عن فجوة كبيرة بين التمثيلات الداخلية والاستجابات المولدة لنماذج اللغات والرؤية الكبيرة في مهام فهم المستندات المرئية، مما يوضح أن المعلومات ذات الصلة بالمهمة غالبًا ما تكون أكثر سهولة في الوصول إليها في الطبقات المتوسطة، وأن الضبط الدقيق لهذه الطبقات يقلص هذه الفجوة بفعالية مع تحسين الأداء العام.

Haruka Kawasaki, Ryota Tanaka, Kyosuke Nishida2026-04-07