💬 NLP

StructEval: Benchmarking LLMs' Capabilities to Generate Structural Outputs

يقدم البحث StructEval، وهو معيار شامل يضم 18 تنسيقاً و44 نوعاً من المهام التي تقيم قدرة النماذج اللغوية الكبيرة على توليد وتحويل المخرجات المهيكلة غير القابلة للعرض والقابلة للعرض على حد سواء، مما يكشف عن فجوات كبيرة في الأداء حيث تعاني حتى النماذج الأكثر تطوراً من دقة الهيكلية، لا سيما في مهام التوليد والمحتوى المرئي.

Jialin Yang, Dongfu Jiang, Lipeng He, Sherman Siu, Yuxuan Zhang, Disen Liao, Zhuofeng Li, Huaye Zeng, Yiming Jia, Haozhe (…)2026-04-06
💬 NLP

Quick on the Uptake: Eliciting Implicit Intents from Human Demonstrations for Personalized Mobile-Use Agents

تقدم هذه الورقة البحثية IFRAgent، وهو إطار عمل يستفيد من مجموعة بيانات MobileIAR للتعرف على تدفقات النوايا البشرية الصريحة والضمنية من العروض التوضيحية، مما يؤدي إلى توليد وكلاء استخدام للهواتف المحمولة مخصصين يتفوقون بشكل كبير على النماذج المرجعية في التوافق مع نية المستخدم وإكمال المهام.

Zheng Wu, Heyuan Huang, Yanjia Yang, Yuanyi Song, Xingyu Lou, Weiwen Liu, Weinan Zhang, Jun Wang, Zhuosheng Zhang2026-04-06
💬 NLP

VeriOS: Query-Driven Proactive Human-Agent-GUI Interaction for Trustworthy OS Agents

تقدم الورقة البحثية VeriOS، وهو إطار عمل وعميل قائم على الاستعلام يعزز موثوقية أتمتة أنظمة التشغيل من خلال الاستعلام الاستباقي من البشر في السيناريوهات غير الموثوقة، محققاً تحسناً كبيراً بنسبة 19.72% في معدلات النجاح لكل خطوة مقارنة بالنماذج المرجعية دون المساس بالأداء الطبيعي.

Zheng Wu, Heyuan Huang, Xingyu Lou, Xiangmou Qu, Pengzhou Cheng, Zongru Wu, Weiwen Liu, Weinan Zhang, Jun Wang, Zhaoxian (…)2026-04-06
💬 NLP

SciNLP: A Domain-Specific Benchmark for Full-Text Scientific Entity and Relation Extraction in NLP

تقدم هذه الورقة SciNLP، وهو أول معيار للنصوص الكاملة لاستخراج الكيانات والعلاقات المصمم خصيصاً لمجال معالجة اللغات الطبيعية (NLP)، والذي يعالج أوجه القصور في مجموعات البيانات الحالية المقتصرة على أقسام محددة من خلال تمكين بناء رسوم بيانية معرفية غنية ودقيقة عبر التوسيم اليدوي الشامل لـ 60 منشوراً علمياً.

Decheng Duan, Yingyi Zhang, Jitong Peng, Chengzhi Zhang2026-04-06
💬 NLP

What Is The Political Content in LLMs' Pre- and Post-Training Data?

تتقصى هذه الورقة المحتوى السياسي في بيانات تدريب النماذج اللغوية الكبيرة، وتجد أن مجموعات بيانات ما قبل التدريب منحازة بشكل منهجي نحو وجهات النظر المنحازة لليسار، مع استمرار هذه الانحيازات عبر مراحل ما بعد التدريب وارتباطها القوي بالمواقف السياسية للنموذج الناتج، مما يسلط الضوء على الدور الحاسم لتكوين البيانات في تشكيل سلوك النموذج.

Tanise Ceron, Dmitry Nikolaev, Dominik Stammbach, Debora Nozza2026-04-06
🤖 machine learning

LiME: Lightweight Mixture of Experts for Efficient Multimodal Multi-task Learning

يُعدُّ LiME إطار عمل خفيف الوزن لخليط الخبراء (Mixture of Experts) من أجل تعلم متعدد الوسائط ومتعدد المهام بكفاءة، حيث يحقق تخصص الخبراء من خلال تعديل المخرجات والتوجيه صفري المعلمات، مما يقلل بشكل كبير من المعلمات القابلة للتدريب ووقت التدريب مع الحفاظ على أداء تنافسي عبر 47 مهمة متنوعة.

Md Kowsher, Haris Mansoor, Nusrat Jahan Prottasha, Ozlem Garibay, Victor Zhu, Zhengping Ji, Chen Chen2026-04-06
🤖 machine learning

SIEVE: Sample-Efficient Parametric Learning from Natural Language

تقترح الورقة البحثية SIEVE، وهي طريقة تعلم بارامترية فعالة في استهلاك العينات تستفيد من مسار مبتكر لتوليد البيانات الاصطناعية (SIEVE-GEN) لتفكيك سياق اللغة الطبيعية واستيعابه داخل أوزان النموذج باستخدام ثلاثة أمثلة استعلام فقط، متفوقة بذلك على طرق التقطير السابقة في مهام الاستدلال.

Parth Asawa, Alexandros G. Dimakis, Matei Zaharia2026-04-06
🤖 machine learning

Not All Denoising Steps Are Equal: Model Scheduling for Faster Masked Diffusion Language Models

تقترح هذه الورقة استراتيجية لجدولة النماذج لنماذج اللغة ذات الانتشار المقنع تستبدل نموذج "ترانسفورمر" الكامل بنموذج أصغر خلال خطوات إزالة الضجيج الوسطى الأقل أهمية، مما يحقق انخفاضًا يصل إلى 17% في العمليات الحسابية (FLOPs) مع الحفاظ على جودة التوليد.

Ivan Sedykh, Nikita Sorokin, Valentin Malykh2026-04-06
💬 NLP

CIPHER: Conformer-based Inference of Phonemes from High-density EEG

تقدم الورقة البحثية نموذج CIPHER، وهو نموذج قائم على الـ Conformer، يقوم بتقييم فك تشفير الوحدات الصوتية (phonemes) من تخطيط كهربائية الدماغ (EEG) عالي الكثافة باستخدام ميزات ERP وDDA، كاشفاً أنه في حين تحقق المهام النطقية الثنائية أداءً عالياً، فإن تصنيف الوحدات الصوتية دقيق التفاصيل المكون من 11 فئة يظل محدوداً وعرضة للمتغيرات المربكة، مما يضع هذا العمل كدراسة مقارنة للميزات بدلاً من كونه نظاماً وظيفياً للتحويل من تخطيط كهربائية الدماغ إلى نص.

Varshith Madishetty2026-04-06
🤖 AI

Internalized Reasoning for Long-Context Visual Document Understanding

تقدم هذه الورقة البحثية مساراً لبيانات اصطناعية يقوم بتوليد واستيعاب آثار الاستدلال لفهم الوثائق المرئية ذات السياق الطويل عبر دمج النماذج منخفض القوة، مما يمكّن النماذج الأصغر مثل Qwen3 VL 32B من التفوق بشكل كبير على نظيراتها الأكبر حجماً مع تقليل استخدام الرموز المخرجة بشكل جذري.

Austin Veselka2026-04-06