💬 NLP

Soft Head Selection for Injecting ICL-Derived Task Embeddings

تقدم الورقة البحثية SITE، وهي طريقة تعتمد على التدرج (gradient-based) لتحديد رؤوس الانتباه ذات الصلة بالمهمة لحقن التضمينات المستمدة من التعلم في السياق (ICL)، والتي تتفوق بشكل كبير على أساليب التكيف القائمة على التضمين وأساليب التعلم في السياق بلقطات قليلة الحالية، مع تطلب عدد أقل من المعلمات القابلة للتدريب مقارنة بالضبط الدقيق الفعال للمعلمات (PEFT) عبر مهام ونماذج بمقاييس متنوعة.

Jungwon Park, Jimyeong Kim, Changin Choi, Wonjong Rhee2026-04-09
💬 NLP

Contrastive Decoding Mitigates Score Range Bias in LLM-as-a-Judge

تحدد هذه الورقة أن النماذج اللغوية الكبيرة المستخدمة كحكام تظهر انحيازاً كبيراً في نطاق الدرجات عند تعيين التقييمات المباشرة، وتقترح طريقة فك تشفير تبايني للتخفيف من هذه المشكلة، محققةً تحسناً نسبياً يصل إلى 11.7% في التوافق مع الأحكام البشرية عبر مهام تلخيص مختلفة.

Yoshinari Fujinuma2026-04-09
💬 NLP

VisCoder2: Building Multi-Language Visualization Coding Agents

تقدم الورقة البحثية VisCoder2، وهي عائلة من نماذج برمجة التصور متعددة اللغات المدربة على مجموعة بيانات VisCode-Multi-679K واسعة النطاق والتي تم تقييمها عبر VisPlotBench، حيث تتفوق بشكل كبير على النماذج مفتوحة المصدر الحالية وتقترب من أداء النماذج المملوكة لجهات خاصة من خلال التصحيح الذاتي التكراري عبر 12 لغة برمجة.

Yuansheng Ni, Songcheng Cai, Xiangchao Chen, Jiarong Liang, Zhiheng Lyu, Jiaqi Deng, Kai Zou, Ping Nie, Fei Yuan, Xiang (…)2026-04-09
💬 NLP

How to Evaluate Speech Translation with Source-Aware Neural MT Metrics

تقدم هذه الورقة أول دراسة منهجية للمقاييس العصبية المدركة للمصدر في ترجمة الكلام، حيث تثبت أن نصوص التعرف الآلي على الكلام والترجمات العكسية تعمل كبدائل اصطناعية فعالة للمصدر — معززة بخوارزمية مبتكرة لإعادة التقسيم عبر اللغات — لتحقيق ارتباط قوي مع التقييمات البشرية حتى في حال عدم توفر نصوص المصدر.

Mauro Cettolo, Marco Gaido, Matteo Negri, Sara Papi, Luisa Bentivogli2026-04-09
💻 computer science

Knowledge Graphs Generation from Cultural Heritage Texts: Combining LLMs and Ontological Engineering for Scholarly Debates

تقدم هذه الورقة البحثية ATR4CH، وهي منهجية نظامية مكونة من خمس خطوات تجمع بين النماذج اللغوية الكبيرة والهندسة الأنطولوجية لتحويل نصوص التراث الثقافي غير المهيكلة تلقائياً إلى رسوم بيانية معرفية مهيكلة وقابلة للاستعلام، مما يظهر دقة استخراج عالية ونشراً فعالاً من حيث التكلفة من خلال دراسة حالة حول نقاشات تقييم الأصالة.

Andrea Schimmenti, Valentina Pasqual, Fabio Vitali, Marieke van Erp2026-04-09
💬 NLP

Improved Evidence Extraction and Metrics for Document Inconsistency Detection with LLMs

تعالج هذه الورقة البحثية محدودية الأبحاث المتعلقة بالكشف عن عدم الاتساق في المستندات القائم على النماذج اللغوية الكبيرة من خلال تقديم إطار عمل "الحذف وإعادة المحاولة" (redact-and-retry) مع تصفية مقيدة ومقاييس شاملة جديدة، مما يحسن بشكل كبير من أداء استخراج الأدلة ويتم التحقق من صحته باستخدام مجموعة بيانات شبه اصطناعية تم إصدارها حديثاً.

Nelvin Tan, Yaowen Zhang, James Asikin Cheung, Fusheng Liu, Yu-Ching Shih, Dong Yang2026-04-09
💬 NLP

PEARL: Self-Evolving Assistant for Time Management with Reinforcement Learning

تقدم هذه الورقة البحثية إطار PEARL، وهو إطار عمل للتعلم التعزيزي مزود بذاكرة تفضيلات خارجية يحسن بشكل كبير من أداء النماذج اللغوية الكبيرة في حل تعارضات التقويم طويلة المدى من خلال التعلم الديناميكي والتكيف مع تفضيلات المستخدم، كما هو موضح في CalConflictBench المقترح حديثاً.

Bingxuan Li, Jeonghwan Kim, Cheng Qian, Xiusi Chen, Eitan Anzenberg, Niran Kundapur, Heng Ji2026-04-09
💻 computer science

WebExpert: domain-aware web agents with critic-guided expert experience for high-precision search

يُعد WebExpert عميل ويب مدركاً للمجال يعزز البحث عالي الدقة في المجالات المتخصصة مثل التمويل والطب الحيوي من خلال دمج استرجاع الخبرة على مستوى الجملة، والاستحثاث الضعيف الموجه للجوانب، والتخطيط الأمثل للتفضيلات، مما يحسن دقة الإجابة بشكل كبير ويقلل خطوات التنقل مقارنة بالنماذج المرجعية الحالية.

Yuelin Hu, Zhengxue Cheng, Ronghua Wu, Qunshan Gu, Hongwei Hu, Wei Liu, Qiao Liang, Li Song2026-04-09
💻 computer science

Benchmarking LLM Tool-Use in the Wild

تقدم هذه الورقة WildToolBench، وهو معيار مرجعي جديد يرتكز على سلوكيات المستخدمين في العالم الحقيقي لكشف القصور الكبير في النماذج اللغوية الكبيرة الحالية في التعامل مع سيناريوهات استخدام الأدوات متعددة الخطوات المعقدة، وغير المنظمة، والمرنة، مما يكشف أن أي نموذج تم تقييمه لم يتجاوز دقة 15% بسبب التحديات المتعلقة بالتنسيق، والاستدلال السياقي، والانتقالات الديناميكية للتعليمات.

Peijie Yu, Wei Liu, Yifan Yang, Jinjian Li, Zelong Zhang, Xiao Feng, Feng Zhang2026-04-09
💻 computer science

LLM Spirals of Delusion: A Benchmarking Audit Study of AI Chatbot Interfaces

تكشف هذه الدراسة التدقيقية أن تقييم النماذج اللغوية الكبيرة من خلال واجهات برمجة التطبيقات (API) وحدها يخفق في رصد سلوكيات روبوتات الدردشة في العالم الحقيقي، مما يثبت أن العوامل المتعلقة بالواجهة، والديناميكيات الزمنية، والخيارات السياساتية تؤثر بشكل كبير على تعزيز الأفكار الوهمية أو التآمرية، مع استمرار ظهور مخاطر سلامة جوهرية وأداء غير مستقر بمرور الوقت في النماذج الأحدث.

Peter Kirgis, Ben Hawriluk, Sherrie Feng, Aslan Bilimer, Sam Paech, Zeynep Tufekci2026-04-09