💻 computer science

WebExpert: domain-aware web agents with critic-guided expert experience for high-precision search

يُعد WebExpert عميل ويب مدركاً للمجال يعزز البحث عالي الدقة في المجالات المتخصصة مثل التمويل والطب الحيوي من خلال دمج استرجاع الخبرة على مستوى الجملة، والاستحثاث الضعيف الموجه للجوانب، والتخطيط الأمثل للتفضيلات، مما يحسن دقة الإجابة بشكل كبير ويقلل خطوات التنقل مقارنة بالنماذج المرجعية الحالية.

Yuelin Hu, Zhengxue Cheng, Ronghua Wu, Qunshan Gu, Hongwei Hu, Wei Liu, Qiao Liang, Li Song2026-04-09
💻 computer science

Benchmarking LLM Tool-Use in the Wild

تقدم هذه الورقة WildToolBench، وهو معيار مرجعي جديد يرتكز على سلوكيات المستخدمين في العالم الحقيقي لكشف القصور الكبير في النماذج اللغوية الكبيرة الحالية في التعامل مع سيناريوهات استخدام الأدوات متعددة الخطوات المعقدة، وغير المنظمة، والمرنة، مما يكشف أن أي نموذج تم تقييمه لم يتجاوز دقة 15% بسبب التحديات المتعلقة بالتنسيق، والاستدلال السياقي، والانتقالات الديناميكية للتعليمات.

Peijie Yu, Wei Liu, Yifan Yang, Jinjian Li, Zelong Zhang, Xiao Feng, Feng Zhang2026-04-09
💻 computer science

LLM Spirals of Delusion: A Benchmarking Audit Study of AI Chatbot Interfaces

تكشف هذه الدراسة التدقيقية أن تقييم النماذج اللغوية الكبيرة من خلال واجهات برمجة التطبيقات (API) وحدها يخفق في رصد سلوكيات روبوتات الدردشة في العالم الحقيقي، مما يثبت أن العوامل المتعلقة بالواجهة، والديناميكيات الزمنية، والخيارات السياساتية تؤثر بشكل كبير على تعزيز الأفكار الوهمية أو التآمرية، مع استمرار ظهور مخاطر سلامة جوهرية وأداء غير مستقر بمرور الوقت في النماذج الأحدث.

Peter Kirgis, Ben Hawriluk, Sherrie Feng, Aslan Bilimer, Sam Paech, Zeynep Tufekci2026-04-09
💬 NLP

The Stepwise Informativeness Assumption: Why are Entropy Dynamics and Reasoning Correlated in LLMs?

تقترح هذه الورقة البحثية وتثبت تجريبياً "فرضية المعلوماتية التدريجية"، التي تفسر الارتباط بين ديناميكيات الإنتروبيا الداخلية وصحة الاستدلال في النماذج اللغوية الكبيرة من خلال إثبات أن مسارات الاستدلال الصحيحة تراكم المعلومات ذات الصلة بالإجابة في التوقع عبر تدريب الاحتمال الأقصى والتعلم المعزز.

Mar Gonzàlez I Català, Haitz Sáez de Ocáriz Borde, George D. Montañez, Pietro Liò2026-04-09
💬 NLP

Depression Detection at the Point of Care: Automated Analysis of Linguistic Signals from Routine Primary Care Encounters

تُظهر هذه الدراسة أن التحليل الآلي للإشارات اللغوية المستمدة من التسجيلات الصوتية الروتينية في الرعاية الأولية، لا سيما باستخدام نماذج GPT ذات التعلم الصفري والنصوص المنسوخة الثنائية، يمكن أن يكتشف الاكتئاب بفعالية لدعم اتخاذ القرارات السريرية في الوقت المناسب.

Feng Chen, Manas Bedmutha, Janice Sabin, Andrea Hartzler, Nadir Weibel, Trevor Cohen2026-04-09
💬 NLP

Hallucination as output-boundary misclassification: a composite abstention architecture for language models

تقترح هذه الورقة بنية امتناع مركبة تجمع بين الرفض القائم على التعليمات وآلية بوابية هيكلية — باستخدام الاتساق الذاتي، واستقرار إعادة الصياغة، وتغطية الاستشهاد للكشف عن الادعاءات غير المدعومة — للحد من الهلوسة في النماذج اللغوية الكبيرة بفعالية من خلال الاستفادة من نقاط القوة المتكاملة لكلا النهجين.

Angelina Hintsanen2026-04-09
💬 NLP

Emergent decentralized regulation in a purely synthetic society

تُثبت هذه الورقة أن مجتمعاً اصطناعياً بحتاً من وكلاء الذكاء الاصطناعي المستقلين على شبكة "مولتبوك" (Moltbook) يُظهر تنظيماً ذاتياً ناشئاً وداخلياً، حيث تزدዛد احتمالية تلقي تغذية راجعة تصحيحية من الوكلاء الآخرين بشكل يتناسب طردياً مع شدة اللغة التوجيهية في منشوراتهم.

Md Motaleb Hossen Manik, Ge Wang2026-04-09
💬 NLP

Beyond Facts: Benchmarking Distributional Reading Comprehension in Large Language Models

تقدم الورقة البحثية Text2DistBench، وهو معيار تقييم مؤتمت ومحدث باستمرار يستخدم تعليقات يوتيوب من العالم الحقيقي لتقييم قدرة النماذج اللغوية الكبيرة على استنتاج المعرفة التوزيعية، مثل نسب المشاعر وتكرارات المواضيع، مما يكشف عن تباينات كبيرة في الأداء عبر أنواع التوزيع المختلفة.

Pei-Fu Guo, Ya-An Tsai, Chun-Chia Hsu, Kai-Xin Chen, Yun-Da Tsai, Kai-Wei Chang, Nanyun Peng, Mi-Yen Yeh, Shou-De Lin2026-04-09
💬 NLP

Cross-Lingual Transfer and Parameter-Efficient Adaptation in the Turkic Language Family: A Theoretical Framework for Low-Resource Language Models

تقترح هذه الورقة إطاراً نظرياً لتحسين النقل عبر اللغات والتكيف الفعال للمعلمات للنماذج اللغوية الكبيرة ضمن عائلة اللغات التركية من خلال تقديم معامل النقل التركي (TTC) ونموذج قياس مفاهيمي لتحليل كيفية تأثير التشابهات النمطية وتفاوت الموارد على أداء التكيف عبر اللغات الأذربيجانية والكازاخستانية والأوزبكية والتركمانية والغاغوزية.

O. Ibrahimzade, K. Tabasaransky2026-04-09
💬 NLP

Extracting Breast Cancer Phenotypes from Clinical Notes: Comparing LLMs with Classical Ontology Methods

تقدم هذه الورقة إطار عمل يعتمد على النماذج اللغوية الكبيرة لاستخراج الأنماط الظاهرية لسرطان الثدي من الملاحظات السريرية غير المهيكلة، مما يثبت تحقيقها دقة تضاهي الطرق التقليدية القائمة على الوجودية (ontology) مع تقديم قدرة أكبر على التكيف مع أمراض أخرى.

Abdullah Bin Faiz, Arbaz Khan Shehzad, Asad Afzal, Momin Tariq, Muhammad Siddiqi, Muhammad Usamah Shahid, Maryam Noor Aw (…)2026-04-09