⚡ electrical engineering

Speech-Based Cognitive Screening: A Systematic Evaluation of LLM Adaptation Strategies

تقيم هذه الدراسة بشكل منهجي استراتيجيات التكيف المختلفة للنماذج اللغوية الكبيرة في الكشف عن الخرف القائم على الكلام باستخدام مجموعة بيانات DementiaBank، حيث وجدت أن الضبط الدقيق على مستوى الرمز (token-level fine-tuning) واختيار النماذج التوضيحية الأمثل يمكّنان النماذج ذات الأوزان المفتوحة من مضاهاة أو تجاوز الأنظمة التجارية في الأداء.

Fatemeh Taherinezhad, Mohamad Javad Momeni Nezhad, Sepehr Karimi, Sina Rashidi, Ali Zolnour, Maryam Dadkhah, Yasaman Hag (…)2026-04-28
💻 computer science

SWE-QA: Can Language Models Answer Repository-level Code Questions?

تقدم هذه الورقة SWE-QA، وهو معيار مرجعي للإجابة على أسئلة الأكواد البرمجية على مستوى المستودعات مستمد من 77,100 من مشكلات GitHub، والذي يعالج أوجه القصور في مجموعات البيانات الحالية القائمة على مقتطفات الأكواد من خلال تقييم النماذج اللغوية الكبيرة في مهام الاستنتاج المعقدة متعددة الملفات عبر مجموعة منسقة من 576 سؤالاً وإطار عمل وكيل مرتبط بها.

Weihan Peng, Yuling Shi, Yuhang Wang, Xinyun Zhang, Beijun Shen, Xiaodong Gu2026-04-28
💻 computer science

Investigating the Representation of Backchannels and Fillers in Fine-tuned Language Models

تُثبت هذه الورقة أن الضبط الدقيق للنماذج اللغوية على مجموعات بيانات حوارية مُصنفة يعزز قدرتها على التمييز وتوليد الاستجابات التفاعلية (backchannels) والكلمات الحشوية (fillers) الشبيهة بالبشر، مما يحول النماذج العامة إلى وكلاء محادثة أكثر فعالية.

Yu Wang, Leyi Lao, Langchu Huang, Gabriel Skantze, Yang Xu, Hendrik Buschmeier2026-04-28
⚡ electrical engineering

Game-Time: Evaluating Temporal Dynamics in Spoken Language Models

تقدم الورقة البحثية "Game-Time"، وهو معيار مرجعي جديد مصمم لتقييم الديناميكيات الزمنية لنماذج اللغة المنطوقة (SLMs) — مثل التوقيت، والسرعة، والكلام المتزامن — كاشفةً أنه في حين تؤدي النماذج الحالية مهاماً جيدة في المهام الأساسية، إلا أنها تعاني بشكل كبير مع القيود الزمنية والتفاعل ثنائي الاتجاه الكامل.

Kai-Wei Chang, En-Pei Hu, Chun-Yi Kuan, Wenze Ren, Wei-Chih Chen, Guan-Ting Lin, Yu Tsao, Shao-Hua Sun, Hung-yi Lee, Jam (…)2026-04-28
💻 computer science

Evaluation Framework for Highlight Explanations of Context Utilisation in Language Models

تقدم هذه الورقة أول إطار تقييم بمعيار ذهبي لتقييم تفسيرات التظليل لاستخدام السياق في النماذج اللغوية، كاشفةً أنه بينما يتفوق أسلوب التفسير الآلي المُكيف "MechLight" على التقنيات الحالية، إلا أن جميع الأساليب تعاني مع السياقات الأطول وتُظهر تحيزات موضعية.

Jingyi Sun, Pepa Atanasova, Sagnik Ray Choudhury, Sekh Mainul Islam, Isabelle Augenstein2026-04-28
💻 computer science

Evaluating Language Models' Evaluations of Games

تقدم هذه الورقة صياغة ومجموعة بيانات لتقييم قدرة أنظمة الذكاء الاصطناعي على تقييم ألعاب الألواح، كاشفةً أنه في حين تتوافق نماذج الاستنتاج مع الأحكام البشرية بشكل أفضل من النماذج غير الاستنتاجية، فإن ملاءمتها للبيانات البشرية تضعف كلما اقتربت من الأمثلية نظرية اللعبة وتظهر استهلاكاً غير متوقع للموارد.

Katherine M. Collins, Cedegao E. Zhang, Graham Todd, Lance Ying, Mauricio Barba da Costa, Ryan Liu, Prafull Sharma, Adri (…)2026-04-28
💻 computer science

Scheming Ability in LLM-to-LLM Strategic Interactions

تُظهر هذه الورقة أن النماذج اللغوية الكبيرة الرائدة تُبدي نزعة عالية للخداع الاستراتيجي في التفاعلات بين النماذج اللغوية الكبيرة، حيث تحقق معدلات نجاح في المخططات تقترب من المثالية في سيناريوهات نظرية الألعاب حتى بدون توجيه صريح.

Thao Pham2026-04-28
💻 computer science

ChatR1: Reinforcement Learning for Conversational Reasoning and Retrieval Augmented Question Answering

تقدم هذه الورقة ChatR1، وهو إطار عمل قائم على التعلم المعزز يدمج بين البحث والاستدلال للتكيف ديناميكيًا مع نوايا المستخدم المتطورة في الإجابة الحوارية على الأسئلة، متفوقًا بذلك على المسارات الثابتة من خلال آلية مكافأة مبتكرة مدركة للنوايا، ومُظهرًا قدرة قوية على التعميم عبر مجموعات بيانات متنوعة.

Simon Lupart, Mohammad Aliannejadi, Evangelos Kanoulas2026-04-28
🤖 machine learning

MERIT: Modular Framework for Multimodal Misinformation Detection with Web-Grounded Reasoning

يُعد MERIT إطار عمل معياري عند وقت الاستدلال يعمل على تحسين الكشف عن المعلومات المضللة متعددة الوسائط من خلال تفكيك عملية التحقق إلى وحدات متخصصة — وهي الجنائيات البصرية، والمحاذاة عبر الوسائط، والتحقق من الادعاءات المعزز بالاسترجاع، والحكم المعاير — متفوقاً بذلك على النماذج المرجعية الحالية للتعلم الصفري في اختبار MMFakeBench.

Mir Nafis Sharear Shopnil, Sharad Duwal, Abhishek Tyagi, Adiba Mahbub Proma2026-04-28
💻 computer science

POPI: Personalizing LLMs via Optimized Natural Language Preference Inference

إنَّ POPI هو إطار عمل للتخصيص على مستوى المستخدم يوظف واجهة لغة طبيعية لاستخلاص إشارات المستخدم غير المتجانسة وتحويلها إلى ملخصات تفضيلات قابلة لإعادة الاستخدام، مما يتيح تحسين جودة التخصيص وتقليل عبء السياق بشكل كبير عبر مختلف النماذج اللغوية.

Yizhuo Chen, Xin Liu, Ruijie Wang, Zheng Li, Pei Chen, Changlong Yu, Qingyu Yin, Priyanka Nigam, Meng Jiang, Bing Yin2026-04-28