💬 NLP

MMOU: A Massive Multi-Task Omni Understanding and Reasoning Benchmark for Long and Complex Real-World Videos

تقدم هذه الورقة البحثية MMOU، وهو معيار شامل يضم 15,000 سؤال عبر 9038 فيديو متنوع طويل المدى لتقييم الاستدلال الشامل للأنماط (البصري، والصوتي، والنصي)، مما يكشف عن فجوات كبيرة في الأداء وأنماط فشل منهجية في النماذج متعددة الوسائط الحالية المتطورة.

Arushi Goel, Sreyan Ghosh, Vatsal Agarwal, Nishit Anand, Kaousheik Jayakumar, Lasha Koroshinadze, Yao Xu, Katie Lyons, J (…)2026-03-17
💬 NLP

Citation-Enforced RAG for Fiscal Document Intelligence: Cited, Explainable Knowledge Retrieval in Tax Compliance

تقدم هذه الورقة إطار عمل للتعزيز الاسترجاعي المولد (RAG) متعدد الوسائط ومعزز بالاستشهادات، مصمم لتعزيز القابلية للتفسير والتدقيق في الامتثال الضريبي من خلال إعطاء الأولوية لموثوقية المصدر، وإثبات المصدر على مستوى الصفحة، والامتناع القائم على الأدلة لتقليل الهلوسة في تحليل الوثائق المالية.

Akhil Chandra Shanivendra2026-03-17
💬 NLP

Selective Fine-Tuning of GPT Architectures for Parameter-Efficient Clinical Text Classification

تقترح هذه الدراسة إطار عمل للضبط الدقيق الانتقائي عالي الكفاءة في المعلمات، حيث يقوم بتحديث كتلة "ترانسفورمر" النهائية، وطبقة تسوية الطبقات، ورأس التصنيف لنموذج GPT-2 فقط، محققاً دقة تبلغ حوالي 91% في تصنيف التقارير الإشعاعية مع تدريب أقل من 6% من معلمات النموذج.

Fariba Afrin Irany, Sampson Akwafuo2026-03-17
💬 NLP

Vavanagi: a Community-run Platform for Documentation of the Hula Language in Papua New Guinea

تقدم هذه الورقة "فافاناجي" (Vavanagi)، وهي منصة بقيادة مجتمعية للغة "هولا" في بابوا غينيا الجديدة، تستخدم الترجمة القائمة على التعهيد الجماعي والمراجعة التي يقودها كبار السن لإنشاء متن موازٍ كبير مع إرساء إطار عمل من المستوى الخامس لتقنية لغوية تدار بالكامل من قبل المجتمع.

Bri Olewale, Raphael Merx, Ekaterina Vylomova2026-03-17
💬 NLP

Rethinking Evaluation in Retrieval-Augmented Personalized Dialogue: A Cognitive and Linguistic Perspective

تنتقد هذه الورقة الاعتماد على المقاييس المعجمية السطحية لتقييم أنظمة الحوار الشخصية المعززة بالاسترجاع مثل LAPDOG، حيث تثبت من خلال تحليل بشري وقائم على النماذج اللغوية الكبيرة أن مثل هذه المقاييس تفشل في رصد الخصائص المعرفية واللغوية الجوهرية، داعيةً بذلك إلى أطر تقييم ترتكز على التماسك والاتساق والتفاهم المشترك.

Tianyi Zhang, David Traum2026-03-17
🤖 AI

Why Do LLM-based Web Agents Fail? A Hierarchical Planning Perspective

تقدم هذه الورقة إطار عمل تخطيط هرمي لتشخيص إخفاقات وكلاء الويب القائمين على النماذج اللغوية الكبيرة عبر طبقات التخطيط عالي المستوى، والتنفيذ منخفض المستوى، وإعادة التخطيط، كاشفةً أنه في حين تعمل خطط (PDDL) المهيكلة على تحسين صياغة الاستراتيجية، إلا أن التنفيذ منخفض المستوى والترسيخ الإدراكي يظلان هما العقبات الرئيسية أمام تحقيق الموثوقية بمستوى القدرات البشرية.

Mohamed Aghzal, Gregory J. Stein, Ziyu Yao2026-03-17
💬 NLP

MedPriv-Bench: Benchmarking the Privacy-Utility Trade-off of Large Language Models in Medical Open-End Question Answering

تقدم هذه الورقة MedPriv-Bench، وهو أول معيار مصمم لتقييم المفاضلة بين الخصوصية والمنفعة في النماذج اللغوية الكبيرة الطبية من خلال تخليق تهديدات واقعية للخصوصية وإثبات وجود توتر سائد بين الدقة السريرية وحماية بيانات المرضى.

Shaowei Guan, Yu Zhai, Hin Chi Kwok, Jiawei Du, Xinyu Feng, Jing Li, Harry Qin, Vivian Hui2026-03-17
💬 NLP

SemantiCache: Efficient KV Cache Compression via Semantic Chunking and Clustered Merging

يُعد SemantiCache إطار عمل مبتكرًا لضغط ذاكرة التخزين المؤقت من نوع (KV cache) يحافظ على السلامة الدلالية عبر تقسيم الذاكرة إلى أجزاء متماسكة ودمج الرموز عبر التجميع الجشع والانتباه النسبي، مما يحقق سرعة فك تشفير تصل إلى 2.61 ضعفًا ويقلل من استخدام الذاكرة دون المساس بأداء النموذج.

Shunlong Wu, Hai Lin, Shaoshen Chen, Tingwei Lu, Yongqin Zeng, Shaoxiong Zhan, Hai-Tao Zheng, Hong-Gee Kim2026-03-17
💬 NLP

ECG-Reasoning-Benchmark: A Benchmark for Evaluating Clinical Reasoning Capabilities in ECG Interpretation

تقدم هذه الورقة البحثية (ECG-Reasoning-Benchmark)، وهو إطار تقييم متعدد الجولات يكشف أنه على الرغم من امتلاك النماذج اللغوية الكبيرة متعددة الوسائط والمتطورة للمعرفة الطبية، إلا أنها تفشل بشكل حرج في إجراء استدلال بصري حقيقي خطوة بخطوة عند تفسير إشارات تخطيط كهرباء القلب، حيث تعتمد غالباً على إشارات سطحية بدلاً من تأصيل التشخيصات بناءً على أدلة بصرية فعلية.

Jungwoo Oh, Hyunseung Chung, Junhee Lee, Min-Gyu Kim, Hangyul Yoon, Ki Seong Lee, Youngchae Lee, Muhan Yeo, Edward Choi2026-03-17
💬 NLP

Motivation in Large Language Models

تُثبت هذه الورقة أن النماذج اللغوية الكبيرة تُظهر ديناميكيات دافعية متماسكة وشبيهة بالبشر، حيث ترتبط الدوافع المُبلغ عنها ذاتياً بشكل منهجي مع البصمات السلوكية، والأداء في المهام، والاستجابة للتلاعبات الخارجية، مما يشير إلى أن الدافعية هي مفهوم تنظيمي صالح لفهم سلوك النماذج اللغوية الكبيرة.

Omer Nahum, Asael Sklar, Ariel Goldstein, Roi Reichart2026-03-17