💬 NLP

Enhancing Unsupervised Keyword Extraction in Academic Papers through Integrating Highlights with Abstract

تُثبت هذه الورقة أن دمج قسم "أبرز النقاط" مع الملخص يحسن بشكل كبير أداء نماذج استخراج الكلمات المفتاحية غير الخاضعة للإشراف للأوراق الأكاديمية، كما تم التحقق من ذلك من خلال تجارب على مجموعات بيانات علوم الحاسوب وعلوم المكتبات والمعلومات.

Yi Xiang, Chengzhi Zhang2026-04-22
💬 NLP

Bangla Key2Text: Text Generation from Keywords for a Low Resource Language

تقدم هذه الورقة البحثية Bangla Key2Text، وهي مجموعة بيانات ضخمة مكونة من 2.6 مليون زوج من الكلمات المفتاحية والنصوص باللغة البنغالية تم إنشاؤها عبر مسار يعتمد على نموذج BERT، وتُظهر أن الضبط الدقيق لنماذج التسلسل إلى تسلسل مثل mT5 وBanglaT5 يتفوق بشكل كبير على النماذج اللغوية الكبيرة ذات القدرة على التعلم الصفري في توليد النصوص القائمة على الكلمات المفتاحية في هذه اللغة ذات الموارد المنخفضة.

Tonmoy Talukder, G M Shahariar2026-04-22
💬 NLP

Diagnosable ColBERT: Debugging Late-Interaction Retrieval Models Using a Learned Latent Space as Reference

تقترح ورقة الموقف هذه إطار عمل "Diagnosable ColBERT"، الذي يعمل على محاذاة تضمينات رموز ColBERT مع فضاء كامن مرتكز على المعرفة السريرية لتحويل درجات التفاعل الضحلة إلى أدلة قابلة للفحص لتشخيص إخفاقات النموذج المنهجية وتوجيه تنقية البيانات القائمة على المبادئ في مجال الاسترجاع الحيوي الطبي.

François Remy2026-04-22
💬 NLP

Impact of large language models on peer review opinions from a fine-grained perspective: Evidence from top conference proceedings in AI

تكشف هذه الدراسة أن ظهور النماذج اللغوية الكبيرة قد غيّر عملية مراجعة الأقران في مؤتمرات الذكاء الاصطناعي المرموقة من خلال جعل التقارير أطول، وأكثر طلاقة، ومعيارية، مع تحويل التركيز في الوقت ذاته نحو الوضوح السطحي والملخصات على حساب التقييمات النقدية الأكثر عمقاً فيما يتعلق بالأصالة والقابلية للتكرار.

Wenqing Wu, Chengzhi Zhang, Yi Zhao, Tong Bao2026-04-22
💬 NLP

RoLegalGEC: Legal Domain Grammatical Error Detection and Correction Dataset for Romanian

تقدم هذه الورقة البحثية RoLegalGEC، وهي أول مجموعة بيانات متوازية باللغة الرومانية تحتوي على 350,000 خطأ نحوي مشروح في النصوص القانونية، وتقيم نماذج شبكات عصبية متنوعة لإثبات فعاليتها في تدريب أدوات كشف وتصحيح الأخطاء النحوية المصممة خصيصاً للمجال القانوني.

Mircea Timpuriu, Dumitru-Clementin Cercel2026-04-22
💬 NLP

The "Small World of Words" German Free-Association Norms

تقدم هذه الورقة البحثية SWOW-DE، وهي أكبر مجموعة من معايير التداعي الحر للغة الألمانية حتى الآن، والتي تسد فجوة في الموارد الحيوية من خلال توفير 5,877 كلمة محفزة تتنبأ بقوة بالأداء في المهام اللغوية النفسية وتتيح إجراء مقارنات عابرة للغات مع البيانات الموجودة.

Samuel Aeschbach, Rui Mata, Kaidi Lõo, Simon De Deyne, Dirk U. Wulff2026-04-22
🤖 AI

SafetyALFRED: Evaluating Safety-Conscious Planning of Multimodal Large Language Models

تقدم هذه الورقة SafetyALFRED، وهو معيار مرجعي جديد يوسع بيئة ALFRED عبر إضافة مخاطر مطبخية من العالم الحقيقي لتقييم النماذج اللغوية الكبيرة متعددة الوسائط، مما يكشف عن فجوة كبيرة بين قدرتها على التعرف على المخاطر الأمنية في إعدادات الإجابة على الأسئلة الثابتة وقدرتها على التخفيف من تلك المخاطر بنشاط من خلال التخطيط المتجسد.

Josue Torres-Fonseca, Naihao Deng, Yinpei Dai, Shane Storks, Yichi Zhang, Rada Mihalcea, Casey Kennington, Joyce Chai2026-04-22
💬 NLP

Micro Language Models Enable Instant Responses

تقدم هذه الورقة نماذج اللغة الدقيقة (μ\muLMs)، وهي نماذج فائقة الصغر مخصصة للأجهزة (8-30 مليون معلمة) تقوم بتوليد بداية الاستجابة فورياً لإخفاء زمن انتقال السحابة، بينما يقوم نموذج سحابي أكبر باستكمال الجملة بسلاسة من خلال إطار عمل تعاوني يضمن الاستجابة للأجهزة الطرفية محدودة الموارد.

Wen Cheng, Tuochao Chen, Karim Helwani, Sriram Srinivasan, Luke Zettlemoyer, Shyamnath Gollakota2026-04-22
💬 NLP

The signal is the ceiling: Measurement limits of LLM-predicted experience ratings from open-ended survey text

تُظهر هذه الورقة أنه بينما يمكن لتخصيص الأوامر البرمجية (prompt customization) أن يحسن دقة النماذج اللغوية الكبيرة قليلاً في التنبؤ بتقييمات تجربة المشجعين من النصوص الاستقصائية، فإن سقف الأداء الجوهري يتحدد من خلال المحتوى اللغوي المتأصل في المدخلات والفجوة بين الملاحظات المكتوبة والقرارات الفعلية، وليس من خلال اختيار النموذج أو الهندسة المكثفة.

Andrew Hong, Jason Potteiger, Luis E. Zapata2026-04-22
💬 NLP

Pause or Fabricate? Training Language Models for Grounded Reasoning

تقدم هذه الورقة البحثية إطار "الاستدلال المرتكز عبر التعلم التعزيزي التفاعلي" (GRIL)، وهو إطار متعدد الجولات يدرب النماذج اللغوية على إدراك فجوات المعلومات والتوقف لطلب التوضيح بدلاً من اختلاق مقدمات، مما يحسن بشكل كبير من دقة وكفاءة الاستدلال في المهام ذات المعلومات غير المكتملة.

Yiwen Qiu, Linjuan Wu, Yizhou Liu, Yuchen Yan, Jin Ma, Xu Tan, Yao Hu, Daoxin Zhang, Wenqi Zhang, Weiming Lu, Jun Xiao (…)2026-04-22