💬 NLP

BibTeX Citation Hallucinations in Scientific Publishing Agents: Evaluation and Mitigation

تقدم هذه الورقة معياراً شاملاً وتصنيفاً للأخطاء لتقييم هلوسة الاستشهاد في النماذج اللغوية الكبيرة المدعومة بالبحث، كاشفةً أن حتى النماذج الرائدة تعاني مع الأوراق البحثية الحديثة بسبب الاعتماد على الذاكرة البارامترية، وتثبت أن استراتيجية تخفيف مكونة من مرحلتين باستخدام أداة `clibib` مفتوحة المصدر تحسن دقة "BibTeX" بشكل كبير مع تقليل التراجع إلى أدنى حد.

Delip Rao, Chris Callison-Burch2026-04-06
💬 NLP

Detecting and Correcting Reference Hallucinations in Commercial LLMs and Deep Research Agents

تقيم هذه الورقة بشكل منهجي مدى صحة روابط الاستشهاد (URLs) في النماذج اللغوية الكبيرة ووكلاء البحث العميق، كاشفةً عن معدلات كبيرة من الهلوسة والروابط غير القابلة للحل عبر مختلف المجالات، وتثبت أن أداة مفتوحة المصدر تسمى `urlhealth` يمكنها تقليل هذه الأخطاء بفعالية بمعدل يصل إلى 79 مرة من خلال التصحيح الذاتي الوكيل.

Delip Rao, Eric Wong, Chris Callison-Burch2026-04-06
🤖 machine learning

PRISM: LLM-Guided Semantic Clustering for High-Precision Topics

تقدم الورقة البحثية PRISM، وهو إطار عمل لنمذجة المواضيع منخفض التكلفة يعمل على تقطير الإشراف المتناثر من النماذج اللغوية الكبيرة (LLMs) إلى مشفر جمل خفيف الوزن لتحقيق تجميع دلالي عالي الدقة وقابل للتفسير لتحليل النصوص على نطاق الويب.

Connor Douglas, Utkucan Balci, Joseph Aylett-Bullock2026-04-06
💬 NLP

Reliability Gated Multi-Teacher Distillation for Low Resource Abstractive Summarization

تقدم هذه الورقة تقنيات تقطير متعددة المعلمين تراعي الموثوقية، وتحديداً EWAD وCPDP، لتحسين التلخيص التجريدي منخفض الموارد من خلال توجيه الإشراف ديناميكياً بناءً على اتفاق المعلمين والحفاظ على القيود الهندسية، مما يثبت في النهاية أن تقطير المعرفة على مستوى اللوجيت (logit-level) يقدم أكثر مكاسب الأداء موثوقية مع الكشف عن حدود التقطير المعقد على المخرجات الطويلة والتحيزات في تقييمات الحكم الواحد.

Dipto Sumit, Ankan Kumar Roy, Sadia Khair Rodela, Atia Haque Asha, Mourchona Afrin, Niloy Farhan, Farig Yousuf Sadeque2026-04-06
💬 NLP

Learning the Signature of Memorization in Autoregressive Language Models

تقدم هذه الورقة البحثية هجوم استنتاج العضوية المتعلم القابل للنقل (LT-MIA)، وهو أول هجوم استنتاج عضوية متعلم قابل للنقل يستفيد من "توقيع الحفظ" الثابت الناتج عن الضبط الدقيق لتحقيق تعميم فائق في وضع الصفر (zero-shot) عبر عائلات معمارية متنوعة (بما في ذلك Mamba وRWKV) ونطاقات بيانات (اللغة الطبيعية والبرمجية) دون الاعتماد على الاستدلالات المصممة يدويًا أو النماذج الظلية.

David Ilić, Kostadin Cvejoski, David Stanojević, Evgeny Grigorenko2026-04-06
💻 computer science

Analyzing Language Bias Between French and English in Conventional Multilingual Sentiment Analysis Models

مستلهمةً من اعتبارات التحيز لدى هيئة الإحصاء الكندية، تستخدم هذه الدراسة نموذجي "آلة ناقلات الدعم" (SVM) و"نايف بايز" (Naive Bayes) على مجموعات بيانات متوازنة باللغتين الفرنسية والإنجليزية لتكشف أنه في حين أن تصنيف المشاعر باللغة الفرنسية غالباً ما يتفوق على الإنجليزية، فإن مقاييس "فيرليرن" (Fairlearn) تشير إلى أن نموذج "آلة ناقلات الدعم" يحقق معاملة شبه عادلة عبر اللغات، بينما يظهر نموذج "نايف بايز" تفاوتات أكبر، مما يؤكد الحاجة الماسة لتطوير أنظمة معالجة لغات طبيعية متعددة اللغات وعادلة.

Ethan Parker Wong, Faten M'hiri2026-04-03
⚡ electrical engineering

J-CHAT: Japanese Large-scale Spoken Dialogue Corpus for Spoken Dialogue Language Modeling

تقدم هذه الورقة J-CHAT، وهو متن مفتوح المصدر للحوار الياباني المنطوق يبلغ طوله 76,000 ساعة، تم إنشاؤه من بيانات يوتيوب والبودكاست باستخدام منهجية مؤتمتة، مما يعالج أوجه القصور في مجموعات البيانات الحالية ويثبت الفعالية في تدريب أنظمة الحوار المنطوق المتقدمة.

Wataru Nakata, Kentaro Seki, Hitomi Yanaka, Yuki Saito, Shinnosuke Takamichi, Hiroshi Saruwatari2026-04-03
💬 NLP

Detecting Reference Errors in Scientific Literature with Large Language Models

تُظهر هذه الدراسة أن النماذج اللغوية الكبيرة من عائلة GPT التابعة لشركة OpenAI يمكنها اكتشاف الاستشهادات الخاطئة في الأدبيات العلمية بفعالية باستخدام مجموعات بيانات مشروحة من قبل خبراء وتعزيز الاسترجاع، دون الحاجة إلى الضبط الدقيق.

Tianmai M. Zhang, Neil F. Abernethy2026-04-03
🤖 machine learning

Green Prompting: Characterizing Prompt-driven Energy Costs of LLM Inference

تثبت هذه الورقة تجريبياً أن المعنى الدلالي للمطالبات والكلمات المفتاحية المحددة المتعلقة بالمهمة، وليس مجرد طول المطالبة، يؤثر بشكل كبير على استهلاك الطاقة أثناء استنتاج النماذج اللغوية الكبيرة، مما يسلط الضوء على إمكانية تحسين الكفاءة من خلال التصميم الاستراتيجي للمطالبات.

Marta Adamska, Daria Smirnova, Hamid Nasiri, Zhengxin Yu, Peter Garraghan2026-04-03
💻 computer science

KARL: Knowledge-Aware Reasoning and Reinforcement Learning for Knowledge-Intensive Visual Grounding

تعالج هذه الورقة فجوة التجذير المعرفي في عملية التأسيس البصري كثيف المعرفة من خلال اقتراح KARL، وهو إطار عمل يجمع بين بيانات الاستدلال الموجهة معرفيًا والتعلم التعزيزي التكيفي لتحسين تحديد مواقع الكيانات، والذي تم التحقق من صحته بواسطة مقياس KVG-Bench الجديد.

Xinyu Ma, Ziyang Ding, Zhicong Luo, Chi Chen, Zonghao Guo, Derek F. Wong, Zhen Zhao, Xiaoyi Feng, Maosong Sun2026-04-03