💬 NLP

RecaLLM: Addressing the Lost-in-Thought Phenomenon with Explicit In-Context Retrieval

يعالج RecaLLM ظاهرة "الضياع في التفكير"، حيث يتدهور أداء الاسترجاع بسبب التفكير، وذلك عبر دمج الاسترجاء السياقي الصريح مع التفكير واستخدام آلية فك ترميز مقيدة لتحقيق أداء قوي في السياقات الطويلة دون الحاجة إلى بيانات تدريب مكلفة للسياقات الطويلة.

Kyle Whitecross, Negin Rahimi2026-04-13
💬 NLP

BERT-as-a-Judge: A Robust Alternative to Lexical Methods for Efficient Reference-Based LLM Evaluation

تقدم هذه الورقة البحثية BERT-as-a-Judge، وهي طريقة تقييم خفيفة الوزن تعتمد على المشفر (encoder)، تتفوق على النماذج المعجمية الجامدة وتضاهي دقة نماذج لغوية كبيرة مكلفة من خلال تقييم الصحة الدلالية في المهام التوليدية القائمة على المراجع.

Hippolyte Gisserot-Boukhlef, Nicolas Boizard, Emmanuel Malherbe, Céline Hudelot, Pierre Colombo2026-04-13
💬 NLP

You Can't Fight in Here! This is BBS!

تتضمن هذه الورقة حواراً بين لغوي رسمي وعالم في الحوسبة، ينضم إليهما ٢٥ خبيراً من مجالات متنوعة، لتفنيد "مغالطة إحصاء السلاسل النصية" و"افتراض بلوغ أقصى حد من الكفاءة" فيما يتعلق بالنماذج اللغوية الكبيرة، داعين في نهاية المطي إلى برنامج بحثي تعاوني موسع يدمج رؤى الذكاء الاصطناعي للنهوض بعلم كل من اللغة البشرية والنماذج اللغوية على حد سواء.

Richard Futrell, Kyle Mahowald2026-04-13
💬 NLP

Many Ways to Be Fake: Benchmarking Fake News Detection Under Strategy-Driven AI Generation

تقدم هذه الورقة MANYFAKE، وهو معيار مرجعي اصطناعي يتكون من 6,798 مقالاً من الأخبار الزائفة القائمة على استراتيجيات محددة، لإثبات أنه في حين تعاني الكواشف الحالية مع القصص المختلقة بالكامل، إلا أنها هشة بشكل خاص أمام التضليل المعتمد على التعاون بين البشر والذكاء الاصطناعي والذي يمزج الأكاذيب مع روايات دقيقة.

Xinyu Wang, Sai Koneru, Wenbo Zhang, Wenliang Zheng, Saksham Ranjan, Sarah Rajtmajer2026-04-13
💬 NLP

VL-Calibration: Decoupled Confidence Calibration for Large Vision-Language Models Reasoning

تقترح الورقة البحثية VL-Calibration، وهو إطار عمل للتعلم التعزيزي يعمل على فصل الثقة إلى مكونات بصرية واستدلالية باستخدام تقدير اليقين البصري الجوهري وإعادة وزن الميزة على مستوى الرمز (token-level advantage reweighting) للحد من الهلوسة بفعالية وتحسين المعايرة في النماذج اللغوية الرؤية الضخمة (Large Vision-Language Models).

Wenyi Xiao, Xinchi Xu, Leilei Gan2026-04-13
💬 NLP

VisionFoundry: Teaching VLMs Visual Perception with Synthetic Images

تقدم الورقة البحثية VisionFoundry، وهو مسار عمل يقوم بتوليد بيانات VQA اصطناعية مخصصة لمهام معينة باستخدام النماذج اللغوية الكبيرة (LLMs) ونماذج تحويل النص إلى صورة لمعالجة نقاط الضعف في الإدراك البصري للنماذج اللغوية الرؤية، مما يؤدي إلى مكاسب كبيرة في الأداء على معايير مثل MMVP وCV-Bench-3D دون الحاجة إلى تعليق بشري.

Guanyu Zhou, Yida Yin, Wenhao Chai, Shengbang Tong, Xingyu Fu, Zhuang Liu2026-04-13
💬 NLP

Case-Grounded Evidence Verification: A Framework for Constructing Evidence-Sensitive Supervision

تقدم هذه الورقة إطار عمل للتحقق من الأدلة القائم على الحالات، والذي يعالج عقبة الإشراف الضعيف في الاستدلال القائم على الأدلة من خلال توليد أمثلة تدريبية محكومة دلالياً لتعليم النماذج الاعتماد الحقيقي على الأدلة لاتخاذ القرارات، مما يثبت أن الإشراف الصريح الذي يرمز الدور السببي للأدلة يحسن الأداء والمتانة بشكل كبير مقارنة بالنماذج المرجعية.

Soroosh Tayebi Arasteh, Mehdi Joodaki, Mahshad Lotfinia, Sven Nebelung, Daniel Truhn2026-04-13
💬 NLP

Seeing Like an AI: How LLMs Apply (and Misapply) Wikipedia Neutrality Norms

تقيم هذه الورقة قدرة النماذج اللغوية الكبيرة على تطبيق سياسة وجهة النظر المحايدة في ويكيبيديا، حيث وجدت أنه بينما تستطيع هذه النماذج توليد إعادة صياغة تُعتبر أكثر حيادية وطلاقة من التعديلات البشرية، إلا أنها تعاني في الكشف الدقيق عن الانحياز وغالباً ما تجري تغييرات غير ضرورية تبتعد عن معايير المجتمع، مما قد يؤدي إلى تقويض استقلالية المحررين وزيادة أعباء الإشراف.

Joshua Ashkinaze, Ruijia Guan, Laura Kurek, Eytan Adar, Ceren Budak, Eric Gilbert2026-04-10
📈 economics

Transforming the Voice of the Customer: Large Language Models for Identifying Customer Needs

تُثبت هذه الورقة أن النماذج اللغوية الكبيرة التي خضعت للضبط الدقيق تحت الإشراف يمكنها أتمتة تحديد وصياغة احتياجات العملاء من البيانات النوعية بفعالية، محققةً أداءً يطابق أو يتجاوز أداء المحللين المهنيين، مع تمكين استخلاص رؤى قابلة للتوسع وعالية التأثير للابتكار في المنتجات.

Artem Timoshenko, Chengfeng Mao, John R. Hauser2026-04-10
💬 NLP

Self-Reported Confidence of Large Language Models in Gastroenterology: Analysis of Commercial, Open-Source, and Quantized Models

تقيم هذه الدراسة الثقة المبلغ عنها ذاتياً لمختلف النماذج اللغوية الكبيرة في 300 سؤال من نمط اختبارات بورد أمراض الجهاز الهضمي، كاشفةً أنه بينما تُظهر النماذج الأعلى أداءً دقةً محسنة، فإن جميع النماذج تُظهر باستمرار ثقة مفرطة، مما يسلط الض الضوء على عائق حاسم أمام نشرها الآمن في مجال الرعاية الصحية.

Nariman Naderi, Seyed Amir Ahmad Safavi-Naini, Thomas Savage, Zahra Atf, Peter Lewis, Girish Nadkarni, Ali Soroush2026-04-10