🤖 AI

GoodPoint: Learning Constructive Scientific Paper Feedback from Author Responses

تقدم الورقة البحثية GoodPoint، وهو إطار عمل للتدريب يستفيد من ردود المؤلفين لتنسيق مجموعة بيانات من الملاحظات الصالحة والقابلة للتنفيذ، مما يمكّن نموذج لغوي كبير تم ضبطه بدقة من التفوق بشكل كبير على النماذج الحالية في توليد ملاحظات بناءة حول الأوراق العلمية يجدها المؤلفون ذات قيمة عملية.

Jimin Mun, Chani Jung, Xuhui Zhou, Hyunwoo Kim, Maarten Sap2026-04-15
💬 NLP

AnyPoC: Universal Proof-of-Concept Test Generation for Scalable LLM-Based Bug Detection

تقدم الورقة البحثية AnyPoC، وهو إطار عمل متعدد الوكلاء وقابل للتوسع يقوم تلقائيًا بتوليد والتحقق بصرامة من اختبارات إثبات المفهوم القابلة للتنفيذ لتقارير الأخطاء البرمجية المرشحة، مما يقلل بشكل كبير من النتائج الإيجابية الكاذبة ويكتشف بنجاح أكثر من 120 خطأً جديدًا عبر 12 نظامًا برمجيًا رئيسيًا.

Zijie Zhao, Chenyuan Yang, Weidong Wang, Yihan Yang, Ziqi Zhang, Lingming Zhang2026-04-15
💬 NLP

INDOTABVQA: A Benchmark for Cross-Lingual Table Understanding in Bahasa Indonesia Documents

تقدم الورقة البحثية INDOTABVQA، وهي مجموعة بيانات مرجعية عابرة للغات لمهام الإجابة البصرية على الأسئلة المتعلقة بالجداول في وثائق اللغة الإندونيسية، والتي تقيم وتُظهر مكاسب أداء كبيرة لنماذج الرؤية واللغة من خلال الضبط الدقيق المستهدف ودمج الأولويات المكانية.

Somraj Gautam, Anathapindika Dravichi, Gaurav Harit2026-04-15
💬 NLP

Filtered Reasoning Score: Evaluating Reasoning Quality on a Model's Most-Confident Traces

تقدم هذه الورقة "درجة الاستدلال المُرشَّحة" (Filtered Reasoning Score - FRS)، وهي مقياس تقييم مبتكر يقيس جودة مسارات استدلال النماذج اللغوية الكبيرة من خلال التركيز على مخرجاتها الأكثر ثقة، مما يميز بين النماذح ذات الدقة المتشابهة ولكن بقدرات استدلال مختلفة، ويُظهر ارتباطاً قوياً بمهارات الاستدلال القابلة للنقل.

Manas Pathak, Xingyao Chen, Shuozhe Li, Amy Zhang, Liu Leqi2026-04-15
💬 NLP

Self-Distillation Zero: Self-Revision Turns Binary Rewards into Dense Supervision

تقترح الورقة البحثية طريقة "التقطير الذاتي الصفري" (SD-Zero)، وهي طريقة تدريب تحول المكافآت الثنائية المتفرقة إلى إشراف كثيف على مستوى الرموز (token-level) من خلال جعل نموذج واحد يعمل كمولد ومراجع في آن واحد، مما يحقق أداءً فائقاً في اختبارات القياس الخاصة بالاستنتاج دون الحاجة إلى معلمين خارجيين أو نماذج توضيحية عالية الجودة.

Yinghui He, Simran Kaur, Adithya Bhaskar, Yongjin Yang, Jiarui Liu, Narutatsu Ri, Liam Fowl, Abhishek Panigrahi, Danqi C (…)2026-04-15
💬 NLP

LLMs Struggle with Abstract Meaning Comprehension More Than Expected

تكشف هذه الورقة أنه على الرغم من قدراتها العامة، تعاني النماذج اللغوية الكبيرة بشكل كبير في استيعاب المعنى التجريدي مقارنة بالنماذج المضبوطة بدقة، ولكنها تقترح مصنفاً يعتمد على الانتباه ثنائي الاتجاه مستوحى من الإدراك البشري، والذي ينجح في تعزيز أداء النماذج المضبوطة بدقة في معيار SemEval-2021 Task 4 (ReCAM).

Hamoud Alhazmi, Jiachen Jiang2026-04-15
💬 NLP

Think Through Uncertainty: Improving Long-Form Generation Factuality via Reasoning Calibration

يقدم البحث إطار عمل CURE، الذي يعزز واقعية التوليد طويل النص من خلال تدريب النماذج اللغوية الكبيرة على تقدير الثقة على مستوى كل ادعاء فردي عبر بروتوكول استدلال مهيكل ومعايرة متعددة المراحل، مما يتيح تنبؤاً انتقائياً أكثر دقة ويقلل من الهلوسة بشكل كبير.

Xin Liu, Lu Wang2026-04-15
💬 NLP

Empirical Evaluation of PDF Parsing and Chunking for Financial Question Answering with RAG

تقدم هذه الورقة دراسة تجريبية لتقييم مختلف أدوات تحليل ملفات PDF واستراتيجيات التجزئة ضمن أنظمة التوليد المعزز بالاسترجاع (RAG) للإجابة على الأسئلة المالية، مقدمةً معياراً جديداً يسمى TableQuest لتوفير إرشادات عملية لبناء مسارات قوية لفهم المستندات.

Omar El Bachyr, Yewei Song, Saad Ezzini, Jacques Klein, Tegawendé F. Bissyandé, Anas Zilali, Ulrick Ble, Anne Goujon2026-04-15
💬 NLP

LoSA: Locality Aware Sparse Attention for Block-Wise Diffusion Language Models

تقترح الورقة البحثية LoSA، وهي آلية انتباه متفرقة مدركة للمحلية، تعمل على تسريع نماذج اللغات الانتشارية القائمة على الكتل من خلال إعادة استخدام نتائج الانتباه المخزنة مؤقتًا للرموز المستقرة وتطبيق الانتباه المتفرق فقط على الرموز النشطة، مما يتغلب على تضخم مفاتيح والقيم (KV) لتحقيق تسريع كبير ودقة محسنة في سيناريوهات السياق الطويل.

Haocheng Xi, Harman Singh, Yuezhou Hu, Coleman Hooper, Rishabh Tiwari, Aditya Tomar, Minjae Lee, Wonjun Kang, Michael Ma (…)2026-04-15
💬 NLP

Robust Explanations for User Trust in Enterprise NLP Systems

تقترح هذه الورقة إطاراً موحداً لتقييم المتانة بنظام الصندوق الأسود للتفسيرات على مستوى الرمز (token-level) في معالجة اللغات الطبيعية للمؤسسات، حيث تُثبت من خلال دراسة واسعة النطاق متعددة البنيات أن النماذج اللغوية الكبيرة القائمة على فك التشفيد (decoder-based) توفر تفسيرات أكثر استقراراً بشكل ملحوظ من نماذج الترميز (encoder models)، مع تحسن الاستقرار بالتوازي مع حجم النموذج، مما يتيح اتخاذ قرارات عملية بشأن المفاضلة بين التكلفة والمتانة لعمليات النشر الحساسة للامتثال.

Guilin Zhang, Kai Zhao, Jeffrey Friedman, Xu Chu, Amine Anoun, Jerry Ting2026-04-15