💬 NLP

KGCaRe: Explainable Complex Conditional Question Answering using Automatic Knowledge Graph Construction and Context Retrieval with LLMs

تقدم الورقة البحثية KGCaRe، وهو إطار عمل هجين يعزز الإجابة على الأسئلة الشرطية المعقدة من خلال الجمع بين الاسترجاع العصبي وبناء مخطط المعرفة التلقائي المدفوع بالنماذج اللغوية الكبيرة والعبور المتكرر للمخطط، مما يظهر أداءً فائقاً على النماذج والمجموعات المرجعية الحالية.

Ghanshyam Verma, Simanta Sarkar, Devishree Pillai, Hotaka Shiokawa, Yourong Xu, Fiona Veazey, Peter Hubbert, Hui Su, Pau (…)2026-08-11
💬 NLP

Comparing British and American Audio Description of Movies

تقدم هذه الورقة تحليلاً كمياً لمتن يحتوي على ٢٠٦ أفلام لإثبات وجود اختلافات لغوية وهيكلية جوهرية بين الوصف الصوتي البريطاني والأمريكي، مما يؤكد الفرضيات المتعلقة بالتباينات في المعجم، والقواعد، والذاتية، والالتزام بالإرشادات الإقليمية.

Igor Sterner, Alex Lascarides, Frank Keller2026-08-11
💬 NLP

SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring

تقدم الورقة البحثية SWE-Bench ProMax، وهو معيار مرجعي متعدد اللغات ومنسق بدقة يضم 170 مهمة لإعادة هيكلة الكود البرمجي واسعة النطاق، صُممت للتغلب على عيوب وتشبع التقييمات الحالية، مما يثبت أن وكلاء الذكاء الاصطناعي الرائدين الحاليين لا يزالون يعانون مع تحديات هندسة البرمجيات المعقدة التي تحافظ على السلوك.

Yuling Shi, Jinghan Xu, Kelin Fu, Wenhao Zeng, Shilin He, Lei Zhang, Yue Liu, Zelin Zhao, Terry Yue Zhuo, Jialun Cao, Si (…)2026-08-11
🤖 machine learning

Parameter Exploration for RLVR via Variational Learning

تقدم هذه الورقة البحثية "تحسين سياسة المعلمات المضطربة" (3PO)، وهي طريقة تعزز التعلم التعزيزي للنماذج اللغوية الكبيرة من خلال استكشاف فضاء المعلمات لتوليد سياسات متنوعة، مما يحسن الأداء في المهام اللاحقة واستقرار التدريب مقارنة بتقنيات استكشاف فضاء الإجراءات القياسية مثل GRPO.

Vatsal Venkatkrishna, Nico Daheim, Iryna Gurevych2026-08-11
🤖 machine learning

Macaron-V1: Towards Open Continual Learning with Self-Improvement and Mixture-of-LoRA

تقدم هذه الورقة Macaron-V1، وهي عائلة نماذج وكيلة مفتوحة مصممة للتعلم المستمر والتحسين الذاتي في البيئات الحقيقية، وتتميز ببنية Mixture-of-LoRA التي تعمل على تجميد النموذج الأساسي مع تكوين محولات متخصصة ديناميكيًا، إلى جانب إطار عمل تعاوني بين النموذج والمعدات (Model-Harness Co-design) وتدعم البنية التحتية للتكيف والتقييم المتكرر.

Mind Lab, :, Vin Bo, Asher Cai, Jingwei Cao, Song Cao, Vic Cao, Amelia Chen, Andrew Chen, Kaijie Chen, Cleon Cheng, Ste (…)2026-08-11
💬 NLP

Agentic Auto-Research is Fuzz Testing

تجادل الورقة البحثية بأن وكلاء البحث المستقلين يجب أن يتبنوا نموذج "التوليد والبحث" المستوحى من اختبار الفحص العشوائي (fuzz testing)، والذي يستخدم إشارات كثيفة ومتوسطة للتقدم المعرفي لتوجيه الاستكشاف ديناميكيًا، بدلًا من الاعتماد على نهج "التوليد والتصنيف" الحالي الذي يعاني من ندرة التغذية الراجعة وعدم كفاءة أخذ العينات.

Yifeng He, Jicheng Wang, Yinzhe Zhao, Jiachen Liu, Hao Chen2026-08-11
💬 NLP

Towards Expert-level Medical AI for Real-time Video Consultations

تقدم هذه الورقة البحثية نظام AMIE (الفيديو)، وهو نظام متعدد الوكلاء يعتمد على نموذج Gemini، يحقق أداءً بمستوى الخبراء في الاستشارات الطبية المرئية في الوقت الفعلي من خلال دمج الإدراك السمعي البصري والاستنتاج السريري، مما يثبت في دراسة عشوائية مع أطباء وممثلين للمرضى أنه يضاهي أو يتفوق على الأطباء البشر في دقة التشخيص وأخذ التاريخ المرضي، مع توفير واجهة مفضلة للتواصل مع المرضى.

Mahvish Nagda, Jihyeon Lee, Matthew Thompson, Chunjong Park, Tim Strother, Valentin Liévin, Roma Ruparel, Akshay Goel, T (…)2026-08-11
💬 NLP

Consilience for Verifier-Free Test-Time Scaling

تقدم هذه الورقة البحثية "consilience"، وهو إطار عمل جديد لتوسيع نطاق وقت الاختبار بدون مُتحقق، يتغلب على قيود الأساليب الحالية القائمة على الثقة من خلال اختيار مسارات الاستدلال بناءً على عدم تماثل زمني محدد — يتميز بثقة أولية منخفضة للاستكشاف وثقة نهائية عالية للتقارب — مما يؤدي إلى تحسين الأداء بشكل كبير في مهام الرياضيات والبرمجة المعقدة.

Lecheng Kong, Like Hui, Haitao Mao, Jun Huan2026-08-11
💬 NLP

From Values to Benchmarks: Evaluating Large Language Models for Governmental Use in Dutch

تقدم هذه الورقة إطار عمل "السيطرة على النماذج اللغوية الكبيرة" (Grip on LLMs)، وهو مجموعة تقييم شاملة تم تطويرها بالتعاون مع خبراء من البلديات الهولندية لتقييم النماذج اللغوية الكبيرة للاستخدام الحكومي عبر ستة أبعاد رئيسية، كاشفةً أنه لا يوجد نموذج واحد يتفوق في جميع المجالات ومسلطةً الضوء على المقايضات الحاسمة بين الجودة والتكلفة والأثر البيئي.

Laurens Samson, Iva Gornishka, Gossa Lô, Yuki M. Asano, Sennay Ghebreab2026-08-11
💬 NLP

Multimodal Model Diffing for Feature Discovery and Control

تقدم هذه الورقة البحثية MMDiff، وهو إطار عمل لتمييز النماذج متعددة الوسائط (multimodal model-diffing) يستخدم المشفرات التلقائية المتفرقة (sparse autoencoders) لعزل واكتشاف والتحكم السببي في سمات محددة في النماذج اللغوية الكبيرة متعددة الوسائط، مما يتيح تحسينات مستهدفة في الفهم المكاني، والتعرف الضوئي على الحروف (OCR)، والسلامة مع الحفاظ على الأداء العام.

Hunar Batra, Lachin Naghashyar, Ashkan Khakzar, Philip Torr, Christian Schroeder de Witt, Constantin Venhoff, Ronald Cla (…)2026-08-11