🤖 AI

VERT: Reliable LLM Judges for Radiology Report Evaluation

تقدم هذه الورقة VERT، وهو مقياس موثوق يعتمد على النماذج اللغوية الكبيرة لتقييم تقارير الأشعة عبر مختلف الوسائط والأعضاء، حيث تثبت من خلال تحليل ارتباط واسع النطاق وضبط دقيق أنه يتفوق بشكل كبير على الأساليب الحالية في التوافق مع أحكام الخبراء مع تقديم مكاسب كفاءة جوهرية.

Federica Bologna, Jean-Philippe Corbeil, Matthew Wilkens, Asma Ben Abacha2026-04-07
💬 NLP

Noise Steering for Controlled Text Generation: Improving Diversity and Reading-Level Fidelity in Arabic Educational Story Generation

تُثبت هذه الورقة أن حقن ضوضاء غاوسية مُعايرة في التمثيلات الداخلية لنماذج اللغة العربية الصغيرة أثناء الاستدلال يعد استراتيجية متفوقة، وخالية من التدريب، لتوليد قصص تعليمية متنوعة وعالية الجودة ومخلصة للمستوى القرائي مقارنة بأخذ العينات عند درجات حرارة عالية التقليدية.

Haziq Mohammad Khalid, Salsabeel Shapsough, Imran Zualkernan2026-04-07
💬 NLP

Are Arabic Benchmarks Reliable? QIMMA's Quality-First Approach to LLM Evaluation

تُعد "قِمّة" (QIMMA) لوحة صدارة للنماذج اللغوية الكبيرة باللغة العربية تضمن جودة النتائج، حيث توظف مسار مراجعة صارمًا متعدد النماذج وبشريًا للتحقق من أكثر من 52,000 عينة من اختبارات القياس باللغة العربية الأصلية، مما يضمن أساسًا موثوقًا وقابلًا للتكرار والتوسع مجتمعيًا لتقييم معالجة اللغات الطبيعية العربية.

Leen AlQadi, Ahmed Alzubaidi, Mohammed Alyafeai, Hamza Alobeidli, Maitha Alhammadi, Shaikha Alsuwaidi, Omar Alkaabi, Bas (…)2026-04-07
💬 NLP

Lightweight Query Routing for Adaptive RAG: A Baseline Study on RAGRouter-Bench

تقدم هذه الورقة أول تقييم منهجي للمصنفات خفيفة الوزن لتوجيه الاستعلامات على RAGRouter-Bench، حيث تُظهر أن نهج TF-IDF مع SVM البسيط يحقق دقة عالية (93.2%) وتوفيراً كبيراً في الرموز (28.1%) من خلال الاستفادة من أنماط الكلمات المفتاحية السطحية بدلاً من التضمينات الدلالية للتمييز بين استعلامات الحقائق، والاستدلال، والتلخيص.

Prakhar Bansal, Shivangi Agarwal2026-04-07
💬 NLP

The Tool Illusion: Rethinking Tool Use in Web Agents

تتحدى هذه الورقة البحثية الفرضية القائلة بتفوق استخدام الأدوات في وكلاء الويب من خلال إجراء دراسة تجريبية واسعة النطاق ومنضبطة عبر إعدادات متنوعة لإرساء أساس تجريبي أكثر موثوقية لفهم فوائدها الفعلية، ومبادئ تصميمها، وآثارها الجانبية المحتملة.

Renze Lou, Baolin Peng, Wenlin Yao, Qianhui Wu, Hao Cheng, Suman Nath, Wenpeng Yin, Jianfeng Gao2026-04-07
💬 NLP

Vocabulary Dropout for Curriculum Diversity in LLM Co-Evolution

تقدم هذه الورقة البحثية "إسقاط المفردات" (vocabulary dropout)، وهو آلية خفيفة الوزن تطبق قناعاً عشوائياً غير مستقر على مخرجات اللوجيت (logits) لنموذج الاقتراح، وذلك لمنع انهيار التنوع في التطور المشترك للعب الذاتي، مما يحافظ على تنوع المنهج الدراسي ويحسن بشكل كبير من أداء الحلّال في اختبارات معايير الاستدلال الرياضي.

Jacob Dineen, Aswin RRV, Zhikun Xu, Ben Zhou2026-04-07
🧬 biology

Large Language Models Align with the Human Brain during Creative Thinking

تُظهر هذه الدراسة أن النماذج اللغوية الكبيرة تُبدي توافقاً متزايداً مع نشاط الدماغ البشري أثناء التفكير الإبداعي مع نمو حجم النموذج، وأن أهداف ما بعد التدريب المحددة (مثل تحسين الإبداع، أو الضبط الدقيق للسلوك البشري، أو تدريب الاستدلال) تعيد تشكيل هذه التمثيلات العصبية بشكل انتقائي لتعمل إما على الحفاظ على هندسة الدماغ للتفكير الإبداعي أو تعزيزها أو الانحراف عنها.

Mete Ismayilzada, Simone A. Luchini, Abdulkadir Gokce, Badr AlKhamissi, Antoine Bosselut, Antonio Laverghetta Jr., Lonne (…)2026-04-07
💬 NLP

Cultural Authenticity: Comparing LLM Cultural Representations to Native Human Expectations

تقدم هذه الورقة إطار عمل متمحور حول الإنسان لتقييم المواءمة الثقافية للنماذج اللغوية الكبيرة من خلال مقارنة ناقلات التمثيل المولدة بواسطة النماذج مقابل ناقلات الأهمية المستمدة من البشر عبر تسع دول، مما يكشف أن النماذج الرائدة الحالية تظهر تحيزات متمحورة حول الغرب وأخطاءً منهجية تفشل في التقاط الأولويات الثقافية الدقيقة للسكان غير الأمريكيين بشكل أصيل.

Erin MacMurray van Liemt, Aida Davani, Sinchana Kumbale, Neha Dixit, Sunipa Dev2026-04-07
🤖 AI

Towards the AI Historian: Agentic Information Extraction from Primary Sources

يقدم تقرير التقدم التقني هذا الوحدة الأولى من "كرونوس" (Chronos)، وهو مؤرخ ذكاء اصطناعي مفتوح المصدر يُمكّن الباحثين من تحويل المسوحات الصورية للمصادر الأولية إلى بيانات من خلال تفاعلات لغوية طبيعية قابلة للتكيف، مما يعالج القيود الحالية لتبني الذكاء الاصطناعي في البحث التاريخي.

Lorenz Hufe, Niclas Griesshaber, Gavin Greif, Sebastian Oliver Eck, Philip Torr2026-04-07
💬 NLP

Focus Matters: Phase-Aware Suppression for Hallucination in Vision-Language Models

تقترح هذه الورقة تدخلاً خفيف الوزن، لا يتطلب تدريباً، عند مرحلة الاستدلال، يعمل على تخفيف الهلوسة في النماذج اللغوية البصرية الكبيرة من خلال تحديد بنية انتباه ثلاثية المراحل وكبت الرموز ذات الانتباه المنخفض انتقائياً خلال مرحلة "التركيز" باستخدام عملية نقطة المحدد، مما يقلل من الهلوسة مع تأخير ضئيل جداً مقارنة بطرق التحسين التكرارية.

Sohyeon Kim, Sang Yeon Yoon, Kyeongbo Kong2026-04-07