💻 computer science

From Static Inference to Dynamic Interaction: Navigating the Landscape of Streaming Large Language Models

تتناول هذه الورقة الفهم المجزأ لنماذج اللغات الكبيرة المتدفقة من خلال اقتراح تعريف موحد وتصنيف منهجي قائم على تدفق البيانات والتفاعل الديناميكي، مع تحليل منهجياتها وتطبيقاتها في العالم الحقيقي واتجاهات البحث المستقبلية.

Junlong Tong, Zilong Wang, YuJie Ren, Peiran Yin, Hao Wu, Wei Zhang, Xiaoyu Shen2026-03-06
💻 computer science

Vibe Code Bench: Evaluating AI Models on End-to-End Web Application Development

تقدم هذه الورقة "Vibe Code Bench"، وهو معيار مرجعي جديد يضم 100 مواصفة لتطبيقات الويب يتم تقييمها بواسطة وكلاء تصفح ذاتيين، مما يكشف أن أفضل النماذج الرائدة لا تحقق سوى 58.0% من الدقة في مهام التطوير من البداية إلى النهاية، ويسلط الضوء على الاختبار الذاتي ومواءمة المقيم كعوامل حاسمة للنجاح.

Hung Tran, Langston Nashold, Rayan Krishnan, Antoine Bigeard, Alex Gu2026-03-06
💻 computer science

Coordinated Semantic Alignment and Evidence Constraints for Retrieval-Augmented Generation with Large Language Models

تقترح هذه الورقة طريقةً للتوليد المعزز بالاسترجاع تدمج بين المحاذاة الدلالية المنسقة وقيود الأدلة الصريحة لمعالجة عدم المحاذاة الدلالية وعدم كفاية استغلال الأدلة، مما يعزز الموثوقية الواقعية والقابلية للتحقق في مخرجات النماذج اللغوية الكبيرة.

Xin Chen, Saili Uday Gadgil, Jiarong Qiu2026-03-06
🔬 physics

Stan: An LLM-based thermodynamics course assistant

تقدم هذه الورقة "ستان" (Stan)، وهو نظام ذكاء اصطناعي محلي النشر ومحافظ على الخصوصية مخصص لمساق الديناميكا الحرارية لمرحلة البكالوريوس، يستخدم نماذج مفتوحة الأوزان لتقديم تعليم مدعوم بمراجع ومستند إلى الحقائق للطلاب، وتوليد رؤى تدريسية قابلة للتنفيذ للمحاضرين في آن واحد من خلال مجموعة بيانات مشتركة من نصوص المحاضرات وبيانات الكتب المنهجية.

Eric M. Furst, Vasudevan Venkateshwaran2026-03-06
💻 computer science

Using Vision + Language Models to Predict Item Difficulty

تُظهر هذه الدراسة أن النهج متعدد الوسائط الذي يجمع بين نماذج الرؤية واللغة (GPT-4.1-nano) لتحليل كل من صور التصورات والسمات النصية يتفوق بشكل كبير على الأساليب أحادية الوسائط في التنبؤ بصعوبة بنود اختبار الثقافة البياناتية للبالغين في الولايات المتحدة، محققاً متوسط خطأ مطلق قدره 0.224.

Samin Khan2026-03-06
💻 computer science

Optimizing Language Models for Crosslingual Knowledge Consistency

تقدم هذه الورقة البحثية "تحسين الاتساق المباشر" (DCO)، وهو أسلوب مستوحى من التعلم التعزيزي يعمل على تحسين اتساق المعرفة عبر اللغات في النماذج اللغوية الكبيرة بشكل كبير، وذلك عبر اشتقاق دالة مكافأة مهيكلة مباشرة من النموذج نفسه، مما يلغي الحاجة إلى نموذج مكافأة صريح ويتفوق على النهج الحالية.

Tianyu Liu, Jirui Qi, Mrinmaya Sachan, Ryan Cotterell, Raquel Fernández, Arianna Bisazza2026-03-06
💻 computer science

AI-Assisted Moot Courts: Simulating Justice-Specific Questioning in Oral Arguments

تقترح هذه الورقة إطار تقييم ثنائي الطبقات لتقدير قدرة نماذج الذكاء الاصطناعي على محاكاة الاستجواب الخاص بالعدالة في المحاكم الصورية، حيث وجدت أنه بينما تولد النماذج أسئلة واقعية تغطي القضايا القانونية الرئيسية، إلا أنها لا تزال تعاني من نقص في التنوع والمداهنة (Sycophancy)—وهي أوجه قصور قد تغفل عنها طرق التقييم الساذجة.

Kylie Zhang, Nimra Nadeem, Lucia Zheng, Dominik Stammbach, Peter Henderson2026-03-06
💻 computer science

Model Medicine: A Clinical Framework for Understanding, Diagnosing, and Treating AI Models

تقدم هذه الورقة "طب النماذج" (Model Medicine)، وهو برنامج بحث سريري شامل يعامل نماذج الذكاء الاصطناعي ككائنات تشبه الكائنات البيولوجية من خلال إنشاء تصنيف للتخصصات الفرعية، وإطار عمل للوراثة السلوكية، وأدوات تشخيصية مبتكرة مثل التصوير بالرنين المغناطيسي العصبي (Neural MRI) لفهم واضطرابات النماذج وتشخيصها وعلاجها بشكل منهجي.

Jihoon Jeong2026-03-06
💻 computer science

Solving an Open Problem in Theoretical Physics using AI-Assisted Discovery

تقدم هذه الورقة نظام ذكاء اصطناعي عصبي-رمزي حلّ بشكل مستقل مسألة مفتوحة في الفيزياء النظرية عبر اشتقاق حلول تحليلية دقيقة وجديدة لطيف قدرة الإشعاع الثقالي للأوتار الكونية، متجاوزاً بذلك النتائج الجزئية السابقة ومثبتاً قدرة الذكاء الاصطناعي على تسريع الاكتشاف الرياضي.

Michael P. Brenner, Vincent Cohen-Addad, David Woodruff2026-03-06
💻 computer science

Interactive Benchmarks

تقترح هذه الورقة البحثية "المعايير المرجعية التفاعلية"، وهي نموذج تقييم موحد يقيس ذكاء النماذج من خلال الاستحواذ النشط على المعلومات والاستدلال تحت قيود الميزانية في البراهين والألعاب التفاعلية، مما يثبت أن النماذج الحالية لا تزال لديها مجال كبير للتحسين في هذه السيناريوهات الديناميكية.

Baoqing Yue, Zihan Zhu, Yifan Zhang, Jichen Feng, Hufei Yang, Mengdi Wang2026-03-06