🤖 AI

Do Vision-Language-Models show human-like logical problem-solving capability in point and click puzzle games?

تقدم هذه الورقة VLATIM، وهو معيار مرجعي قائم على لعبة *The Incredible Machine 2* يكشف عن فجوة كبيرة بين قدرات التخطيط رفيعة المستوى والربط البصري الدقيق للنماذج اللغوية الرؤية الحالية، مما يثبت أنها لم تحقق بعد قدرات حل المشكلات المنطقية الشبيهة بالبشر في بيئات الألغاز التفاعلية القائمة على النقر والتشير.

Dominik Helfenstein, Marco Menner, Maximilian Triebel2026-05-13
💻 computer science

ABRA: Agent Benchmark for Radiology Applications

تقدم الورقة البحثية ABRA، وهو معيار مرجعي جديد لوكلاء الأشعة، يضم 655 مهمة تم إنشاؤها برمجياً ضمن بيئة DICOM واقعية، والتي تكشف عن قدرات النماذج الحالية القوية في تنسيق الأدوات ولكنها تظهر أيضاً قصوراً كبيراً في الإدراك الصوري الطبي وتحديد مواقع النتائج.

Bulat Maksudov, Vladislav Kurenkov, Kathleen M. Curran, Alessandra Mileo2026-05-13
🤖 AI

PIVOT: Bridging Planning and Execution in LLM Agents via Trajectory Refinement

إن PIVOT هو إطار عمل للتعلم الذاتي يجسّر الفجوة بين التخطيط والتنفيذ في وكلاء النماذج اللغوية الكبيرة (LLM agents) من خلال تحسين المسارات المرشحة بشكل تكراري عبر عملية مكونة من أربع مراحل هي التخطيط، والفحص، والتطوير، والتحقق، محققاً أداءً هو الأفضل في فئته مع تقليل التكاليف الحسابية بشكل كبير.

Tuo Zhang, Alin-Ionut Popa, Yan Xu, Rui Song, Dimitrios Dimitriadis2026-05-13
🤖 machine learning

LiBaGS: Lightweight Boundary Gap Synthesis for Targeted Synthetic Data Selection

تُعدُّ LiBaGS طريقةً خفيفة الوزن وغير مرتبطة بمولد محدد، تعمل على تحسين اختيار البيانات الاصطناعية من خلال تقييم العينات بناءً على القرب من الحدود، وعدم اليقين، والكثافة، مع توظيف قاعدة تخصيص فجوة الحدود ومعيار توقف القيمة الهامشية لتحسين دقة المهام اللاحقة دون بيانات زائدة أو غير واقعية.

Abhishek Moturu, Anna Goldenberg, Babak Taati2026-05-13
🤖 AI

Rethinking LLMOps for Fraud and AML: Building a Compliance-Grade LLM Serving Stack

تقدم هذه الورقة بنية تحتية لعمليات النماذج اللغوية الكبيرة (LLMOps) مدركة لحجم عبء العمل ومصممة خصيصاً للامتثال لمكافحة الاحتيال ومكافحة غسل الأموال، والتي تستفيد من النماذج ذات الأوزان المفتوحة، وتحسينات الخدمة المتقدمة مثل PagedAttention وتخزين البادئة المؤقت (prefix caching)، وبوابات جودة صارمة لتحقيق تحسينات كبيرة في معدل الإنتاجية، وزمن الاستجابة، واستغلال وحدة معالجة الرسومات مقارنة بنهج خدمة النماذج اللغوية الكبيرة العامة.

Prathamesh Vasudeo Naik, Naresh Dintakurthi, Yue Wang2026-05-13
🤖 machine learning

Internalizing Curriculum Judgment for LLM Reinforcement Fine-Tuning

تقدم الورقة البحثية METIS، وهو إطار عمل مبتكر يستوعب حكم المنهج الدراسي كقدرة معرفية فوقية أصيلة للضبط الدقيق بالتعزيز للنماذج اللغوية الكبيرة عبر الاستفيد من تباين المكافأة داخل المطالبة لتخصيص موارد التدريب ديناميكيًا، مما يلغي الاعتماد على الاستدلالات الخارجية ويحقق أداءً فائقًا مع تقارب أسرع بشكل ملحوظ.

Han Zheng, Yining Ma, Karthick Gunasekaran, Bharathan Balaji, Zheng Du, Shiv Vitaladevuni, Cathy Wu2026-05-13
🤖 AI

Unlocking LLM Creativity in Science through Analogical Reasoning

تقدم هذه الورقة البحثية الاستدلال القياسي كنهج مبتكر للتخفيف من حدة انهيار النمط في النماذج اللغوية الكبيرة، حيث تُظهر أنه يعزز بشكل كبير تنوع وجدة الحلول العلمية المولدة مع تحقيق أداء رائد عبر مهام طبية حيوية متعددة.

Andrew Shen, Shaul Druckmann, James Zou2026-05-13
🤖 machine learning

Curriculum Learning-Guided Progressive Distillation in Large Language Models

تقترح هذه الورقة البحثية "التقطير التدريجي الموجه بالتعلم المنهجي" (CLPD)، وهو إطار عمل موحد يعزز تقطير المعرفة في النماذج اللغوية الكبيرة من خلال مواءمة صعوبة بيانات التدريب مع زيادة قدرة النموذج المعلم بشكل تدريجي، مما يتغلب على قيود الطرق الحالية ويحسن أداء الاستنتاج في النماذج الطلابية الأصغر حجماً.

Jincheng Cao, Fanzhi Zeng, Leqi Liu, Aryan Mokhtari2026-05-13
📊 statistics

Rethinking external validation for the target population: Capturing patient-level similarity with a generative model

تقترح هذه الورقة إطار عمل جديد للتحقق الخارجي يستخدم المشفرات التلقائية التوليدية لقياس مدى تشابه مستوى المريض مع بيانات التطوير، وذلك من أجل الفصل بين أوجه القصور في النموذج والاختلافات السكانية لتوفيش تقييم أكثر دقة لقابلية نقل النموذج التنبؤي وسلامته لمجموعات فرعية محددة من المرضى.

Mohammad Azizmalayeri (on behalf of the NHR THI registration committee), Ameen Abu-Hanna (on behalf of the NHR THI regis (…)2026-05-13
🤖 machine learning

Beyond Similarity: Temporal Operator Attention for Time Series Analysis

تقدم هذه الورقة "انتباه المؤثر الزمني" (TOA)، وهو إطار عمل يتغلب على قيود انتباه "softmax" القياسي في التنبؤ بالسلاسل الزمنية من خلال دمج مؤثرات صريحة وقابلة للتعلم في فضاء المتتالية لتمكين التحويلات الموقعة والتذبذبية، مما يحقق أداءً فائقاً عبر مختلف المعايير المرجعية.

Jevon Twitty, Vinh Pham, Nitiwith Rotchanarak, Viresh Pati, Yubin Kim, Shihao Yang, Jiecheng Lu2026-05-13