💻 computer science

A Reproducible Log-Driven AutoML Framework for Interpretable Pipeline Optimization in Healthcare Risk Prediction

تقدم هذه الورقة البحثية yvsoucom-iterkit، وهو إطار عمل للتعلم الآلي المؤتمت (AutoML) حتمي وقائم على السجلات، يعمل على تحسين مسارات التنبؤ بالمخاطر الصحية من خلال ترميزها ككيانات قابلة للتتبع، كاشفاً أن الأداء محكوم بمجموعة فرعية صغيرة من المكونات عالية التأثير مثل تعزيز البيانات ومعالجة عدم التوازن، مع تحقيق نتائج مستقرة وقابلة للتكرار عبر تكوينات متنوعة.

Rui Huang, Lican Huang2026-05-22
💻 computer science

RefusalBench: Why Refusal Rate Misranks Frontier LLMs on Biological Research Prompts

تقدم الورقة البحثية RefusalBench، وهو معيار اختبار قائم على الثلاثيات المتطابقة يكشف أن معدلات الرفض الصارمة تسيء ترتيب النماذج اللغوية الكبيرة الرائدة في مطالبات الأبحاث البيولوجية بسبب سياسات مسارات الوصول الخاصة بالمزودين بدلاً من أوزان النماذج، بينما تثبت أن المقاييس الثنائية تفشل في رصد سلوكيات الامتثال الجزئي الدقيقة وأن أداء التمييز بين الفئات يتباين بشكل كبير عبر النماذج.

Lukas Weidener, Marko Brkić, Mihailo Jovanović, Emre Ulgac, Aakaash Meduri2026-05-22
📊 statistics

Scalable On-Policy Reinforcement Learning via Adaptive Batch Scaling

تتحدى هذه الورقة الاعتقاد التقليدي بأن التدريب باستخدام الدفعات الكبيرة لا يتوافق مع التعلم المعزز من خلال اقتراح "تحجيم الدفعة التكيفي" (ABS)، وهي طريقة تضبط أحجام الدفعات ديناميكيًا بناءً على استقرار السياسة للجمع بنجاح بين الشبكات الكبيرة والدفعات الكبيرة لتحقيق أداء فائق.

Jongchan Park2026-05-22
💻 computer science

When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning

تقدم هذه الورقة طريقة التقطير الذاتي داخل السياسة الموزون بالموضع (PW-OPSD)، وهي طريقة تعمل على تحسين أداء نماذج الاستدلال من خلال تحديد أن موثوقية توكن المعلم تتبع نمطاً ذا بنية مسارية يمكن التنبؤ به بشكل أفضل عبر موضع التوكن بدلاً من الإنتروبيا، مما يسمح بالتقطير المستهدف دون حسابات إضافية للمعلم.

Xiaogeng Liu, Xinyan Wang, Yingzi Ma, Yechao Zhang, Chaowei Xiao2026-05-22
💻 computer science

The Shape of Testimony: A Scalable Framework for Oral History Archive Comparison

تستخدم هذه الدراسة إطاراً حوسبياً قابلاً للتوسع لتحليل أكثر من 1,600 شهادة لناجين من الهولوكوست، مما يؤكد وجود اختلافات هيكلية عامة بين أرشيفي مؤسسة "يو إس سي شوا" وأرشيف "ييل فورتونوف"، مع الكشف في الوقت ذاته عن تداخلات سردية كبيرة تتحدى الثنائية التبسيطية القائمة على "الهيكلية مقابل الشكل الحر".

Itamar Trainin, Renana Keydar, Amit Pinchevski2026-05-22
💻 computer science

Flat-Pack Bench: Evaluating Spatio-Temporal Understanding in Large Vision-Language Models through Furniture Assembly

تقدم هذه الورقة البحثية "Flat-Pack Bench"، وهو معيار مرجعي جديد مصمم لتقييم قدرات الاستدلال المكاني-الزماني الدقيقة للنماذج اللغوية البصرية الكبيرة من خلال مهام تجميع الأثاث، مما يكشف أن النماذج الحالية الرائدة تواجه صعوبة كبيرة في الترتيب الزمني، وتحديد الحالة، وتزاوج الأجزاء، والتتبع.

Aditya Chetan, Eric Cai, Peeyush Kushwaha, Bharath Raj Nagoor Kani, Utkarsh Mall, Qianqian Wang, Noah Snavely, Bharath H (…)2026-05-22
💻 computer science

Faster Completion, Less Learning: Generative AI Reduced Study Time on Math Problems and the Knowledge They Build

تكشف هذه الدراسة واسعة النطاق التي استندت إلى بيانات "أليكس" (ALEKS) الممتدة لعقد من الزمن أن الذكاء الاصطناعي التوليدي قد قلل بشكل كبير من وقت دراسة الطلاب للمسائل الرياضية المعرضة للتأثر به، بينما أدى في الوقت ذاته إلى تدهور استبقاء المعرفة على المدى الطويل، وهي ظاهرة حددها المؤلفون بأنها "الاستسلام المعرفي".

Sina Rismanchian, Hasan Uzun, Jeffrey Matayoshi, Eric Cosyn, Eyad Kurd-Misto2026-05-22
💻 computer science

Addressing the Synergy Gap: The Six Elements of the Design Space

تحدد هذه الورقة "فجوة التآزر" المستمرة حيث تفشل التوليفات بين البشر والذكاء الاصطناي في التفوق على أي منهما بمفرده، وتجادل بأن سد هذه الفجوة يتطلب تجاوز الإصلاحات الهندسية الضيقة للانخراط صراحةً في فضاء تصميم أوسع يتألف من ستة عناصر مترابطة: السياق الاجتماعي التقني، وأطر اتخاذ القرار، والمشاركين البشريين، وقدرات الذكاء الاصطناعي، والتفاعل، والتقييم الشامل.

Tommaso Turchi, Ben Wilson, Matt Roach, Alan Dix, Alessio Malizia2026-05-22
💬 NLP

Amplifying, Not Learning: Fine-Tuned AI Text Detectors Amplify a Pretrained Direction

تجادل هذه الورقة بأن كواشف النصوص المعتمدة على الذكاء الاصطناعي تعمل أساساً على تضخيم محور "النمطية" (typicality) المُدرب مسبقاً والمتأصل في المشفرات الخام بدلاً من تعلم حد فاصل متميز بين الذكاء الاصطناعي والبشر، وهي آلية تفسر فشلها في التعامل مع كتابات غير الناطقين باللغة، وقابليتها للتأثر بالتدخلات البسيطة، وحقيقة أن المسابر (probes) الدنيا يمكنها مضاهاة أداء الضبط الدقيق الكامل.

Alexander Smirnov2026-05-22
💬 NLP

Value-Gradient Hypothesis of RL for LLMs

تقترح هذه الورقة فرضية تدرج القيمة لتفسير فعالية طرق التعلم المعزز الخالية من الناقد مثل PPO وGRPO في مرحلة ما بعد التدريب للنماذج اللغوية الكبيرة، حيث تُثبت أن تحديثات الممثل تقرب تدرجات القيمة من خلال التفاضل التلقائي وتضع معياراً لمتى يحقق التعلم المعزز أكبر المكاسب بناءً على إشارة القيمة وهامش المكافأة.

Arip Asadulaev, Daniil Ognev, Karim Salta, Martin Takac2026-05-22