💻 computer science

HealthCraft: A Reinforcement Learning Safety Environment for Emergency Medicine

تُعد HealthCraft بيئة تعزيز تعلم عامة ومبتكرة صُممت لتقييم النماذج اللغوية الرائدة في طب الطوارئ عبر محاكاة سير عمل سريري واقعي مع معايير سلامة صارمة ذات طبقتين، مما كشف عن معاناة النماذج الحالية من انهيار شبه كامل في الأداء في المهام متعددة الخطوات، وسلط الضوء على الأهمية البالغة لدقة البنية التحتية في تقييمات السلامة.

Brandon Dent2026-05-22
💻 computer science

From Parameters to Data: A Task-Parameter-Guided Fine-Tuning Pipeline for Efficient LLM Alignment

تقترح الورقة البحثية إطار عمل "من المعلمات إلى البيانات" (P2D)، وهو إطار عمل موحد يستفيد من رؤوس الانتباه الحساسة للمهام لتوجيه اختيار البيانات والضبط الدقيق الكفء للمعلمات في آن واحد، محققاً مكاسب كبيرة في الأداء وتسريعاً بمقدار 7.0 أضعاف من خلال مزامنة تحديثات المعلمات مع مجموعات فرعية من البيانات ذات الألفة العالية.

Hao Chen, Qi Zhang, Liyao Li, Zhanming Shen, Wentao Ye, Lirong Gao, Ningtao Wang, Xing Fu, Xiaoyu Shen, Junbo Zhao2026-05-22✓ Author reviewed
💻 computer science

Flat-Pack Bench: Evaluating Spatio-Temporal Understanding in Large Vision-Language Models through Furniture Assembly

تقدم هذه الورقة البحثية "Flat-Pack Bench"، وهو معيار مرجعي جديد مصمم لتقييم قدرات الاستدلال المكاني-الزماني الدقيقة للنماذج اللغوية البصرية الكبيرة من خلال مهام تجميع الأثاث، مما يكشف أن النماذج الحالية الرائدة تواجه صعوبة كبيرة في الترتيب الزمني، وتحديد الحالة، وتزاوج الأجزاء، والتتبع.

Aditya Chetan, Eric Cai, Peeyush Kushwaha, Bharath Raj Nagoor Kani, Utkarsh Mall, Qianqian Wang, Noah Snavely, Bharath H (…)2026-05-22
💬 NLP

EntmaxKV: Support-Aware Decoding for Entmax Attention

يُعد EntmaxKV إطار عمل لفك التشفير المتناثر المدرك للدعم، والذي يستفيد من التناثر الدقيق لانتباه α\alpha-entmax لتحميل صفحات ذاكرة التخزين المؤقت (KV cache) بشكل انتقائي قبل عملية الاستدلال، مما يقلل بشكل كبير من حركة مرور الذاكرة ويحقق تسارعاً جوهرياً في توليد السياقات الطويلة مع الحفاظ على دقة مقاربة للنماذج المرجعية ذات الذاكرة الكاملة.

Gonçalo Duarte, Miguel Couceiro, Marcos V. Treviso2026-05-22
💬 NLP

Amplifying, Not Learning: Fine-Tuned AI Text Detectors Amplify a Pretrained Direction

تجادل هذه الورقة بأن كواشف النصوص المعتمدة على الذكاء الاصطناعي تعمل أساساً على تضخيم محور "النمطية" (typicality) المُدرب مسبقاً والمتأصل في المشفرات الخام بدلاً من تعلم حد فاصل متميز بين الذكاء الاصطناعي والبشر، وهي آلية تفسر فشلها في التعامل مع كتابات غير الناطقين باللغة، وقابليتها للتأثر بالتدخلات البسيطة، وحقيقة أن المسابر (probes) الدنيا يمكنها مضاهاة أداء الضبط الدقيق الكامل.

Alexander Smirnov2026-05-22
💬 NLP

Value-Gradient Hypothesis of RL for LLMs

تقترح هذه الورقة فرضية تدرج القيمة لتفسير فعالية طرق التعلم المعزز الخالية من الناقد مثل PPO وGRPO في مرحلة ما بعد التدريب للنماذج اللغوية الكبيرة، حيث تُثبت أن تحديثات الممثل تقرب تدرجات القيمة من خلال التفاضل التلقائي وتضع معياراً لمتى يحقق التعلم المعزز أكبر المكاسب بناءً على إشارة القيمة وهامش المكافأة.

Arip Asadulaev, Daniil Ognev, Karim Salta, Martin Takac2026-05-22
💬 NLP

X-Token: Projection-Guided Cross-Tokenizer Knowledge Distillation

تقترح الورقة البحثية X-Token، وهو إطار عمل لتقطير المعرفة عبر أجهزة الترميز (cross-tokenizer) بتوجيه من الإسقاط، يستخدم مصفوفات إسقاط متفرقة للتغلب على عدم توافق المفردات ومحدودية مطابقة الرموز في التقطير القائم على اللوجيت (logit-based distillation)، مما يمكن النماذج الطلابية من تعلم "المعرفة المظلمة" بفعالية من النماذج المعلمة ذات المفردات غير المتطابقة وتحقيق أداء رائد في هذا المجال.

Sharath Turuvekere Sreenivas, Adithyakrishna Venkatesh Hanasoge, Mingyu Yang, Ali Taghibakhshi, Saurav Muralidharan, Ash (…)2026-05-22
💬 NLP

Probabilistic Attribution For Large Language Models

تقدم هذه الورقة إطار عمل احتمالي للنسب لا يعتمد على نموذج محدد، يستفيد من قاعدة بايز على احتمالات رموز النماذج اللغوية الكبيرة لتقدير أهمية الرموز والاعتلاج، مما يعزز القابلية للتفسير ويكشف رؤى حول استقرار النموذج وسلوكه عبر مختلف الأوامر.

Shilpika Shilpika, Carlo Graziani, Bethany Lusch, Venkatram Vishwanath, Michael E. Papka2026-05-22
💬 NLP

BEiTScore: Reference-free Image Captioning Evaluation with an Efficient Cross-Encoder Model

تقدم الورقة البحثية BEiTScore، وهو مقياس لتقييم وصف الصور لا يعتمد على مرجع، يستفيد من نموذج مشفر متقاطع خفيف الوزن تم تدريبه باستخدام بيانات معززة بنماذج لغوية كبيرة تنافسية لتحقيق أداء رائد في الحساسية والتعميم التركيبي مع الحفاظ على الكفاءة الحسابية.

Gonçalo Gomes, Bruno Martins, Chrysoula Zerva2026-05-22
💬 NLP

Reflective Prompt Tuning through Language Model Function-Calling

تقترح هذه الورقة البحثية "ضبط التلقين التأملي" (RPT)، وهو إطار عمل يستفيد من استدعاء الدوال في النماذج اللغوية الكبيرة لمحاكاة مهندسي التلقين البشريين عبر تشخيص أنماط الفشل المنهجية عبر مجموعة بيانات كاملة بشكل تكراري واستخدام الرؤى المتراكمة لتحسين التلقينات، مما يؤدي إلى تحسين الأداء بشكل كبير في مهام الاستدلال المعقدة ومعايرة الثقة.

Farima Fatahi Bayat, Moin Aminnaseri, Pouya Pezeshkpour, Estevam Hruschka2026-05-22