💬 NLP

OncoTriad-QA: A Patient-Level Radiology-Pathology-Genomics Benchmark for Pan-Cancer Reasoning

تقدم هذه الورقة OncoTriad-QA، وهو معيار مرجعي شامل على مستوى المريض يدمج بيانات الأشعة والباثولوجيا والجينوميات من 9,281 حالة من مشروع TCGA لتقييم وتحسين قدرة النماذج متعددة الوسائط على إجراء استدلال شامل للسرطانات عبر نظام الإجابة على الأسئلة.

Ahnaf Munir, Dannong Wang, Michael W. McDonald, Mubarak Shah, Pegah Khosravi, Yu Tian2026-08-05
💬 NLP

Evaluating OpenAI's Privacy Filter: Cross-Lingual, Cross-Domain PII Detection Across 42 Benchmarks

تقدم هذه الورقة أول تقييم مستقل ومنهجي لمرشح الخصوصية (Privacy Filter) الخاص بشركة OpenAI عبر 42 معياراً، كاشفةً أنه في حين يتفوق النموذج على الأدوات الحالية في بيانات الهوية الشخصية (PII) الاصطناعية المهيكلة ومجالات محددة مثل خدمة العملاء، فإنه يعاني من تدهور حاد في الأداء عند التعامل مع النثر السردي، والنصوص غير اللاتينية، وأنواع بيانات الهوية الشخصية المتغيرة ثقافياً.

Rohith Uppala2026-08-05
💬 NLP

Preferred, Not Safer: Pairwise Preference Is a Poor Proxy for Clinical Safety

تُثبت هذه الورقة أن التفضيلات الثنائية للأطباء هي مؤشر غير موثوق للسلامة السريرية في النماذج اللغوية الكبيرة، حيث يمكن للنماذج ذات التصنيف العالي أن تظل تُظهر إخفاقات جسيمة حرجة من الناحية السريرية، مما يستلزم ممارسات تقييم تبلغ مباشرة عن معدلات الفشل وتدمج تعديلات قائمة على معايير سريرية رصينة.

Fay Elhassan, David Sasu, Alexandra Kulinkina, Lars Henning Klein, Mary-Anne Hartley2026-08-05
💻 computer science

Beyond the Hivemind: Escaping LLM Homogeneity via Meta-Persona Anchoring and Sequential Temperature Scaling

تقترح هذه الورقة إطار عمل مبتكرًا يجمع بين "تثبيت الشخصية الميتافيزيقية" (Meta-Persona Anchoring) و"تدرج الحرارة المفلتر" (Filtered Temperature Scaling) للتخفيف من تأثير "الخلية الاصطناعية الموحدة" (Artificial Hivemind) في النماذج اللغوية الكبيرة، مما نجح في تقليل التقارب الدلالي وزيادة تنوع الاستجابات عبر خفض متوسط تشابه جيب التمام الزاوي من حوالي 0.85 إلى 0.65.

Tairan Fu, Javier Conde, Carlos Arriaga, Gonzalo Martínez, Pedro Reviriego, Javier Coronado-Blázquez2026-08-05
💬 NLP

JudgeArena: A Unified Framework for Reproducible LLM-Judge Evaluation

تُعد JudgeArena إطار عمل مفتوح المصدر يوحد معايير قياس نماذج اللغات الكبيرة (LLM) الرئيسية تحت واجهة واحدة لتعزيز قابلية التكرار، وتمكين الدراسات المنهجية لخيارات تصميم التقييم، وتوفير محاكاة عالية الدقة لدرجات "إيلو" (Elo score) باستخدام نماذج مفتوحة مضبوطة كبديل للمحكمين من النماذج المغلقة والتعليقات البشرية المكلفة.

Erlis Lushtaku, Bora Kargi, Ali Elganzory, Fabio Ferreira, Alejandro R. Salamanca, Julia Kreutzer, David Salinas2026-08-05
💬 NLP

Knowing the Form, Not the Function: Automatically Auditing Answer--Authority Decoupling in Legal Benchmarks

تقترح هذه الورقة إطار تقييم مشترك للمعايير المرجعية القانونية يقيم في آن واحد صحة الإجابة والاستناد إلى السلطة التشريعية، مما يكشف أن النماذج تفصل بشكل متكرر بين هذين البعدين وأن الاعتماد فقط على دقة الإجابة يؤدي إلى مقاييس أداء مضللة.

Hsien-Jyh Liao2026-08-05
💬 NLP

Speculative Correction: Draft-then-Refine Decoding for Diffusion Language Models

تقدم هذه الورقة استراتيجية فك تشفير قائمة على مبدأ "المسودة ثم الصقل" لنماذج اللغات الانتشارية، والتي تستفيد من الصقل ثنائي الاتجاه لتحسين الدقة والسرعة بشكل كبير مقارنة بالتوليد التلقائي الكتلي القياسي، مما يثبت أن التصحيح الذاتي للنموذج نفسه والتصحيح التخميني عبر النماذج يوفران مسارات فعالة وخالية من التدريب للوصول إلى توليد نصوص عالية الجودة وسريع.

Brian K Chen, Chong Wu, Kenji Kawaguchi2026-08-05
💻 computer science

Single Canonical Prompts Underestimate LLM Safety's Surface-Form Sensitivity

تُثبت هذه الورقة أن الاعتماد على مطالبات نموذجية (canonical prompts) واحدة لتقييم سلامة النماذج اللغوية الكبيرة يؤدي إلى تقدير نقص كبير في الامتثال غير الآمن، حيث تكشف التغييرات في الصيغ السطحية التي تحافظ على المعنى أن جزءاً كبيراً من السلوكيات الضارة يظل غير مكتشف بواسطة طرق القياس المعيارية.

Yongxi Zhou, Junwei Yao, Yuanzhe Liu, Zihan Dong, Wenbo Ye, Jiaxi Wen, Lai Yun Choi2026-08-05
🤖 machine learning

Sphere Retraction Normalizations

تعمم هذه الورقة البحثية "التطبيع الجيوديزي" (Geodesic Normalization) من خلال إثبات أن جميع خرائط الارتداد (retraction maps) لتدفقات البقايا الكروية تختزل إلى معلمة قياسية واحدة تتحكم في زاوية الدوران، مما يؤدي إلى عائلة "pp-SpheretNorm" المقترحة التي تتفوق على الأساليب الحالية في نموذج nanoGPT عبر تحديد أن الخريطة الأسية (exponential map) ليست سوى حالة حدية وليست الخيار الأمثل.

Jie Zhang, Cheng-Fang Su, Yi-Jui Huang, Min-Te Sun2026-08-05
💬 NLP

Stuck on "A": Diagnosing and Repairing Interface Injury in Attention-to-KDA Linearization of a 0.6B Language Model

تشخص هذه الورقة وتصلح "إصابة واجهة" محددة في نموذج لغوي بحجم 0.6 مليار تم تحويله إلى انتباه خطي، حيث يتنبأ النموذج بشكل أعمى بتسميات الخيارات (مثل "A") بدلاً من المحتوى، وذلك باستخدام تشخيص قائم على التبديل وعملية تقطير KL مستهدفة في مرحلة الإكمال لاستعادة دقة الاختيار من متعدد مع الحفاظ على الكفاءة على الأجهزة الاستهلاكية.

Ronglong Bao2026-08-05