💻 computer science

Specialty-Specific Medical Language Model for Immune-Mediated Diseases

تقدم هذه الورقة نموذجاً متخصصاً للتعرف على الكيانات المسماة قائماً على تقنية "ترانسفورمر" (transformer)، تم تدريبه على بيانات سريرية مشروحة من قبل خبراء، والذي يحقق أداءً فائقاً (درجة F1 تبلغ 0.89) في استخراج كيانات الأمراض المناعية والعدوائية الدقيقة من السرديات الطبية ذات النصوص الحرة مقارنة بالنهج العامة أو نهج التعلم الصفري.

Veysel Kocaman, Gursev Pirge, Yigit Gul, Ace Vo, Zhenya Nargizyan, David Talby2026-05-29
💻 computer science

Thoughts-as-Planning: Latent World Models for Chain-of-Thoughts Optimization via Reinforcement Planning

تقدم هذه الورقة "الأفكار كعملية تخطيط" (Thoughts-as-Planning)، وهو إطار عمل مبتكر يعمل على تحسين سلاسل الاستدلال من خلال نمذجة النموذج اللغوي الكبير كبيئة قابلة للملاحظة جزئياً وتعلم نموذج عالم كامن لتمكين التخطيط الفعال، والقابل للتفسير، ومتعدد المقاييس عبر التدرج الاشتقاقي أو التعلم التعزيزي.

Dong Liu, Yanxuan Yu, Ying Nian Wu2026-05-29
💻 computer science

GPF-LiveNews: A Streaming Evaluation Protocol for Group-Conditioned Framing in Large Language Models

تقدم هذه الورقة GPF-LiveNews، وهو بروتوكول ومعيار تقييم للبث المباشر يدقق في كيفية صياغة النماذج اللغوية الكبيرة للأحداث الإخبارية الناشئة لمجموعات هويات مختلفة من خلال تحليل التباينات الدلالية والوجدانية عبر مدخلات ديناميكية من العالم الحقيقي.

Mohd Ariful Haque, Fahad Rahman, Kishor Datta Gupta, Roy George2026-05-29
🤖 machine learning

Mechanistic origins of catastrophic forgetting: why RL preserves circuits better than SFT?

تقدم هذه الورقة مقياساً على مستوى الرأس يسمى "الضعف التفاضلي للدوائر" (differential circuit vulnerability) لتوضيح أنه بينما يعمل الضبط الدقيق الخاضع للإشراف على تكييف النماذج مع المهام الجديدة بشكل أسرع، فإن التعلم المعزز يحافظ بشكل أفضل على الدوائر الحسابية الداخلية، مما يقدم تفسيراً ميكانيكياً لمقاومته المتفوقة للنسيان الكارثي.

Jeanmely Rojas Nunez, Viraj Sawant, Nathan Allen, Nomgondalai Amgalanbaatar, Yannis Zongo, Vasu Sharma, Maheep Chaudhary2026-05-29
💻 computer science

From Data to Insights: Exploring Program-of-Thoughts Prompting for Chart Summarization

تقدم هذه الورقة استراتيجية تلميح "برنامج الفكر" (Program-of-Thought) بنمط الصفر من الأمثلة، والتي تستفيد من نماذج لغوية بصرية خفيفة الوزن ومهمة مساعدة مبتكرة لتحويل المخطط إلى قاموس (chart-to-dictionary) لتوليد كود بايثون من أجل تلخيص المخططات بدقة وكفاءة، محققةً أداءً يضاهي الأساليب الحالية مع تحسين الصحة الواقعية.

Yutong Qu, Wei Zhang2026-05-29
💻 computer science

GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human

تقترح الورقة البحثية نظام GrowLoop، وهو نظام تقييم محادثة ذاتي التطور يستخدم حداً أدنى من التعليقات التوضيحية البشرية الأولية وتحسيناً تكرارياً للمعايير مدفوعاً بالنماذج اللغوية الكبيرة ليتكيف باستمرار مع النماذج المتقدمة والسيناريوهات المتغيرة، متجاوزاً بذلك قيود المعايير الثابتة في تقييم الشبه بالبشر.

Yihang Lin, Yunze Gao, Zeyang Lin, Dongbo Li, Kun Peng, Chenglong Song, Yue Liu2026-05-29
💻 computer science

Hallucination Detection-Guided Preference Optimization for Clinical Summarization

تقدم هذه الورقة طريقة للاستدلال وإطار عمل مقابل لتعلم التفضيلات يستفيدان من كواشف الهلوسة لتنقيح وضبط النماذج اللغوية الكبيرة بشكل تكراري، مما يقلل بشكل كبير من الهلوسات الواقعية في التلخيص السريري مع الحفاظ على الطلاقة والتماسك.

Shamanth Kuthpadi Seethakantha, Dung Ngoc Thai, Vara Prasad Gudi, Simran Tiwari, Rami Matar, Avijit Mitra, Wenlong Zhao (…)2026-05-29
💻 computer science

The Trust Paradox: How CS Researchers Engage LLM Leaderboards

تكشف هذه الورقة، من خلال مقابلات مع ثمانية من باحثي علوم الحاسوب، عن مفارقة حيث يشكك الممارسون في لوحات صدارة النماذج اللغوية الكبيرة (LLM leaderboards) ومع ذلك يعتمدون عليها كأدلة استرشادية تقريبية، لتخلص في النهاية إلى أن الشبكات الأقران والتصنيفات القائمة على نظام "الساحة" (arena-based rankings) هي التي تقود عملية اختيار النماذج أكثر من المعايير القياسية الثابتة، مع تسليط الضوء على طلب حاسم بشأن شفافية التكلفة.

Pouya Sadeghi, Anamaria Crisan, Jimmy Lin2026-05-29
💻 computer science

Measuring Real-World Prompt Injection Attacks in LLM-based Resume Screening

تقدم هذه الورقة أول دراسة منهجية لهجمات حقن الأوامر (prompt injection) في العالم الحقيقي في عمليات فحص السير الذاتية القائمة على النماذج اللغوية الكبيرة (LLM)، حيث حللت 200,000 سيرة ذاتية لتكشف أن ما يقرب من 1% منها يحتوي على حقن مخفي، وأن انتشارها في تزايد، وأن معظمها لا يستخدم تعليمات صريحة.

Mohan Zhang, Yuqi Jia, Zhen Tan, Steven Jiang, Neil Zhenqiang Gong, Tianlong Chen, Dawn Song2026-05-29
💻 computer science

Text-Preserving Lossy Text Compression: A Study of Strategic Deletion and LLM Reconstruction

تتقصى هذه الورقة إطار عمل لضغط النصوص الدلالي غير الفاقد للمعلومات حيث يقوم مشفر بحذف النص استراتيجياً من أجل إعادة البناء بواسطة النماذج اللغوية الكبيرة، لتجد أن الحذف القائم على تكرار الكلمات البسيط يقدم خط أساس قوي وفعال بينما تتفوق الأساليب الدلالية الهجينة عند معدلات ضغط متوسطة، كما ينتج عن ضبط (QLoRA) أجهزة فك تشفير محلية تنافسية.

Yuchun Zou, Junhong Tong, Jun Li2026-05-29