💻 computer science

AI use in American newspapers is widespread, uneven, and rarely disclosed

يكشف تدقيق أجري عام 2025 على 186,000 مقال من 1,500 صحيفة أمريكية أن ما يقرب من 9% منها يحتوي على محتوى مولد بواسطة الذكاء الاصطنا-عي، مع تركز الاستخدام بشكل غير متناسب في المنافذ المحلية الصغيرة، ومواضيع محددة، وقطع الرأي، ومع ذلك يظل الاستخدام غير معلن عنه إلى حد كبير رغم انتشاره.

Jenna Russell, Marzena Karpinska, Destiny Akinode, Katherine Thai, Bradley Emi, Max Spero, Mohit Iyyer2026-04-28
💻 computer science

Synthetic Eggs in Many Baskets: The Impact of Synthetic Data Diversity on LLM Fine-Tuning

تُظهر هذه الورقة أن الضبط الدقيق للنماذج اللغوية الكبيرة باستخدام مصادر بيانات اصطناعية متنوعة يقلل بفعالية من انهيار التوزيع وتحيز التفضيل الذاتي، رغم أنه قد يعزز في الوقت ذاته جودة المخرجات بطرق تزيد من مخاطر السلامة المحتملة عبر إزالة الضوابط الوقائية.

Max Schaffelder, Albert Gatt2026-04-28
⚡ electrical engineering

Diagnostic-Driven Layer-Wise Compensation for Post-Training Quantization of Encoder-Decoder ASR Models

يُعد FADE إطار عمل تشخيصي لتكميم ما بعد التدريب لنماذج التعرف التلقائي على الكلام القائمة على بنية المشفر وفك التشفير، والذي يعمل على تخفيف تراكم الأخطاء عبر الطبقات من خلال تعيين معاملات تعويض تكيفية لكل طبقة بناءً على هندسة الأوزان وموثوقية المعايرة.

Xinyu Wang, Ziyu Zhao, Yajie Luo, Yihong Wu, Liheng Ma, Jingrui Tian, Lei Ding, Xiao-Wen Chang, Peng Lu2026-04-28
💻 computer science

CURE-Med: Curriculum-Informed Reinforcement Learning for Multilingual Medical Reasoning

تقدم الورقة البحثية إطار CURE-MED، وهو إطار للتعلم المعزز القائم على المنهج الدراسي والمدعوم بمجموعة بيانات CUREMED-BENCH الجديدة متعددة اللغات، والتي تعزز بشكل كبير الصحة المنطقية والاستقرار اللغوي للنماذج اللغوية الكبيرة عبر ثلاث عشرة لغة متنوعة من أجل استنتاج طبي موثوق.

Eric Onyame, Akash Ghosh, Subhadip Baidya, Sriparna Saha, Xiuying Chen, Chirag Agarwal2026-04-28
💻 computer science

A BERTology View of LLM Orchestrations: Token- and Layer-Selective Probes for Efficient Single-Pass Classification

تقترح هذه الورقة إطار عمل فعال للتصنيف بمرور واحد يعيد استخدام الحالات الخفية من النماذج اللغوية الكبيرة المستخدمة في الإنتاج عبر مجسات خفيفة الوزن ومنتقاة للرموز والطبقات، مما يلغي زمن الاستجابة وتكاليف الموارد الخاصة بنماذج السلامة أو النماذج المخصصة لمهام معينة مع تحقيق أداء تنافسي عبر بنيات متنوعة.

Gonzalo Ariel Meyoyan, Luciano Del Corro2026-04-28
💻 computer science

SWE-Pruner: Self-Adaptive Context Pruning for Coding Agents

إن SWE-Pruner هو إطار عمل للتنقية التكيفية للسياق يستخدم مِشّاراً عصبياً مدركاً للمهام لتصفية الكود غير ذي الصلة ديناميكياً بناءً على أهداف الوكيل الصريحة، مما يقلل بشكل كبير من استخدام الرموز (tokens) والتكاليف مع الحفاظ على أداء وكيل البرمجة أو تحسينه عبر مختلف المعايلات.

Yuhang Wang, Yuling Shi, Mo Yang, Rongrui Zhang, Shilin He, Heng Lian, Yuting Chen, Siyu Ye, Kai Cai, Xiaodong Gu2026-04-28
💬 NLP

A Lightweight Explainable Guardrail for Prompt Safety

تقدم هذه المساهمة LEG، وهو حاجز حماية خفيف الوزن وقابل للتفسير يستفيد من التعلم متعدد المهام، والبيانات الاصطناعية المخففة للتحيز، ودالة فقدان مبتكرة مرجحة بعدم اليقين لتحقيق أداء رائد في تصنيف سلامة المطالبات وتفسيرها مع حجم نموذج أصغر بكثير.

Md Asiful Islam, Mihai Surdeanu2026-04-28
💻 computer science

Beyond Static: Related Questions Retrieval Through Conversations in Community Question Answering

تقترح الورقة البحثية نموذج TeCQR، وهو نموذج مبتكر لاسترجاع الأسئلة ذات الصلة في مجتمعات الإجابة على الأسئلة، والذي يستفيد من الأسئلة التوضيحية المعززة بالوسوم واستراتيجية تدريب مقاومة للضجيج لالتقاط العلاقات الدلالية دقيقة التفاصيل من خلال نهج حواري.

Xiao Ao, Jie Zou, Yibiao Wei, Peng Wang, Weikang Guo2026-04-28
🤖 machine learning

KARL: Mitigating Hallucinations in LLMs via Knowledge-Boundary-Aware Reinforcement Learning

يُعدُّ KARL إطار عمل جديدًا للتعلم التعزيزي يعمل على الحد من هلوسة النماذج اللغوية الكبيرة عبر استخدام آلية مكافأة مدركة لحدود المعرفة واستراتيجية تدريب ثنائية المرحلة لمواءمة قدرة النموذج ديناميكيًا على الامتناع عن الإجابة على الأسئلة مع حدود معرفته المتطورة، مما يحسن المقايضة بين الدقة والحذر.

Cheng Gao, Cheng Huang, Kangyang Luo, Ziqing Qiao, Shuzheng Si, Huimin Chen, Chaojun Xiao, Maosong Sun2026-04-28
🧬 biology

RCSB PDB AI Help Desk: retrieval-augmented generation for protein structure deposition support

لدعم الحجم المتزايد من استفسارات الإيداع، طور بنك بيانات البروتين (RCSB PDB) مكتب مساعدة مدعومًا بالذكاء الاصطناعي باستخدام بنية التوليد المعزز بالاسترجاع (RAG) لتزويد المودعين بمساعدة مدعومة بالاستشهادات على مدار الساعة طوال الأسبوع.

Vivek Reddy Chithari (RCSB Protein Data Bank, Rutgers, The State University of New Jersey, Piscataway, NJ, USA), Jasmine (…)2026-04-28