⚡ electrical engineering

In-Sync: Adaptation of Speech Aware Large Language Models for ASR with Word Level Timestamp Predictions

تقدم هذه الورقة طريقة لتكييف النماذج اللغوية الكبيرة المدركة للكلام للتنبؤ بالطوابع الزمنية على مستوى الكلمة مباشرةً إلى جانب النصوص باستخدام استراتيجيات تدريب مبتكرة خفيفة الوزن، مما يحسن دقة المحاذاة وأداء التعرف التلقائي على الكلام بشكل عام.

Xulin Fan, Vishal Sunder, Samuel Thomas, Mark Hasegawa-Johnson, Brian Kingsbury, George Saon2026-04-28
💻 computer science

AeSlides: Incentivizing Aesthetic Layout in LLM-Based Slide Generation via Verifiable Rewards

يقدم AeSlides إطار عمل للتعلم التعزيزي يستخدم مجموعة من المقاييس المصممة بدقة والقابلة للتحقق لتحسين توليد الشرائح القائم على النماذج اللغوية الكبيرة مباشرةً من أجل جودة التنسيق الجمالي، متفوقاً بشكل كبير على الأساليب الحالية القائمة على الانعكاس والضبط الدقيق.

Yiming Pan, Chengwei Hu, Xuancheng Huang, Can Huang, Mingming Zhao, Yuean Bi, Xiaohan Zhang, Aohan Zeng, Linmei Hu2026-04-28
💻 computer science

A Large-Scale, Cross-Disciplinary Corpus of Systematic Reviews

يقدم المؤلفون Webis-SR4ALL-26، وهو متن ضخم متعدد التخصصات يضم أكثر من 300,000 مراجعة منهجية تتضمن بيانات وصفية مرتبطة ومصنفات منهجية مستخرجة لدعم القياس المرجعي، والتدريب على الاستخراج، وأبحاث الميتا-علم عبر جميع المجالات العلمية.

Pierre Achkar, Tim Gollub, Arno Simons, Harrisen Scells, Martin Potthast2026-04-28
🤖 machine learning

Quantifying and Mitigating Self-Preference Bias of LLM Judges

تقدم هذه الورقة إطار عمل مؤتمتًا بالكامل لقياس وتخفيف انحياز التفضيل الذاتي في أنظمة "النموذج اللغوي الكبير كحكم" (LLM-as-a-judge) باستخدام أزواج استجابات متساوية الجودة للفصل بين الانحياز التقييمي وقدرة النموذج، مقترحةً في النهاية استراتيجية تقييم متعددة الأبعاد تقلل من الانحياز بمتوسط قدره 31.5%.

Jinming Yang, Chuxian Qiu, Zhenyu Deng, Xinshan Jiao, Tao Zhou2026-04-28
💻 computer science

Uncertainty Quantification for LLM Function-Calling

تقدم هذه الورقة أول تقييم لطرق تقدير عدم اليقين (UQ) لاستدعاء الدوال في النماذج اللغوية الكبيرة (LLM)، حيث اكتشفت أنه بينما لا تقدم طرق العينات المتعددة سوى فائدة ضئيلة مقارنة بطرق العينة الواحدة في هذا السياق، إلا أنه يمكن تحسين أدائها بشكل كبير من خلال الاستفادة من الخصائص الهيكلية والدلالية المحددة لمخرجات استدعاء الدوال.

Zihuiwen Ye, Lukas Aichberger, Michael Kirchhof, Sinead Williamson, Luca Zappella, Yarin Gal, Arno Blaas, Adam Golinski2026-04-28
💻 computer science

FormalScience: Scalable Human-in-the-Loop Autoformalisation of Science with Agentic Code Generation in Lean

تقدم الورقة البحثية **FormalScience**، وهو مسار وكيل (agentic pipeline) يعتمد على تدخل العنصر البشري ومصمم لمساعدة الخبراء في المجال على أتمتة صياغة الاستدلال العلمي في كود Lean4 بكفاءة، وهو ما تم إثباته من خلال إنشاء **FormalPhysics**، وهي مجموعة بيانات عالية الجودة من مسائل الفيزياء بمستوى جامعي توفر تحليلاً منهجياً للانزياح الدلالي (semantic drift) في عملية الصياغة الرسمية القائمة على النماذج اللغوية الكبيرة (LLMs).

Jordan Meadows, Lan Zhang, Andre Freitas2026-04-28
🤖 machine learning

Preserving Long-Tailed Expert Information in Mixture-of-Experts Tuning

لمعالجة مشكلة هشاشة الموجه وفقدان المعلومات في الضبط الدقيق لخليط الخبراء (MoE)، تقترح هذه الورقة إطار عمل خالٍ من الخسارة المساعدة يستخدم التناثر المدفوع بالانحياز و"خبراء التكثيف" النشطين دائمًا للحفاظ على المعرفة القيمة من الخبراء الذين يتم تفعيلهم نادرًا مع تحسين الأداء العام.

Haoze He, Xingyuan Ding, Xuan Jiang, Xinkai Zou, Alex Cheng, Yibo Zhao, Juncheng Billy Li, Heather Miller2026-04-28
💻 computer science

Evaluating Temporal Consistency in Multi-Turn Language Models

تقدم هذه الورقة ChronoScope، وهو معيار اختبار واسع النطاق صُمم لتقييم ما إذا كانت النماذج اللغوية قادرة على الحفاظ على السياق الزمني أو تحديثه عبر الحوارات متعددة الأدوار، مما يكشف أن النماذج تخفق تكراراً في الحفاظ على الاتساق الزمني حتى عندما تمتلك المعرفة الواقعية الأساسية الصحيحة.

Yash Kumar Atri, Steven L. Johnson, Tom Hartvigsen2026-04-28
💻 computer science

DeepImagine: Learning Biomedical Reasoning via Successive Counterfactual Imagining

إن DeepImagine هو إطار عمل يعلّم النماذج اللغوية الكبيرة الاستدلال الطبي الحيوي عبر تدريبها على التنبؤ بكيفية تغير نتائج التجارب السريرية تحت تأثير متغيرات تجريبية مختلفة من خلال الجمع بين الضبط الدقيق الخاضع للإشراف على الأزواج الواقعية المضادة، والتعلم التعزيزي، ومسارات الاستدلال الاصطناعية.

Youze Zheng, Jianyou Wang, Yuhan Chen, Matthew Feng, Longtian Bao, Hanyuan Zhang, Maxim Khan, Aditya K. Sehgal, Christop (…)2026-04-28
💻 computer science

Implicit Framing in Obstetric Counseling Notes: A Grounded LLM Pipeline on a VBAC-Eligible Cohort

تستخدم هذه الورقة البحثية مساراً قائماً على النماذج اللغوية الكبيرة (LLM) والمستند إلى بيانات واقعية لتحليل الملاحظات السريرية لطب التوليد، مما يكشف أن الأطباء يستخدمون لغة تركز على المخاطر بشكل أكبر بكثير عند توثيق الاستشارات المتعلقة بالعمليات القيصرية المتكررة مقارنة بالولادة المهبلية بعد القيصرية.

Baris Karacan, Barbara Di Eugenio, Patrick Thornton, Joanna Tess, Subhash Kumar Kolar2026-04-28