💬 NLP

Evaluating Scoring Bias in LLM-as-a-Judge

تتناول هذه الورقة البحثية مسألة تحيز التقييم في أنظمة "النموذج اللغوي الكبير كحكم" (LLM-as-a-Judge) التي لم تنل حظها الكافي من الدراسة، وذلك عبر تعريف وقياس ثلاثة أنواع مستحدثة من التحيز —وهي تحيز ترتيب المعايير، وتحيز معرف الدرجة، وتحيز درجة الإجابة المرجعية— واقتراح إطار عمل شامل للتخفيف منها من خلال تحسين تصميم الأوامر البرمجية والتقييم الآلي.

Qingquan Li, Shaoyu Dou, Kailai Shao, Chao Chen, Haixiang Hu2026-05-22
💬 NLP

STRUCTSENSE: A Task-Agnostic Agentic Framework for Structured Information Extraction with Human-In-The-Loop Evaluation and Benchmarking

تقدم الورقة البحثية "StructSense"، وهو إطار عمل مفتوح المصدر، معياري، وغير مرتبط بمهمة محددة، يجمع بين المعرفة الرمزية الموجهة بالأنطولوجيا، والتقييم الذاتي الوكيل، والتحقق من خلال العنصر البشري، لتحقيق استخراج معلومات هيكلية قوي وقابل للتعميم عبر مجالات علمية متنوعة.

Tek Raj Chhetri, Yibei Chen, Puja Trivedi, Dorota Jarecka, Saif Haobsh, Patrick Ray, Lydia Ng, Satrajit S. Ghosh2026-05-22
💬 NLP

RAGCap-Bench: Benchmarking Capabilities of LLMs in Agentic Retrieval Augmented Generation Systems

تقدم الورقة البحثية RAGCap-Bench، وهو معيار موجه نحو القدرات مصمم لتقييم مهام الاستدلال الوسيطة لأنظمة التوليد المعزز بالاسترجاع (RAG) الوكيلية، مما يثبت أن النماذج ذات الأداء الأقوى في هذه القدرات الدقيقة تحقق نتائج فائقة في العمليات النهائية الشاملة.

Jingru Lin, Chen Zhang, Stephen Y. Liu, Haizhou Li2026-05-22
💬 NLP

MAP4TS: A Multi-Aspect Prompting Framework for Time-Series Forecasting with Large Language Models

تقترح الورقة البحثية إطار عمل MAP4TS، وهو إطار توجيه متعدد الجوانب يدمج تحليل السلاسل الزمنية الكلاسيكي (بما في ذلك الارتباط الذاتي وتحليل فورير) في مطالبات النماذج اللغوية الكبيرة (LLM) لالتقاط الخصائص الإحصائية والارتباطات الزمنية بفعالية، مما يؤدي إلى تفوقه على الأساليب الحالية الرائدة في التنبؤ بالسلاسل الزمنية.

Suchan Lee, Jihoon Choi, Sohyeon Lee, Minseok Song, Bong-Gyu Jang, Hwanjo Yu, Soyeon Caren Han2026-05-22
⚡ electrical engineering

Quantizing Whisper-small: How design choices affect ASR performance

تقدم هذه الورقة تقييماً عبر المكتبات لعملية التكميم ما بعد التدريب على نموذج Whisper-small، مما يثبت أن التكميم الديناميكي بنمط int8 باستخدام Optimum-Quanto يقدم الحل الأمثل للموازنة من خلال تقليل حجم النموذج بنسبة 57% مع تحسين معدل خطأ الكلمات دون الحاجة لإعادة التدريب.

Arthur Söhler, Julian Irigoyen, Andreas Søeborg Kirkedal2026-05-22
💬 NLP

Structural Anchor Pruning: Training-Free Multi-Vector Compression for Visual Document Retrieval

تقدم الورقة البحثية إطار عمل "تقليم المرساة الهيكلية" (SAP)، وهو إطار عمل لا يتطلب تدريباً ولا يعتمد على الاستعلام، يحقق ضغطاً عالياً في استرجاع الوثائق المرئية من خلال تحديد والحفاظ على "هضبة هيكلية" مستقرة ضمن الطبقات المتوسطة للنموذج، مما يحافظ على أكثر من 90% من أداء الاسترجاع مع تقليم أكثر من 90% من الرموز المرئية دون الحاجة إلى ضبط خاص لكل نموذج.

Zhuchenyang Liu, Ziyu Hu, Yao Zhang, Yu Xiao2026-05-22
💬 NLP

Unifying Masked Diffusion Models with Various Generation Orders and Beyond

تقدم هذه الورقة إطار عمل نموذج الانتشار المقنع المعتمد على الترتيب (OeMDM) ومتغيره القابل للتعلم (LoMDM)، اللذين يوحدان مختلف ترتيبات التوليد ويقومان بتحسين سياسات الترتيب بشكل مشترك مع العمود الفقري للانتشار من الصفر لتحقيق أداء فائق في توليد اللغة مقارنة بنماذج الانتشار المنفصلة الحالية.

Chunsan Hong, Sanghyun Lee, Jong Chul Ye2026-05-22
💬 NLP

When Shared Knowledge Hurts: Spectral Over-Accumulation in Model Merging

تقدم هذه الورقة البحثية "معايرة القيم المفردة" (SVC)، وهي طريقة لا تتطلب تدريباً تعمل على تخفيف تدهور الأداء الناتج عن التراكم المفرط للمعرفة الطيفية المشتركة في دمج النماذج، وذلك من خلال قياس تداخل الفضاءات الجزئية وإعادة تحجيم القيم المفردة المتضخمة، مما يحقق نتائج هي الأفضل حالياً عبر معايير الرؤية واللغة.

Yayuan Li, Ze Peng, Jian Zhang, Jintao Guo, Yue Duan, Yinghuan Shi2026-05-22
💬 NLP

Discovering Implicit Large Language Model Alignment Objectives

تقدم هذه الورقة إطار عمل Obj-Disco، الذي يقوم تلقائياً بتفكيك إشارات مكافأة محاذاة النماذج اللغوية الكبيرة المعقدة إلى أهداف لغوية طبيعية متفرقة وقابلة للتفسير بشرياً للكشف عن الحوافز الضمنية والتخفيف من المخاطر مثل اختراق المكافأة.

Edward Chen, Sanmi Koyejo, Carlos Guestrin2026-05-22
💬 NLP

Discrete Stochastic Localization for Non-autoregressive Generation

تقدم هذه الورقة البحثية "التوطين العشوائي المتقطع" (DSL)، وهو إطار عمل للحالة المستمرة بتمثيلات رموز (token embeddings) على كرة الوحدة، يُمكّن شبكة واحدة مدربة من دعم مسارات أخذ عينات متنوعة — بما في ذلك الانتشار المقنع، والارتباط الذاتي عشوائي الترتيب، والتوليد الهجين المستمر-المتقطع — مما يحسن بشكل كبير من دقة التوزيع مقارنة بنماذج الانتشار المتقطع المقنع القياسية دون الحاجة إلى تقطير أو إعادة تدريب.

Yunshu Wu, Jiayi Cheng, Longxuan Yu, Partha Thakuria, Rob Brekelmans, Evangelos E. Papalexakis, Greg Ver Steeg2026-05-22