⚡ electrical engineering

All That Glitters Is Not Audio: Rethinking Text Priors and Audio Reliance in Audio-Language Evaluation

تقدم هذه الورقة إطاراً تشخيصياً يكشف أن العديد من النماذج اللغوية الصوتية الكبيرة تحقق درجات مرتفعة في الاختبارات المعيارية من خلال الاعتماد على الأولويات النصية والشظايا الصوتية الموضعية بدلاً من الإدراك السمعي الحقيقي، مما يشير إلى أن التقييمات الحالية غالباً ما تفشل في قياس الفهم الصوتي الفعلي.

Leonardo Haw-Yang Foo, Chih-Kai Yang, Chen-An Li, Ke-Han Lu, Hung-yi Lee2026-04-28
💻 computer science

Can You Make It Sound Like You? Post-Editing LLM-Generated Text for Personal Style

تخلص هذه الدراسة إلى أنه في حين أن التحرير اللاحق للمسودات التي أنشأتها النماذج اللغوية الكبيرة يساعد المستخدمين على دمج بعض من أسلوبهم الشخصي، إلا أن النص الناتج يظل أقرب من الناحية الأسلوبية إلى مخرجات النموذج الأصلية مقارنة بالكتابة البشرية غير المساعدة، ويظهر تنوعاً منخفضاً، مما يخلق فجوة بين الأصالة المتصورة والتشابه الأسلوبي القابل للقياس.

Connor Baumler, Calvin Bao, Huy Nghiem, Xinchen Yang, Marine Carpuat, Hal Daumé III2026-04-28
💻 computer science

Zero-shot Large Language Models for Automatic Readability Assessment

تقدم هذه الورقة منهجية تحفيز صفرية النموذج ونموذجاً هجيناً يسمى LAURAE يستفيدان من النماذج اللغوية الكبيرة لتحقيق تقييم آلي قوي ومتطور وغير خاضع للإشراف لسهولة القراءة عبر مجموعات بيانات ولغات وأنواع نصوص متنوعة.

Riley Grossman, Yi Chen2026-04-28
💻 computer science

Agentic clinical reasoning over longitudinal myeloma records: a retrospective evaluation against expert consensus

تُظهر هذه الدراسة الاسترجاعية أن نظام الاستدلال السريري الوكيل يتفوق على أساليب التوليد المعزز بالاسترداد (RAG) التقليدية وأساليب السياق الكامل في تركيب سجلات مرض الورم النخاعي المتعدد الطولية لمطابقة إجماع الخبراء، لا سيما في الحالات المعقدة، رغم أن ارتفاع شدة الأخطاء المتبقية لديه يستلزم التحقق الاستباقي قبل النشر السريري.

Johannes Moll, Jannik Lübberstedt, Christoph Nuernbergk, Jacob Stroh, Luisa Mertens, Anna Purcarea, Christopher Zirn, Ze (…)2026-04-28
💻 computer science

Generating Place-Based Compromises Between Two Points of View

تقدم هذه الورقة طريقة لتوليد تسويات محايدة تعاطفياً بين وجهات النظر المتعارضة حول أماكن مشتركة باستخدام التشابه التعاطفي الخارجي كتعليقات راجعة تكرارية للتفوق على الاستدلال القياسي، ومن ثم استغلال مجموعة البيانات الناتجة لتدريب نماذج أصغر أكثر كفاءة عبر مواءمة التفضيلات البشرية.

Sumanta Bhattacharyya, Francine Chen, Scott Carter, Yan-Ying Chen, Tatiana Lau, Nayeli Suseth Bravo, Monica P. Van, Kate (…)2026-04-28
💻 computer science

Layerwise Convergence Fingerprints for Runtime Misbehavior Detection in Large Language Models

تقدم هذه الورقة "بصمة التقارب عبر الطبقات" (LCF)، وهي مراقب وقت تشغيل لا يتطلب ضبطًا، يكتشف سلوكيات النماذج اللغوية الكبيرة المتنوعة الخاطئة — بما في ذلك الأبواب الخلفية، وكسر الحماية، وحقن الأوامر — عبر بنيات متعددة من خلال تحليل مسارات الحالات الخفية بين الطبقات دون الحاجة إلى نموذج مرجعي، أو معرفة بالمحفزات، أو إعادة تدريب.

Nay Myat Min, Long H. Pham, Jun Sun2026-04-28
💻 computer science

STELLAR-E: a Synthetic, Tailored, End-to-end LLM Application Rigorous Evaluator

يُعد STELLAR-E إطار عمل مؤتمتًا بالكامل ومكونًا من مرحلتين، يقوم بتوليد مجموعات بيانات اصطناعية عالية الجودة وقابلة للتخصيص لتقييم تطبيقات النماذج اللغوية الكبيرة (LLM) بدقة، مما يوفر بديلًا قابلاً للتوسع وفعالًا لجمع البيانات يدويًا مع تحقيق جودة تقييم تضاهي المعايير المرجعية الحالية.

Alessio Sordo, Lingxiao Du, Meeka-Hanna Lenisa, Evgeny Bogdanov, Maxim Romanovsky2026-04-28
💻 computer science

Looking for the Bottleneck in Fine-grained Temporal Relation Classification

تقدم هذه الورقة نهج "الفترة من النقطة" (Interval from Point)، الذي يصنف العلاقات الزمنية عبر تحديد علاقات النقاط بين نهايات الفترات أولاً ثم فك تشفيرها، محققاً درجة جديدة قياسية للوعي الزمني تبلغ 70.1% على مجموعة بيانات TempEval-3.

Hugo Sousa, Ricardo Campos, Alípio Jorge2026-04-28
💻 computer science

Less Is More: Engineering Challenges of On-Device Small Language Model Integration in a Mobile Application

تقدم هذه الورقة دراسة حالة طولية حول دمج نماذج اللغات الصغيرة التي تعمل على الجهاز داخل تطبيق أندرويد في بيئة إنتاجية، كاشفةً أنه على الرغم من كون ذلك ممكناً، فإن التكامل الناجح يتطلب تحولاً معمارياً براغماتياً حيث يتم تقليل مسؤوليات نموذج اللغة الكبير والاعتماد على استراتيجيات دفاعية قوية للتغلب على تحديات هندسية محددة مثل انتهاكات المخرجات وزمن الاستجابة.

William Oliveira2026-04-28
💻 computer science

DepthKV: Layer-Dependent KV Cache Pruning for Long-Context LLM Inference

يُعد DepthKV إطار عمل مبتكرًا لتقليم ذاكرة التخزين المؤقت لـ KV يعتمد على الطبقات، حيث يعمل على تحسين استنتاج النماذج اللغوية الكبيرة ذات السياق الطويل من خلال تخصيص ميزانية ذاكرة عالمية ثابتة ديناميكيًا عبر الطبقات بناءً على حساسية التقليم الفردية لكل منها، متفوقًا بذلك على طرق التقليم الموحدة التقليدية.

Zahra Dehghanighobadi, Asja Fischer2026-04-28