💬 NLP

Adaptive Modality Reliability Diagnosis and Restoration for Robust Multimodal Intent Recognition

تقدم الورقة البحثية إطار عمل PRIME، وهو إطار عمل مغلق الحلقة يشخص نقاط ضعف الأنماط باستخدام تباين السجل السياقي، ويستعيد التمثيلات المتدهورة عبر وحدة تباينية مشروطة بالنموذج الأصلي، ويعيد تقييم الموثوقية لتمكين التعرف القوي على النوايا متعدد الوسائط في ظل ظروف الضجيج أو الفقدان أو التعارض.

Suraj Kumar, Mohnish Raj, Soumi Chattopadhayay, Chandranath Adak, Ayan Dutta2026-08-05
💬 NLP

Consensus Measures for Unstructured Biomedical Text Annotations

تتقصى هذه الورقة طرق قياس موثوقية التوافق بين المقيمين في التعليقات التوضيحية للنصوص الطبية الحيوية غير المهيكلة، مبينة أنه في حين أن مقاييس التكافؤ الدلالي مثل التضمينات والنماذج اللغوية الكبيرة لها قيود متميزة، فإن الاستدلال باللغة الطبيعية يقدم حلاً وسطاً واعداً لتقييم هذا التوافق.

Pascal Wullschleger, Christian Kreis, Martin A. Walter, Marc Pouly, Jennifer Foster2026-08-05
💬 NLP

LoopMTP: A looped transformer guided by latent multi-token prediction

تقترح الورقة البحثية LoopMTP، وهو إطار عمل فعال من حيث المعلمات يعزز نماذج المحولات الحلقية (looped transformers) عبر محاذاة الحالات الخفية المتوسطة مع تضمينات الرموز المستقبلية من خلال التنبؤ متعدد الرموز الكامن، مما يخفف من حدة الإفراط في التفكير ويحسن دقة الاستنتاج بشكل كبير.

Behzad Shomali, Markus Frey, David Berghaus, Joachim Koehler, Mehdi Ali2026-08-05
💬 NLP

How Closely Do LLM Reviews Align with Human Peer Review?

تقيم هذه الدراسة ثلاثة من النماذج اللغوية الكبيرة الرائدة مقابل مراجعات الأقران البشرية لأبحاث مقدمة لـ ICLR 2026، وتجد أنه بينما تستطيع النماذج اللغوية الكبيرة التمييز بشكل عام بين الأوراق المقبولة والمرفوضة، إلا أنها تفشل في محاكاة التمايزات البشرية بين العروض الشفهية والملصقات، وتظهر تحيزات في التقييم خاصة بكل مزود واختلافات موضوعية في تحديد نقاط الضعف.

Abraham Camelo-Guerrero, Jairo Diaz-Rodriguez2026-08-05
💬 NLP

VetScore: Risk-Weighted Fact Verification for Veterinary Long-Form QA with Citations

تقدم هذه الورقة VetScore، وهو إطار تقييم مرجح بالمخاطر للأسئلة والأجوبة الطويلة في المجال البيطري، يقيم مدى أمانة الادعاءات المُولدة لمقتطفات المصدر مع إعطاء الأولوية للادعاءات بناءً على ضررها المحتمل، محققاً توافقاً عالياً مع أحكام الخبراء.

Ivan Kartáč, Jan Tovarys, Mateusz Lango, Ondřej Dušek2026-08-05
💬 NLP

Predicting Deep Neural Network Training Outcomes from Early Training Telemetry

تُثبت هذه الورقة أن الأشجار المعززة بالتدرج يمكنها التنبؤ بدقة بالأداء النهائي وأنماط الفشل لعمليات تدريب الشبكات العصبية العميقة باستخدام القياسات عن بُعد المبكرة فقط (مثل الخسارة، والتدرجات، ومعايير الأوزان) من الدورات الأولى، مما يتيح تخصيصاً فعالاً للحوسبة دون الحاجة إلى الرجوع إلى عمليات تدريب أخرى.

Ranjita Naik, Anh D. Nguyen, Pankaj Kumar Singh2026-08-05
💬 NLP

When Outputs Disperse, Does Epistemic Revision Follow? A Black-Box Coupling Diagnostic for Machine Collectives

تقدم هذه الورقة تشخيصاً بنظام الصندوق الأسود يسمى "اقتران مراجعة التشتت" (dispersion-revision coupling) ليكشف أنه في حين أن تنوع المخرجات في مجموعات النماذج اللغوية الكبيرة لا يضمن مراجعة معرفية حقيقية، فإن فعالية مثل هذه التدخلات تتباين بشكل كبير عبر النماذج، حيث أظهر نموذج GPT-4o-mini تحسناً في التعافي من المقدمات الخاطئة من خلال الاعتراض المشروط، بينما اكتفى نموذج Gemini-2.5-flash بإعادة صياغة الحجج دون تغيير موقفه الأساسي.

Molood Arman2026-08-05
💬 NLP

GPTKB 2.0: Direct Construction of Disambiguated Knowledge Bases from Large Language Models

تقدم الورقة البحثية GPTKB 2.0، وهي منهجية قابلة للتوسع تبني قاعدة معرفية بمليون عنصر وفك لغمبضات المعنى مباشرة من النماذج اللغوية الكبيرة عبر تنفيذ عملية توحيد القياس (canonicalization) للكيانات والعلاقات والفئات آنياً للتغلب على قيود التمثيل الأصلية.

Yujia Hu, Tuan-Phong Nguyen, Simon Razniewski2026-08-05
💬 NLP

An Actionable Diagnosis of Multilingual, Multi-Agent Planning Failures

تقدم هذه الورقة تصنيفاً إجرائياً لإخفاقات ربط التخطيط في الأنظمة متعددة الوكلاء ومتعددة اللغات، وتقترح TART، وهو منهج تمثيل موجه بالتصنيف يحسن دقة التنفيذ بشكل كبير عبر لغات وتكوينات نماذج متنوعة من خلال المعالجة الصريحة لفقدان المعلومات أثناء عملية تحويل الطلب إلى خطة.

Vikas Pahuja, Jonathan Brokman, Omer Hofman, Tamir Nizri, Daniel Vishna, Seraphina Goldfarb-Tarrant, Kelly Marchisio, Hi (…)2026-08-05
💬 NLP

SciRet: A Compute-Aware Empirical Study of Retrieval and Reranking for Scientific RAG

يقدم SciRet دراسة تجريبية مدركة للحوسبة تقيم خط معالجة استرجاع معزز بالبيانات (RAG) علمي ثابت عبر مقاييس مختلفة من المتون على مجموعة بيانات CORD-19، كاشفاً أن الاسترجاع الهجين يتفوق على النهج أحادي الطريقة مع تسليط الضوء على التأثير الضار لأجهزة إعادة الترتيب غير المتوافقة مع المجال والارتباط الإيجابي بين حجم المتن وأمانة التوليد.

Kaysarul Anas Apurba, Md. Hasibul Hasan, Rofiqul Alam Shehab, Asab Azad2026-08-05