🤖 machine learning

Whose Gold? Annotator-Pool Disagreement Is Large at the Item Level, and Hidden by Small Leaderboards

تكشف هذه الورقة أن الاختلاف الجوهري بين الخبراء والمشاركين من الجمهور على مستوى العناصر يتم حجبه بسبب صغر حجم لوحات المتصدرين، مما يخلق شعوراً زائفاً بالاستقرار في تصنيفات النماذج يفشل في التعميم مع زيادة عدد النماذج.

Anik Jha2026-08-18
🤖 AI

From Sequence to Structure: Relational Uncertainty Propagation for LLM Agents

تقدم هذه الورقة البحثية RUPA، وهو إطار عمل لتقدير عدم اليقين على مستوى المسار، يقوم بنمذجة سجلات التنفيذ كرسوم بيانية موجهة لنشر عدم اليقين عبر التبعيات العلاقاتية، مما يتفوق بذلك على الأساليب الحالية في اكتشاف تراكم الأخطاء بعيد المدى وتحسين موثوقية وكلاء النماذج اللغوية الكبيرة (LLM) في البيئات التفاعلية المعقدة.

Zhengzhao Ma. Boxi Cao, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun2026-08-18
🤖 AI

Prior Audit-Repair Context Shifts LLM Verifier Thresholds Toward Leniency

تُثبت هذه الورقة أنه عندما يعمل مُحقِّق النموذج اللغوي ضمن سياق يحتوي على حلقة مراجعة وإصلاح سابقة، فإن عتبة اتخاذ القرار لديه تنزاح بشكل ملحوظ نحو التساهل، مما يقلل من الإنذارات الكاذبة بنسبة تتراوح بين 9 و25% دون المساس بقدرته على التمييز بين المخرجات الصحيحة والخاطئة.

Parsa Mazaheri, Kasra Mazaheri2026-08-18
💻 computer science

ReRef-3D: A Benchmark for Spatial Referring Expression-Guided 3D Scene Rearrangement

تقدم الورقة البحثية ReRef-3D، وهو معيار شامل يتكون من أكثر من 33,000 تعليمات موجهة لغوياً لإعادة ترتيب المشاهد ثلاثية الأبعاد، والذي يقيم النماذج بناءً على قدرتها على توليد مواضع صالحة فيزيائياً تستوفي العلاقات المكانية، مما يكشف أن النماذج الحالية الرائدة تعاني بشكل كبير مع الاستدلال العلاقاتي المعقد والقيود الفيزيائية.

Mary Lynn Martin, Yifei Zhang, Martha Palmer, Maria Leonor Pacheco2026-08-18
💻 computer science

DuplexGen: Decoupling Content, Timing, and Acoustics for Synthetic Dialogue Speech

يُعد DuplexGen إطار عمل مبتكر لتوليد الحوار يعمل على فصل المحتوى والتوقيت والخصائص الصوتية عبر استخدام نموذج لغوي كبير لتوليد السيناريو، يليه نموذجان للحوار ثنائي الاتجاه (full-duplex) يتفاعلان في الوقت الفعلي، مما يتيح ظهور ديناميكيات حوارية طبيعية مثل المقاطعات والتداخلات مع الحفاظ على المحتوى المكتوب وجودة الكلام العالية.

Pengcheng Wang, Sheng Li, Jiyi Li, Takahiro Shinozaki2026-08-18
🤖 AI

CAPO: Constraint-Aware Prompt Optimization for LLM Agents

تقدم هذه الورقة البحثية طريقة CAPO، وهي طريقة لتحسين الأوامر البرمجية (prompt optimization) تراعي القيود وتستخدم نهجاً ثنائياً أولياً (primal-dual approach) مع أوزان قيود تكيفية لتحسين الأوامر البرمجية لأنظمة وكلاء النماذج اللغوية الكبيرة (LLM agent systems) بفعالية من أجل أداء المهام مع الالتزام بالقيود التشغيلية مثل السلامة والتنسيق، إلى جانب نسخة ديناميكية (DCAPO) تقوم بتدريب مُعيد صياغة متخصص لتحقيق أوامر برمجية قابلة للتنفيذ وعالية الأداء عبر مجالات متنوعة دون تعديل وكيل المهمة الأساسي.

Victor Ye Dong, Reid Pryzant, Yi Liu, Jian Jiao2026-08-18
💻 computer science

HyperSkill: Self-Evolving LLM Agents via Hypergraph-Structured Skill Memory

يُعد HyperSkill إطار عمل مبتكر يعزز أداء وكلاء النماذج اللغوية الكبيرة (LLM) في المهام المعقدة من خلال تمثيل الذاكرة التجريبية كـ "رسم بياني فائق" (hypergraph) يتكون من مهام فرعية ومهارات قابلة لإعادة الاستخدام، مما يتيح تخزيناً أكثر فعالية، واسترجاعاً علاقيّاً، وصيانة ذاتية التطور تتفوق بشكل كبير على النماذج المرجعية الحالية.

Ruiyao Xu, Tiankai Yang, Wei-Chieh Huang2026-08-18
🤖 AI

QUMem: Personalized Memory for Query-Conditioned User-State Inference in LLM Agents

يُعد QUMem إطار عمل ذاكرة مهيكلة يعزز تخصيص وكلاء النماذج اللغوية الكبيرة من خلال تقسيم سجلات التفاعل إلى حلقات دلالية، وتفكيكها إلى أنواع ذاكرة قابلة للاسترجاع بشكل مستقل، وتوظيف عملية استرجاع متعددة الوكلاء لاستنتاج حالات مستخدم صالحة زمنياً وسياقياً، مما يحقق أداءً رائدًا في معايير قياس التخصيص.

Heng Wang, Yifei Li, Lingling Zhang, Pengyu Li, Xinyu Che, Xinyu Zhang, Zesheng Yang2026-08-18
💻 computer science

INSPIRE: A Benchmark for Instruction-Aware Speech Retrieval

تقدم الورقة البحثية INSPIRE، وهو أول معيار لتقييم استرجاع الكلام المدرك للتعليمات، والذي يوضح أن طرق الاسترجاع الحالية تفشل في التعامل بمتانة مع نوايا المستخدم المتنوعة من خلال كشف مقايضة حيث تتفوق النماذج القائمة على النصوص في المطابقة الدلالية ولكنها تعاني مع السمات شبه اللغوية، بينما تلتقط النماذج القائمة على الكلام الخصائص الصوتية لكنها تتعثر في اتباع التعليمات المعقدة.

Chen-An Li, Hung-yi Lee2026-08-18
🤖 machine learning

Domain-Agnostic Neural Topic Modeling with Contextual Token-Level Semantic Graph Representation

تقدم الورقة البحثية DARTopic، وهو إطار عمل للنمذجة الموضوعية العصبية غير المرتبط بنطاق محدد، والذي يعزز القابلية للتفسير في المتون المتخصصة من خلال بناء رسوم بيانية دلالية على مستوى الرموز (tokens) من تضمينات النماذج اللغوية مسبقة التدريب والمجمدة، والتدريب المشترك لمشفر شبكة عصبية رسومية (GNN)، مما يتغلب على قيود فضاء التضمين في الطرق الحالية دون الحاجة إلى ضبط دقيق للمشفر.

Seung-Won Seo, Won Ik Cho, Yongmin Yoo2026-08-18