💬 NLP

Outcome Monitors: Recovery Affordances for Silent Tool Failures

تقدم هذه الورقة "مراقب النتائج" (Outcome Monitors)، وهي آلية تكتشف حالات فشل الأدوات الصامتة من خلال التحقق من عقود النتائج وإصدار إيصالات مع أدوات الاسترداد، مما يحسن معدلات إتمام المهام في تقييمات الوكلاء بشكل كبير، مع تسليط الضوء على أن الكشف الحالي يعتمد بشكل كبير على المفردات المستخرجة.

Sugam Panthi, Rabab Abdelfattah2026-08-21
🤖 machine learning

Improved Confidence Estimates for Black-Box Large Language Models

تقترح هذه الورقة طريقة منخفضة التكلفة تُحسّن تقدير عدم اليقين للنماذج اللغوية الكبيرة ذات الصندوق الأسود، وذلك عبر تدريب مصنفات بسيطة للتنبؤ بصحة الاستجابة باستخدام درجات الثقة الحالية وصحة الاستعلامات المماثلة من مجموعة بيانات مستهدفة.

Sokhna Diarra Mbacke, Mouloud Belbahri, Gabriel Loaiza-Ganem2026-08-21
🤖 machine learning

Mechanistic Tomography: Designed Measurement for Control-Oriented Interpretability

تقدم هذه الورقة "التصوير المقطعي الآلي"، وهو إطار عمل موحد ينمذج تقنيات التفسير كقياسات مصممة لاستعادة الآليات الداخلية للنماذج وآثار التدخل بشكل منهجي، مما يثبت من خلال تجارب متنوعة أن التحقق الموجه نحو التحكم وعائلات القياس المخصصة يمكن أن يعيد بناء الهياكل والتفاعلات السببية في النماذج اللغوية الكبيرة بكفاءة.

Vijay Erramilli2026-08-21
🤖 machine learning

HYDRA: A Heterogeneous Chiplet DSE Framework for Serving Dynamic Hybrid LLM Workloads

تقدم هذه الورقة البحثية HYDRA، وهو إطار عمل شامل لاستكشاف فضاء التصميم يعمل على تحسين بنيات الرقائق المتغايرة وسياسات وقت التشغيل الديناميكية بشكل مشترك لزيادة الإنتاجية وتقليل زمن الاستجابة بشكل كبير لخدمة نماذج اللغات الكبيرة الهجينة من نوع Transformer-Mamba.

Jiahao Lin, Alish Kanani, Sangwan Lee, Jaehyun Park, Umit Ogras2026-08-21
💬 NLP

Are LLMs becoming similarly creative? Evidence from three years of models

تحلل هذه الورقة ثلاثة أعوام من إصدارات النماذج اللغوية الكبيرة وتجد انخفاضاً ذا دلالة إحصائية في تنوع المخرجات في المهام الإبداعية مفتوحة النهايات، مما يشير إلى اتجاه نحو التجانس قد يقلل من الوكالة البشرية في العمل الإبداعي المشترك بين الإنسان والذكاء الاصطناعي.

Nirav Patel, Josiah Crossman, Eva Aggarwal, Emily Wenger2026-08-21
💬 NLP

Measuring What a Specification Determines: A Formal Semantic-Block Model and an Execution-Judged Benchmark

يقدم هذا البحث نموذج كتلة دلالية رسمياً ومعياراً تقييمياً محكوماً بالتنفيذ لتقييم جودة المواصفات بشكل مستقل عن قدرة النموذج، موضحاً من خلال دراسة حالة لهجرة من Oracle إلى PostgreSQL أنه بينما يعد الحتمية مفهوماً رسمياً صالحاً، إلا أنها لا تعمل بعد كمعيار جودة تجريبي قائم بذاته للنماذج اللغوية الكبيرة المعاصرة بسبب التباين الكبير في التنفيذ.

Oleg Grynets, Dmytro Kostetskyi, Vasyl Lyashkevych2026-08-21
🤖 AI

Symposium: Trust via Auditable Records for Communities of AI Scientist Agents

إن "سيمبوزيوم" (Symposium) هو إطار عمل رسمي وتنفيذ عملي يُمكّن المجتمعات العلمية البحثية الصغيرة من الحفاظ على سجلات غير قابلة للتغيير وقابلة للتدقيق للأبحاث التي تقودها الوكلاء الاصطناعيون، مما يعزز الثقة والاستمرارية من خلال الفصل بين التاريخ العلمي الدائم والأنظمة الاصطناعية المتطورة التي تستخدمه.

Dexter Pratt2026-08-21
🤖 machine learning

In Two Minds about Lifelong Learning: Exploring Hemispheric Redundancy and Specialisation in Neural Models

تقترح هذه الورقة البنية الكلية 4MAS، التي تحاكي التعلم البيولوجي من خلال أنصاف كرات دماغية غير متماثلة وفترات دمج تشبه النوم للتغلب على النسيان الكارثي في التعلم المستمر، محققةً دقة تنافسية في مجموعات بيانات Split-MNIST وSplit-Fashion-MNIST وSplit-CIFAR-100.

Benjamin Smith, Levin Kuhlmann, Kaushik Roy, Gideon Kowadlo2026-08-21
💬 NLP

Automated Summarization of Financial News Using Large Language Models and Retrieval-Augmented Generation: An Early Empirical Study (Fall 2023)

تُظهر هذه الدراسة الصادرة عن جامعة جورج واشنطن في خريف ٢٠٢٣ أن مسار معالجة يستخدم نموذج Falcon-7B مع سلاسل التلخيص (Summarize Chains) يعمل بفعالية على أتمتة تلخيص الأخبار المالية لعشر شركات كبرى، متفوقاً بذلك على كل من نهج التوليد المعزز بالاسترداد (RAG) ومعيار Lead-3، مع تسليط الضوء في الوقت ذاته على التحديات المستمرة مثل الهلوسة في النماذج الأصغر حجماً.

Pranav Chandaliya2026-08-21
💬 NLP

When Machines Speak: A Unified Generative Framework for Integrating Machine-Native Symbols into Pretrained Large Language Models

تقدم هذه الورقة UniLang، وهو إطار توليدي موحد يوسع نماذج اللغات الكبيرة مسبقة التدريب لمعالجة وتوليد الرموز الأصلية للآلة بشكل أصيل إلى جانب اللغة الطبيعية، مما يسد الفجوة بين النمذجة اللغوية والتنبؤ المهيكل دون الحاجة إلى التعبير اللفظي أو بنى تحتية خاصة بالمهام.

Su Yan, Rakesh Iyer2026-08-21