💬 NLP

Automated Summarization of Financial News Using Large Language Models and Retrieval-Augmented Generation: An Early Empirical Study (Fall 2023)

تُظهر هذه الدراسة الصادرة عن جامعة جورج واشنطن في خريف ٢٠٢٣ أن مسار معالجة يستخدم نموذج Falcon-7B مع سلاسل التلخيص (Summarize Chains) يعمل بفعالية على أتمتة تلخيص الأخبار المالية لعشر شركات كبرى، متفوقاً بذلك على كل من نهج التوليد المعزز بالاسترداد (RAG) ومعيار Lead-3، مع تسليط الضوء في الوقت ذاته على التحديات المستمرة مثل الهلوسة في النماذج الأصغر حجماً.

Pranav Chandaliya2026-08-21
💬 NLP

When Machines Speak: A Unified Generative Framework for Integrating Machine-Native Symbols into Pretrained Large Language Models

تقدم هذه الورقة UniLang، وهو إطار توليدي موحد يوسع نماذج اللغات الكبيرة مسبقة التدريب لمعالجة وتوليد الرموز الأصلية للآلة بشكل أصيل إلى جانب اللغة الطبيعية، مما يسد الفجوة بين النمذجة اللغوية والتنبؤ المهيكل دون الحاجة إلى التعبير اللفظي أو بنى تحتية خاصة بالمهام.

Su Yan, Rakesh Iyer2026-08-21
💬 NLP

PEA-DPO: Perception-Enhanced Alignment Direct Preference Optimization for MLLMs Alignment

تقدم هذه الورقة البحثية "تحسين التفضيل المباشر للمحاذاة المعزز بالإدراك" (PEA-DPO)، وهو إطار عمل مبتكر يعالج عدم الحساسية البصرية للنماذج اللغوية الكبيرة متعددة الوسائط من خلال الاستف banyak صراحةً من إشارات التفضيل البصري، مما يقلل بشكل كبير من الهلوسة ويحسن المحاذاة متعددة الوسائط مع الحفاظ على القدرات اللغوية.

Jiawei Feng, Jiancan Wu, Xingyu Zhu, Junkang Wu, Xiang Wang, Xiangnan He2026-08-21
💬 NLP

Forking Fast: Efficiently Estimating Uncertainty Dynamics in Text Generation

تقدم هذه الورقة البحثية "Forking Fast"، وهي طريقة فعالة حاسوبياً تستخدم نموذجاً إحصائياً لتنعيم بيانات إعادة أخذ العينات منخفضة العينات والمشوبة بالضجيج، مما يتيح التقدير الدقيق لديناميكيات عدم اليقين في توليد النصوص بواسطة النماذج اللغوية الكبيرة (LLM) دون التكلفة الباهظة لإعادة أخذ العينات الشاملة.

Eric Bigelow, Amir Zur, Satchel Grant, Tal Haklay, Can Rager, Owen Lewis, Thomas McGrath, Jack Merullo, Ekdeep Singh Lub (…)2026-08-21
💬 NLP

The Asymmetric Harms of LLM Compression

تكشف هذه الورقة أن المقاييس التجميعية القياسية تفشل في رصد الأضرار غير المتماثلة لضغط النماذج اللغوية الكبيرة، والتي تضعف بشكل غير متناسب القدرة على الاحتفاظ بالمعرفة الأساسية، وتحافظ على مستويات ثقة عالية في المعلومات المفقودة حديثاً، وتخفي التحولات المتعارضة في التحيزات الاجتماعية عبر المجموعات السكانية الفرعية.

Yuan Wu, Mairui Li, Lesia Semenova, Chudi Zhong2026-08-21
💬 NLP

StreamSoccer: Event-Driven Memory for Streaming Soccer Commentary

يُعد StreamSoccer نظاماً قائماً على الأحداث يستخدم ذاكرة نشطة ذات ميزانية ثابتة لتنظيم بث فيديو كرة القدم إلى دورات حياة أحداث دلالية، مما يتيح توليد تعليق فوري وحالي وحديث وتاريخي مع حوسبة محدودة مع تحقيق أداء رائد على مجموعة بيانات جديدة ثلاثية المسارات.

Chenxi Shao, Bozhong Wang, Jiaxin Huang, Zhao Liu, Sunwei Zhu, Tianxin Hang, Gaoqi He, Yang Li, Changbo Wang2026-08-21
💬 NLP

Projector Is All You Train

تُثبت هذه الورقة أنه بالنسبة للنماذج اللغوية الكبيرة ثلاثية الأبعاد متعددة الوسائط، فإن تدريب جهاز الإسقاط (projector) فقط مع إبقاء العمود الفقري للنموذج اللغوي مجمدًا يعد كافيًا لتحقيق أداء قوي، وتجنب انحراف القدرات، ومضاعفة إنتاجية التدريب مقارنة بالتدريب المشترك.

Nyx Iskandar, Saathvik Selvan, Slater Victoroff2026-08-21
💬 NLP

One Success Isn't Reliability: Thinkingbox, a Sandbox and Benchmark for Agents in Stateful Business Workflows

تقدم هذه الورقة "Thinkingbox"، وهو بيئة تجريبية ومعيار تقييمي صُمم لتقييم وكلاء الذكاء الاصطناعي في تدفقات العمل التجارية ذات الحالة المستمرة، وذلك عبر قياس قدرتهم على تنفيذ مهام معقدة متعددة الخطوات بدقة مع انتقالات صحيحة في الحالة المستمرة، مما يكشف عن فجوة كبيرة بين النجاح العرضي والموثوقية المستمرة عبر 507 سيناريو مشروط بالسياسات.

Zhuochun Li, Youngmin Ko, Ali Keramati, Nicola Ferri, Susana Palmaz Lopez Pelaez, Liang-Chun Tsai, Calvin Wang, Mirco Mi (…)2026-08-21
💬 NLP

PersonalBench: Measuring the Authorship Gap in LLM Personalization

تقدم الورقة البحثية PersonalBench، وهو معيار مرجعي يوضح أنه بينما تستطيع طرق التخصيص الحالية أثناء وقت الاستنتاج تعديل مخرجات النماذج اللغوية الكبيرة لتكون متميزة بأسلوب المؤلف، إلا أنها تفشل في سد الفجوة الكبيرة للوصول إلى التأليف البشري الحقيقي، حيث يظل النص المولد أكثر بعداً عن الأساليب البشرية مما هم عليه البشر من بعضهم البعض.

Yash Ganpat Sawant2026-08-21
💬 NLP

SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?

تقدم هذه الورقة SWE-bench Science، وهو معيار مرجعي شامل يضم 119 مهمة على مستوى المستودعات عبر 20 مجالاً علمياً، والذي يكشف أن وكلاء البرمجة الحاليين يعانون في حل المهام الهندسية في البرمجيات العلمية بسبب آليات فشل محددة مثل نقص المعرفة وأخطاء الاستكشاف، بينما يوضح أيضاً أن فائدة التوجيه العلمي الصريح تعتمد على مدى توافقه مع سياق الإصلاح.

Zhipeng Xu, Jiahao Lu, Yining Zheng, Yuxin Wang, Xipeng Qiu2026-08-21