💬 NLP

From Triage to Discharge: A Survey of NLP Tasks, Methods, and Open Challenges in the Emergency Department

تستعرض هذه الدراسة المسحية 46 ورقة بحثية حول معالجة اللغات الطبيعية في أقسام الطوارئ، حيث تُحلل الأساليب والتوجهات عبر مراحل الفرز، والتشخيص، والخروج، مع تسليط الضوء على التحديات القائمة مثل القدرة على التعميم، والبيانات المشوشة، وقيود سير العمل.

Dipankar Srirag, Aditya Joshi, Salil Kanhere, Padmanesan Narasimhan2026-08-26
🤖 AI

Auditing the Synthetic Memoir: Measuring Scene-Level Confabulation in LLM-Generated Autobiography Against the Documented Record of the Life It Describes

تقدم هذه الورقة أول تدقيق كمي على مستوى المشهد لسيرة ذاتية من إنتاج النماذج اللغوية الكبيرة مقابل سجل حقيقي، كاشفةً عن معدل فشل في التحقق بنسبة 96.7% يهيمن عليه "الانجراف المرتكز" (مشاهد مخترعة تستخدم أشخاصاً وأماكن حقيقيين)، ومثبتةً أنه بينما يؤدي ترسيخ التوليد في المتن الفعلي للموضوع إلى تحسين الدقة، إلا أن الهلوسة الجوهرية لا تزال قائمة.

Heather Renze2026-08-26✓ Author reviewed
💬 NLP

Contextual Embedding Evidence for Main--Light Verb Distinctions in Urdu

تستخدم هذه الدراسة التضمينات السياقية من نماذج "بيرت" (BERT) متعددة لتقديم دليل حوسبي على أن الأفعال المساعدة (light verbs) في اللغة الأردية تتمايز بشكل منهجي عن نظيراتها من الأفعال الرئيسية في بنية الحدث، مع الحفاظ على الارتباط المعجمي الخاص بالكلمة الأصلية (lemma)، بما يتوافق مع التحليل النظري لـ "بوت" (Butt).

Farah Adeeba, Miriam Butt2026-08-26
🤖 AI

Gated Activation Steering for Reducing Sycophancy & Hallucination in Medical Question Answering

تقترح هذه الورقة إطار عمل للتدخل الموجه أثناء الاستدلال، يعمل على توجيه رؤوس انتباه محددة ديناميكيًا للحد بشكل مشترك من الهلوسة والمداهنة في الإجابة على الأسئلة الطبية، مما يثبت أن التعديلات المستهدفة والواعية بالسياق يمكن أن تحسن بشكل كبير من متانة النماذج الأصغر ضد ضغط المستخدم دون تقليل أدائها في الاستجابات الصحيحة.

Himanshu Tripathi, Subash Neupane, Shaswata Mitra, Sudip Mittal, Noorbakhsh Amiri Golilarz, Shahram Rahimi2026-08-26
🤖 AI

Automata from Agent Traces: Failure and Next-Step Prediction

تقترح هذه الورقة طريقة لطي مسارات تنفيذ وكلاء النماذج اللغوية الكبيرة إلى آلات حالات محدودة مدمجة وغير مرتبطة بنموذج معين، تلتقط بفعالية الطوبولوجيا السلوكية المشتركة، مما يتيح تنبؤاً فائقاً بالخطوة التالية وكشفاً مبكراً للفشل لأغراض تدقيق السلامة والمراقبة أثناء التشغيل.

Seonglae Cho, Franklin Cardenoso Fernandez, Umar Mohammed, Zekun Wu, Kleyton Da Costa, Ilham Wicaksono, Adriano Koshiyam (…)2026-08-26
💬 NLP

ADE: Agentic Data Evolution Framework for Human-Centered Objectives

تقترح الورقة البحثية "تطور البيانات الوكيل" (Agentic Data Evolution - ADE)، وهو إطار عمل متمحور حول البيانات يستخدم إجراءً مغلق الحلقة يتكون من الملاحظة-التنوع-الاختيار مع آلية قبول في حالة مستقرة لتحسين البيانات الاصطناعية بشكل تكراري، مما يحسن بشكل كبير من محاذاة النماذج اللغوية الكبيرة مع الأهداف غير القابلة للتنفيذ والمتمحورة حول الإنسان عبر مختلف المعايير وطرق ما بعد التدريب.

Yang Yu, Yilin Jiang, Zexuan Fei, Yiming Luo, Xingkai Song, Kaiyi Huang, Aimin Zhou, Xin Lin, Fei Tan2026-08-26
🤖 machine learning

Calibration-Preserving Pruning: Compression as a Reliability Contract

تقدم هذه الورقة البحثية طريقة "التقليم المحافظ على المعايرة" (CPP)، وهي طريقة تعزز ضغط النماذج من خلال دمج بروز تدرج عدم المطابقة لتقليل أحجام مجموعات التنبؤ في التنبؤ المطابق، مع الحفاظ على ضمانات التغطية ذات العينات المحدودة، مما يظهر مكاسب كفاءة كبيرة في مهام التصنيف ذات الملصقات الكبيرة دون المساس بالموثوقية.

Ibne Farabi Shihab, Adria Binte Habib, Anuj Sharma2026-08-26
💬 NLP

Giga-Embeddings: Mixture-of-Experts Encoders for High-Throughput Text Embeddings

تقدم الورقة البحثية Giga-Embeddings، وهي عائلة من نماذج تضمين النصوص التي تتميز بمُشفّر "خليط من الخبراء" (Mixture-of-Experts) متفرق يضم 10 مليارات معلمة، والذي يحقق جودة استرجاع رائدة وإنتاجية عالية عبر لغات متعددة، إلى جانب متغيرات كثيفة ومقطرة أصغر مُحسّنة للبيئات ذات الموارد المحدودة.

Egor Kolodin, Egor Krasnoperov, Evgeniy Kosarev, Fyodor Minkin2026-08-26
🤖 machine learning

Discovering Cross-Language Reasoning Invariance in LLMs with Geometry-Invariant Sparse Autoencoders

تتقصى هذه الورقة البحثية ثبات الاستدلال عبر اللغات في النماذج اللغوية الكبيرة متعددة اللغات من خلال تقديم المشفرات التلقائية المتناثرة ثابتة الهندسة (GI-SAE) لتحديد الميزات المشتركة عبر اللغات، كاشفةً أنه بينما يمكن لهذه النماذج تعلم تمثيلات ثابتة لغوياً، فإن قابليتها للتبادل الوظيفي والطبقات المحددة التي تظهر فيها تختلف بشكل كبير اعتماداً على بنية النموذج.

Igor Bogdanov, Changcheng Huang2026-08-26
🤖 machine learning

Learning to Grade Efficiently: A Bandit-Driven Prompt-Selection Framework for Low-Cost LLM Essay Scoring

تقدم هذه الورقة إطار عمل يعتمد على "المتعدد الأذرع" (multi-armed bandit) ومراعٍ للتكلفة، يقوم باختيار استراتيجيات التلقين المثلى للتصحيح الآلي للمقالات بشكل تكيفي، محققاً دقة تضاهي البحث الشبكي الشامل مع تقليل استدعاءات النماذج اللغوية الكبيرة بنسبة 78.4%، ومؤسساً أول منحنيات تعلم للتكلفة والموثوقية في هذا المجال.

Olga Manakina, Igor Bogdanov2026-08-26