💬 NLP

TAB-PO: Preference Optimization with a Token-Level Adaptive Barrier for Token-Critical Structured Generation

تقدم هذه الورقة البحثية TAB-PO، وهي طريقة مبتكرة لتحسين التفضيلات تستخدم حواجز تكيفية على مستوى الرمز (token-level) ومزايا موزونة للتغلب على قيود طريقة DPO القياسية في مهام التوليد الهيكلي الحرجة للرموز، محققةً تحسينات كبيرة في الأداء في مجال التوسيم الطبي من خلال معالجة مشكلات مثل انهيار الهامش وتخفيف التدرج.

Samah Fodeh, Linhai Ma, Ganesh Puthiaraju, Srivani Talakokkul, Afshan Khan, Ashley Hagaman, Sarah R. Lowe, Aimee Kendall (…)2026-03-03
💬 NLP

ActMem: Bridging the Gap Between Memory Retrieval and Reasoning in LLM Agents

تقدم هذه الورقة البحثية إطار عمل ActMem، وهو إطار عمل مبتكر يسد الفجوة بين استرجاع الذاكرة والاستنتاج من خلال تحويل سجل الحوار إلى رسم بياني سببي مهيكل لتمكين وكلاء النماذج اللغوية الكبيرة من استنتاج القيود الضمنية وحل النزاعات، إلى جانب معيار جديد، ActMemEval، لتقييم هذه القدرات المعززة.

Xiaohui Zhang, Zequn Sun, Chengyuan Yang, Yaqin Jin, Yazhong Zhang, Wei Hu2026-03-03
💬 NLP

EPPCMinerBen: A Novel Benchmark for Evaluating Large Language Models on Electronic Patient-Provider Communication via the Patient Portal

تقدم هذه الورقة EPPCMinerBen، وهو معيار مرجعي جديد يتكون من ثلاث مهام فرعية و1,933 جملة تم ترميزها من قبل خبراء من بوابة المرضى في مستشفى ييل نيو هيفن، لتقييم أداء مختلف النماذج اللغوية الكبيرة في تحليل التواصل الإلكتروني بين المريض ومقدم الرعاية الصحية، مما يكشف أن النماذج الأكبر والمضبوطة بالتعليمات تتفوق عمومًا على النماذج الأصغر، لا سيما في استخراج الأدلة والاستدلال دقيق التفاصيل.

Samah Fodeh, Yan Wang, Linhai Ma, Srivani Talakokkul, Jordan M. Alpert, Sarah Schellhorn2026-03-03
💬 NLP

Embracing Anisotropy: Turning Massive Activations into Interpretable Control Knobs for Large Language Models

تقترح هذه الورقة تحديد وتوجيه "الأبعاد الحرجة للمجال" (Domain-Critical Dimensions)—وهي وحدات سمات قابلة للتفسير تتميز باستجابات هائلة—لتحقيق أداء متفوق في تكييف المجال وكسر الحماية (jailbreaking) في النماذج اللغوية الكبيرة مقارنة بالتوجيه التقليدي للأبعاد الكاملة.

Youngji Roh, Hyunjin Cho, Jaehyung Kim2026-03-03
💬 NLP

GRIP: Geometric Refinement and Adaptive Information Potential for Data Efficiency

تقدم الورقة البحثية إطار عمل GRIP، وهو إطار لرفع كفاءة البيانات يوحد بين موازنة التوزيع العالمي واختيار العينات المحلية من خلال النمذجة الهندسية والجهد المعلوماتي التكيفي، مما يمكّن النماذج من التفوق على تلك المدربة على مجموعات بيانات أكبر بكثير وغير منقحة.

Changhao Wang, Jiaolong Yang, Xinhao Yao, Yunfei Yu, Peng Jiao, Lu Yu, Junpeng Fang, Riccardo Cantoro, Qing Cui, Jun Zho (…)2026-03-03
💬 NLP

How effective are VLMs in assisting humans in inferring the quality of mental models from Multimodal short answers?

تقدم الورقة البحثية إطار عمل MMGrader، الذي يستخدم الرسوم البيانية للمفاهيم لاستنتاج جودة النماذج الذهنية لطلاب العلوم والتكنولوجيا والهندسة والرياضيات (STEM) من الإجابات القصيرة متعددة الوسائط، لكنها تجد أن النماذج اللغوية البصرية الحالية تحقق دقة تبلغ حوالي 40% فقط، وبالتالي تقصر عن الوصول إلى مستوى الأداء البشري رغم قدرتها على مساعدة المعلمين في تصميم تدخلات تربوية مستهدفة.

Pritam Sil, Durgaprasad Karnam, Vinay Reddy Venumuddala, Pushpak Bhattacharyya2026-03-03
💬 NLP

Linguistic Uncertainty and Engagement in Arabic-Language X (formerly Twitter) Discourse

تحلل هذه الدراسة مجموعة بيانات تضم 16,695 تغريدة باللغة العربية حول لبنان لتُبين أن عدم اليقين اللغوي يزيد بشكل كبير من تفاعل المستخدمين، لا سيما في شكل الردود، مما يشير إلى أن عدم اليقين يعمل كإشارة حوارية في الخطاب عبر وسائل التواصل الاجتماعي بغير اللغة الإنجليزية.

Mohamed Soufan2026-03-03
💬 NLP

Stepwise Penalization for Length-Efficient Chain-of-Thought Reasoning

تقترح هذه الورقة إطار عمل "الجزاء التكيفي المتدرج" (SWAP)، وهو إطار تعلم تعزيزي دقيق يخصص جزاءات الطول ديناميكيًا لخطوات الاستدلال منخفضة الأهمية بناءً على مساهمتها في الإجابة الصحيحة، مما يحقق تقليلاً بنسبة 64.3% في طول الاستدلال وتحسناً بنسبة 5.7% في الدقة دون التضحية بالأداء.

Xintong Li, Sha Li, Rongmei Lin, Hongye Jin, Linwei Li, Hejie Cui, Sarah Zhang, Chia-Yuan Chang, Kewei Cheng, Besnik Fet (…)2026-03-03
💬 NLP

From Prerequisites to Predictions: Validating a Geometric Hallucination Taxonomy Through Controlled Induction

تتحقق هذه الدراسة من تصنيف الهلوسة الهندسية في نموذج GPT-2 من خلال إثبات أن إخفاقات فجوة التغطية (النوع 3) هي نمط الإخفاق الأكثر تميزاً واستقراراً، والتي تتميز بانفصال معيار ثابت في التضمينات الساكنة، بينما تؤكد أن نوعي انزياح المركز وتقارب البئر الخاطئ لا ينفصلان هندسياً، وأن التحليلات على مستوى الرمز (token) تعاني من تكرار زائف شديد.

Matic Korun2026-03-03
💬 NLP

A Typologically Grounded Evaluation Framework for Word Order and Morphology Sensitivity in Multilingual Masked LMs

تقدم هذه الورقة إطاراً تشخيصياً مدركاً للأنماط التصنيفية باستخدام التبعيات العالمية والاضطرابات في وقت الاستدلال لتقييم كيفية اعتماد نماذج اللغة المقنعة متعددة اللغات (mBERT وXLM-R) على ترتيب الكلمات مقابل الصرف التصريفي عبر خمس لغات، مما يكشف أنه بينما يؤدي الترتيب العشوائي الكامل إلى تدهور الأداء بشدة، فإن استبدال اللمات يؤثر بشكل كبير على الدقة في اللغات التصريفية ولكنه يفشل في التخفيف من آثار الاضطراب الهيكلي.

Anna Feldman, Libby Barak, Jing Peng2026-03-03