💬 NLP

I-CALM: Incentivizing Confidence-Aware Abstention for LLM Hallucination Mitigation

تقدم الورقة البحثية إطار العمل I-CALM، وهو إطار عمل قائم على التلقين (prompt-based) يعمل على الحد من هلوسة النماذج اللغوية الكبيرة (LLMs) من خلال تحفيز الامتناع المعرفي عبر مخططات مكافأة صريحة ومبادئ معيارية، مما يؤدي إلى تحسين موثوقية الإجابة الانتقائية دون الحاجة إلى إعادة تدريب النموذج.

Haotian Zong, Binze Li, Yufei Long, Sinyin Chang, Jialong Wu, Gillian K. Hadfield2026-04-07
💬 NLP

From Plausible to Causal: Counterfactual Semantics for Policy Evaluation in Simulated Online Communities

تقترح هذه الورقة إطاراً سببيّاً مضاداً للواقع للمحاكاة الاجتماعية القائمة على النماذج اللغوية الكبيرة، يميز بين السببية الضرورية والكافية لمواءمة مخرجات المحاكاة مع احتياجات أصحاب المصلحة المحددة، مما يحول تقييم السياسات من مجرد سرد قصصي معقول إلى استدلال سببي صارم يعتمد على دقة المحاكاة.

Agam Goyal, Yian Wang, Eshwar Chandrasekharan, Hari Sundaram2026-04-07
💬 NLP

Uncertainty as a Planning Signal: Multi-Turn Decision Making for Goal-Oriented Conversation

تقدم هذه الورقة إطار عمل التخطيط الواعي لعدم اليقين في المحادثة (CUP)، الذي يدمج النماذج اللغوية مع التخطيط المهيكل للتعامل مع عدم اليقين كإشارة توجيهية لاتخاذ القرارات متعددة الأدوار، مما يؤدي إلى تحسين معدلات نجاح المحادثات الموجهة نحو الأهداف مع تقليل عدد جولات التفاعل.

Xinyi Ling, Ye Liu, Reza Averly, Xia Ning2026-04-07
💬 NLP

Predict, Don't React: Value-Based Safety Forecasting for LLM Streaming

تقدم هذه الورقة البحثية StreamGuard، وهو حاجز حماية تدفقي موحد وغير مرتبط بنموذج محدد يعمل على تحسين الإشراف على السلامة من خلال صياغة التنبؤ بالمخرجات كمسألة تنبؤ بالضررية المستقبلية عبر عمليات محاكاة مونت كارلو (Monte Carlo rollouts)، مما يحقق دقة أعلى ومعدلات خطأ أقل مقارنة بطرق اكتشاف الحدود الحالية دون الحاجة إلى تسميات توضيحية دقيقة على مستوى الرمز (token).

Pride Kavumba, Koki Wataoka, Huy H. Nguyen, Jiaxuan Li, Masaya Ohagi2026-04-07
💬 NLP

Emergent Inference-Time Semantic Contamination via In-Context Priming

تثبت هذه الورقة أن التلوث الدلالي أثناء وقت الاستدلال عبر التهيئة داخل السياق هو ظاهرة حقيقية في النماذج اللغوية الكبيرة ذات القدرات الكافية، حيث يمكن للأمثلة القليلة المحملة ثقافياً أن تسبب تحولات توزيعية ملموسة نحو موضوعات ضارة، مما يتحدى الاستنتاج السابق بأن مثل هذه التأثيرات لا تحدث بمجرد التلقين.

Marcin Abram2026-04-07
💬 NLP

Extracting and Steering Emotion Representations in Small Language Models: A Methodological Comparison

تقدم هذه الورقة أول تحليل مقارن لاستخراج تمثيل العاطفة في النماذج اللغوية الصغيرة (100 مليون إلى 10 مليارات معلمة)، مظهرةً أن الأساليب القائمة على التوليد تحقق فصلاً فائقاً للعواطف، وأن التمثيلات تتركز في طبقات المحولات الوسطى بغض النظر عن البنية، وأن توجيه هذه المتجهات يستحث أنظمة سلوكية متميزة مع الكشف عن مخاوف تتعلق بالسلامة عبر اللغات في النماذج متعددة اللغات.

Jihoon Jeong2026-04-07
💬 NLP

Shorter, but Still Trustworthy? An Empirical Study of Chain-of-Thought Compression

تقدم هذه الورقة أول دراسة تجريبية منهجية تثبت أن ضغط تسلسل الأفكار (chain-of-thought compression) غالباً ما يقوض موثوقية النموذج عبر معايير السلامة، ومقاومة الهلوسة، والمتانة متعددة اللغات، محاججةً بأن التحسين المستقبلي يجب أن يوازن بين الكفاءة وقيود الموثوقية الحرجة هذه.

Lingjie Zeng, Xiaofan Chen, Yanbo Wang, Xiuying Chen2026-04-07
💬 NLP

A Semi-Automated Annotation Workflow for Paediatric Histopathology Reports Using Small Language Models

تُظهر هذه الدراسة أن سير عمل شبه مؤتمت باستخدام نماذج لغوية صغيرة، وتحديداً نموذج Gemma 2 2B المعزز بإرشادات الكيانات الموجهة من قبل الأطباء وأمثلة التعلم من أمثلة قليلة، يمكنه استخراج المعلومات المهيكلة بكفاءة ودقة من تقارير خزعة الكلى للأطفال غير المهيكلة على بنية تحتية تعتمد فقط على وحدة المعالجة المركزية مع معالجة مخاوف الخصوصية وتقليل عبء العمل على الأطباء.

Avish Vijayaraghavan, Jaskaran Singh Kawatra, Sebin Sabu, Jonny Sheldon, Will Poulett, Alex Eze, Daniel Key, John Booth (…)2026-04-07
💬 NLP

Position: Logical Soundness is not a Reliable Criterion for Neurosymbolic Fact-Checking with LLMs

تجادل هذه الورقة بأن الاعتماد على السلامة المنطقية الشكلية كمعيار أساسي للتحقق من الحقائق عبر النماذج الرمزية العصبية باستخدام النماذج اللغوية الكبيرة هو أمر معيب جوهرياً لأنه يفشل في مراعاة الاستدلالات التداولية البشرية، وتدعو بدلاً من ذلك إلى الاستفادة من نزعات الاستدلال الشبيهة بالبشر لدى النماذج اللغوية الكبيرة للتحقق من صحة المخرجات الشكلية مقابل الاستنتاجات المضللة.

Jason Chan, Robert Gaizauskas, Zhixue Zhao2026-04-07
💬 NLP

Which English Do LLMs Prefer? Triangulating Structural Bias Towards American English in Foundation Models

تتقصى هذه الورقة وتثبت، من خلال تحليل متعدد المراحل لمتون ما قبل التدريب، وأدوات التجزئة (tokenizers)، والمخرجات التوليدية، أن النماذج اللغوية الكبيرة تظهر انحيازاً هيكلياً منهجياً يفضل الإنجليزية الأمريكية على الإنجليزية البريطانية، مما يعزز التجانس اللغوي والظلم المعرفي في النشر العالمي للذكاء الاصطناعي.

Mir Tafseer Nayeem, Davood Rafiei2026-04-07