💬 NLP

Laissez-Faire Harms: Algorithmic Biases in Generative Language Models

تُظهر هذه الدراسة أن خمسة نماذج لغوية توليدية ضخمة، عند نشرها في بيئات "الاسترخاء" الطبيعية دون مطالبات هوية صريحة، تكرس بشكل منهجي عمليات الحذف والإخضاع والنمطية الضارة تجاه الأشخاص من الأقليات، وتولد مخرجات تمييزية تزيد احتمالية كونها سلبية بمئات إلى آلاف المرات عن كونها تمكينية، وتشكل مخاطر نفسية جسيمة.

Evan Shieh, Faye-Marie Vassel, Cassidy Sugimoto, Thema Monroe-White2026-05-04
💬 NLP

Bias in Large Language Models: Origin, Evaluation, and Mitigation

تقدم هذه الورقة مراجعة شاملة للتحيز في النماذج اللغوية الكبيرة، حيث تحلل أصوله بشكل منهجي، وتقيم طرق الكشف عبر مستويات البيانات والنموذج والمخرجات، وتصنف استراتيجيات التخفيف مع مناقشة الآثار الأخلاقية والقانونية للذكاء الاصطناعي المتحيز في التطبيقات الواقعية.

Yufei Guo, Muzhe Guo, Juntao Su, Zhou Yang, Mengqiu Zhu, Hongfei Li, Mengyang Qiu, Shuo Shuo Liu2026-05-04
💬 NLP

Comparing Exploration-Exploitation Strategies of LLMs and Humans: Insights from Standard Multi-armed Bandit Experiments

تقارن هذه الدراسة بين استراتيجيات الاستكشاف والاستغلال لنماذج اللغات الكبيرة، والبشر، والخوارزميات في مهام "المتعدد الأذرع" (multi-armed bandit)، وتجد أنه بينما يجعل تمكين "التفكير" نماذج اللغات الكبيرة أكثر شبهاً بالبشر في البيئات المستقرة، إلا أنها لا تزال تعاني لتحقيق القدرة البشرية على التكيف والاستكشاف الموجه في البيئات المعقدة وغير المستقرة.

Ziyuan Zhang, Darcy Wang, Ningyuan Chen, Rodrigo Mansur, Vahid Sarhangian2026-05-04
💬 NLP

Lightweight Domain Adaptation of a Large Language Model for Legal Assistance in the Indian Context

تقدم هذه الورقة Legal Assist AI، وهو إطار عمل خفيف الوزن يستفيد من نموذج Llama 3.1 المكمّم ذي 8 مليارات معلمة، مدمجاً مع تقنية التوليد المعزز بالاسترجاع (RAG) ومتن قانوني هندي متخصص، ليتفوق على النماذج الأكبر مثل GPT-3.5 Turbo في امتحان المحاماة لعموم الهند، مع الحد من الهلوسة بفعالية وتحقيق كفاءة في عدد المعلمات تزيد بمقدار 22 مرة.

Jatin Gupta, Akhil Sharma, Saransh Singhania, Ali Imam Abidi2026-05-04
💬 NLP

ExCyTIn-Bench: Evaluating LLM agents on Cyber Threat Investigation

تقدم هذه الورقة ExCyTIn-Bench، وهو أول معيار مصمم لتقييم وكلاء النماذج اللغوية الكبيرة (LLM agents) في التحقيق في التهديدات السيبرانية من خلال توليد 7,542 سؤالاً من سجلات Microsoft Sentinel ورسوم التحقيق البيانية، مما كشف أن النماذج الرائدة الحالية تحقق فقط درجة مكافأة قدرها 0.606 ويسلط الضوء على وجود مجال كبير للتحسين في المستقبل.

Yiran Wu, Mauricio Velazco, Andrew Zhao, Manuel Raúl Meléndez Luján, Srisuma Movva, Yogesh K Roy, Quang Nguyen, Roberto (…)2026-05-04
💬 NLP

InterChart: Benchmarking Visual Reasoning Across Decomposed and Distributed Chart Information

تقدم الورقة البحثية InterChart، وهو معيار تشخيصي مصمم لتقييم قدرة نماذج الرؤية واللغة على الاستنتاج عبر مخططات متعددة ذات صلة، كاشفاً أن النماذج الحالية المتطورة تعاني بشكل كبير من التكامل عبر المخططات والاستدلال المعقد متعدد الخطوات رغم تحسن أدائها في المهام البصرية المفككة.

Anirudh Iyengar Kaniyar Narayana Iyengar, Srija Mukhopadhyay, Adnan Qidwai, Shubhankar Singh, Dan Roth, Vivek Gupta2026-05-04
💬 NLP

Knowing When to Defer: Selective Prediction for Responsible Knowledge Tracing

تقدم هذه الورقة إطاراً للتنبؤ الانتقائي الجوهري لنماذج تتبع المعرفة يستفيد من تقنية "مونت كارلو دروب أوت" (Monte Carlo Dropout) لقياس عدم اليقين المعرفي، مما يثبت أن تأجيل التنبؤات الأكثر عدم يقيناً يعزز الدقة والعدالة بشكل كبير، ويكشف في الوقت ذاته أن العوامل السيكومترية القياسية تفسر أقل من ربع إشارة عدم اليقين الخاصة بالنموذج.

Joshua Mitton, Prarthana Bhattacharyya, Ralph Abboud, Simon Woodhead2026-05-04
💬 NLP

Learning from Supervision with Semantic and Episodic Memory: A Reflective Approach to Agent Adaptation

تقترح هذه الورقة إطار عمل معززاً بالذاكرة يستفيد من الانتقادات التي تولدها النماذج اللغوية الكبيرة والمخزنة في الذاكرة العرضية والدلالية لتحسين قدرة الوكيل على التكيف وتقليل تكاليف الاستدلال دون تحديث المعلمات، مع تقديم مقياس "القابلية للتأثر" لتفسير تباينات الأداء عبر مختلف النماذج والمجالات.

Jackson Hassell, Dan Zhang, Hannah Kim, Tom Mitchell, Estevam Hruschka2026-05-04
💬 NLP

PORTool: Importance-Aware Policy Optimization with Rewarded Tree for Multi-Tool-Integrated Reasoning

تقدم الورقة البحثية PORTool، وهو خوارزمية لتحسين السياسات القائمة على الأهمية تستفيد من أشجار التدحرج (rollout trees) ذات المكافآت لتعيين مكافآت على مستوى الخطوة بناءً على الصحة وصحة التنفيذ، مما يؤدي إلى حل غموض تحديد المسؤولية (credit-assignment ambiguity) وتحسين كل من دقة وكفاءة وكلاء الاستدلال المتكاملين مع أدوات متعددة.

Feijie Wu, Weiwu Zhu, Yuxiang Zhang, Soumya Chatterjee, Jiarong Zhu, Fan Mo, Rong Luo, Jing Gao2026-05-04