💬 NLP

"Not in My Backyard": LLMs Uncover Online and Offline Social Biases Against Homelessness

تقدم هذه الورقة أول متن لغوي متعدد المجالات لتتبع التحيزات الاجتماعية ضد المشردين عبر المنصات الإلكترونية وغير الإلكترونية، كاشفةً أنه في حين تستطيع النماذج اللغوية الكبيرة تحديد الوصمة، إلا أنها تبالغ بشكل منهجي في رصد مشاعر "الرفض المحلي" (NIMBY) وتفشل في رصد الادعاءات الواقعية، مما يسلط الضوء على الحاجة إلى بروتوكولات تدقيق معايرة بدلاً من الاعتماد على مخرجات النماذج كحقائق مطلقة.

Jonathan A. Karr, Benjamin F. Herbst, Matthew L. Sisk, Xueyun Li, Ting Hua, Matthew Hauenstein, Georgina Curto, Nitesh V (…)2026-08-03
💬 NLP

Influence-driven Curriculum Learning for Pre-training on Limited Data

تُثبت هذه الورقة أن استبدال مقاييس الصعوبة التقليدية المتمحورة حول الإنسان بمقاييس تأثير بيانات التدريب المتمحورة حول النموذج يُمكّن التعلم المنهجي من التفوق بشكل كبير على التدريب المسبق ذي الترتيب العشوائي عند استخدام بيانات محدودة، محققاً تحسناً يتجاوز 10 نقاط مئوية في المعايير المرجعية.

Loris Schoenegger, Lukas Thoma, Terra Blevins, Benjamin Roth2026-08-03
💬 NLP

Regional Attention-Enhanced Swin Transformer for Clinically Relevant Medical Image Captioning

تقدم هذه الورقة نموذج "Swin Transformer" المعزز بالانتباه الإقليمي، وهو نموذج مدمج وقابل للتفسير يحقق أعلى مستويات الدقة الدلالية في توليد تعليقات طبية ذات صلة سريرية من خلال تضخيم المناطق ذات الأهمية التشخيصية، كما تم التحقق من ذلك عبر الأداء المتفوق على مجموعة بيانات ROCO مقارنة بالنماذج المرجعية الحالية.

Zubia Naz, Farhan Asghar, Muhammad Ishfaq Hussain, Yahya Hadadi, Muhammad Aasim Rafique, Wookjin Choi, Moongu Jeon2026-08-03
💬 NLP

Quantifying and Mitigating Socially Desirable Responding in LLMs: A Desirability-Matched Graded Forced-Choice Psychometric Study

تقترح هذه الورقة إطاراً سيكومترياً لقياس الاستجابة المرغوبة اجتماعياً (SDR) في النماذج اللغوية الكبيرة من خلال مقارنة الاستجابات الصادقة مقابل الاستجابات الموجهة بالتزييف، وتثبت أن قوائم الجرد القائمة على الاختيار القسري المتدرج والمطابقة للمرغوبية تخفف بشكل كبير من هذا الانحياز مع الحفاظ على دقة توصيف الشخصية مقارنة بالاستبيانات التقليدية القائمة على مقياس ليكرت.

Kensuke Okada, Yui Furukawa, Kyosuke Bunji2026-08-03
🤖 AI

Can AI Evaluate AI Scientists? A Benchmarking Study of Autonomous Research Generation Systems Using Automated Multi-Model Review

تقدم هذه الدراسة معياراً صارماً للمراجعة الزميلة المؤتمتة باستخدام نماذج لغوية كبيرة رائدة لتقييم أنظمة البحث المستقلة، كاشفةً أن إطار عمل FARS يتفوق بشكل كبير على المنافسين في توليد أوراق بحثية علمية عالية الجودة، مع إثبات موثوقية تقييم النماذج اللغوية الكبيرة متعددة النماذج في تقدير جودة الأبحاث.

Vaibhava Lakshmi Ravideshik, Mayank Kejriwal2026-08-03
💬 NLP

Chain-of-Models: Cross-Model Auditing for Bias-Robust LLM Judges

تقدم هذه الورقة البحثية "سلسلة النماذج" (Chain-of-Models)، وهو إطار عمل للتدقيق الآلي يستخدم نموذجاً ثانوياً لفحص مسارات الاستدلال بحثاً عن التحيز، مما يثبت أن استراتيجية اختيار المدقق المتنوع وظيفياً والمخصص للتحيز تتفوق بشكل كبير على كل من المدققين الثابتين المنفردين والأسس التي لا تعتمد على التدقيق في تعزيز متانة أحكام النماذج اللغوية الكبيرة.

Qian Wang, Zhanzhi Lou, Zhenheng Tang, Nuo Chen, Bingsheng He2026-08-03
💬 NLP

ZeroR@CHiPSAL 2026: Two-Stage Vision-Language Adaptation with Contrastive Learning for Nepali Meme Classification

حقق فريق ZeroR@CHiPSAL 2026 مراتب متقدمة في تصنيف الميمات النيبالية من خلال توظيف مسار تكيف رؤية-لغة ثنائي المراحل باستخدام نموذج Qwen3-VL-8B-Instruct مع التعلم التبايني والضبط الدقيق لتقنية LoRA للقضاء على الاعتماد على التعرف الضوئي على الحروف (OCR) والتعامل بفعالية مع خطاب الكراهية وتحديد المشاعر متعدد الوسائط في ظل ندرة الموارد.

Nitiz Khanal2026-08-03
💬 NLP

The Formalism Trap: Are LLM-as-a-Judge Evaluators Blinded by Consensus Mimicry under Social Load?

تقدم هذه الورقة البحثية مفهوم "فخ الشكلانية الوكالية" (Agentic Formalism Trap) و"مؤشر التنافر التقييمي" (Evaluative Dissonance Index) لإثبات أن أنظمة "النماذج اللغوية الكبيرة كحكم" (LLM-as-a-Judge) معرضة بشكل منهجي للخلط بين الشكلانية الإجرائية والحقيقة الدلالية تحت الظروف العدائية، وهو خلل غير مرتبط بنطاق محدد مدفوع بمحفزات تركيبية محددة وتضاريس معمارية تستوجب تنفيذ مرشحات يقظة خاصة بالبنية المعمارية.

Dahlia Shehata, Ming Li2026-08-03
💬 NLP

Evaluating Federated Pre-Training: On the Reliability of Downstream Fine-Tuning and Intrinsic Evaluation

تُثبت هذه الورقة أن الضبط الدقيق اللاحق هو مقياس غير موثوق لتقييم جودة ما قبل التدريب الاتحادي لأنه يفشل في الحفاظ على ترتيب النماذج الأصلي، بينما يوفر التنبؤ بالرمز التالي الجوهري انعكاساً أكثر أمانة لأداء ما قبل التدريب.

Claudia Grosser, Maike Heuer, Denis Krompass, Thomas A. Runkler2026-08-03
💬 NLP

The Checking Problem: What must be true before AI ships in a regulated firm

تُثبت هذه الورقة أن جدوى الذكاء الاصطناعي للمؤسسات في الخدمات المالية الخاضعة للتنظيم تعتمد على سمات قابلة للقياس مثل الإسناد القابل للتحقق وإشارات الثقة، أكثر من اعتمادها على الدقة الخام، وهو ما يمكن أن يقلل بشكل كبير من عبء المراجعة البشرية المطلوبة للنشر في بيئة الإنتاج.

Prerit Ahuja2026-08-03