💬 NLP

MedFrameQA: A Multi-Image Medical VQA Benchmark for Clinical Reasoning

تقدم هذه الورقة MedFrameQA، وهو أول معيار مرجعي للمساءلة البصرية الطبية متعدد الصور (VQA) مستمد من نصوص مقاطع الفيديو التعليمية لتقييم الاستدلال السريري، مما يكشف أن النماذج اللغوية الكبيرة متعددة الوسائط المتقدمة حالياً تعاني بشكل كبير في دمج المعلومات البصرية عبر تسلسلات الصور وتتبع التطور المرضي.

Suhao Yu, Haojin Wang, Juncheng Wu, Luyang Luo, Jingshen Wang, Cihang Xie, Pranav Rajpurkar, Carl Yang, Yang Yang, Kang (…)2026-02-04
💬 NLP

Surprisal from Larger Transformer-based Language Models Predicts fMRI Data More Poorly

تُظهر هذه الدراسة أن علاقة القياس العكسي، حيث تتنبأ النماذج اللغوية القائمة على "ترانسفورمر" (Transformer) بصعوبة معالجة الجمل لدى البشر بدقة أقل كلما زاد حجمها، تمتد لتتجاوز أوقات القراءة لتطبق أيضاً على بيانات التصوير بالرنين المغناطيسي الوظيفي (fMRI).

Yi-Chien Lin, William Schuler2026-02-04
💬 NLP

Understanding Verbatim Memorization in LLMs Through Circuit Discovery

تستخدم هذه الورقة البحثية التفسير الآلي واكتشاف دوائر المحولات للكشف عن أن رسومًا بيانية عصبية متميزة هي المسؤولة عن بدء مقابل الحفاظ على الحفظ الحرفي في النماذج اللغوية الكبيرة، حيث يكون البدء معتمدًا على السياق بينما تنتقل آليات المنع بقوة عبر المجالات.

Ilya Lasy, Peter Knees, Stefan Woltran2026-02-04
💬 NLP

LUMINA: Detecting Hallucinations in RAG System with Context-Knowledge Signals

تقدم الورقة البحثية LUMINA، وهو إطار عمل قوي يكتشف الهلوسة في أنظمة التوليد المعزز بالاسترجاع من خلال قياس التوازن بين السياق الخارجي واستخدام المعرفة الداخلية عبر المسافة التوزيعية وتتبع تطور الرموز، محققاً أداءً فائقاً على الطرق الحالية دون الحاجة إلى ضبط مكثف للمعلمات الفائقة.

Samuel Yeh, Sharon Li, Tanwi Mallick2026-02-04
💬 NLP

Beyond the Vision Encoder: Identifying and Mitigating Spatial Bias in Large Vision-Language Models

تحدد هذه الورقة أن التحيز المكاني في نماذج الرؤية واللغة الكبيرة ينبع من عدم تطابق الانتباه بين مشفر الرؤية والنموذج اللغوي بدلاً من المشفر نفسه، وتقترح آلية خفيفة الوزن لحقن السياق العالمي التكيفي (AGCI) للتخفيف من هذا التحيز وتعزيز المتانة المكانية دون إجراء تعديلات هيكلية.

Yingjie Zhu, Xuefeng Bai, Kehai Chen, Yang Xiang, Youcheng Pan, Yongshuai Hou, Weili Guan, Jun Yu, Min Zhang2026-02-04
💬 NLP

A2D: Any-Order, Any-Step Safety Alignment for Diffusion Language Models

يقدم A2D طريقة محاذاة سلامة على مستوى الرمز لنماذج اللغة الانتشارية تستفيد من القناع العشوائي لإصدار إشارات رفض [EOS] فورية، مما يحيد بفعالية هجمات أي ترتيب وأي خطوة مثل DIJA مع تمكين المراقبة في الوقت الفعلي وإنهاء آمن أسرع بكثير.

Wonje Jeung, Sangyeon Yoon, Yoonjun Cho, Dongjae Jeon, Sangwoo Shin, Hyesoo Hong, Albert No2026-02-04
💬 NLP

Winning the Pruning Gamble: A Unified Approach to Joint Sample and Token Pruning for Efficient Supervised Fine-Tuning

تقدم هذه الورقة البحثية Q-Tuning، وهو إطار عمل موحد يعمل على تحسين تقليم العينات والرموز بشكل مشترك عبر مستوي الخطأ وعدم اليقين (Error-Uncertainty Plane) للاحتفاظ استراتيجياً بالبيانات التعليمية عالية القيمة، محققاً أداءً هو الأفضل في فئته في الضبط الدقيق الخاضع للإشراف مع استخدام 12.5% فقط من بيانات التدريب الأصلية.

Shaobo Wang, Jiaming Wang, Jiajun Zhang, Cong Wang, Yue Min, Zichen Wen, Xingzhang Ren, Fei Huang, Huiqiang Jiang, Junya (…)2026-02-04
💬 NLP

Do AI Models Perform Human-like Abstract Reasoning Across Modalities?

تُثبت هذه الورقة أن تقييم التفكير التجريدي للذكاء الاصطناعي بناءً على الدقة وحدها هو أمر مضلل، لأنه يبالغ في تقدير القدرات في المهام القائمة على النصوص حيث تعتمد النماذج على اختصارات سطحية، ويقلل من تقديرها في المهام البصرية حيث تدرك النماذج غالباً التجريدات المقصودة رغم فشلها في تطبيقها بشكل صحيح.

Claas Beger, Ryan Yi, Shuhao Fu, Kaleda Denton, Arseny Moskvichev, Sarah W. Tsai, Sivasankaran Rajamanickam, Melanie Mit (…)2026-02-04
💬 NLP

Reusing Overtrained Language Models Saturates Scaling

تثبت هذه الورقة تجريبياً أن إعادة استخدام النماذج اللغوية المفرطة في التدريب لغرض المزيد من التدريب المسبق تؤدي إلى عوائد متناقصة، حيث تنخفض كفاءة التوسع لوغاريتمياً مع حجم مجموعة بيانات التدريب المسبق الأولية، مما يكشف عن مقايضة جوهرية في استراتيجيات التدريب متعددة المراحل.

Seng Pei Liew, Takuya Kato2026-02-04