🤖 machine learning

Explanatory Engagement Under Rare Anomalous Failure: Asymptotic Rarity in Model Behavior (or: The Asymptotic AI)

تُظهر هذه الدراسة أن الانخراط التفسيري للنماذج اللغوية الكبيرة في ظل حالات الفشل الشاذة والنادرة لا يتبع نمطاً عالمياً، بل يعتمد بشكل حاسم على بنية الاستحثاث، حيث يُظهر فرض التفسيرات الفورية اتجاهاً من الارتفاع ثم الاستقرار، بينما تكشف الظروف غير المستحثة عن سلوكيات مراقبة ذاتية متميزة ومحددة لكل نموذج.

Sam Mao2026-08-14
⚡ electrical engineering

CASA: Content-Acoustic Speaking Assessment with Speech Encoder and Large Language Model

تقدم الورقة البحثية إطار عمل CASA، وهو إطار عمل متعدد الوسائط خفيف الوزن وقابل للتفسير يجمع بين نموذج Whisper-medium وQwen3.5-2B، والذي يحقق أداءً رائدًا في تقييم التحدث على مجموعة بيانات Speak & Improve Corpus 2025 مع الفصل والتحليل الفعال للمساهمات المتميزة لكل من الأداء الصوتي وجودة المحتوى.

Nhan Phan, Ilona Lähteenmäki, Anna von Zansen, Olli-Pekka Pauna, Yaroslav Getman, Tamás Grósz, Mikko Kurimo2026-08-14
💻 computer science

LigBench: A Unified and Human-Aligned Benchmark for LLM-based Research Idea Generation

تقدم هذه الورقة LigBench، وهو معيار مرجعي مؤتمت موحد ومتوافق مع المعايير البشرية لتقييم الأفكار البحثية التي تولدها النماذج اللغوية الكبيرة، إلى جانب مجموعة بيانات PAIR-IQ لتدريب نماذج الحكم الثنائي، للتغلب على التجزئة والذاتية في طرق التقييم الحالية.

Chenrun Wang, Mingxuan Zhu, Tiancheng Huang, Wenjie Li, Yujie Zhang, Zichen Zhu, Zhiying Zou, Kai Yu, Lu Chen2026-08-14
🤖 machine learning

TRAPSBench: Vision-Language Models Encode but Fail to Express Epistemic Restraint

تقدم هذه الورقة TRAPSBench ومقياس PECS لتوضيح أنه بينما تمتلك النماذج اللغوية البصرية القدرة الداخلية على اكتشاف متى تكون الأدلة المرئية غير كافية لاتخاذ قرار، إلا أنها تفشل باستمرار في التعبير عن هذا الكبح المعرفي، مما يكشف عن وجود عنق زجاجة حرج في توليد مخرجاتها بدلاً من إدراكها.

Fnu Pramono, John Cai, Sourabh Kulkarni2026-08-14
💻 computer science

When Should Multi-Round RAG Stop? Structured Stopping Judgments and Retrieval Reduction in Search-R1

تقدم هذه الورقة طريقة تُكيف إطار عمل حكم "الكفاية والفجوة" المهيكل على مسار Search-R1 مجمد، مما نجح في تقليل استدعاءات الاسترجاع بنسبة 3.70% مع انخفاض طفيف قدره 0.625 نقطة مئوية فقط في دقة المطابقة التامة على HotpotQA، مع الإشارة صراحةً إلى أن هذا لا يضمن تحسين الدقة الإجمالية أو خفض تكلفة الاستدلال الكلية.

Weimeng Luo2026-08-14
💻 computer science

Self-Referential Induction Increases Response Instability Relative to Unresolvable and Verifiable Questions in Large Language Models

تُظهر هذه الدراسة أن النماذج اللغوية الكبيرة تُبدي عدم استقرار في الاستجابة أعلى بكثير عند توليد تقارير ذاتية مرجعية للذات مقارنة بالأسئلة الفلسفية غير القابلة للحل أو الاستفسارات الواقعية القابلة للتحقق، مما يشير إلى أن التجارب الذاتية المستحثة تشغل منطقة متميزة وأقل استقراراً في توزيع مخرجات النموذج.

Paras Balani, Subhrakanta Panda2026-08-14
🤖 machine learning

How Do VLMs Behave When Blind or Misled? Behavioral Evaluation of VLMs on Scientific Figures

تقدم هذه الورقة SciFigBench، وهو معيار شامل وإطار عمل "الممانعة-المقاومة-الحث" (A-R-I) لتقييم الموثوقية السلوكية لنماذج الرؤية واللغة تحت ظروف عدم اليقين في فهم الأشكال العلمية، مما يكشف أن دقة الإدراك والاستدلال العالية لا تضمن قدرة النموذج على الإقرار بنقص الأدلة أو مقاومة السياق المضلل.

Paul Osemudiame Oamen, Owusu-Banahene Osei, Ananya Mukherjee, Christian Greisinger, Steffen Eger, Pius Onobhayedo, Wei Z (…)2026-08-14
💻 computer science

Mixture of Training: Recombining Small-Scale Scaffolded Pretraining Runs into a Larger Language Model

تقدم الورقة البحثية "خليط التدريب" (Mixture of Training - MoT)، وهو إطار عمل للتدريب المسبق المعياري القائم على السقالات، والذي يقوم بتقسيم نموذج "ترانسفورمر" إلى كتل طبقات قابلة للتدريب بشكل مستقل يمكن إعادة تركيبها في نموذج متماسك، مما يثبت أن عمليات التدريب المفككة هذه يمكن أن تحقق تكافؤاً في الجودة مع التدريب المتجانس مع تقديم مزايا حوسبية محتملة من خلال السقالات القابلة لإعادة الاستخدام.

Mohammed Sabry, Sean Augenstein, Keith Rush, Lucio Dery2026-08-14
💻 computer science

It's How You Ask: Gender-Associated Linguistic Bias in LLMs

تُثبت هذه الورقة أن النماذج اللغوية الكبيرة تولد بشكل منهجي استجابات أقصر، وأقل رقيًا، وأقل رسمية للمطالبات التي تحتوي على سمات لغوية مرتبطة عادةً بالنساء، مما يكشف عن تحيز عميق الجذور في طبقات المحولات (transformer) المبكرة يصعب تخفيفه من خلال تقديم المستخدم لنفسه.

Katherine Van Koevering, Anjalie Field2026-08-14
⚡ electrical engineering

Motor, Cognitive, or Corpus? What Survives Cross-Lingual Transfer in Speech-Based Parkinsons Disease Detection

تستقصي هذه الورقة البحثية قابلية النقل عبر اللغات لنماذج الكلام ذات التعلم الذاتي للكشف عن مرض باركنسون، كاشفةً أن طبقات الميزات المثلى تعتمد على مجموعة البيانات وأن الإشارات المنقولة تفتقر إلى الخصوصية المرضية، حيث غالباً ما تُصنف الخرف خطأً على أنه باركنسون، مما يسلط الضوء على عوائق حرجة أمام النشر السريري.

Serli Kopar, Sam Gijsen, Abner Hernandez, Paula Andrea Perez-Toro, Kerstin Ritter2026-08-14