🤖 machine learning

Expert-Choice Routing Enables Adaptive Computation in Diffusion Language Models

تقترح هذه الورقة البحثية توجيه "اختيار الخبير" (EC) كبديل متفوق لتوجيه "اختيار الرمز" (TC) لنماذج اللغة الانتشارية، حيث تُثبت أن موازنة الحمل الحتمية لـ (EC)، مقترنة بالسعة التكيفية المعتمدة على الخطوة الزمنية، تُحسن بشكل كبير من معدل الإنتاجية، وسرعة التقارب، ودقة المهام اللاحقة، مع تمكين تحديث النماذج الحالية.

Shuibai Zhang, Caspian Zhuang, Chihan Cui, Zhihan Yang, Fred Zhangzhi Peng, Yanxin Zhang, Haoyue Bai, Zack Jia, Yang Zho (…)2026-04-03
💻 computer science

OSCAR: Orchestrated Self-verification and Cross-path Refinement

يُعد OSCAR إطار عمل للاستدلال في وقت التشغيل دون الحاجة لتدريب لنماذج اللغة الانتشارية، حيث يعمل على التخفيف من الهلوسة عبر تحديد مواضع الرموز ذات عدم اليقين العالي من خلال تحليل إنتروبيا السلسلة المتقاطعة وتصحيحها عبر إعادة قناع مستهدفة باستخدام أدلة مسترجعة، مما يستفيد من مسار إزالة الضجيج الأصلي للنموذج لتحقيق دقة واقعية فائقة مقارنة بالنهج التوليدي المتسلسل.

Yash Shah, Abhijit Chakraborty, Naresh Kumar Devulapally, Vishnu Lokhande, Vivek Gupta2026-04-03
🤖 machine learning

CRIT: Graph-Based Automatic Data Synthesis to Enhance Cross-Modal Multi-Hop Reasoning

تقدم الورقة البحثية CRIT، وهو عبارة عن مجموعة بيانات ومعيار مرجعي مستند إلى الرسوم البيانية ومُخلق تلقائياً، صُمم لمعالجة نقص الاستدلال متعدد الخطوات عبر الوسائط في نماذج الرؤية واللغة الحالية، حيث أظهرت أن التدريب على هذه البيانات يحسن بشكل كبير من أداء النماذج في مهام الاستدلال المعقدة ويقلل من الهلوسة.

Junyoung Sung, Seungwoo Lyu, Minjun Kim, Sumin An, Arsha Nagrani, Paul Hongsuck Seo2026-04-03
💻 computer science

Fragile Reasoning: A Mechanistic Analysis of LLM Sensitivity to Meaning-Preserving Perturbations

تكشف هذه الورقة أن النماذج اللغوية الكبيرة تظهر هشاشة كبيرة تجاه الاضطرابات الحافظة للمعنى في الاستدلال الرياضي، وتُقدم إطار عمل تشخيص الاضطراب الآلي (MPD) لتتبع هذه الإخفاقات وصولاً إلى أنماط معمارية محددة، وتصنيفها إلى أنواع محلية، وموزعة، ومتشابكة، ذات قدرات متفاوتة على الاسترداد من خلال تدخلات مستهدفة.

Shou-Tzu Han, Rodrigue Rizk, KC Santosh2026-04-03
💻 computer science

ThinknCheck: Grounded Claim Verification with Compact, Reasoning-Driven, and Interpretable Models

تقدم الورقة البحثية "ThinknCheck"، وهو نموذج تحقق بكفاءة الموارد يضم 1 مليار معلمة، ويحقق أداءً رائدًا في التحقق من الادعاءات المستندة إلى الحقائق عبر الاستفادة من إطار عمل استدلالي مُشرف عليه ومدمج لتوليد مسوغات مهيكلة قبل إصدار الأحكام الثنائية، متفوقًا بشكل كبير على النماذج الأكبر ونماذج القياس الصفري.

Delip Rao, Feijiang Han, Chris Callison-Burch2026-04-03
💻 computer science

What Do Claim Verification Datasets Actually Test? A Reasoning Trace Analysis

تحلل هذه الورقة مسارات الاستدلال عبر 24,000 مثال للتحقق من الادعاءات لتكشف أن المعايير الحالية تختبر في الغالب المطابقة اللفظية واستخراج الأدلة بدلاً من التركيب المعقد أو الاستدلال العددي، مما يؤدي إلى ملفات تعريف أخطاء تتباين بشكل كبير حسب المجال، ويشير إلى الحاجة لمجموعات تقييم أكثر تحدياً.

Delip Rao, Chris Callison-Burch2026-04-03
🤖 machine learning

Coupled Query-Key Dynamics for Attention

تقدم هذه الورقة البحثية "ديناميكيات الاستعلام والمفتاح المقترنة" (coupled QK dynamics)، وهي آلية تتطور من خلالها الاستعلامات والمفاتيح بشكل مشترك عبر ديناميكيات متعلمة مشتركة قبل عملية حساب درجات الانتباه، مما يثبت أن هذا النهج يحسن كفاءة العينات واستقرار التدريب بشكل كبير في المجموعات النصية ذات التماسك النطاقي، بينما يكشف في الوقت نفسه عن أن فوائده تعتمد على طبيعة المجموعة النصية وتتضاءل في النصوص الويب غير المتجانسة أو عند أحجام النماذج الأكبر.

Barak Gahtan, Alex M. Bronstein2026-04-03
💻 computer science

On the Role of Reasoning Patterns in the Generalization Discrepancy of Long Chain-of-Thought Supervised Fine-Tuning

تكشف هذه الورقة أن الضبط الدقيق الخاضع للإشراف على مسارات "سلسلة الأفكوت" (Chain-of-Thought) الطويلة المستمدة من DeepSeek-R1 يؤدي إلى خفض خسارة التدريب ولكن مع تعميم أسوأ مقارنة بالبيانات المستمدة من gpt-oss-120b بسبب أنماط استدلال غير فعالة ومتباعدة، وتقترح تصفية المسارات التي تتفرع بشكل متكرر لتحسين أداء الاستدلال بشكل كبير.

Zhaoyi Li, Xiangyu Xi, Zhengyu Chen, Wei Wang, Gangwei Jiang, Ranran Shen, Linqi Song, Ying Wei, Defu Lian2026-04-03
💻 computer science

Development and multi-center evaluation of domain-adapted speech recognition for human-AI teaming in real-world gastrointestinal endoscopy

تقدم هذه الورقة نظام EndoASR، وهو نظام للتعرف التلقائي على الكلام متكيف مع المجال، يعمل على تحسين دقة النسخ والتعرف على المصطلحات الطبية بشكل كبير من أجل التعاون الفوري بين الإنسان والذكاء الاصطناعي في تنظير الجهاز الهضمي، مما يظهر قدرة قوية على التعميم ونشراً فعالاً عند الحواف عبر إعدادات سريرية متعددة المراكز.

Ruijie Yang, Yan Zhu, Peiyao Fu, Te Luo, Zhihua Wang, Xian Yang, Quanlin Li, Pinghong Zhou, Shuo Wang2026-04-03
💻 computer science

From BM25 to Corrective RAG: Benchmarking Retrieval Strategies for Text-and-Table Documents

تقوم هذه الورقة البحثية بتقييم عشر استراتيجيات استرجاع على مجموعة بيانات ضخمة للأسئلة والأجوبة القائمة على النصوص والجداول المالية، كاشفةً أن خط معالجة استرجاع هجين يعتمد على إعادة الترتيب العصبي يتفوق على الأساليب أحادية المرحلة، وأن خوارزمية BM25 غالباً ما تتفوق على الاسترجاع الكثيف في الوثائق المالية، مع تقديم رؤى عملية حول الفائدة المحدودة لتوسيع الاستعلام بالنسبة للاستعلامات الرقمية الدقيقة.

Meftun Akarsu, Recep Kaan Karaman, Christopher Mierbach2026-04-03