💬 NLP

AlpsBench: An LLM Personalization Benchmark for Real-Dialogue Memorization and Preference Alignment

تقدم هذه الورقة البحثية AlpsBench، وهو معيار مرجعي جديد مستمد من 2,500 حوار واقعي بين البشر والنماذج اللغوية الكبيرة (LLMs) مع ذكريات مهيكلة موثقة، لتقييم وكشف القيود الحرجة في النماذج الحالية فيما يتعلق باستخراج وتحديث واسترجاع واستخدام المعلومات الشخصية عبر دورة حياة الذاكرة الكاملة.

Jianfei Xiao, Xiang Yu, Chengbing Wang, Wuqiang Zheng, Xinyu Lin, Kaining Liu, Hongxun Ding, Yang Zhang, Wenjie Wang, Fu (…)2026-03-31
💻 computer science

LITTA: Late-Interaction and Test-Time Alignment for Visually-Grounded Multimodal Retrieval

إنَّ LITTA هو إطار عمل للمحاذاة في وقت الاختبار يعزز استرجاع المستندات متعدد الوسائط المرتكز بصرياً من خلال توليد متغيرات متعددة للاستعلام عبر نموذج لغوي كبير وتجميع نتائجها عبر دمج الرتب المتبادل، مما يحسن المتانة والدقة دون الحاجة إلى إعادة تدريب المسترجع.

Seonok Kim2026-03-31
💬 NLP

The Cognitive Divergence: AI Context Windows, Human Attention Decline, and the Delegation Feedback Loop

تضع هذه الورقة نظرية "التباعد المعرفي"، وهو ديناميكية تعزز نفسها حيث يؤدي النمو الأسي لنوافذ سياق الذكاء الاصطناعي والتراجع المتزامن في الانتباه البشري المستدام إلى خلق فجوة قدرات متسعة، مدفوعة بـ "حلقة تغذية راجعة للتفويض" يتم من خلالها تآكل القدرة المعرفية البشرية بشكل أكبر مع زيادة الاعتماد على الذكاء الاصطناعي.

Netanel Eliav (Machine Human Intelligence Lab)2026-03-31
💻 computer science

SEAR: Schema-Based Evaluation and Routing for LLM Gateways

إن SEAR هو نظام قائم على المخططات لبوابات النماذج اللغوية الكبيرة (LLM) يوحد بين التقييم والتوجيه عبر تعريف مخطط علاقي قابل للتوسيع لإشارات الجودة الدقيقة والمقاييس التشغيلية، مستفيداً من الاستدلال المدفوع بالنماذج اللغوية الكبيرة لتوليد بيانات مهيكلة تتيح توجيهاً دقيقاً، وقابلاً للتفسير، وفعالاً من حيث التكلفة لطلبات مقدمي الخدمات المتعددين.

Zecheng Zhang, Han Zheng, Yue Xu2026-03-31
💬 NLP

Do Multilingual VLMs Reason Equally? A Cross-Lingual Visual Reasoning Audit for Indian Languages

تقدم هذه الورقة أول تدقيق عابر للغات للاستدلال البصري لست لغات هندية، كاشفةً أن نماذج الرؤية واللغة متعددة اللغات تعاني من انخفاض كبير في الدقة وتظهر أداءً متدهوراً في سلسلة الأفكن في السياقات غير الإنجليزية، لا سيما بالنسبة للغات الدراويدية، مما يثبت أن التدريب المسبق متعدد اللغات الحالي يفشل في نقل قدرات الاستدلال البصري عبر الحدود اللغوية والخطية.

Swastik R2026-03-31
💬 NLP

LogicDiff: Logic-Guided Denoising Improves Reasoning in Masked Diffusion Language Models

تُعد LogicDiff طريقةً خالية من المعلمات وتعمل أثناء وقت الاستدلال، حيث تعزز بشكل كبير قدرات الاستنتاج لنماذج اللغة ذات الانتشار المقنع عبر استبدال عملية كشف الرموز القياسية القائمة على الثقة بجدولة موجهة منطقياً تعطي الأولوية للروابط المنطقية الحرجة، مما يؤدي إلى رفع الدقة في معايير GSM8K وMATH-500 دون الحاجة إلى إعادة تدريب النموذج.

Shaik Aman2026-03-31
🤖 AI

FormalProofBench: Can Models Write Graduate Level Math Proofs That Are Formally Verified?

تقدم الورقة البحثية FormalProofBench، وهو معيار خاص لتقييم قدرة نماذج الذكاء الاصطناعي على توليد براهين رياضية ذات مستوى دراسات عليا ومحققة رسميًا بلغة Lean 4، كاشفةً أن أفضل النماذج أداءً حقق دقة تبلغ 33.5% فقط، مع تقديم تحليل شامل لاستخدام الأدوات، وأنماط الفشل، والكفاءة.

Nikil Ravi, Kexing Ying, Vasilii Nesterov, Rayan Krishnan, Elif Uskuplu, Bingyu Xia, Janitha Aswedige, Langston Nashold2026-03-31
⚡ electrical engineering

PHONOS: PHOnetic Neutralization for Online Streaming Applications

يُعد PHONOS وحدة بث في الوقت الفعلي لإخفاء هوية المتحدث تعمل على تحييد اللهجات غير الأصلية لتجعلها تبدو كأنها لهجة أصلية باستخدام عبارات ذهبية مُعدة مسبقاً لتدريب مترجم لهجات سببي، مما يقلل بشكل كبير من مخاطر تحديد الهوية القائمة على اللهجة مع الحفاظ على زمن انتقال منخفض.

Waris Quamer, Mu-Ruei Tseng, Ghady Nasrallah, Ricardo Gutierrez-Osuna2026-03-31
💬 NLP

The Last Fingerprint: How Markdown Training Shapes LLM Prose

تجادل هذه الورقة بأن الإفراط المميز في استخدام الشرطات الطويلة (em dashes) في النصوص المولدة بواسطة الذكاء الاصطناعي هو نتاج بنيوي لبيانات التدريب المشبعة بتنسيقات "مارك داون" (markdown)، وهو أمر يستمر حتى عندما تُوجه النماذج لتجنب التنسيق، مما يجعله بمثابة توقيع تشخيصي لمنهجيات ضبط دقيق محددة بدلاً من كونه مجرد عيب أسلوبي.

E. M. Freeburg2026-03-31