🤖 AI

Polysemanticity or Polysemy? Lexical Identity Confounds Superposition Metrics

تُثبت هذه الورقة أن جزءًا كبيرًا من التراكب العصبي الظاهري في النماذج اللغوية ناتج في الواقع عن خلط معجمي حيث تنشط الخلايا العصبية لأشكال كلمات مشتركة مثل "bank" بدلاً من مفاهيم غير مترابطة مضغوطة، وهو اكتشاف يؤدي، عند تصحيحه، إلى تحسين فك التباس معنى الكلمات وانتقائية تعديلات المعرفة.

Iyad Ait Hou, Rebecca Hwa2026-04-02
🤖 AI

First Logit Boosting: Visual Grounding Method to Mitigate Object Hallucination in Large Vision-Language Models

تقترح هذه الورقة تقنية "تعزيز اللوجيت الأول" (First Logit Boosting - FLB)، وهي تقنية بسيطة وخالية من التدريب، تعمل على التخفيف من حدة الهلوسة الكائنية في النماذج اللغوية البصرية الضخمة عبر الحفاظ على المعلومات البصرية الأولية طوال عملية التوليد لمواجهة التحلل طويل الأمد، وكل ذلك مع تكبد عبء حسابي ضئيل للغاية أثناء الاستدلال.

Jiwoo Ha, Jongwoo Baek, Jinhyun So2026-04-02
🤖 AI

Optimsyn: Influence-Guided Rubrics Optimization for Synthetic Data Generation

إن Optimsyn هو إطار عمل قائم على التحسين يستفيد من تقدير التأثير لقياس فائدة التدريب للبيانات الاصطناعية، مما يوجه التكيف القائم على التعلم المعزز لمعايير التوليد لتحسين أداء النماذج في المهام اللاحقة عبر مجالات متنوعة كثيفة المعرفة دون الحاجة إلى ضبط خاص بكل مهمة.

Zhiting Fan, Ruizhe Chen, Tianxiang Hu, Ru Peng, Zenan Huang, Haokai Xu, Yixin Chen, Jian Wu, Junbo Zhao, Zuozhu Liu2026-04-02
🤖 AI

Ontology-Constrained Neural Reasoning in Enterprise Agentic Systems: A Neurosymbolic Architecture for Domain-Grounded AI Agents

تقدم هذه الورقة بنية عصبية رمزية ضمن منصة Foundation AgenticOS تستخدم إطاراً أنطولوجياً ثلاثي الطبقات لتقييد وكلاء النماذج اللغوية الكبيرة، مما يحسن بشكل كبير من دقتها، وامتثالها التنظيمي، واتساق أدوارها — لا سيما في المجالات ذات البيانات التدريبية المحدودة — من خلال فرض تجذير دلالي رسمي على كل من المدخلات والمخرجات.

Thanh Luong Tuan2026-04-02
📊 statistics

Common TF-IDF variants arise as key components in the test statistic of a penalized likelihood-ratio test for word burstiness

تُثبت هذه الورقة أن درجات أوزان المصطلحات الشبيهة بـ TF-IDF تظهر بشكل طبيعي من الإحصاء الاختباري لاختبار نسبة الأرجحية المُعاقب والمصمم للكشف عن تدفق الكلمات، مما يقدم أساساً إحصائياً للصيغة الكلاسيكية ويُظهر أداءها المماثل في مهام تصنيف المستندات.

Zeyad Ahmed, Paul Sheridan, Michael McIsaac, Aitazaz A. Farooque2026-04-02
⚡ electrical engineering

OmniVoice: Towards Omnilingual Zero-Shot Text-to-Speech with Diffusion Language Models

يُعد OmniVoice نموذجاً متطوراً للغاية لتحويل النص إلى كلام متعدد اللغات بأسلوب التعلم الصفري، حيث يتوسع ليشمل أكثر من 600 لغة عبر استخدام بنية غير تكرارية منفصلة بأسلوب نماذج اللغة الانتشارية المبتكرة لربط النص مباشرة بالرموز الصوتية، محققاً وضوحاً فائقاً وتغطية لغوية واسعة من خلال استراتيجية قناع عشوائي لكامل دفتر الرموز والتهيئة المسبقة باستخدام النماذج اللغوية الكبيرة.

Han Zhu, Lingxuan Ye, Wei Kang, Zengwei Yao, Liyong Guo, Fangjun Kuang, Zhifeng Han, Weiji Zhuang, Long Lin, Daniel Pove (…)2026-04-02
🤖 AI

To Memorize or to Retrieve: Scaling Laws for RAG-Considerate Pretraining

تتقصى هذه الورقة البحثية المقايضة بين بيانات ما قبل التدريب وحجم متن الاسترجاع عبر مختلف أحجام النماذج، مقترحةً إطار توسع ثلاثي الأبعاد لتحديد التخصيصات المثلى لميزانية البيانات من أجل تعظيم أداء النماذج اللغوية في المهام كثيفة المعرفة.

Karan Singh, Michael Yu, Varun Gangal, Zhuofu Tao, Sachin Kumar, Emmy Liu, Steven Y. Feng2026-04-02
🤖 machine learning

Multimodal Language Models Cannot Spot Spatial Inconsistencies

تقدم هذه الورقة معياراً جديداً لتقييم اتساق الحركة ثلاثية الأبعاد في النماذج اللغوية الكبيرة متعددة الوسائط (MLLMs) من خلال توليد أزواج صور غير متسقة مكانياً، مما يكشف أن النماذج الحالية المتطورة تؤدي بشكل أقل بكثير من البشر وتفتقر إلى فهم قوي للبنية الفيزيائية ثلاثية الأبعاد.

Om Khangaonkar, Hadi J. Rad, Hamed Pirsiavash2026-04-02
🤖 machine learning

Routing-Free Mixture-of-Experts

تقدم هذه الورقة البحثية "خليط الخبراء الخالي من التوجيه" (Routing-Free Mixture-of-Experts)، وهو بنية معمارية مبتكرة تلغي آليات التوجيه المركزية عبر تمكين الخبراء الأفراد من التنشيط الذاتي من خلال تدفق متصل للتدرج، مع استخدام إطار عمل تكيفي موحد لتحسين توازن كل من الخبراء والرموز، مما يؤدي إلى قابلية توسع ومتانة فائقتين مقارنة بالنماذج المرجعية القياسية.

Yilun Liu, Jinru Han, Sikuan Yan, Volker Tresp, Yunpu Ma2026-04-02
🤖 AI

Emotion Entanglement and Bayesian Inference for Multi-Dimensional Emotion Understanding

تقدم هذه الورقة البحثية EmoScene، وهو معيار مرجعي مليء بالتحديات يضم 4,731 سيناريو غني بالسياق مشروحة بمتجهات عاطفية ذات 8 أبعاد، وتقترح إطار استدلال بايزي مدرك للتشابك يستفيد من إحصائيات التزامن العاطفي لتحسين الاتساق الهيكلي وأداء فهم العواطف متعدد الأبعاد في النماذج اللغوية الكبيرة بشكل كبير.

Hemanth Kotaprolu, Kishan Maharaj, Raey Zhao, Abhijit Mishra, Pushpak Bhattacharyya2026-04-02