🧬 biology

Training-Driven Representational Geometry Modularization Predicts Brain Alignment in Language Models

تُظهر هذه الدراسة أنه أثناء تدريب النماذج اللغوية الكبيرة، فإن التنظيم الذاتي للهندسة التمثيلية إلى وحدات منخفضة التعقيد تتميز بانخفاض في الإنتروبيا والانحناء يتنبأ بقوة بالتوافق مع نشاط الدماغ البشري، مما يكشف عن مسارات مكانية-زمانية متميزة عبر المناطق الصدغية والجبهية.

Yixuan Liu, Zhiyuan Ma, Likai Tang, Runmin Gan, Xinche Zhang, Jinhao Li, Chao Xie, Sen Song2026-07-28
💬 NLP

Evaluating the Effect of Linguistic Relatedness on Cross-Lingual Transfer in Large Multilingual Automatic Speech Recognition

تقيم هذه الورقة بشكل منهجي تأثير القرابة اللغوية على النقل عبر اللغات في التعرف الآلي متعدد اللغات على الكلام، وتجد أن التكيف المسبق للنماذج مع لغات مساعدة ذات صلة لا يحقق أي تحسينات ذات جدوى عملية مقارنة باستخدام ساعة واحدة فقط من بيانات اللغة المستهدفة، مما يشير إلى أن القرابة اللغوية وحدها ليست مؤشراً موثوقاً لمكاسب النقل بالنسبة للغات الأفريقية ذات الموارد المنخفضة.

Andrei Florian, Cynthia Jayne Amol, Hope Kerubo Ombaba, Xiaoyu Cui, Boniface Mwau, Biatus Maina Kamau, Lilian Diana Awuo (…)2026-07-28
💬 NLP

VibeVoice-ASR-BitNet Technical Report

يُعد VibeVoice-ASR-BitNet نموذجاً مضغوطاً للتعرف التلقائي على الكلام في الوقت الفعلي، مُحسَّناً لمعالجات الحافة (edge CPUs) عبر التكميم غير المتجانس (INT8 للمُشفر التلقائي VAE وأوزان ثلاثية بأسلوب BitNet للنموذج اللغوي) ونواة SIMD مخصصة، محققاً سرعة استنتاج تزيد بمقدار 1.6 إلى 2.3 ضعفاً مقارنة بـ Whisper.cpp مع حد أدنى من فقدان الدقة.

Songchen Xu, Ting Song, Shaohan Huang, Zhiliang Peng, Yan Xia, Yujie Tu, Xin Huang, Xun Wu, Wenhui Wang, Yaoyao Chang, J (…)2026-07-28
💬 NLP

Capital Markets LLM Reliability Score (CM-LRS): From Plausible to Bankable

تقدم هذه الورقة البحثية "درجة موثوقية النماذج اللغوية الكبيرة في أسواق رأس المال" (CM-LRS)، وهو إطار تقييم مبتكر سباعي الأبعاد مصمم لتقييم مدى "قابلية الاعتماد المصرفي" لمخرجات النماذج اللغوية الكبيرة في تدفقات العمل المالية المنظمة، كاشفةً أنه بينما تتقارب النماذج الرائدة بشكل وثيق في الأداء العام، لا تزال هناك فجوات كبيرة في قدرات الاسترجاع والتركيب مقارنة بالنماذج الأساسية مفتوحة الأوزان.

Prerit Ahuja2026-07-28
💬 NLP

DONDO: Open w2v-BERT Speech-Recognition Base Models for African Languages

تقدم الورقة البحثية DONDO، وهي عائلة من نماذج التعرف التلقائي على الكلام (ASR) مفتوحة المصدر وذات تراخيص تسمح بالاستخدام الواسع لـ 27 لغة أفريقية مبنية على نموذج w2v-BERT 2.0، والتي تستفيد من بيانات النصوص الدينية واستراتيجية ضبط دقيق مبتكرة تعتمد على تبريد معدل التعلم لتحقيق أداء تنافسي في كل من البيئات أحادية اللغة ومتعددة اللغات، مع تغطية ما يقرب من 100 مليون متحدث باللغة الأم.

Paul Azunre, Naafi Ibrahim, Joel Budu, Lawrence Adu-Gyamfi2026-07-28
🤖 machine learning

Semalith v1.4: A Calibrated 184M Safety Classifier Achieving State-of-the-Art Prompt-Injection Detection at 44x Fewer Parameters than Llama-Guard-3-8B

يُعد Semalith v1.4 مصنف سلامة عالي الكفاءة بـ 184 مليون معلمة، يحقق مستويات رائدة في اكتشاف حقن الأوامر (prompt-injection) وصفر من الإيجابيات الكاذبة في المطالبات الوكيلية السليمة، مع امتلاكه 44 ضعفاً أقل من المعلمات مقارنة بـ Llama-Guard-3-8B، بينما يتميز بقدرته الفريدة على تقديم اكتشاف متزامن للضرر العام والامتثال التنظيمي المالي في تمريرة استدلال واحدة.

Tejasvi C. Addagada2026-07-28
💬 NLP

MioFFAn: an Annotation Software for Formula Formalization with LLM Automation Capabilities

تقدم هذه الورقة MioFFAn، وهو إطار عمل مفتوح المصدر وقابل للتخصيص للتعليق التوضيحي يوسع بنية MioGatto لتسهيل إنشاء مجموعات بيانات عالية الجودة لصياغة الصيغ الرياضية من خلال الجمع بين التعليق البشري وأتمتة النماذج اللغوية الكبيرة التركيبية.

Nicolas Sibuet, Horacio Saggion, Riccardo Rossi2026-07-28
💬 NLP

Evaluating the Impact of Reviewer Guideline Design on LLM-Based Automated Peer Review

تُظهر هذه الدراسة أن أنظمة مراجعة الأقران المؤتمتة تحقق أعلى درجات التوافق مع الأحكام البشرية عندما تسترشد بالإرشادات الرسمية للمؤتمرات بدلاً من المحاكاة التي تولدها النماذج اللغوية الكبيرة، وأن السماح بالتقييم الشمولي يتفوق على النهج الصارم القائم على القواعد.

Haowen Li, Yoichi Ishibashi, Masafumi Oyamada2026-07-28
💬 NLP

Same Question, Different Answers: Evaluating LLM Reliability Beyond Accuracy

تكشف هذه الورقة أن النماذج اللغوية الكبيرة غالباً ما تظهر عدم استقرار ملحوظ في إجاباتها عند مواجهة إعادة صياغة تحافظ على المعنى، مما يثبت أن مقاييس الدقة القياسية يمكن أن تخفي مشكلات الموثوقية وأن استراتيجيات إعادة الصياغة الذاتية يمكن أن تستعيد المعرفة الكامنة بفعالية لتحسين الأداء.

Kazem Faghih, Yize Cheng, Shoumik Saha, Mobina Pournemat, Armin Gerami, Soheil Feizi2026-07-28
💬 NLP

Source-Aware Reranking for Retrieval-Augmented Generation: A Reliability Prior Approach

تقترح هذه الورقة البحثية وتقيم طريقة لإعادة ترتيب النتائج مدركة للمصدر لعملية التوليد المعزز بالاسترجاع، والتي تعيد وزن درجات الاسترجاع باستخدام أولويات موثوقية المصدر المستندة إلى المجال، مما يظهر تحسينات كبيرة في الدقة وتقليلاً في الاسترجاع العدائي على مجموعة بيانات من المجال الصحي.

Yuktha Tata Koganti, Hugo Garrido-Lestache Belinchon2026-07-28