💻 computer science

EDINET-Bench: Evaluating LLMs on Complex Financial Tasks using Japanese Financial Statements

تقدم هذه الورقة EDINET-Bench، وهو معيار مرجعي مفتوح المصدر وتحدي مستمد من عشر سنوات من التقارير المالية اليابانية لتقييم النماذج اللغوية الكبيرة في مهام معقدة مثل كشف الاحتيال والتنبؤ بالأرباح، مما يكشف أن النماذج الحالية تعاني بشكل كبير دون دعامات متخصصة ويسلط الضوء على الحاجة إلى أطر تقييم أكثر واقعية.

Issa Sugiura, Takashi Ishida, Taro Makino, Chieko Tazuke, Takanori Nakagawa, Kosuke Nakago, David Ha2026-03-06
💻 computer science

La Leaderboard: A Large Language Model Leaderboard for Spanish Varieties and Languages of Spain and Latin America

تقدم الورقة البحثية "La Leaderboard"، وهي أول مبادرة مفتوحة المصدر ومدفوعة من المجتمع لتقييم 50 نموذجاً لغوياً كبيراً توليدياً عبر 66 مجموعة بيانات تغطي تنوعات اللغة الإسبانية ولغات إسبانيا وأمريكا اللاتينية، وذلك بهدف وضع معايير للتقييم وتعزيز التنوع اللغوي.

María Grandury, Javier Aula-Blasco, Júlia Falcão, Clémentine Fourrier, Miguel González, Gonzalo Martínez, Gonzalo Santam (…)2026-03-06
💻 computer science

Traceable Evidence Enhanced Visual Grounded Reasoning: Evaluation and Methodology

تقدم هذه الورقة TreeBench، وهو معيار تشخيصي لتقييم الاستدلال البصري المرتكز القابل للتتبع، وتقترح TreeVGR، وهو نموذج تدريب قائم على التعلم التعزيزي يعزز أداء النموذج بشكل كبير من خلال الإشراف المشترك على التحديد والاستدلال.

Haochen Wang, Xiangtai Li, Zilong Huang, Anran Wang, Jiacong Wang, Tao Zhang, Jiani Zheng, Sule Bai, Zijian Kang, Jiashi (…)2026-03-06
💻 computer science

How Quantization Shapes Bias in Large Language Models

تُقيّم هذه الدراسة بشكل شامل كيف يؤثر تكميم الأوزان والتنشيط على أشكال مختلفة من التحيز في النماذج اللغوية الكبيرة، كاشفةً أنه بينما يمكنه تقليل السمية والحفاظ على المشاعر، فإنه غالباً ما يفاقم الصور النمطية وعدم الإنصاف في المهام التوليدية، لا سيما في ظل الضغط الشديد.

Federico Marcuzzi, Xuefei Ning, Roy Schwartz, Iryna Gurevych2026-03-06
💻 computer science

New Insights into Optimal Alignment of Acoustic and Linguistic Representations for Knowledge Transfer in ASR

تقترح هذه الورقة نموذج محاذاة قائماً على النقل الأمثل غير المتوازن يعيد صياغة المطابقة الصوتية اللغوية كمسألة كشف للتعامل بفعالية مع عدم التماثل الهيكلي وعدم التطابق التوزيعي، مما يؤدي إلى تحسين أداء نقل المعرفة في أنظمة التعرف التلقائي على الكلام القائمة على نموذج CTC.

Xugang Lu, Peng Shen, Hisashi Kawai2026-03-06
💻 computer science

TSPC: A Two-Stage Phoneme-Centric Architecture for code-switching Vietnamese-English Speech Recognition

تقترح هذه الورقة البحثية بنية TSPC، وهي بنية مبتكرة ثنائية المراحل ترتكز على الفونيمات وتستفيد من مجموعة فونيمات فيتنامية موسعة كتمثيل وسيط لتحسين دقة التعرف على الكلام في التبديل اللغوي بين الفيتنامية والإنجليزية بشكل كبير مع الحفاظ على الكفاءة الحسابية.

Tran Nguyen Anh, Truong Dinh Dung, Vo Van Nam, Minh N. H. Nguyen2026-03-06
💻 computer science

Llama-Mimi: Exploring the Limits of Flattened Speech Language Modeling

تقدم هذه الورقة البحثية Llama-Mimi، وهو نموذج لغوي صوتي يعتمد على فك تشفير Transformer، يقوم بتسطيح رموز RVQ متعددة المستويات من ترميز Mimi إلى تسلسل واحد، مما يظهر أداءً فائقاً على النماذج الهرمية في معظم المهام ويحقق اتساقاً صوتياً هو الأفضل من نوعه.

Issa Sugiura, Shuhei Kurita, Yusuke Oda, Ryuichiro Higashinaka2026-03-06
💻 computer science

BeyondBench: Contamination-Resistant Evaluation of Reasoning in Language Models

يقدم "بينش-بيند" (BeyondBench) إطار تقييم مقاوم للتلوث يستخدم التوليد الخوارزمي للمشكلات أثناء التشغيل لتقييم قدرات الاستنتاج الحقيقية لـ 101 نموذج لغوي عبر 44 مهمة، مما يكشف عن فجوات كبيرة في حل المشكلات المعقدة والدور الحاسم لاستخدام الأدوات.

Gaurav Srivastava, Aafiya Hussain, Zhenyu Bi, Swastik Roy, Priya Pitre, Meng Lu, Morteza Ziyadi, Xuan Wang2026-03-06
💻 computer science

Pretraining Large Language Models with NVFP4

تقدم هذه الورقة إطار عمل تدريب NVFP4 مبتكر يجمع بين تحويلات هادامارد العشوائية، والكمية ثنائية الأبعاد، والتقريب العشوائي، والطبقات الانتقائية عالية الدقة، لتدريب نموذج بـ 12 مليار معلمة بنجاح على 10 تريليونات توكن بأداء يضاهي النماذج المرجعية بمعيار FP8، مما يثبت جدوى التدريب المستقر بدقة 4 بت للنماذج اللغوية الكبيرة.

NVIDIA, Felix Abecassis, Anjulie Agrusa, Dong Ahn, Jonah Alben, Stefania Alborghetti, Michael Andersch, Sivakumar Arayan (…)2026-03-06
💻 computer science

PrefDisco: Benchmarking Proactive Personalized Reasoning

تقدم هذه الورقة PrefDisco، وهو إطار عمل مرجعي ومنهجية تقييم مبتكرة تحول المهام الاستاتيكية إلى سيناريوهات تفاعلية لتقييم وتحسين قدرة النماذج اللغوية الكبيرة على تحديد تفضيلات المستخدم بشكل استباقي وتكييف سلاسل الاستدلال الخاصة بها من أجل المواءمة الشخصية في حالات البداية الباردة وفي الوقت المناسب.

Shuyue Stella Li, Avinandan Bose, Faeze Brahman, Simon Shaolei Du, Pang Wei Koh, Maryam Fazel, Yulia Tsvetkov2026-03-06