💬 NLP

Sparse-BitNet: 1.58-bit LLMs are Naturally Friendly to Semi-Structured Sparsity

تقدم هذه الورقة Sparse-BitNet، وهو إطار عمل موحد يوضح أن نماذج BitNet ذات الـ 1.58 بت هي بطبيعتها أكثر توافقًا مع التناثر شبه المهيكل N:M من النماذج ذات الدقة الكاملة، مما يتيح تدريبًا مستقرًا، وتقليل تدهور الأداء، وتسريعًا كبيرًا في كل من التدريب والاستدلال.

Di Zhang, Xun Wu, Shaohan Huang, Yudong Wang, Hanyong Shao, Yingbo Hao, Zewen Chi, Li Dong, Ting Song, Yan Xia, Zhifang (…)2026-03-06
🤖 AI

Guidelines for the Annotation and Visualization of Legal Argumentation Structures in Chinese Judicial Decisions

تقترح هذه الورقة إطاراً منهجياً لتوصيف وتصور بنيات الحجاج القانوني في القرارات القضائية الصينية من خلال تحديد أربعة أنواع من القضايا وخمسة أنواع من العلاقات لتمكين تحليل حوسبي متسق وقابل للتكرار للاستدلال القضائي.

Kun Chen, Xianglei Liao, Kaixue Fei, Yi Xing, Xinrui Li2026-03-06
💬 NLP

Transducing Language Models

تقدم هذه الورقة إطار عمل عامًا لاشتقاق نماذج لغوية جديدة عبر تركيب النماذج مسبقة التدريب مع محولات الحالة المحدودة الحتمية، مما يتيح تهميش الاحتمالات والاشتراط بكفاءة لتكييف المخرجات مع تنسيقات متنوعة مثل البايتات، أو الكلمات، أو الأحماض الأمينية دون الحاجة لإعادة التدريب.

Vésteinn Snæbjarnarson, Samuel Kiegeland, Tianyu Liu, Reda Boumasmoud, Ryan Cotterell, Tim Vieira2026-03-06
💬 NLP

Distilling Formal Logic into Neural Spaces: A Kernel Alignment Approach for Signal Temporal Logic

تقترح هذه الورقة إطار عمل مبتكرًا يستخلص الدلالات الهندسية لمنطق الزمن الإشاري إلى مشفر "ترانسفورمر" عبر محاذاة النواة، مما يتيح تمثيلات عصبية فعالة، وعكوسة، وأمينة دلاليًا تتغلب على القيود الحسابية للنوى الرمزية والقصور الهيكلي للتمثيلات القائمة على بناء الجملة.

Sara Candussio, Gabriele Sarti, Gaia Saveri, Luca Bortolussi2026-03-06
💬 NLP

Core-based Hierarchies for Efficient GraphRAG

تقترح هذه الورقة إطار عمل GraphRAG حتميًا وفعالًا يستبدل تجميع "لايدن" (Leiden clustering) غير القابل لإعادة الإنتاج بتفكيك الـ "k-core" واستدلالات خفيفة الوزن لتحسين الإدراك العالمي، وشمولية الإجابة، والتنوع، مع تقليل تكاليف الرموز (tokens) عبر مجموعات بيانات متنوعة من العالم الحقيقي.

Jakir Hossain, Ahmet Erdem Sarıyüce2026-03-06
🤖 AI

Balancing Coverage and Draft Latency in Vocabulary Trimming for Faster Speculative Decoding

تقترح هذه الورقة استراتيجية لتقليم المفردات من أجل فك التشفير التخميني، حيث تصيغ عملية اختيار مفردات النموذج المسودة كمسألة تحسين مقيدة للموازنة بين تغطية الرموز وزمن الاستج้าة، محققةً تحسينات كبيرة في معدل الإنتاجية وخفضاً في زمن الاستجابة من خلال تخصيص المفردات لتناسب أعباء العمل الخاصة بمجالات معينة.

Ofir Ben Shoham2026-03-06
💬 NLP

VietJobs: A Vietnamese Job Advertisement Dataset

تقدم هذه الورقة VietJobs، وهو أول متن عام واسع النطاق يضم 48,092 إعلاناً وظيفياً باللغة الفيتنامية، ويختبر نماذج اللغات الكبيرة التوليدية في مهام مثل تصنيف الوظائف وتقدير الرواتب لتعزيز معالجة اللغات الطبيعية للفيتنامية وتحليلات سوق العمل.

Hieu Pham Dinh, Hung Nguyen Huy, Mo El-Haj2026-03-06
💬 NLP

SarcasmMiner: A Dual-Track Post-Training Framework for Robust Audio-Visual Sarcasm Reasoning

يُعد SarcasmMiner إطار عمل للتدريب اللاحق يعتمد على التعلم المعزز، حيث يوظف استراتيجية تقطير ثنائية المسار باستخدام نموذج مكافأة توليدي وتحسين السياسة النسبي للمجموعات لتعزيز الاستدلال القوي للسخرية السمعية البصرية بشكل كبير وتقليل الهلوسة في النماذج التأسيسية.

Zhu Li, Yongjian Chen, Huiyuan Lai, Xiyuan Gao, Shekhar Nayak, Matt Coler2026-03-06
🤖 AI

Med-V1: Small Language Models for Zero-shot and Scalable Biomedical Evidence Attribution

تقدم الورقة البحثية Med-V1، وهي عائلة من النماذج اللغوية الصغيرة ذات الكفاءة والتي تضم 3 مليارات معلمة، والتي تم تدريبها على بيانات اصطناعية وتحقق أداءً يضاهي النماذج الرائدة مثل GPT-5 في مجالي عزو الأدلة الطبية الحيوية والكشف عن الهلوسة، مع تمكين تطبيقات قابلة للتوسع مثل تحليل صحة الاستشهاد وتحديد الأخطاء في عزو الأدلة في الإرشادات السريرية.

Qiao Jin, Yin Fang, Lauren He, Yifan Yang, Guangzhi Xiong, Zhizheng Wang, Nicholas Wan, Joey Chan, Donald C. Comeau, Rob (…)2026-03-06
🤖 AI

PersianPunc: A Large-Scale Dataset and BERT-Based Approach for Persian Punctuation Restoration

تقدم هذه الورقة PersianPunc، وهي مجموعة بيانات ضخمة تضم 17 مليون عينة، ونموذج ParsBERT مضبوط بدقة يحقق درجة F1 متوسطة قدرها 91.33% لاستعادة علامات الترقيم في اللغة الفارسية، مما يوفر بديلاً أكثر كفاءة ودقة للنماذج اللغوية الكبيرة للتطبيقات في الوقت الفعلي.

Mohammad Javad Ranjbar Kalahroodi, Heshaam Faili, Azadeh Shakery2026-03-06