💬 NLP

MAPLE: Metadata Augmented Private Language Evolution

تقترح الورقة البحثية إطار عمل MAPLE، وهو إطار عمل مبتكر يعزز التطور اللغوي ذو الخصوصية التفاضلية للنماذج اللغوية الكبيرة التي يمكن الوصول إليها عبر واجهة برمجة التطبيقات (API) من خلال الاستفيد من البيانات الوصفية الجدولية ذات الخصوصية التفاضلية والتعلم في السياق للتغلب على اختناقات التهيئة، مما يحقق مقايضات فائقة بين الخصوصية والمنفعة، وتقارباً أسرع، وتكاليف أقل لواجهة برمجة التطبيقات مقارنة بالطرق الحالية.

Eli Chien, Yuzheng Hu, Ryan McKenna, Shanshan Wu, Zheng Xu, Peter Kairouz2026-03-23
💬 NLP

Breeze Taigi: Benchmarks and Models for Taiwanese Hokkien Speech Recognition and Synthesis

تقدم هذه الورقة Breeze Taigi، وهو إطار عمل شامل يتميز بمعايير قياسية، ومجموعات بيانات منسقة، ونماذج مفتوحة المصدر تستفيد من البيانات الاصطناعية والموارد المتوازية بين لغتي الماندرين والتايغي لتعزيز التعرف على الكلام وتخليقه للغة هوكين (التايغي) التايوانية بشكل كبير.

Yu-Siang Lan, Chia-Sheng Liu, Yi-Chang Chen, Po-Chun Hsu, Allyson Chiu, Shun-Wen Lin, Da-shan Shiu, Yuan-Fu Liao2026-03-23
💬 NLP

Significance-Gain Pair Encoding for LLMs: A Statistical Alternative to Frequency-Based Subword Merging

تقترح هذه الورقة البحثية "Significance-Gain BPE"، وهي بديل قائم على أسس إحصائية لعملية دمج الكلمات الفرعية التقليدية المعتمدة على التكرار، حيث تستخدم إحصائية z لقياس تماسك الأزواج، مما أظهر تحسينات ملحوظة في مقاييس الحيرة (perplexity) وعدد البتات لكل حرف (bits per character) للنماذج اللغوية على مجموعة بيانات WikiText-103.

Azam Nouri2026-03-23
💬 NLP

The {\alpha}-Law of Observable Belief Revision in Large Language Model Inference

تقدم هذه الورقة "قانون ألفا" (α\alpha-Law)، وهو قانون قياس ضربي يحكم كيفية مراجعة النماذج اللغوية الكبيرة لمعتقداتها أثناء الاستدلال التكراري، مما يثبت أن وجود أسٍ أقل من واحد يضمن الاستقرار التقاربي ويكشف عن سلوكيات تحديث قريبة من السلوك البايزي عبر نماذج ومعايير متنوعة.

Mike Farmer, Abhinav Kochar, Yugyung Lee2026-03-23
💬 NLP

Generative Active Testing: Efficient LLM Evaluation via Proxy Task Adaptation

تقدم هذه الورقة البحثية "الاختبار النشط التوليدي" (GAT)، وهو إطار عمل مدرك لعدم اليقين يستفيد من النماذج اللغوية الكبيرة كبدائل ومن وحدة تكيف العبارات المبتكرة لاختيار العينات بكفاءة لتقييم مهام الأسئلة والأجوبة التوليدية، مما يقلل خطأ التقدير بنسبة 40% تقريبًا مقارنة بطرق أخذ العينات التقليدية مع تقليل تكلفة التصنيف من قبل الخبراء إلى أدنى حد.

Aashish Anantha Ramakrishnan, Ardavan Saeedi, Hamid Reza Hassanzadeh, Fazlolah Mohaghegh, Dongwon Lee2026-03-23
💬 NLP

Full-Stack Domain Enhancement for Combustion LLMs: Construction and Optimization

تقدم هذه الورقة أول سير عمل كامل الحزمة ومعزز بالمجال لعلوم الاحتراق، والذي يدمج بناء المتون الآلي، والتدريب المسبق التدريجي، والضبط الدقيق للتعليمات، والتعلم المعزز القائم على المكافأة القابل للتحقق للقضاء على الهلوسة وضمان الالتزام بالقوانين الفيزيائية، وهو ما تم التحقق منه بواسطة معيار FlameBench الجديد الذي أظهر أداءً فائقاً على النماذج الرائدة.

Quanjia Xiao, Weimin Ouyang, Zonglin Yang, Tianhao Wu, Qingguo Zhou, Runze Mao, Zhi X. Chen2026-03-23
💬 NLP

Autonoma: A Hierarchical Multi-Agent Framework for End-to-End Workflow Automation

تقدم هذه الورقة Autonoma، وهو إطار عمل هرمي متعدد الوكلاء يقوم بترجمة المطالبات باللغة الطبيعية إلى سير عمل متين وشامل من البداية إلى النهاية عبر فصل منطق التنسيق عن التنفيذ المتخصص، محققاً بذلك موثوقية عالية وقابلية للتوسع وشمولية مع دعم متعدد الوسائط وثنائي اللغة.

Eslam Reda, Maged Yasser, Sara El-Metwally2026-03-23
💬 NLP

Improving Automatic Summarization of Radiology Reports through Mid-Training of Large Language Models

تُظهر هذه الورقة أن استراتيجية "التدريب المسبق، والتدريب المتوسط، والضبط الدقيق" باستخدام نصوص سريرية واسعة النطاق تُحسن بشكل كبير التلخيص التلقائي لتقارير الأشعة، محققةً أداءً فائقاً في كل من جودة النص وواقعيته مقارنةً بنهج الضبط الدقيق المباشر التقليدي.

Mengxian Lyu, Cheng Peng, Ziyi Chen, Mengyuan Zhang, Jieting Li Lu, Yonghui Wu2026-03-23
💬 NLP

URAG: A Benchmark for Uncertainty Quantification in Retrieval-Augmented Large Language Models

تقدم هذه الورقة URAG، وهو معيار شامل يعيد صياغة مهام التوليد المعزز بالاسترجاع (RAG) مفتوحة النهايات إلى أسئلة متعددة الخيارات لتمكين التكميم المنهجي لعدم اليقين عبر التنبؤ المطابق، مما يكشف عن رؤى نقدية حول كيفية تأثير ضوضاء الاسترجاع، وتعقيد الطريقة، والعوامل النوعية على دقة وموثوقية النماذج اللغوية الكبيرة المعززة بالاسترجاع.

Vinh Nguyen, Cuong Dang, Jiahao Zhang, Hoa Tran, Minh Tran, Trinh Chau, Thai Le, Lu Cheng, Suhang Wang2026-03-23
💬 NLP

Automated Motif Indexing on the Arabian Nights

تقدم هذه الورقة أول نهج حوسبي للفهرسة الآلية للموتيفات، باستخدام متن من "ألف ليلة وليلة" مُشروح يدويًا مقترنًا بفهرس الشامي للموتيفات، لإثبات أن نموذج Llama3 الذي تم ضبطه بدقة يمكنه اكتشاف تعبيرات الموتيف بفعالية وبدرجة F1 تبلغ 0.85.

Ibrahim H. Alyami, Mark A. Finlayson2026-03-23