💬 NLP

Developing an English-Efik Corpus and Machine Translation System for Digitization Inclusion

تتناول هذه الدراسة نقص التمثيل للغة الإفيكك (Efik) ذات الموارد المنخفضة في مجال معالجة اللغات الطبيعية من خلال تطوير متن موازٍ مُعدّ بواسطة المجتمع، وإثبات أن ضبط نموذج NLLB-200 بدقة على هذه المجموعة من البيانات يؤدي إلى أداء متفوق في الترجمة الآلية من الإنجليزية إلى الإفيكك مقارنة بنموذج mT5، مما يساهم في تعزيز الحفظ الرقمي الشامل والعادل للغات.

Offiong Bassey Edet, Mbuotidem Sunday Awak, Emmanuel Oyo-Ita, Benjamin Okon Nyong, Ita Etim Bassey2026-03-17
⚡ electrical engineering

Modeling and Benchmarking Spoken Dialogue Rewards with Modality and Colloquialness

تقدم هذه الورقة البحثية SDiaReward، وهو نموذج مكافأة متعدد الدورات يعمل من البداية إلى النهاية وتم تدريبه على مجموعة بيانات جديدة لسد الفجوات في الوسائط واللغة العامية في أنظمة الحوار المنطوق، جنباً إلى جنب مع معيار ESDR-Bench، محققاً أداءً هو الأفضل في فئته في تقييم النبرة، والعاطفة، والتعبير عن الكلام الطبيعي.

Jingyu Lu, Yuhan Wang, Fan Zhuo, Xize Cheng, Changhao Pan, Xueyi Pu, Yifu Chen, Chenyuhao Wen, Tianle Liang, Zhou Zhao2026-03-17
💬 NLP

LLMs as Signal Detectors: Sensitivity, Bias, and the Temperature-Criterion Analogy

تطبق هذه الدراسة المسجلة مسبقاً نظرية كشف الإشارة على النماذج اللغوية الكبيرة، كاشفةً أن درجة الحرارة تعمل كمعدل مزدوج لكل من الحساسية والانحياز بدلاً من كونها مجرد إزاحة في المعيار، ومثبتةً أن إطار نظرية كشف الإشارة البارامتري الكامل يكشف عن تمايزات تشخيصية حاسمة بين النماذج تعجز مقاييس المعايرة التقليدية عن رصدها.

Jon-Paul Cacioli2026-03-17
💬 NLP

Fine-tuning RoBERTa for CVE-to-CWE Classification: A 125M Parameter Model Competitive with LLMs

تقدم هذه الورقة نموذج RoBERTa مضبوطاً بدقة بـ 125 مليون معلمة، والذي يحقق أداءً تنافسياً في تصنيف الـ CVE إلى CWE مقارنة بالنماذج اللغوية الكبيرة الأكبر حجماً، وذلك عبر الاستفضاء من مجموعة بيانات واسعة النطاق ومُحسّنة بالذكاء الاصطناعي للتفوق بشكل كبير على النماذج المرجعية التقليدية في فئات نقاط الضعف النادرة.

Nikita Mosievskiy2026-03-17
💬 NLP

Rethinking LLM Watermark Detection in Black-Box Settings: A Non-Intrusive Third-Party Framework

تقدم الورقة البحثية TTP-Detect، وهو إطار عمل رائد بنظام الصندوق الأسود يتيح التحقق من العلامات المائية للنماذج اللغوية الكبيرة من قبل طرف ثالث بشكل غير اقتحامي عبر فصل عملية الكشف عن عملية الحقن من خلال النماذج الوسيطة واختبار الفرضيات النسبي، مما يتغلب على قيود مخططات المفتاح السري الحالية.

Zhuoshang Wang, Yubing Ren, Yanan Cao, Fang Fang, Xiaoxue Li, Li Guo2026-03-17
💬 NLP

Beyond Benchmark Islands: Toward Representative Trustworthiness Evaluation for Agentic AI

تقترح هذه الورقة إطار تقييم الوكيل الهولوغرافي (HAAF)، وهو نموذج تقييم منهجي ينقل تقييم موثوقية الذكاء الاصطناعي الوكيل من جزر الاختبارات المعيارية المجزأة إلى نهج تمثيلي مدرك للتوزيع يدمج التحليل الساكن، والمحاكاة التفاعلية، والتوافق الاجتماعي الأخلاقي لمعالجة المخاطر الواقعية ونقاط الضعف في الحالات الحدية.

Jinhu Qi, Yifan Li, Minghao Zhao, Wentao Zhang, Zijian Zhang, Yaoman Li, Irwin King2026-03-17
💬 NLP

OrgForge: A Multi-Agent Simulation Framework for Verifiable Synthetic Corporate Corpora

إن OrgForge هو إطار عمل مفتوح المصدر للمحاكاة متعددة الوكلاء يقوم بتوليد مجموعات بيانات مؤسسية اصطناعية قابلة للتحقق ومتسقة زمنياً عبر فصل محرك حقيقة الأحداث الحتمي عن توليد النثر السطحي القائم على النماذج اللغوية الكبيرة للقضاء على الهلوسة وعدم الاتساق في الخطوط الزمنية من أجل تقييم قوي لخطوط أنابيب استرجاع المعلومات المعزز (RAG).

Jeffrey Flynt2026-03-17
💬 NLP

Pretraining and Benchmarking Modern Encoders for Latvian

تتناول هذه الورقة ندرة نماذج اللغة اللاتفية من خلال التدريب المسبق واختبار مجموعة من المشفرات أحادية اللغة القائمة على بنيات RoBERTa وDeBERTaV3 وModernBERT، مما يثبت أن نموذج lv-deberta-base الناتج يتفوق على النماذج المرجعية متعددة اللغات وأحادية اللغة الموجودة مع توفير كفاءة محسنة.

Arturs Znotins2026-03-17
💬 NLP

Interpretable Predictability-Based AI Text Detection: A Replication Study

تقدم هذه الورقة تكراراً وتوسيعاً لنظام AuTexTification 2023 الخاص بنسبة المؤلف، حيث تُثبت أن دمج النماذج متعددة اللغات الأحدث مع السمات الأسلوبية على مستوى المستند وتحليل SHAP يحسن أداء الكشف عبر اللغات، مع تسليط الضوء على الحاجة الماسة إلى توثيق واضح لضمان التكرار الموثوق.

Adam Skurla, Dominik Macko, Jakub Simko2026-03-17
💬 NLP

Thinking in Latents: Adaptive Anchor Refinement for Implicit Reasoning in LLMs

تقدم الورقة البحثية AdaAnchor، وهو إطار عمل للاستدلال الكامن يقوم بعمليات حسابية تكرارية صامتة من خلال تحسين ناقلات الارتكاز الملحقة بالمدخلات باستخدام آلية توقف تكيفية، مما يؤدي إلى تحسين الدقة بشكل كبير وتقليل تكاليف الاستدلال مقارنة بكل من أسلوب "سلسلة الأفكط" (Chain-of-Thought) الصاخب وطرق الكمون ذات الخطوات الثابتة.

Disha Sheshanarayana, Rajat Subhra Pal, Manjira Sinha, Tirthankar Dasgupta2026-03-17