💬 NLP

A Multilingual Human Annotated Corpus of Original and Easy-to-Read Texts to Support Access to Democratic Participatory Processes

تقدم هذه الورقة مجموعة بيانات متعددة اللغات ومتاحة بحرية من النصوص الأصلية والموسومة بشرياً بأسلوب "سهل القراءة" باللغات الإسبانية والكتالونية والإيطالية، والتي صُممت لدعم أبحاث التبسيط التلقائي للنصوص وتعزيز الوصول إلى عمليات المشاركة الديمقراطية.

Stefan Bott, Verena Riegler, Horacio Saggion, Almudena Rascón Alcaina, Nouran Khallaf2026-03-06
💬 NLP

Exploring the potential and limitations of Model Merging for Multi-Domain Adaptation in ASR

تتقصى هذه الورقة دمج النماذج كبديل قابل للتوسع للضبط الدقيق الكامل لأنظمة التعرف التلقائي على الكلام متعددة المجالات، حيث قامت بمقارنة معيارية لـ 11 خوارزمية عبر 10 مجالات للغة البرتغالية الأوروبية، وطرحت طريقة مبتكرة بعنوان "BoostedTSV-M" تتفوق على الضبط الدقيق الكامل مع الحفاظ على القدرة على التعميم خارج نطاق التوزيع.

Carlos Carvalho, Francisco Teixeira, Thomas Rolland, Alberto Abad2026-03-06
💬 NLP

DiSCTT: Consensus-Guided Self-Curriculum for Efficient Test-Time Adaptation in Reasoning

تقترح الورقة البحثية إطار عمل DiSCTT، وهو إطار عمل ذاتي المنهج يعتمد على الصعوبة وتوجيه الإجماع، يقوم بتخصيص استراتيجيات الضبط الدقيق الخاضع للإشراف أو التعلم المعزز ديناميكيًا بناءً على الاتفاق على مستوى المثيل بين مسارات الاستدلال، مما يحقق تكيفًا أكثر استقرارًا وكفاءة ودقة عند زمن الاختبار للنماذج اللغوية الكبيرة في مهام الاستدلال غير المتجانسة.

Mohammad Mahdi Moradi, Sudhir Mudur2026-03-06
💬 NLP

Progressive Residual Warmup for Language Model Pretraining

تقترح الورقة البحثية طريقة "التحمية المتبقية التدريجية" (ProRes)، وهي طريقة تعمل على استقرار وتسريع عملية ما قبل التدريب للنماذج اللغوية القائمة على بنية "ترانسفورمر" عبر تطبيق فلسفة "الطبقات الأولى تتعلم أولاً"، حيث لا يتم تفعيل الطبقات الأعمق تدريجياً إلا بعد استقرار الطبقات الأقل عمقاً، مما يؤدي إلى تقارب أسرع وتحسين الأداء في المهام اللاحقة.

Tianhao Chen, Xin Xu, Lu Yin, Hao Chen, Yang Wang, Shizhe Diao, Can Yang2026-03-06
💬 NLP

An Exploration-Analysis-Disambiguation Reasoning Framework for Word Sense Disambiguation with Low-Parameter LLMs

تُظهر هذه الدراسة أن النماذج اللغوية الكبيرة ذات المعلمات المنخفضة (أقل من 4 مليارات معلمة) التي تم ضبطها بدقة باستخدام تسلسل التفكير وتحليل الكلمات المجاورة، يمكنها تحقيق أداء في تحديد معاني الكلمات يضاهي أو يتجاوز النماذج عالية المعلمات المتطورة مثل GPT-4-Turbo، مع تقليل التكاليف الحسابية واستهلاك الطاقة بشكل كبير.

Deshan Sumanathilaka, Nicholas Micallef, Julian Hough2026-03-06
🤖 AI

Dissociating Direct Access from Inference in AI Introspection

تُثبت هذه الورقة أن نماذج الذكاء الاصطناعي تكتشف التمثيلات الداخلية المحقونة من خلال آليتين متمايزتين: مطابقة الاحتمالات بناءً على شذوذ المطالبات، والوصول المباشر إلى الحالات الداخلية بغض النظر عن المحتوى، حيث تسمح الآلية الأخيرة باكتشاف الشذوذ دون تحديد دلالي موثوق، وهو ما يتوافق مع النظريات الراسخة في الفلسفة وعلم النفس.

Harvey Lederman, Kyle Mahowald2026-03-06
🤖 AI

Ensembling Language Models with Sequential Monte Carlo

تقدم هذه الورقة إطاراً موحداً لدمج النماذج اللغوية المتنوعة عبر توزيعات ff-ensemble، وتقترح خوارزمية مونت كارلو تسلسلية على مستوى البايت (byte-level) للعينات من هذه التوزيعات، مما يتغلب بفعالية على تحديات مثل عدم تطابق المفردات والتقريبات المنحازة لتحسين الأداء في مهام توليد النصوص المهيكلة.

Robin Shing Moon Chan, Tianyu Liu, Samuel Kiegeland, Clemente Pasti, Jacob Hoover Vigly, Timothy J. O'Donnell, Ryan Cott (…)2026-03-06
🤖 AI

Distributed Partial Information Puzzles: Examining Common Ground Construction Under Epistemic Asymmetry

تقدم هذه الورقة لغز المعلومات الجزئية الموزعة (DPIP) ومجموعته البيانية متعددة الوسائط المرتبطة به لتقييم مدى قدرة النماذج اللغوية الكبيرة والأنظمة القائمة على المنطق الحالية على بناء أرضية مشتركة في ظل عدم التماثل المعرفي، مما يكشف أن النماذج اللغوية الكبيرة الحديثة تواجه صعوبة في تتبع تقدم المهام وحالات الاعتقاد بدقة مقارنة بالنهجات البديهية.

Yifan Zhu, Mariah Bradford, Kenneth Lai, Timothy Obiso, Videep Venkatesha, James Pustejovsky, Nikhil Krishnaswamy2026-03-06
💬 NLP

DEBISS: a Corpus of Individual, Semi-structured and Spoken Debates

تقدم هذه الورقة DEBISS، وهو متن لغوي جديد للمناظرات المنطوقة والفردية شبه المهيكلة المصمم لمعالجة ندرة مجموعات بيانات المناظرة من خلال توفير تعليقات توضيحية شاملة لمعالجة اللغات الطبيعية لمهام مثل تحويل الكلام إلى نص، وتحديد هوية المتحدث، وتعديد المتحدثين، وتنقيب الحجج، وتقييم جودة المناظر.

Klaywert Danillo Ferreira de Souza, David Eduardo Pereira, Cláudio E. C. Campelo, Larissa Lucena Vasconcelos2026-03-06
💬 NLP

NCTB-QA: A Large-Scale Bangla Educational Question Answering Dataset and Benchmarking Performance

تقدم هذه الورقة NCTB-QA، وهي مجموعة بيانات ضخمة للأسئلة والأجوبة التعليمية باللغة البنغالية تتميز بتوزيع متوازن للأسئلة القابلة للإجابة وغير القابلة للإجابة مع وجود مشتتات تنافسية، وتُظهر أن الضبط الدقيق لنماذج المحولات (transformer models) على هذه البيانات الخاصة بهذا المجال يحسن الأداء بشكل كبير في البيئات ذات الموارد المنخفضة.

Abrar Eyasir, Tahsin Ahmed, Muhammad Ibrahim2026-03-06