💬 NLP

Personalized Graph-Empowered Large Language Model for Proactive Information Access

تقدم هذه الورقة إطار عمل مرن يدمج النماذج اللغوية الكبيرة مع الرسوم البيانية للمعرفة الشخصية لمساعدة المستخدمين بشكل استباقي في استرجاع أحداث الحياة المنسية، وذلك من خلال الكشف الفعال عن احتياجات الوصول إلى المعلومات والتكيف مع تزايد بيانات سجل الحياة.

Chia Cheng Chang, An-Zi Yen, Hen-Hsen Huang, Hsin-Hsi Chen2026-02-26
💬 NLP

ExpLang: Improved Exploration and Exploitation in LLM Reasoning with On-Policy Thinking Language Selection

تقدم الورقة البحثية ExpLang، وهو مسار تدريب لاحق مبتكر يعزز نماذج الاستدلال اللغوية الكبيرة من خلال تمكين اختيار لغة التفكير أثناء التعلم المعزز وفق السياسة المتبعة (on-policy)، مما يحسن كلاً من الاستكشاف والاستغلال عبر المزايا متعددة اللغات مع التفوق على التدريب المقتصر على اللغة الإنجليزية فقط.

Changjiang Gao, Zixian Huang, Kaichen Yang, Jiajun Chen, Jixing Li, Shujian Huang2026-02-26
💬 NLP

CxMP: A Linguistic Minimal-Pair Benchmark for Evaluating Constructional Understanding in Language Models

تقدم الورقة البحثية CxMP، وهو معيار للأزواج الدنيا قائم على قواعد البناء، والذي يكشف أنه بينما تكتسب النماذج اللغوية الكفاءة النحوية بسرعة، فإن قدرتها على تفسير العلاقات الدلالية للبنى القواعدية تتطور بشكل أكثر تدرجاً وتظل محدودة حتى في النماذج الضخمة.

Miyu Oba, Saku Sugawara2026-02-26
⚡ electrical engineering

TG-ASR: Translation-Guided Learning with Parallel Gated Cross Attention for Low-Resource Automatic Speech Recognition

تقدم هذه الورقة البحثية إطار عمل TG-ASR، وهو إطار عمل موجه بالترجمة يستخدم آلية انتباه متقاطع بوابي متوازي ومتنًا جديدًا من دراما لغة هوكين التايوانية مدته 30 ساعة (YT-THDC) لتحسين التعرف الآلي على الكلام في الموارد المنخفضة بشكل كبير من خلال الاستفادة من ترجمات الماندرين والتمثيلات المتعددة اللغات، محققًا انخفاضًا نسبيًا بنسبة 14.77% في معدل خطأ الحروف.

Cheng-Yeh Yang, Chien-Chun Wang, Li-Wei Chen, Hung-Shin Lee, Hsin-Min Wang, Berlin Chen2026-02-26
💬 NLP

Confidence-Driven Multi-Scale Model Selection for Cost-Efficient Inference

تقترح الورقة استراتيجية اختيار نماذج متعددة المقاييس مدفوعة بالثقة، تقوم بتوجيه المهام ديناميكياً إلى نماذج أصغر أو أكبر بناءً على الدقة المقدرة، مما يحقق أداءً مقارناً لأكبر النماذج مع تقليل التكاليف الحسابية واستهلاك رموز الـ API بشكل كبير.

Bo-Wei Chen, Chung-Chi Chen, An-Zi Yen2026-02-26
💬 NLP

IndicIFEval: A Benchmark for Verifiable Instruction-Following Evaluation in 14 Indic Languages

تقدم هذه الورقة IndicIFEval، وهو معيار مرجعي يتكون من 800 مثال تم التحقق منها بشرياً عبر 14 لغة هندية لتقييم قدرات النماذج اللغوية الكبيرة في اتباع التعليمات، مما يكشف أنه بينما تلتزم النماذج جيداً بقيود التنسيق، إلا أنها تتخلف بشكل كبير عن الأداء باللغة الإنجليزية في المهام المعجمية وعبر اللغوية.

Thanmay Jayakumar, Mohammed Safi Ur Rahman Khan, Raj Dabre, Ratish Puduppully, Anoop Kunchukuttan2026-02-26
💬 NLP

When AI Writes, Whose Voice Remains? Quantifying Cultural Marker Erasure Across World English Varieties in Large Language Models

تقدم هذه الدراسة مفهوم "التلاشي الثقافي" (Cultural Ghosting) لقياس كيفية قيام النماذج اللغوية الكبيرة بمحو العلامات اللغوية من تنوعات اللغة الإنجليزية غير الأصلية، مثل الإنجليزية الهندية والسنغافورية والنيجيرية، مما يكشف عن مفارقة حيث يتم الحفاظ على المعنى الدلالي بينما تضيع الهوية الثقافية، رغم أن المطالبات الصريحة يمكن أن تخفف من هذا المحو بشكل كبير.

Satyam Kumar Navneet, Joydeep Chandra, Yong Zhang2026-02-26
💬 NLP

SumTablets: A Transliteration Dataset of Sumerian Tablets

تقدم هذه الورقة البحثية SumTablets، وهي مجموعة بيانات شاملة تزاوج بين 91,606 لوحاً من الكتابة المسمارية السومرية ونصوصها المترجمة من Oracc لتمكين تطبيقات معالجة اللغات الطبيعية الحديثة، مبرهنةً على أن نماذج اللغة ذات التوليد الذاتي والضبط الدقيق يمكنها تحقيق دقة عالية (97.55 chrF) في أتمتة عملية الترجمة الحرفية.

Cole Simmons, Richard Diehl Martinez, Dan Jurafsky2026-02-26
💬 NLP

Recovered in Translation: Efficient Pipeline for Automated Translation of Benchmarks and Datasets

تقدم هذه الورقة البحثية "Recovered in Translation"، وهو إطار عمل مؤتمت يستفيد من استراتيجيات توسيع نطاق الحوسبة في وقت الاختبار مثل التحسين الذاتي الشامل وطريقة T-RANK المبتكرة لإنتاج ترجمات عالية الجودة ومحافظة على المعنى للمعايسات المرجعية إلى ثماني لغات من شرق وجنوب أوروبا، وذلك للتغلب على قيود الموارد الحالية وتمكين تقييم أكثر موثوقية للنماذج اللغوية الكبيرة متعددة اللغات.

Hanna Yukhymenko, Anton Alexandrov, Martin Vechev2026-02-26