💬 NLP

Neuron-Aware Data Selection In Instruction Tuning For Large Language Models

تقترح الورقة البحثية إطار عمل NAIT، وهو إطار عمل مبتكر يحسن ضبط تعليمات النماذج اللغوية الكبيرة من خلال اختيار مجموعات فرعية مثالية من البيانات بناءً على تشابه أنماط تنشيط العصبونات بين العينات المرشحة وقدرات المجال المستهدف، مما يثبت أن هذا النهج يتفوق على الأساليب الحالية ويكشف عن القابلية القوية لنقل الميزات المنطقية والبرمجية عبر المهام المتنوعة.

Xin Chen, Junchao Wu, Shu Yang, Runzhe Zhan, Zeyu Wu, Min Yang, Shujian Huang, Lidia S. Chao, Derek F. Wong2026-03-16
💬 NLP

Llettuce: An Open Source Natural Language Processing Tool for the Translation of Medical Terms into Uniform Clinical Encoding

تقدم هذه الورقة Llettuce، وهي أداة مفتوحة المصدر لمعالجة اللغات الطبيعية ومتوافقة مع اللائحة العامة لحماية البيانات (GDPR)، تستخدم النماذج اللغوية الكبيرة والمطابقة الضبابية لأتمتة وتحسين عملية ربط المصطلحات الطبية غير الرسمية بمفاهيم معيار OMOP، مما يعالج أوجه القصور في الحلول الحالية التي تعتمد بكثافة على العمل اليدوي.

James Mitchell-White, Reza Omdivar, Benjamin Partridge, Esmond Urwin, Karthikeyan Sivakumar, Ruizhe Li, Andy Rae, Xiaoya (…)2026-03-13
💬 NLP

Structured Agent Distillation for Large Language Model

تقترح الورقة البحثية "تقطير الوكيل المهيكل" (Structured Agent Distillation)، وهو إطار عمل يعمل على ضغط وكلاء النماذج اللغوية الكبيرة إلى نماذج أصغر وأكثر كفاءة من خلال تطبيق خسائر محددة للنطاق لمحاذاة مقاطع الاستدلال والعمل، مما يؤدي إلى التفوق على التقطير القياسي على مستوى الرمز مع الحفاظ على دقة اتخاذ القرار.

Jun Liu, Zhenglun Kong, Peiyan Dong, Changdi Yang, Tianqi Li, Hao Tang, Geng Yuan, Wei Niu, Wenbin Zhang, Pu Zhao, Xue L (…)2026-03-13
💬 NLP

ReasonMap: Towards Fine-Grained Visual Reasoning from Transit Maps

تقدم هذه الورقة البحثية "ReasonMap"، وهو معيار مرجعي جديد يتكون من خرائط نقل عالية الدقة وأزواج متنوعة من الأسئلة والأجوبة لتقييم قدرات الاستدلال البصري دقيقة التفاصيل للنماذج اللغوية الكبيرة متعددة الوسائط، كاشفةً أن النماذج الأساسية مفتوحة المصدر غالباً ما تفوق نظيراتها التي خضعت للضبط الدقيق للاستدلال، مع التأكيد على الحاجة الماسة للربط البصري المباشر بدلاً من الأولويات اللغوية.

Sicheng Feng, Song Wang, Shuyi Ouyang, Lingdong Kong, Zikai Song, Jianke Zhu, Huan Wang, Xinchao Wang2026-03-13
💬 NLP

Swiss Parliaments Corpus Re-Imagined (SPC_R): Enhanced Transcription with RAG-based Correction and Predicted BLEU

تقدم هذه الورقة البحثية "مجموعة بيانات البرلمان السويسري المُعاد تصورها" (SPC_R)، وهي مجموعة بيانات عالية الجودة طويلة التنسيق تتكون من 555 ساعة من المناظرات البرلمانية باللغة الألمانية السويسرية، والتي أُنشئت عبر تفريغ المقاطع الصوتية باستخدام نموذج Whisper Large-v3، وتنقيتها من خلال عملية تصحيح ثنائية الخطوات باستخدام GPT-4o، وتصفية المقاطع بناءً على درجات مقياس BLEU المتوقعة واكتمال المعنى لتحقيق تحسن قدره 6 نقاط في مقياس BLEU مقارنة بالإصدارات السابقة على مستوى الجملة.

Vincenzo Timmel, Manfred Vogel, Daniel Perruchoud, Reza Kakooee2026-03-13
💬 NLP

Multi-lingual Functional Evaluation for Large Language Models

تقدم هذه الورقة معايير مرجعية وظيفية متعددة اللغات (CL-GSM Symbolic و CL-IFEval) عبر خمس لغات لتوضيح أن التقييمات متعددة اللغات الثابتة غالباً ما تبالغ في تقدير أداء النماذج ومتانتها مقارنة بالتقييمات العملية القائمة على المهام.

Victor Ojewale, Inioluwa Deborah Raji, Suresh Venkatasubramanian2026-03-13
💬 NLP

NeuralOS: Towards Simulating Operating Systems via Neural Generative Models

يُعد NeuralOS إطار عمل عصبي يحاكي واجهات المستخدم الرسومية لأنظمة التشغيل عبر الجمع بين شبكة عصبية متكررة لتتبع الحالة ومُصوّر يعتمد على الانتشار لتوليد إطارات شاشة واقعية استجابةً لمدخلات المستخدم، مما يظهر القدرة على تعلم وتخليق التفاعلات لكل من التطبيقات الحالية وغير المرئية من بيانات التدريب.

Luke Rivard, Sun Sun, Hongyu Guo, Wenhu Chen, Yuntian Deng2026-03-13
💬 NLP

Seq vs Seq: An Open Suite of Paired Encoders and Decoders

تقدم الورقة البحثية مجموعة "إيتين" (Ettin)، وهي تشكيلة من نماذج المشفّر فقط (encoder-only) والنماذج المفككة فقط (decoder-only) المزدوجة، والتي تم تدريبها على بيانات ووصفات متطابقة، حيث تحقق أداءً قياسياً جديداً لأحجامها مع إثبات أن البنى الأصلية تتفوق بشكل كبير على النماذج المُكيَّفة في مهامها المتخصصة.

Orion Weller, Kathryn Ricci, Marc Marone, Antoine Chaffin, Dawn Lawrie, Benjamin Van Durme2026-03-13
💬 NLP

On the Theoretical Limitations of Embedding-Based Retrieval

تُظهر هذه الورقة البحثية أن الاسترجاع القائم على التضمين يواجه قيوداً نظرية جوهرية حيث يتقيد عدد مجموعات الوثائق (top-k) التي يمكن تحقيقها بأبعاد التضمين، وهو عائق يستمر حتى مع التدريب الأمثل ويتسبب في فشل النماذج الحديثة في أداء مهام بسيطة وواقعية.

Orion Weller, Michael Boratko, Iftekhar Naim, Jinhyuk Lee2026-03-13
💬 NLP

NormGenesis: Multicultural Dialogue Generation via Exemplar-Guided Social Norm Modeling and Violation Recovery

تقدم الورقة البحثية NormGenesis، وهو إطار عمل متعدد الثقافات يقوم بتوليد وتوسيم 10,800 حوار متجذر اجتماعياً باللغات الإنجليزية والصينية والكورية من خلال توظيف صقل موجه بالأمثلة ونوع حوار مبتكر من "الانتهاك إلى الإصلاح" (V2R) لنمذجة انتهاكات المعايير وإصلاحها، مما يعزز بشكل كبير الكفاءة البراغماتية والقدرة على التكيف الثقافي لأنظمة الحوار.

Minki Hong, Jangho Choi, Jihie Kim2026-03-13