💬 NLP

Clinical Note Bloat Reduction for Efficient LLM Use

تقدم الورقة البحثية TRACE، وهو خط معالجة مسبقة قابل للتوسع يستفيد من البيانات الوصفية للسجلات الصحية الإلكترونية وإزالة التكرار القائم على التكرار لإزالة ما يقرب من نصف "تضخم الملاحظات" الزائد في التوثيق السريري، مما يقلل بشكل كبير من تكاليف استدلال النماذج اللغوية الكبيرة مع الحفاظ على الأداء في المهام السريرية اللاحقة.

Jordan L. Cahoon, Chloe Stanwyck, Asad Aali, Rachel Madding, Emma Sun, Yixing Jiang, Renumathy Dhanasekaran, Emily Alsen (…)2026-04-21
💬 NLP

Cross-Family Speculative Decoding for Polish Language Models on Apple~Silicon: An Empirical Evaluation of Bielik~11B with UAG-Extended MLX-LM

تقدم هذه الورقة تقييماً تجريبياً لفك التشفير التخميني عبر العائلات المختلفة لنماذج اللغة البولندية على معالجات "Apple Silicon"، حيث تُظهر أنه في حين أن ترجمة الرموز المدركة للسياق تحسن معدلات القبول، فإن قيود عرض نطاق الذاكرة الموحدة وعدم توافق أجهزة الترميز تحد من مكاسب الإنتاجية، لا سيما عندما تضعف أداء نماذج المسودة المتخصصة مقارنة بالبدائل العامة.

Krzysztof Fonal2026-04-21
💬 NLP

Brain-CLIPLM: Decoding Compressed Semantic Representations in EEG for Language Reconstruction

يقترح نموذج Brain-CLIPLM فرضية ضغط دلالي لفك تشفير إشارات الدماغ (EEG)، حيث يثبت أن إطار عمل ثنائي المراحل يستخرج الركائز الدلالية عبر التعلم التبايني ويعيد بناء الجمل باستخدام نموذج لغوي كبير قائم على الاسترجاع، يتفوق بشكل كبير على فك التشفير المباشر من خلال مواءمة تعقيد إعادة البناء مع السعة المعلوماتية الجوهرية لإشارات الدماغ غير الغازية.

Xiaoli Yang, Huiyuan Tian, Yurui Li, Jianyu Zhang, Shijian Li, Gang Pan2026-04-21
💬 NLP

CFMS: Towards Explainable and Fine-Grained Chinese Multimodal Sarcasm Detection Benchmark

تقدم هذه الورقة البحثية مجموعة بيانات CFMS، وهي أول مجموعة بيانات صينية متعددة الوسائط للسخرية ذات دقة عالية تتميز بتعليقات توضيحية ثلاثية المستويات ومجموعة فرعية للاستعارة، إلى جانب استراتيجية التعلم في السياق المعززة بالتعلم التعزيزي (PGDS) التي تحسن بشكل كبير أداء اكتشاف السخرية وتوليد التفسيرات.

Junzhao Zhang, Hsiu-Yuan Huang, Chenming Tang, Yutong Yang, Yunfang Wu2026-04-21
💬 NLP

GoCoMA: Hyperbolic Multimodal Representation Fusion for Large Language Model-Generated Code Attribution

تقدم هذه الورقة البحثية GoCoMA، وهو إطار عمل متعدد الوسائط يستفيد من الهندسة الزائدية لدمج أسلوب الكتابة البرمجية وصور المخرجات الثنائية ما قبل التنفيذية لعزو الكود المولد بواسطة النماذج اللغوية الكبيرة بدقة إلى نموذجها المصدر، متفوقاً بذلك على النماذج المرجعية أحادية الوسائط والنموذج الإقليدي.

Nitin Choudhury, Bikrant Bikram Pratap Maurya, Bhavinkumar Vinodbhai Kuwar, Arun Balaji Buduru2026-04-21
💬 NLP

Data Mixing for Large Language Models Pretraining: A Survey and Outlook

تقدم هذه الورقة مسحاً شاملاً لطرق خلط البيانات لتدريب النماذج اللغوية الكبيرة، حيث تقدم تعريفاً رسمياً للمشكلة، وتصنيفاً دقيقاً يميز بين النهجين الاستاتيكي والديناميكي، وتحليلاً للمفاضلة بين الأداء والتكلفة، وخارطة طريق لاتجاهات البحث المستقبلية.

Zhuo Chen, Yuxuan Miao, Supryadi, Deyi Xiong2026-04-21
💬 NLP

LiFT: Does Instruction Fine-Tuning Improve In-Context Learning for Longitudinal Modelling by Large Language Models?

تقدم الورقة البحثية LiFT، وهو إطار عمل للضبط الدقيق التعليمي الطولي يستخدم نهجاً قائماً على المنهج الدراسي لتعزيز قدرة النماذج اللغوية الكبيرة بشكل كبير على التعلم في السياق في مهام الاستدلال الزمني، مما يظهر تحسينات مستمرة مقارنة بالنماذج الأساسية في تتبع التفاعلات المتطورة وكشف أحداث التغيير النادرة عبر مجموعات بيانات وأحجام نماذج متنوعة.

Iqra Ali, Talia Tseriotou, Mahmud Elahi Akhter, Yuxiang Zhou, Maria Liakata2026-04-21
💬 NLP

Measuring the Gap Between Media Coverage and Public Information Demand: Evidence from the 2026 Lebanon Conflict

تكشف هذه الدراسة عن انفصال كبير خلال صراع لبنان في مارس ٢٠٢٦، حيث ركزت التغطية الإعلامية بشكل ساحق على الأحداث العسكرية (٩٤.٩٪) بينما كان الطلب الشعبي على المعلومات، كما تم قياسه عبر اتجاهات البحث، مدفوعاً في المقام الأول بالظروف الاقتصادية، والحياة اليومية، والهجرة (٦٣.١٪).

Mohamed Soufan2026-04-21
💬 NLP

Measuring Representation Robustness in Large Language Models for Geometry

تقدم هذه الورقة إطار عمل "GeoRepEval"، الذي يوضح أن النماذج اللغوية الكبيرة تظهر فجوات أداء كبيرة وإخفاقات مرتبطة بتمثيل البيانات في الاستدلال الهندسي — لا سيما مع الصيغ المتجهة — مما يكشف أن النماذج الحالية تعتمد على استدلالات سطحية بدلاً من فهم هندسي تجريدي متين.

Vedant Jawandhia, Yash Sinha, Murari Mandal, Ankan Pal, Dhruv Kumar2026-04-21
💬 NLP

Injecting Structured Biomedical Knowledge into Language Models: Continual Pretraining vs. GraphRAG

تقارن هذه الورقة بين استراتيجيتين لدمج المعرفة الطبية الحيوية المهيكلة من "UMLS Metathesaurus" في النماذج اللغوية —وهما التدريب المسبق المستمر وGraphRAG— حيث تُظهر أن التدريب المسبق يحقق مكاسب متواضعة في مهام محددة، بينما يوفر GraphRAG تحسينات فائقة وشفافة ولا تتطلب إعادة تدريب على الإجابة على الأسئلة الطبية الحيوية.

Jaafer Klila, Sondes Bannour Souihi, Rahma Boujelben, Nasredine Semmar, Lamia Hadrich Belguith2026-04-21