💻 computer science

Taming CATS: Controllable Automatic Text Simplification through Instruction Fine-Tuning with Control Tokens

تقدم هذه الورقة إطار عمل غير مرتبط بنطاق محدد للتبسيط التلقائي للنصوص القابل للتحكم (CATS) باستخدام الضبط الدقيق للتعليمات مع رموز التحكم، مما يثبت أنه في حين يمكن للنماذج الأصغر تحقيق تحكم ثابت في سهولة القراءة، فإن الضغط الموثوق والتقييم يعتمدان بشكل حاسم على تنوع بيانات التدريب واعتماد المقاييس القائمة على الأخطاء لمعالجة أوجه القصور في المجموعات الحالية من البيانات وممارسات التقييم القياسية.

Hanna Hubarava, Yingqiang Gao2026-04-03
🤖 machine learning

Language-Pretraining-Induced Bias: A Strong Foundation for General Vision Tasks

تتحدى هذه الورقة الافتراض القائل بأن النماذج المدربة لغوياً غير مناسبة لمهام الرؤية، وذلك من خلال إثبات أن مرحلة "تدريب جسر الملصقات العشوائية" البسيطة والخالية من الملصقات يمكن أن توائم بفعالية بين معاملات النماذج اللغوية الكبيرة والأسس البصرية، مما يكشف أن التكيف الجزئي غالباً ما يحافظ على الخصائص التأسيسية المفيدة عبر الوسائط المختلفة.

Yaxin Luo, Zhiqiang Shen2026-04-03
💻 computer science

Is Clinical Text Enough? A Multimodal Study on Mortality Prediction in Heart Failure Patients

تُظهر هذه الدراسة أن الدمج متعدد الوسائط الخاضع للإشراف للنصوص السريرية مع التمثيلات على مستوى الكيانات والبيانات المهيكلة يتفوق على كل من النهج المعتمد على النصوص فقط ونهج النماذج اللغوية الكبيرة الحالية للتنبؤ بالوفاة على المدى القصير لدى مرضى فشل القلب.

Oumaima El Khettari, Virgile Barthet, Guillaume Hocquet, Joconde Weller, Emmanuel Morin, Pierre Zweigenbaum2026-04-03
💻 computer science

ImplicitBBQ: Benchmarking Implicit Bias in Large Language Models through Characteristic Based Cues

تقدم الورقة البحثية ImplicitBBQ، وهو معيار مرجعي جديد يستخدم إشارات قائمة على الخصائص للكشف عن أن النماذج اللغوية الكبيرة تظهر تحيزات ضمنية أعلى بكثير عبر مختلف الفئات الديموغرافية مقارنة بالتحيزات الصريحة، وهي فجوة تفشل استراتيجيات السلامة والتحفيز الحالية في معالجتها بشكل كافٍ.

Bhaskara Hanuma Vedula, Darshan Anghan, Ishita Goyal, Ponnurangam Kumaraguru, Abhijnan Chakraborty2026-04-03
💻 computer science

Reliable News or Propagandist News? A Neurosymbolic Model Using Genre, Topic, and Persuasion Techniques to Improve Robustness in Classification

تقترح هذه الورقة نموذجاً عصبياً رمزياً يجمع بين تمثيلات النصوص غير السياقية والميزات الرمزية مثل النوع، والموضوع، وتقنيات الإقناع لتعزيز متانة وتعميم كشف الدعاية مقارنة بنهج النماذج اللغوية القياسية.

Géraud Faye, Benjamin Icard, Morgane Casanova, Guillaume Gadek, Guillaume Gravier, Wassila Ouerdane, Céline Hudelot, Syl (…)2026-04-03
🤖 machine learning

RuleForge: Automated Generation and Validation for Web Vulnerability Detection at Scale

يُعد RuleForge نظاماً داخلياً في AWS يعمل على أتمتة توليد والتحقق من قواعد اكتشاف ثغرات الويب من قوالب Nuclei باستخدام نظام ثقة مبتكر يعتمد على "النموذج اللغوي الكبير كحَكَم" (LLM-as-a-judge) واستراتيجية تحسين تكرارية، مما يقلل بشكل كبير من الإيجابيات الكاذبة مع معالجة حجم عمليات الكشف عن الثغرات الأمنية (CVE) الحديثة.

Ayush Garg, Sophia Hager, Jacob Montiel, Aditya Tiwari, Michael Gentile, Zach Reavis, David Magnotti, Wayne Fullen2026-04-03
💻 computer science

SAFE: Stepwise Atomic Feedback for Error correction in Multi-hop Reasoning

تقدم الورقة البحثية SAFE، وهو إطار عمل مرجعي ديناميكي يستبدل استدلال "سلسلة الأفك‏ت" (Chain-of-Thought) غير المستند إلى أسس بمتتالية من الكيانات المرتكزة القابلة للتحقق بدقة من خلال التحقق أثناء التدريب والتغذية الراجعة أثناء الاستنتاج، مما يقضي على الصحة الزائفة في أسئلة وأجوبة الاستجواب متعدد الخطوات ويحسن دقة النموذج بشكل كبير.

Daeyong Kwon, Soyoung Yoon, Seung-won Hwang2026-04-03
💻 computer science

kkNNProxy: Efficient Training-Free Proxy Alignment for Black-Box Zero-Shot LLM-Generated Text Detection

تقترح الورقة البحثية kkNNProxy، وهو إطار عمل خالٍ من التدريب وفعال في الاستعلام، يعمل على مواءمة نموذج لغوي كبير (LLM) وسيط ثابت مع نماذج مصدرية مجهولة باستخدام آلية استرجاع أقرب kk جيران عبر مخزن بيانات خفيف الوزن، مما يتيح كشفاً قوياً لصفرِي للّغة المولدة بواسطة النماذج اللغوية الكبيرة دون الحاجة إلى الضبط الدقيق أو تفاعلات متكررة مع واجهة برمجة التطبيقات (API).

Kahim Wong, Kemou Li, Haiwei Wu, Jiantao Zhou2026-04-03
⚡ electrical engineering

Tracking the emergence of linguistic structure in self-supervised models learning from speech

تتقصى هذه الورقة البحثية ظهور البنية اللغوية في نماذج الكلام ذات التعلم الذاتي المدربة على اللغة الهولندية، كاشفةً أن المستويات اللغوية المختلفة تظهر أنماطاً ومسارات تعلم متباينة عبر الطبقات، تتأثر بمدى تجريدها من الإشارات الصوتية وبأهداف ما قبل التدريب المحددة المستخدمة.

Marianne de Heer Kloots, Martijn Bentum, Hosein Mohebbi, Charlotte Pouw, Gaofei Shen, Willem Zuidema2026-04-03
💻 computer science

BidirLM: From Text to Omnimodal Bidirectional Encoders by Adapting and Composing Causal LLMs

تقدم هذه الورقة البحثية BidirLM، وهي عائلة من المشفرات ثنائية الاتجاه عالية الأداء التي تم إنشاؤها عبر تكييف نماذج اللغات الكبيرة السببية بشكل منهجي من خلال مرحلة قناع مسبق مبتكرة، واستراتيجية مزدوجة لدمج الأوزان الخطية ومزيج البيانات لمنع النسيان الكارثي، والتركيب مع نماذج سببية متخصصة لدمج القدرات متعددة الوسائط بسلاسة.

Nicolas Boizard, Théo Deschamps-Berger, Hippolyte Gisserot-Boukhlef, Céline Hudelot, Pierre Colombo2026-04-03