💬 NLP

Structured Causal Video Reasoning via Multi-Objective Alignment

تقدم الورقة البحثية Factum-4B، وهو نموذج استدلال مرئي يسد الفجوة بين البنى المعرفية البشرية ونماذج الفيديو اللغوية الكبيرة الحالية من خلال توليد حقائق أحداث مهيكلة واستخدام إطار تعلم تعزيزي متعدد الأهداف للموازنة بين الدقة السببية وكفاءة الاستدلال.

Zinuo Li, Yongxin Guo, Jun Liu, Jiawei Zhan, Xi Jiang, Chengjie Wang, Mohammed Bennamoun, Farid Boussaid, Feng Zheng, Qi (…)2026-04-07
💬 NLP

DeonticBench: A Benchmark for Reasoning over Rules

تقدم هذه الورقة DeonticBench، وهو معيار شامل يتكون من 6,232 مهمة عبر مجالات قانونية وسياساتية أمريكية متنوعة لتقييم وتحسين قدرة النماذج اللغوية الكبيرة على أداء الاستدلال الوجوبي المعقد والمحدد سياقياً من خلال سير عمل يعتمد على كل من اللغة الطبيعية ولغة البرمجة الرمزية Prolog.

Guangyao Dou, Luis Brena, Akhil Deo, William Jurayj, Jingyu Zhang, Nils Holzenberger, Benjamin Van Durme2026-04-07
💬 NLP

Conversational Control with Ontologies for Large Language Models: A Lightweight Framework for Constrained Generation

تقترح هذه الورقة إطار عمل خفيف الوزن ومستقلاً عن النموذج، يستخدم التعريفات الأنطولوجية كقيود وإجراء ضبط دقيق هجين لتحقيق تحكم معياري وقابل للتفسير ومحسن في مخرجات النماذج اللغوية الكبيرة لأهداف محادثة محددة مثل مستوى الكفاءة والقطبية.

Barbara Gendron, Gaël Guibon, Mathieu d'Aquin2026-04-07
🤖 AI

Empirical Characterization of Rationale Stability Under Controlled Perturbations for Explainable Pattern Recognition

تقدم هذه الورقة مقياساً جديداً يعتمد على تشابه جيب التمام لقيم "شاب" (SHAP) لتقييم استقرار تفسيرات النماذج تحت تأثير الاضطرابات الحافظة للتسميات، مما يثبت فعاليتها في تحديد أنماط الإسناد غير المتسقة والسلوكيات غير المتوافقة في نماذج تحليل المشاعر مثل "بيرت" (BERT) و"روبيرتا" (RoBERTa).

Abu Noman Md Sakib, Zhensen Wang, Merjulah Roby, Zijie Zhang2026-04-07
🤖 AI

What Makes a Sale? Rethinking End-to-End Seller--Buyer Retail Dynamics with LLM Agents

تقدم الورقة البحثية RetailSim، وهو إطار عمل لمحاكاة التجزئة متكامل الأطراف مدعوم بوكلاء النماذج اللغوية الكبيرة (LLM agents) يوحد بين إقناع البائع، والتفاعل بين البائع والمشتري، وقرارات الشراء لنمذجة التبعيات عبر المراحل بدقة وتقييم استراتيجيات التجزئة من خلال الدقة السلوكية والانتظامات الاقتصادية.

Jeonghwan Choi, Jibin Hwang, Gyeonghun Sun, Minjeong Ban, Taewon Yun, Hyeonjae Cheon, Hwanjun Song2026-04-07
🧬 biology

Same Geometry, Opposite Noise: Transformer Magnitude Representations Lack Scalar Variability

تُظهر هذه الورقة أنه بينما تلتقط النماذج اللغوية القائمة على المحولات الهندسة الانضغاطية اللوغاريتمية للمقادير العددية، إلا أنها تفشل في إظهار التباين القياسي الملحوظ بيولوجياً (معامل الاختلاف الثابت)، حيث تُظهر بدلاً من ذلك ضجيجاً تمثيلياً يتناقص مع زيادة المقدار.

Jon-Paul Cacioli2026-04-07
🤖 AI

SuperLocalMemory V3.3: The Living Brain -- Biologically-Inspired Forgetting, Cognitive Quantization, and Multi-Channel Retrieval for Zero-LLM Agent Memory Systems

يُعد SuperLocalMemory V3.3 نظام ذاكرة للوكلاء يعتمد على المعالج المركزي ومفتوح المصدر، ويحقق أداءً رائدًا في استرجاع البيانات بدون نموذج لغوي كبير (zero-LLM) من خلال دمج النسيان المستوحى بيولوجيًا، ومقاييس "فيشر-راو" المدركة للكمية، وبنية استرجاع معرفي مبتكرة ذات سبعة قنوات.

Varun Pratap Bhardwaj2026-04-07
💬 NLP

CommonMorph: Participatory Morphological Documentation Platform

تقدم الورقة البحثية CommonMorph، وهي منصة تشاركية مفتوحة المصدر تسرع عملية التوثيق الصرفي للغات ذات الموارد المنخفضة من خلال الجمع بين تعريفات الخبراء، والاستقصاء المجتمعي، والتعلم النشط لإنتاج مجموعات بيانات قابلة للتشغيل البيني ومتوافقة مع معيار UniMorph.

Aso Mahmudi, Sina Ahmadi, Kemal Kurniawan, Rico Sennrich, Eduard Hovy, Ekaterina Vylomova2026-04-07
💬 NLP

Multilingual Prompt Localization for Agent-as-a-Judge: Language and Backbone Sensitivity in Requirement-Level Evaluation

تُظهر هذه الورقة أن ترتيب أداء أطر عمل الوكيل المطور (developer-agent frameworks) حساس للغاية للغة التقييم والنموذج الأساسي للحكم (judge backbone)، مما يكشف عن عدم هيمنة نموذج واحد عبر جميع اللغات، وأن توطين تعليمات الحكم أمر بالغ الأهمية لضمان دقة التقييم متعدد اللغات.

Alhasan Mahmood, Samir Abdaljalil, Hasan Kurban2026-04-07
💬 NLP

Mapping the Exploitation Surface: A 10,000-Trial Taxonomy of What Makes LLM Agents Exploit Vulnerabilities

من خلال دراسة منهجية شملت ١٠,٠٠٠ تجربة عبر سبعة نماذج، يكشف هذا البحث أنه بينما تفشل معظم تقنيات التلقين العدائي الشائعة في تحفيز وكلاء النماذج اللغوية الكبيرة على استغلال الثغرات، فإن تعليمات "إعادة صياغة الهدف" المحددة التي تعيد تفسير المهام كأحاجي تتجاوز قواعد السلامة بشكل موثوق، مما يشير إلى ضرب على المدافعين إعطاء الأولوية للتدقيق في هذا النمط اللغوي الخفي بدلاً من الفئات العدائية الواسعة.

Charafeddine Mouzouni2026-04-07