🤖 AI

Proof-of-Guardrail in AI Agents and What (Not) to Trust from It

تقترح هذه الورقة نظام "إثبات الحواجز الوقائية" (Proof-of-Guardrail)، وهو نظام يستفيد من بيئات التنفيذ الموثوقة لتوفير إثبات تشفيري وقابل للتحقق بأن وكلاء الذكاء الاصطناعي يفرضون تدابير سلامة محددة، مما يعالج تهديد السلامة المعلنة كذباً مع الإقرار بالمخاطر المتبقية مثل عمليات كسر الحماية النشطة.

Xisen Jin, Michael Duan, Qin Lin, Aaron Chan, Zhenglun Chen, Junyi Du, Xiang Ren2026-03-09
🤖 machine learning

Test-Time Adaptation via Many-Shot Prompting: Benefits, Limits, and Pitfalls

تقيم هذه الورقة تجريبياً فعالية ومحدودية التلقين متعدد الأمثلة (many-shot prompting) للتكيف أثناء وقت الاختبار في النماذج اللغوية الكبيرة، حيث وجدت أنه بينما يفيد المهام المهيكلة ذات كسب المعلومات العالي، فإن أداءه حساس للغاية لاستراتيجيات الاختيار وغالباً ما يحقق تحسينات محدودة في التوليد مفتوح النهايات.

Shubhangi Upasani, Chen Wu, Jay Rainton, Bo Li, Changran Hu, Qizheng Zhang, Urmish Thakker2026-03-09
💬 NLP

Building an Ensemble LLM Semantic Tagger for UN Security Council Resolutions

تقدم هذه الورقة منهجية تجميعية فعالة من حيث التكلفة باستخدام النماذج اللغوية الكبيرة (LLMs) ومقاييس تقييم مبتكرة (نسبة الحفاظ على المحتوى، وسلامة صياغة الوسوم) لتحقيق وسم دلالي دقيق وموثوق لقرارات مجلس الأمن التابع للأمم المتحدة مع تقليل الهلوسة إلى أدنى حد.

Hussein Ghaly2026-03-09
💬 NLP

InfoGatherer: Principled Information Seeking via Evidence Retrieval and Strategic Questioning

يُعد InfoGatherer إطار عمل مبدئيًا للإجابة على الأسئلة المستندة إلى الوثائق في الحالات عالية المخاطر، حيث يجمع بين الأدلة المسترجعة والأسئلة الاستراتيجية للمستخدم، مستخدمًا تعيينات الاعتقاد لـ "دمبستر-شيفر" لنمذجة عدم اليقين وتحسين موثوقية القرار مع تقليل عدد جولات التفاعل.

Maksym Taranukhin, Shuyue Stella Li, Evangelos Milios, Geoff Pleiss, Yulia Tsvetkov, Vered Shwartz2026-03-09
🤖 AI

Addressing the Ecological Fallacy in Larger LMs with Human Context

تُثبت هذه الورقة أن معالجة المغالطة البيئية من خلال نمذجة السياق اللغوي للمؤلف عبر مهمة محددة تسمى HuLM، لا سيما أثناء الضبط الدقيق (HuFT) أو التدريب المسبق المستمر، يحسن بشكل كبير أداء نموذج Llama بحجم 8 مليار بارامتر عبر مهام متعددة لاحقة مقارنة بطرق التدريب القياسية.

Nikita Soni, Dhruv Vijay Kunjadiya, Pratham Piyush Shah, Dikshya Mohanty, H. Andrew Schwartz, Niranjan Balasubramanian2026-03-09
🤖 machine learning

Implicit Style Conditioning: A Structured Style-Rewrite Framework for Low-Resource Character Modeling

تقترح هذه الورقة إطار عمل لإعادة صياغة الأسلوب المهيكل يجمع بين الفصل الصريح للأبعاد الأسلوبية والاشتراط الضمني لسلسلة الأفك "Chain-of-Thought" لتمكين النماذج اللغوية الصغيرة من تحقيق تقمص أدوار الشخصيات بدقة عالية واتساق دون الحاجة إلى رموز استدلال صريحة أثناء الاستدلال.

Chanhui Zhu2026-03-09
🤖 AI

Who We Are, Where We Are: Mental Health at the Intersection of Person, Situation, and Large Language Models

تقترح هذه الورقة نهجاً للنمذجة القابلة للتفسير يدمج السمات النفسية على مستوى الفرد مع سمات السياق الموقفي المستمدة من بيانات وسائل التواصل الاجتماعي للتنبؤ بالرفاهية النفسية الديناميكية، مما يثبت أن الأساليب القائمة على النظرية تقدم أداءً تنافسياً ورؤى أكثر قابلية للفهم البشري مقارنة بتضمينات النماذج اللغوية القياسية.

Nikita Soni, August Håkan Nilsson, Syeda Mahwish, Vasudha Varadarajan, H. Andrew Schwartz, Ryan L. Boyd2026-03-09
💬 NLP

Track-SQL: Enhancing Generative Language Models with Dual-Extractive Modules for Schema and Context Tracking in Multi-turn Text-to-SQL

يُعد Track-SQL إطار عمل مبتكر يعزز نماذج اللغة التوليدية لمهام تحويل النص إلى SQL متعددة الجولات من خلال دمج وحدات استخراج مزدوجة لتتبع المخطط الدلالي والسياق، محققاً أداءً هو الأفضل في فئته على مجموعتي بيانات SparC وCoSQL.

Bingfeng Chen, Shaobin Shi, Yongqi Luo, Boyan Xu, Ruichu Cai, Zhifeng Hao2026-03-09
🤖 AI

Evaluating Austrian A-Level German Essays with Large Language Models for Automated Essay Scoring

تقيم هذه الورقة أداء أربعة من النماذج اللغوية الكبيرة ذات الأوزان المفتوحة والأحدث حالياً في تصحيح مقالات اللغة الألمانية لمستوى (A-level) النمساوي باستخدام مطالبات قائمة على معايير التقييم، لتجد أنه على الرغم من قدرتها على تطبيق معايير موحدة، إلا أن معدلات توافقها المنخفضة مع الخبراء البشريين (بحد أقصى 40.6% في الأبعاد الفرعية و32.8% في الدرجات النهائية) تجعلها غير مناسبة حالياً للتصحيح الآلي في العالم الحقيقي.

Jonas Kubesch, Lena Huber, Clemens Havas2026-03-09
🤖 machine learning

Diffusion Language Models Are Natively Length-Aware

تقترح هذه الورقة آلية "صفرية التدريب" (zero-shot) تستفيد من تمثيلات المطالبات الكامنة لقص نافذة السياق الثابتة لنماذج اللغات الانتشارية ديناميكيًا قبل عملية التوليد، مما يقلل التكاليف الحسابية بشكل كبير مع الحفاظ على الأداء أو تحسينه عبر المهام المتنوعة.

Vittorio Rossi, Giacomo Cirò, Davide Beltrame, Luca Gandolfi, Paul Röttger, Dirk Hovy2026-03-09