💬 NLP

Not Worth Mentioning? A Pilot Study on Salient Proposition Annotation

تقدم هذه الورقة دراسة استطلاعية تعمل على تشغيل بروز القضية المتدرج من خلال تحديد مهمة وسم، وتطبيقها على مجموعة بيانات متعددة الأنواع، وتقييم علاقتها الأولية بمركزية الوحدة الخطابية في نظرية البنية الخطابية.

Amir Zeldes, Katherine Conhaim, Lauren Levine2026-03-31
🤖 AI

Heterogeneous Debate Engine: Identity-Grounded Cognitive Architecture for Resilient LLM-Based Ethical Tutoring

تقدم هذه الورقة محرك المناظرة غير المتجانس (HDE)، وهو بنية معرفية تجمع بين التوليد المعزز بالاسترجاع القائم على الهوية ونظرية العقل الاستدلالية لمنع الانحراف الدلالي والتدهور المنطقي في أنظمة النماذج اللغوية الكبيرة متعددة الوكلاء، مما يتيح تدريباً أخلاقياً مرناً وعالي الدقة من خلال تفاعلات جدلية معادية استراتيجياً.

Jakub Masłowski, Jarosław A. Chudziak2026-03-31
🤖 machine learning

The Geometry of Harmful Intent: Training-Free Anomaly Detection via Angular Deviation in LLM Residual Streams

تُعد LatentBiopsy طريقة للكشف عن الشذوذ لا تتطلب تدريبًا، حيث تحدد المطالبات الضارة من خلال قياس انحرافها الزاوي عن اتجاه مرجعي معياري في التدفقات المتبقية للنماذج اللغوية الكبيرة، محققةً دقة عالية عبر مختلف متغيرات النماذج —بما في ذلك تلك التي استُبعدت منها آليات الرفض جراحيًا— وذلك عبر استغلال التباين الهندسي بين النية الضارة وسلوكيات المحاذاة.

Isaac Llorente-Saguer2026-03-31
💬 NLP

Improving Attributed Long-form Question Answering with Intent Awareness

تقترح هذه الورقة إطار عمل مدركاً للقصد يستخدم مخططات هيكلية قائمة على الوسوم لاستخراج مقاصد المؤلف الضمنية، مما يحسن بشكل كبير جودة ودقة الاستشهاد وقابلية القراءة للتقارير العلمية طويلة التنسيق الناتجة عن كل من النماذج اللغوية الكبيرة والصغيرة.

Xinran Zhao, Aakanksha Naik, Jay DeYoung, Joseph Chee Chang, Jena D. Hwang, Tongshuang Wu, Varsha Kishore2026-03-31
💬 NLP

Multi-Agent Dialectical Refinement for Enhanced Argument Classification

تقدم الورقة البحثية إطار عمل MAD-ACC، وهو إطار متعدد الوكلاء لا يتطلب تدريباً، يستخدم جدلاً جدلياً قائماً على (المؤيد-المعارض-الحكم) لحل الغموض الهيكلي في تنقيب الحجج، محققاً دقة تصنيف وقابلية تفسير متفوقة مقارنة بالنماذج المرجعية أحادية الوكيل على مجموعة بيانات مقالات الطلاب من UKP.

Jakub Bąba, Jarosław A. Chudziak2026-03-31
💬 NLP

AgentSwing: Adaptive Parallel Context Management Routing for Long-Horizon Web Agents

يقدم البحث AgentSwing، وهو إطار عمل تكيفي مدرك للحالة يستخدم إدارة السياق المتوازي والتوجيه الاستباقي لتحسين أداء وكيل الويب طويل الأمد ديناميكيًا، مما يقلل بشكل كبير من عدد جولات التفاعل مع تجاوز استراتيجيات إدارة السياق الثابتة.

Zhaopeng Feng, Liangcai Su, Zhen Zhang, Xinyu Wang, Xiaotian Zhang, Xiaobin Wang, Runnan Fang, Qi Zhang, Baixuan Li, Shi (…)2026-03-31
💬 NLP

Over-Refusal and Representation Subspaces: A Mechanistic Analysis of Task-Conditioned Refusal in Aligned LLMs

تقدم هذه الورقة تحليلاً آلياً يكشف أنه بينما يخضع الرفض الضار لمتجه عالمي واحد، فإن الإفراط في الرفض ينشأ من فضاءات فرعية ذات أبعاد أعلى تعتمد على المهمة ضمن مجموعات المهام الحميدة، مما يفسر فشل الاستئصال العالمي ويستلزم تدخلات هندسية خاصة بكل مهمة.

Utsav Maskey, Mark Dras, Usman Naseem2026-03-31
⚛️ lattice

PRBench: End-to-end Paper Reproduction in Physics Research

تقدم الورقة البحثية PRBench، وهو معيار مرجعي صارم يتكون من 30 مهمة في الفيزياء تم إعدادها من قبل خبراء لتقييم قدرات إعادة الإنتاج الشاملة للوكلاء الاصطناعيين، كاشفةً أن النماذج الحالية تعاني بشكل كبير من حيث صحة الكود، ودقة البيانات، وتحقيق إعادة إنتاج ناجحة رغم قدراتها المتقدمة في التفكير.

Shi Qiu, Junyi Deng, Yiwei Deng, Haoran Dong, Jieyu Fu, Mao Li, Zeyu Li, Zhaolong Zhang, Huiwen Zheng, Leidong Bao, Anqi (…)2026-03-31
💬 NLP

Budget-Xfer: Budget-Constrained Source Language Selection for Cross-Lingual Transfer to African Languages

تقدم الورقة البحثية Budget-Xfer، وهو إطار عمل يعمل على تحسين اختيار اللغة المصدر وتخصيص البيانات في ظل ميزانية تعليق ثابتة، كاشفاً أن النقل متعدد المصادر يتفوق بشكل كبير على النقل أحادي المصدر بالنسبة للغات الأفريقية، مع إثبات أن تشابه التضمين ليس مؤشراً موثوقاً به عالمياً للاختيار.

Tewodros Kederalah Idris, Roald Eiselen, Prasenjit Mitra2026-03-31
💬 NLP

Can Large Language Models Simulate Human Cognition Beyond Behavioral Imitation?

تقدم هذه الورقة معياراً مرجعياً جديداً يعتمد على المسارات النشرية الطولية لـ 217 من باحثي الذكاء الاصطناعي لتقييم ما إذا كانت النماذج اللغوية الكبيرة تحاكي حقاً الأنماط المعرفية البشرية الفردية أم أنها تكتفي بمحاكة السلوكيات السطحية، وذلك باستخدام إعداد الإزاحة الزمنية عبر المجالات ومقياس محاذاة متعدد الأبعاد لتقييم النماذج الحالية وتقنيات التحسين.

Yuxuan Gu, Lunjun Liu, Xiaocheng Feng, Kun Zhu, Weihong Zhong, Lei Huang, Bing Qin2026-03-31