🤖 machine learning

The UNDO Flip-Flop: A Controlled Probe for Reversible Semantic State Management in State Space Model

تقدم هذه الورقة مهمة "UNDO Flip-Flop" لتوضيح أنه بينما تمتلك نماذج فضاء الحالة مثل "Mamba-2" نظرياً القدرة على إدارة الحالة الدلالية القابلة للعكس، إلا أن التحسين القائم على التدرج يفشل في تعلم آليات التراجع القائمة على المكدس (stack-based rollback) الضرورية، مما يؤدي إلى انهيار النماذج إلى استدلالات غير موثوقة تحت تأثير التراجع العدائي.

Hongxu Zhou2026-04-08
💬 NLP

"I See What You Did There": Can Large Vision-Language Models Understand Multimodal Puns?

تقدم هذه الورقة مجموعة بيانات MultiPun ومسار توليد لتقييم قدرة نماذج اللغة الرؤية الكبيرة (LVLMs) بشكل منهجي على فهم التورية متعددة الوسائط، مما يكشف عن محدوديتها الحالية ويقترح استراتيجيات تحسن أداءها في فهم التورية بشكل ملحوظ.

Naen Xu, Jiayi Sheng, Changjiang Li, Chunyi Zhou, Yuyuan Li, Tianyu Du, Jun Wang, Zhihui Fu, Jinbao Li, Shouling Ji2026-04-08
💬 NLP

BOSCH: Black-Box Binary Optimization for Short-Context Attention-Head Selection in LLMs

تقدم الورقة البحثية BOSCH، وهي طريقة تحسين ثنائي الصندوق (black-box) خالية من التدريب، تقوم باختيار رؤوس الانتباه ديناميكيًا لآلية انتباه النافذة المنزلقة ذات السياق القصير في النماذج اللغوية الكبيرة (LLMs)، متفوقةً بذلك على الاستدلالات الحالية على مستوى الطبقة أو الاستدلالات الثابتة على مستوى الرأس عبر التكيف مع الاحتياجات المحددة لنسب الانتباه المختلفة.

Abbas Ghaddar, Ivan Kobyzev, Boxing Chen, Yufei Cui2026-04-08
💬 NLP

Disentangling MLP Neuron Weights in Vocabulary Space

تقدم هذه الورقة البحثية طريقة ROTATE، وهي طريقة خالية من البيانات تعمل على فك تشابك عصبونات الشبكات العصبية متعددة الطبقات (MLP) إلى "قنوات مفردات" قابلة للتفسير عبر تحسين تدويرات الأوزان لتعظيم التفرطح في فضاء المفردات، مما يؤدي إلى استعادة تمثيلات متفرقة وأمينة تتفوق على النماذج المرجعية القائمة على التنشيط في وصف سلوك العصبونات.

Asaf Avrahamy, Yoav Gur-Arieh, Mor Geva2026-04-08
🤖 AI

Epistemic Blinding: An Inference-Time Protocol for Auditing Prior Contamination in LLM-Assisted Analysis

تقدم هذه الورقة "التعمية المعرفية" (epistemic blinding)، وهي بروتوكول يُطبق أثناء الاستدلال يعمل على إخفاء هوية معرفات الكيانات لتدقيق وقياس مدى اعتماد النماذج اللغوية الكبيرة على الأولويات المحفوظة مقابل البيانات المقدمة في التحليل الوكيل، مما يكشف عن تلوث كبير في تحديد أولويات أهداف الأدوية والفرز المالي مع ضمان التزام النظام بالعمليات التحليلية المصممة.

Michael Cuccarese2026-04-08
💬 NLP

From Hallucination to Structure Snowballing: The Alignment Tax of Constrained Decoding in LLM Reflection

تكشف هذه الورقة أن فرض التأمل المنظم في النماذج اللغوية الكبيرة عبر فك التشفير المقيد يفشل في تحسين التصحيح الذاتي، ويؤدي بدلاً من ذلك إلى نمط فشل جديد يُعرف بـ "تراكم هيكلية كرة الثلج"، حيث يتسبب العبء المعرفي الناتج عن الالتزام بقواعد التنسيق الصارمة في جعل النماذج تعطي الأولوية للمحاذاة النحوية السطحية على حساب معالجة الأخطاء الدلالية العميقة، مما يكشف عن "ضريبة محاذاة" متأصلة.

Hongxu Zhou2026-04-08
💬 NLP

Short Data, Long Context: Distilling Positional Knowledge in Transformers

تُثبت هذه الورقة أن النماذج اللغوية يمكنها اكتساب قدرات استرجاع السياق الطويل من خلال تقطير المعرفة القائم على اللوجيت (logit-based knowledge distillation) والمدرب حصرياً على عينات السياق القصير المعبأة، وذلك عبر الاستفادة من توسيع تضمين الموضع الدوراني (Rotary Position Embedding) على مراحل، وكشف كيفية انتقال المعلومات الموضعية عبر طبقات المحولات (transformer layers) للتأثير على إشارة التقطير.

Patrick Huber, Ernie Chang, Chinnadhurai Sankar, Rylan Conway, Igor Fedorov, Md Rifat Arefin, Adithya Sagar2026-04-08
💬 NLP

Stories of Your Life as Others: A Round-Trip Evaluation of LLM-Generated Life Stories Conditioned on Rich Psychometric Profiles

تُظهر هذه الدراسة أن النماذج اللغوية الكبيرة يمكنها ترميز وفك تشفير الفروق الفردية في الشخصية بمتانة من خلال توليد قصص حياة من ملفات تعريف سيكومترية حقيقية واستعادة درجات السمات بدقة من تلك السرديات، محققةً مستويات موثوقية تضاهي اتساق الاختبار وإعادة الاختبار لدى البشر.

Ben Wigler, Maria Tsfasman, Tiffany Matej Hrkalovic2026-04-08
🤖 AI

ACE-Bench: Agent Configurable Evaluation with Scalable Horizons and Controllable Difficulty under Lightweight Environments

يُعد ACE-Bench معياراً خفيف الوزن وقابلاً لإعادة الإنتاج لتقييم الوكلاء، حيث يستخدم مهمة تخطيط موحدة قائمة على الشبكة مع بيئات JSON ثابتة لتوفير تحكم دقيق وقابل للضبط في آفاق المهام وصعوبتها، مما يعالج مشكلات التكلفة العالية وعدم موثوقية التسجيل السائدة في المعايير الحالية.

Wang Yang, Chaoda Song, Xinpeng Li, Debargha Ganguly, Chuang Ma, Shouren Wang, Zhihao Dou, Yuli Zhou, Vipin Chaudhary, X (…)2026-04-08
💬 NLP

Paper Circle: An Open-source Multi-agent Research Discovery and Analysis Framework

تقدم هذه الورقة "Paper Circle"، وهو إطار عمل مفتوح المصدر متعدد الوكلاء يسخر النماذج اللغوية الكبيرة لتبسيط البحث الأكاديمي من خلال مسارات استكشاف وتحليل متكاملة، تتميز باسترجاع متعدد المصادر، وتوليد رسوم بيانية معرفية مهيكلة، ومخرجات قابلة لإعادة الإنتاج.

Komal Kumar, Aman Chadha, Salman Khan, Fahad Shahbaz Khan, Hisham Cholakkal2026-04-08