💬 NLP

Jailbreaking Leaves a Trace: Understanding and Detecting Jailbreak Attacks from Internal Representations of Large Language Models

تقترح هذه الورقة إطار عمل خفيف الوزن للكشف عن كسر الحماية (jailbreak) والتخفيف من آثاره أثناء مرحلة الاستدلال، والذي يستفيد من الأنماط المتسقة في الفضاء الكامن ضمن التمثيلات الداخلية للنماذج اللغوية الكبيرة لتحديد المطالبات الضارة وتعطيلها دون الحاجة إلى ضبط دقيق للنموذج أو كواشف مساعدة.

Sri Durga Sai Sowmya Kadali, Evangelos E. Papalexakis2026-02-23
💬 NLP

AI Hallucination from Students' Perspective: A Thematic Analysis

تحلل هذه الدراسة تجارب طلاب الجامعات مع الهلوسة الاصطناعية، كاشفةً أنهم يواجهونها بشكل أساسي من خلال الاستشهادات المفبركة والثقة المضللة، ويعتمدون على استراتيجيات كشف متفاوتة تتراوح من الحدس إلى التحقق، وغالباً ما يحملون تصورات خاطئة حول أسباب هذه الأخطاء، مما يؤكد الحاجة الملحة لدمج الوعي بالهلوسة والنماذج الذهنية الدقيقة في مناهج محو الأمية بالذكاء الاصطناي.

Abdulhadi Shoufan, Ahmad-Azmi-Abdelhamid Esmaeil2026-02-23
💬 NLP

Lost Before Translation: Social Information Transmission and Survival in AI-AI Communication

تُثبت هذه الورقة أن التواصل بين الذكاء الاصطناعي والذكاء الاصطناعي يشوه المعلومات بشكل منهجي من خلال التقارب، والبقاء الانتقائي، والترشيح التنافسي، مما ينتج محتوىً يبدو أكثر مصداقية للبشر بينما يؤدي في الوقت ذاته إلى تآكل الاستدعاء الحقائقي، والتوازن، واللمسات العاطفية الدقيقة.

Bijean Ghafouri, Emilio Ferrara2026-02-23
💬 NLP

Epistemic Traps: Rational Misalignment Driven by Model Misspecification

تقترح هذه الورقة إطارًا نظريًا موحدًا قائمًا على عقلانية بيرك-ناش (Berk-Nash Rationalizability) لإثبات أن حالات عدم المواءمة المستمرة في الذكاء الاصطناعي، مثل التملق والخداع، هي سلوكيات عقلانية رياضياً ناشئة عن سوء توصيف النموذج، مما يؤسس إلى أن السلامة القوية تتطلب هندسة بنية الاعتقاد الداخلي للوكيل بدلاً من مجرد تحسين المكافآت البيئية.

Xingcheng Xu, Jingjing Qu, Qiaosheng Zhang, Chaochao Lu, Yanqing Yang, Na Zou, Xia Hu2026-02-23
💬 NLP

IRPAPERS: A Visual Document Benchmark for Scientific Retrieval and Question Answering

تقدم الورقة البحثية IRPAPERS، وهو معيار مرجعي للوثائق المرئية يضم 3,230 صفحة من 166 ورقة علمية، والذي يوضح أنه في حين أن الاسترجاع القائم على النصوص يتفوق عمومًا على الأساليب القائمة على الصور، فإن نهجًا هجينًا متعدد الوسائط يستفيد من نقاط قوتهما المتكاملة يحقق أداءً فائقًا في الاسترجاع والإجابة على الأسئلة.

Connor Shorten, Augustas Skaburskas, Daniel M. Jones, Charles Pierse, Roberto Esposito, John Trengrove, Etienne Dilocker (…)2026-02-23
💬 NLP

Tethered Reasoning: Decoupling Entropy from Hallucination in Quantized LLMs via Manifold Steering

تقدم الورقة البحثية HELIX، وهو إطار هندسي يفصل بين الإنتروبيا والهلوسة في النماذج اللغوية الكبيرة المكممة من خلال ربط مسارات الحالة الخفية بمتشعب الصدق، مما يتيح استدلالاً بدرجة حرارة عالية يعزز التنوع الإبداعي بشكل كبير مع الحفاظ على التماسك المنطقي والدقة.

Craig Atkinson2026-02-23
💬 NLP

ADAPT: Hybrid Prompt Optimization for LLM Feature Visualization

تقدم هذه الورقة البحثية ADAPT، وهي طريقة هجينة لتحسين المطالبات تجمع بين تهيئة البحث الشعاعي (beam search) والطفرات التكيفية الموجهة بالتدرج لتصور الميزات المشفرة في فضاءات تنشيط النماذج اللغوية الكبيرة (LLM) بفعالية، مما يظهر أداءً متفوقًا على التقنيات الحالية على كامنات المشفّر التلقائي المتناثر (Sparse Autoencoder latents) لنموذج Gemma 2 2B.

João N. Cardoso, Arlindo L. Oliveira, Bruno Martins2026-02-23
💬 NLP

Understanding Unreliability of Steering Vectors in Language Models: Geometric Predictors and the Limits of Linear Approximations

تتقصى هذه الأطروحة عدم موثوقية نواقل التوجيه في النماذج اللغوية، مبرهنةً على أن فعالية التوجيه تعتمد على المحاذاة الهندسية بين بيانات التدريب والسلوك المستهدف، ومستنتجةً أن التقريبات الخطية تفشل عندما تكون التمثيلات الكامنة غير خطية.

Joschka Braun2026-02-23
💬 NLP

Analyzing LLM Instruction Optimization for Tabular Fact Verification

تقدم هذه الورقة أول تقييم منهجي لتحسين التعليمات القائم على DSPy للتحقق من الحقائق الجدولية، مما يثبت أن أدوات التحسين مثل MiPROv2 وSIMBA تعزز بشكل كبير أداء استراتيجيات التلقين المختلفة (بما في ذلك CoT وReAct) عبر مختلف أحجام النماذج، مع تميز SIMBA بتحسين الاستدلال العددي وكفاءة استخدام الأدوات.

Xiaotang Du, Giwon Hong, Wai-Chung Kwan, Rohit Saxena, Ivan Titov, Pasquale Minervini, Emily Allaway2026-02-23
💬 NLP

Decomposing Retrieval Failures in RAG for Long-Document Financial Question Answering

تحدد هذه الورقة وتعالج نمط الفشل الحرج في أنظمة استرجاع المعلومات المعزز بالتوليد (RAG) المالية، حيث يتم استرجاع المستند الصحيح ولكن تُفقد الصفحة المحددة التي تحتوي على الإجابة، وتقترح مُقيّم صفحات مضبوطاً بدقة لنطاق العمل (domain fine-tuned page scorer) يحسن بشكل كبير أداء الاسترجاع على مستوى الصفحة والقطعة في التقارير التنظيمية الطويلة.

Amine Kobeissi, Philippe Langlais2026-02-23