💻 computer science

What Prompts Don't Say: Understanding and Managing Underspecification in LLM Prompts

تحلل هذه الورقة البحثية هشاشة عدم التحديد في الأوامر البرمجية (prompt underspecification) في النماذج اللغوية الكبيرة، مظهرةً أنه بينما تستنتج النماذج غالباً المتطلبات المفقودة، فإن هذا يؤدي إلى أداء غير مستقر لا يمكن إصلاحه بشكل موثوق عبر التحديد البسيط أو أدوات التحسين القياسية، مما دفع المؤلفين إلى اقتراح آليات تحسين مدركة للمتطلبات وعملية منهجية للإدارة الاستباقية للمتطلبات.

Chenyang Yang, Yike Shi, Qianou Ma, Michael Xieyang Liu, Christian Kästner, Tongshuang Wu2026-04-28
💻 computer science

DRP: Distilled Reasoning Pruning with Skill-aware Step Decomposition for Efficient Large Reasoning Models

تقترح الورقة البحثية تقنية "تقليم الاستدلال بالتقطير" (DRP)، وهي إطار عمل هجين يجمع بين التقليم أثناء الاستدلال وبين تفكيك الخطوات المدرك للمهارة والتقطير، وذلك لتقليل استخدام الرموز (tokens) بشكل كبير في نماذج الاستدلال الكبيرة مع الحفاظ على الدقة أو تحسينها في مهام الاستدلال الرياضي المعقدة.

Yuxuan Jiang, Dawei Li, Francis Ferraro2026-04-28
💬 NLP

Explaining Puzzle Solutions in Natural Language: An Exploratory Study on 6x6 Sudoku

تقيم هذه الدراسة الاستكشافية خمسة نماذج لغوية كبيرة على ألغاز سودوكو بحجم 6×6، وتجد أنه بينما يُظهر أحد النماذج قدرة محدودة على الحل، لا يمكن لأي منها تقديم تفسيرات تعكس التفكير الاستراتيجي أو حل المشكلات القائم على الحدس، مما يسلط الضرض على عوائق كبيرة أمام اتخاذ القرار الفعال والتعاوني بين الإنسان والذكاء الاصطناعي.

Anirudh Maiya, Razan Alghamdi, Maria Leonor Pacheco, Ashutosh Trivedi, Fabio Somenzi2026-04-28
💻 computer science

CUB: Benchmarking Context Utilisation Techniques for Language Models

تقدم هذه الورقة البحثية CUB، وهو أول معيار شامل لتقييم تقنيات التلاعب باستغلال السياق (CMTs) في التوليد المعزز بالاسترجاع، كاشفةً من خلال اختبارات مكثفة أن معظم الأساليب الحالية تعاني مع السياقات الواقعية المتنوعة والمشوشة، وغالباً ما تظهر أداءً مبالغاً فيه على مجموعات البيانات الاصطناعية المبسطة.

Lovisa Hagström, Youna Kim, Haeun Yu, Sang-goo Lee, Richard Johansson, Hyunsoo Cho, Isabelle Augenstein2026-04-28
💻 computer science

PARASITE: Conditional System Prompt Poisoning to Hijack LLMs

تقدم الورقة البحثية PARASITE، وهو إطار عمل لهجوم الصندوق الأسود يقوم بتسميم مطالبات الأنظمة التابعة لجهات خارجية بـ "عملاء نائمين" لاختطاف النماذج اللغوية الكبيرة وتوجيهها نحو توليد استجابات مستهدفة ومخترقة لاستعلامات محددة مع الحفاظ على الوظائف الطبيعية للمدخلات الحميدة، مما يؤدي فعلياً إلى التهرب من الدفاعات القياسية.

Viet Pham, Thai Le2026-04-28
💻 computer science

Explaining Sources of Uncertainty in Automated Fact-Checking

تقدم الورقة البحثية إطار عمل CLUE، وهو إطار عمل جاهز للاستخدام (plug-and-play) يولد تفسيرات باللغة الطبيعية لعدم اليقين في التحقق الآلي من الحقائق عبر تحديد وتجسيد التناقضات والاتفاقات بين الامتدادات النصية، مما ينتج مخرجات أكثر دقة وإفادة واتساقاً منطقياً من النماذج المرجعية الحالية.

Jingyi Sun, Greta Warren, Irina Shklovski, Isabelle Augenstein2026-04-28
💻 computer science

Language Models Might Not Understand You: Evaluating Theory of Mind via Story Prompting

تقدم هذه الورقة "StorySim"، وهو إطار عمل قابل للبرمجة لإنشاء مطالبات قصصية مبتكرة وخالية من التلوث لتقييم النماذج اللغوية الكبيرة، كاشفةً أن هذه النماذج تؤدي عموماً بشكل أفضل في مهام نمذجة العالم مقارنة بمهام نظرية العقل، وغالباً ما تعتمد على الاستدلالات بدلاً من التفكير العميق.

Nathaniel Getachew, Abulhair Saparov2026-04-28
💻 computer science

Swa-bhasha Resource Hub: Romanized Sinhala to Sinhala Transliteration Systems and Data Resources

تقدم هذه الورقة "مركز سواباشا للموارد" (Swa-bhasha Resource Hub)، وهو منصة متاحة للجمهور توفر مجموعة شاملة من البيانات والخوارزميات لعملية تحويل النصوص من السنغالية المكتوبة بالأحرف الرومانية إلى السنغالية الأصلية التي تم تطويرها بين عامي 2020 و2025، إلى جانب تحليل مقارن للأدوات الحالية للنهوض بمعالجة اللغات الطبيعية للغة السنغالية.

Deshan Sumanathilaka, Sameera Perera, Sachithya Dharmasiri, Maneesha Athukorala, Anuja Dilrukshi Herath, Rukshan Dias, P (…)2026-04-28
🤖 machine learning

Is Chain-of-Thought Reasoning of LLMs a Mirage? A Data Distribution Lens

تقترح هذه الورقة أن استدلال "سلسلة الأفكار" (CoT) ليس علامة على ذكاء حقيقي، بل هو انعكاس هش لانحيازات استقرائية متعلمة تنجح فقط عندما تتوافق استعلامات الاختبار مع توزيع بيانات التدريب، وتفشل عند مواجهة تحولات في التوزيع.

Chengshuai Zhao, Zhen Tan, Pingchuan Ma, Dawei Li, Bohan Jiang, Yancheng Wang, Yingzhen Yang, Huan Liu2026-04-28